В 2021 году исследователи обучили две модели машинного обучения — XGBoost и случайный лес (Random Forest) — на данных детской офтальмологической клиники. Обе модели выделили одинаково важные признаки: общее количество визитов пациента и средний интервал между ними. Фактически это компоненты «давность» (Recency) и «частота» (Frequency) из маркетинговой модели RFM. Эксперимент подтвердил: RFM-фичи — надёжные предикторы риска неявки.
Почему прогнозирование неявок важно для клиники
Неявки пациентов нарушают непрерывность лечения, ухудшают результаты и вызывают финансовые потери. Для детской офтальмологии пропуск приёма особенно критичен: можно упустить ранние стадии амблиопии и других заболеваний. Поэтому клиникам необходимо заранее выявлять пациентов с высоким риском неявки.
Классические подходы — напоминания по SMS и телефону — снижают процент неявок, но не устраняют структурные закономерности. Машинное обучение позволяет выявить, какие пациенты с высокой вероятностью пропустят приём, и адресно воздействовать на них.
Методология исследования: данные, переменные, алгоритмы
Исследование, опубликованное в 2021 году в международной биомедицинской базе PubMed Central, опиралось на реальные данные посещений академической педиатрической офтальмологической клиники. Точные размер выборки и временные рамки в кратком обзоре не раскрыты, но в модель включили демографические, клинические и поведенческие переменные.
Главные инструменты анализа — две ансамблевые модели:
- XGBoost — реализация градиентного бустинга на деревьях решений, известная высокой точностью и устойчивостью к пропускам в данных.
- Случайный лес (Random Forest) — алгоритм, который усредняет прогнозы множества деревьев, снижая риск переобучения.
Обе модели решали задачу бинарной классификации: явится пациент или не явится.
Результаты: на какие признаки указали обе модели
После оценки важности признаков XGBoost и случайный лес сошлись во мнении. Самыми значимыми предикторами оказались:
- Количество предыдущих визитов — чем больше визитов в анамнезе, тем выше вероятность явки.
- Средний интервал между визитами — короткие и стабильные интервалы коррелируют с соблюдением записи.
Другие логичные кандидаты — возраст, диагноз, день недели, расстояние до клиники — либо не попали в топ, либо получили значительно меньший вес. Поведенческая история оказалась важнее демографии.
Для российской частной клиники это означает, что даже простая выгрузка истории визитов из медицинской информационной системы (МИС) даёт прогностическую силу, не требуя сбора чувствительных данных. Это полностью укладывается в логику Федерального закона № 152-ФЗ «О персональных данных»: при внутренней обработке обезличенных записей о визитах дополнительных согласований, как правило, не требуется.
RFM-модель: почему «частота» и «давность» работают в медицине
Модель RFM (Recency, Frequency, Monetary) пришла из маркетинга и десятилетиями используется для оценки лояльности и оттока покупателей. Применительно к медицинским услугам:
- Давность (Recency) — сколько дней прошло с последнего визита. Чем меньше давность, тем «теплее» пациент.
- Частота (Frequency) — общее число визитов. Высокая частота указывает на вовлечённость.
- Денежный вклад (Monetary) — обычно сумма расходов; в медицинском RFM его иногда заменяют на клиническую ценность, но в данном исследовании денежный компонент не оценивался.
Эксперимент эмпирически выделил именно давность и частоту как ведущие предикторы. Следовательно, поведенческая сегментация по RFM может быть автоматически выстроена в любой клинике с электронным расписанием, без привлечения дополнительных данных.
Сравнение RFM-компонент с признаками, важными для машинного обучения
| RFM-компонент | Описание | Признак из ML-модели | Роль в прогнозе неявки |
|---|---|---|---|
| Давность (Recency) | Время с последнего визита | Средний интервал между визитами | Короткий интервал → высокая приверженность |
| Частота (Frequency) | Общее число визитов | Количество предыдущих визитов | Много визитов → низкий риск пропуска |
| Денежный вклад (Monetary) | Платежи / ценность | Не оценивался в исследовании | Не входил в модель |
Совпадение по двум из трёх компонент подтверждает: базового набора транзакционных данных достаточно, чтобы построить работающую скоринговую модель риска неявки.
Как внедрить прогноз неявок на основе RFM-фич
Практические шаги для клиники:
- Выгрузить из используемой медицинской информационной системы (МИС) историю визитов каждого пациента: даты, количество, интервалы.
- Рассчитать для каждого пациента давность (дни от последнего приёма) и частоту (общее число приёмов).
- Обучить простую модель — например, логистическую регрессию или применить пороговые правила — либо сразу использовать готовые RFM-сегменты.
- Применить результаты: пациентам с высоким риском неявки назначить дополнительный обзвон, персональные напоминания, гибкое расписание.
- Регулярно пересчитывать RFM-показатели по мере накопления новых записей.
Такой подход не требует мощной ИТ-инфраструктуры и на старте может быть реализован даже в Excel, оставаясь при этом эмпирически обоснованным.
Применимость для РФ
Что переносится напрямую. Признаки «количество визитов» и «интервал» доступны в любой российской МИС или CRM. Их анализ на основе обезличенных идентификаторов не противоречит 152-ФЗ, если обработка ведётся внутри организации и есть согласие пациента на обработку данных в медицинских целях.
Что требует адаптации. В России отсутствует прямой аналог американского HIPAA, однако действуют нормы отраслевых приказов. Автоматизированное принятие решений, затрагивающее права граждан, должно быть прозрачным; при внутреннем скоринге неявок, как правило, дополнительных уведомлений Роскомнадзора не требуется.
Инфраструктурные нюансы. Большинство частных клиник уже ведут электронные расписания, но качество исторических данных различается. Если в МИС не фиксируется точное время явки или записи редактировались вручную, RFM-фичи могут быть зашумлены. Тем не менее даже грубая оценка числа визитов даёт практическую пользу.
FAQ
Q: Что такое RFM-фичи и как они связаны с неявками пациентов? A: RFM — это давность последнего визита (Recency), частота визитов (Frequency) и денежный вклад (Monetary). Исследование показало, что давность и частота являются главными предикторами неявок: чем выше частота и меньше давность, тем ниже риск пропуска приёма.
Q: Какие модели машинного обучения использовались в эксперименте 2021 года? A: Применялись XGBoost (градиентный бустинг) и случайный лес (Random Forest). Обе модели дали одинаковый набор наиболее важных признаков.
Q: Можно ли прогнозировать неявки без машинного обучения? A: Да, ключевые RFM-признаки — количество визитов и интервал — можно использовать в простых правилах или скоринговых таблицах без сложных алгоритмов. Это снижает порог входа для небольших клиник.
Q: Какие данные нужны для расчёта RFM-фич в российской клинике? A: Достаточно истории визитов из МИС: даты приёмов для каждого пациента. Персональные данные при внутренней обработке можно обезличить, что соответствует требованиям 152-ФЗ.
Q: Почему демографические факторы оказались слабее истории визитов? A: Возраст, диагноз или расстояние до клиники дают косвенную информацию, тогда как частота и давность напрямую отражают сложившееся поведение пациента. Поэтому поведенческие признаки перевешивают демографические.