На выборке из более чем 1,5 млн телемедицинских приёмов модель XGBoost, обученная с учётом стоимости ошибок, достигла наилучшего показателя AUC 0.722 (площадь под ROC-кривой) при прогнозировании неявки. Главными предикторами оказались поведенческие признаки на основе давности, частоты и денежной ценности (RFM): общее число предыдущих визитов, средний временной промежуток между ними и время, оставшееся до запланированного приёма.
Источник и масштаб исследования
Работа опубликована в 2025 году в рецензируемом журнале, индексируемом PubMed. Авторы проанализировали обезличенные данные более 1,5 миллиона реальных телемедицинских визитов — одно из крупнейших на сегодня исследований в области прогнозирования неявки для дистанционных консультаций. Такой объём позволил построить устойчивые модели машинного обучения и выявить поведенческие паттерны, не зависящие от конкретной клиники или сезона.
Сравниваемые алгоритмы: Random Forest, XGBoost, LightGBM
Исследователи протестировали три ансамблевых метода на основе деревьев решений, хорошо зарекомендовавших себя на табличных данных:
- Random Forest — классический бэггинг-ансамбль, устойчивый к переобучению;
- XGBoost — градиентный бустинг с регуляризацией, часто лидирующий в медицинских задачах;
- LightGBM — ещё один фреймворк градиентного бустинга, оптимизированный под скорость и работу с разреженными признаками.
Все три алгоритма обучались на одних и тех же признаках, извлечённых из расписания визитов и истории пациента. Для владельца российской частной клиники это означает, что даже при ограниченном наборе данных о пациентах — только история записи и факт посещения — можно построить предсказательную модель, не собирая сложную клиническую информацию.
Борьба с дисбалансом классов: недодискретизация и обучение с учётом стоимости ошибок
Ключевая методологическая проблема предсказания неявки — сильный дисбаланс: доля неявившихся пациентов обычно не превышает 10–20 %. Без коррекции модель может вырождаться в константное предсказание «явится», показывая высокую общую точность, но нулевую практическую пользу. В работе применили две стратегии:
- Недодискретизация — случайное удаление избыточных примеров класса «явка» до достижения баланса 1:1 или близкого к нему.
- Обучение с учётом стоимости ошибок — встраивание весов ошибок непосредственно в функцию потерь: штраф за пропуск реальной неявки делается в k раз выше, чем за ложную тревогу.
Оба подхода сравнивались для каждой из трёх моделей. Лучший результат — AUC 0.722 — продемонстрировал XGBoost с обучением с учётом стоимости ошибок.
Почему именно XGBoost с обучением с учётом стоимости ошибок?
Модель XGBoost с настройкой стоимости ошибок выигрывает за счёт того, что градиентный бустинг итеративно исправляет ошибки, а встроенные веса смещают фокус в сторону трудных случаев (меньшинства). В отличие от недодискретизации, этот метод не теряет информацию, сохраняя все доступные примеры класса «явка». При объёме данных более 1,5 млн выбрасывание даже части записей о состоявшихся визитах снизило бы качество обучения, поэтому вариант с весами ошибок оказался предпочтительным. Для российской клиники, где база визитов может быть меньше, но всё равно содержит множество явок на одну неявку, этот подход особенно ценен — он позволяет использовать все данные без искусственного урезания.
RFM-переменные как ключевые предикторы
Авторы явно указывают, что поведенческие RFM-признаки (давность, частота, денежная ценность) оказались решающими. В контексте телемедицины они были адаптированы следующим образом:
- Давность — время, прошедшее с последнего визита (или время до запланированного приёма);
- Частота — общее количество предыдущих визитов (любых, не только телемедицинских);
- Денежная ценность — в оригинальной RFM-концепции это сумма покупок; в медицинской адаптации её заменяли на количество завершённых консультаций или средний промежуток между визитами.
Топ-3 наиболее значимых признака, согласно важности в модели XGBoost:
- Число предыдущих визитов — чем выше, тем ниже вероятность неявки.
- Средний промежуток между визитами — длинные интервалы коррелируют с пропусками.
- Время до записи — записи, сделанные задолго до приёма, чаще отменяются или по ним не приходят.
Таким образом, модель не требует сложных клинических данных — достаточно истории расписания, что упрощает внедрение. Российские МИС (например, «1С:Медицина», «Медиалог», «Интерин») и облачные телемедицинские платформы, агрегирующие записи (такие как medaccount.ru), уже накапливают подобную информацию. При соблюдении требований 152-ФЗ по обезличиванию эти данные можно сразу использовать для расчета RFM-переменных.
Применимость для РФ
- Прямой перенос методов: все описанные алгоритмы (Random Forest, XGBoost, LightGBM) и техники балансировки доступны в открытых библиотеках Python (scikit-learn, XGBoost, LightGBM). Их можно обучить на данных российских телемедицинских сервисов и МИС без каких-либо законодательных ограничений, при условии обезличивания информации о пациентах (Федеральный закон № 152-ФЗ «О персональных данных»).
- Инфраструктурные возможности: в РФ телемедицина регулируется приказом Минздрава № 965н и последующими поправками, что определяет формат хранения записей о визитах. Если МИС фиксирует факт визита, его статус («состоялся», «неявка»), временные метки и идентификатор пациента, то RFM-переменные могут быть рассчитаны. Проблемой может стать разрозненность данных между разными сервисами — для полноценной частотной истории пациента часто требуется интеграция нескольких источников, и здесь помогают агрегаторы медицинских записей.
- Защита данных: в США действует Закон о мобильности и подотчётности медицинского страхования (HIPAA), который устанавливает единые стандарты защиты медицинской информации. В РФ отдельного закона, полностью аналогичного HIPAA, нет, однако требования 152-ФЗ и отраслевых приказов делают обязательным обезличивание (агрегацию) данных перед построением предиктивных моделей. Это достижимо стандартными методами хеширования и псевдонимизации, применяемыми в любой сертифицированной МИС.
- Практическая ценность: использование модели XGBoost с учётом стоимости ошибок позволило бы частным телемедицинским платформам прогнозировать вероятность неявки за 1–2 дня до приёма и инициировать напоминания, перераспределять слоты или предлагать перенос. Сервисы, агрегирующие данные из разных клиник, уже располагают готовой основой для RFM-анализа и последующего обучения модели.
FAQ
Q: Что такое неявка в телемедицине? A: Неявка — ситуация, когда пациент не подключается к запланированной дистанционной консультации без предварительной отмены. Это приводит к простою врача и снижению доступности записи для других пациентов.
Q: Почему XGBoost с учётом стоимости ошибок дал лучший результат? A: XGBoost с обучением, учитывающим стоимость ошибок, достиг AUC 0.722 за счёт встроенной регуляризации и возможности назначать больший штраф за пропуск неявки. Такой подход эффективен при сильном дисбалансе классов, типичном для реальных медицинских данных.
Q: Что такое обучение с учётом стоимости ошибок? A: Это метод, при котором в функцию потерь модели добавляются веса: ошибка на миноритарном классе (неявка) «стоит» дороже, чем на мажоритарном. В результате модель учится уделять больше внимания редким, но критичным событиям, не теряя информацию о частых.
Q: Какие данные нужны для построения такой модели? A: Достаточно обезличенной истории визитов: идентификатор пациента, статус визита (явился/не явился), дата и время записи, дата и время самого визита. На их основе вычисляются поведенческие RFM-переменные — давность, частота, косвенный показатель ценности.
Q: Можно ли применить этот подход в российской частной клинике? A: Да, все алгоритмы открыты, а требуемые данные уже присутствуют в большинстве МИС, используемых в РФ. Необходимо соблюдение Федерального закона № 152-ФЗ и обезличивание персональных данных; дополнительные разрешения для обработки агрегированной статистики не требуются. Интеграция через сервисы, консолидирующие записи из разных источников, упрощает сбор полной истории визитов.