В 2024 году исследователи проанализировали обезличенные данные электронных медицинских карт (ЭМК) и сравнили несколько методов автоматической группировки пациентов. Выводы полезны для частных клиник: метод k-средних остаётся надёжным базовым вариантом при грамотной предобработке данных; алгоритм пространственной кластеризации с шумом (DBSCAN) значительно лучше справляется с пропусками и неравномерной посещаемостью; а иерархическая кластеризация даёт самую понятную для врача картину, если в выборке менее 5 000 пациентов.
Почему стратификация пациентов требует алгоритмического подхода
Классический маркетинговый подход — анализ трёх показателей: давность последнего визита, частота обращений и совокупные затраты (RFM). Эти три признака позволяют выделить сегменты «хроники в ремиссии», «дорогостоящие частые пациенты», «потерянные» и другие. Однако фиксированные пороги («более двух визитов в год — значит, частый») редко улавливают сложные паттерны в данных ЭМК, где пропуски неизбежны, а длительность наблюдений сильно различается.
Автоматическая кластеризация не только экономит время аналитика, но и вскрывает неочевидные закономерности. Например, группа пациентов с редкими, но однотипными дорогими услугами может попасть в один кластер, что невозможно задать вручную. От выбора алгоритма напрямую зависит качество сегментов, а значит, и эффективность программ лояльности, прицельных рассылок и профилактических кампаний клиники.
Как оценивались алгоритмы: методология сравнения
В работе протестировали пять подходов: метод k-средних, иерархическая агломеративная кластеризация, DBSCAN, модели гауссовых смесей (GMM) и спектральная кластеризация. Все они применены к обезличенным записям ЭМК, преобразованным в таблицу RFM-характеристик с предварительной нормализацией.
Качество сегментации оценивали по трём критериям:
- Коэффициент силуэта — мера компактности и разделимости кластеров.
- Индекс Дэвиса-Болдина — чем ниже, тем лучше изолированы группы.
- Клиническая интерпретируемость — экспертная оценка врачей: насколько полученные сегменты отражают реальные клинические когорты и пригодны для принятия решений.
Ни один алгоритм не оказался лучшим по всем метрикам одновременно. Это подтверждает, что выбор всегда компромисс между формальным качеством и практической полезностью для клиники.
Метод k-средних — надёжная основа при правильной подготовке данных
Метод k-средних устойчиво формирует геометрически компактные кластеры при условии обязательной стандартизации признаков (Z-оценка). Однако он чувствителен к выбору числа групп и плохо выделяет кластеры невыпуклой формы. На реальных медицинских данных пациенты с нетипичной историей визитов либо «притягивались» к ближайшему центру, либо размывали границы сегментов.
Для операционной рутины — например, ежемесячного обновления сегментов для программ лояльности — метод k-средних остаётся прагматичным выбором. В российской клинике его можно реализовать даже в связке с Excel или Python-скриптом на локальном сервере. Главное условие — тщательная предобработка: удаление выбросов по межквартильному размаху и стандартизация каждого RFM-компонента. Заранее задайте начальное значение генератора случайных чисел, чтобы обеспечить воспроизводимость результатов.
DBSCAN — алгоритм для данных с шумом и редкими визитами
Ключевое преимущество DBSCAN — способность автоматически выделять нетипичные наблюдения как «шум» (метка −1) и находить группы произвольной формы. На реальных выборках ЭМК, где значительная доля пациентов имеет всего 1–2 записи, это особенно ценно: такие записи не искажают основные сегменты, а собираются в отдельную категорию.
Для настройки алгоритма задают два параметра: радиус соседства ε и минимальное число точек для формирования ядра. Подбор по графику k-расстояний в исследовании дал максимальный коэффициент силуэта именно на зашумлённых данных. DBSCAN показал себя эффективным для выявления редких профилей — например, пациентов с однократной экстренной госпитализацией. С точки зрения клиники это означает автоматическое отделение «случайных» посетителей от ядра лояльных, что упрощает планирование маркетинговых акций.
Иерархическая кластеризация — наглядность для малых выборок (менее пяти тысяч)
Когда анализируемая когорта не превышает 5 000 пациентов, иерархический агломеративный метод с критерием Варда даёт наиболее клинически осмысленные группы. Его главное преимущество — дендрограмма, наглядное дерево расстояний между группами. Врач может сам выбрать степень агрегации, не слепо доверяя индексам.
Недостаток — вычислительная сложность растёт кубически с числом записей, поэтому на всю базу клиники в десятки тысяч пациентов метод не масштабируется. Зато для пилотных проектов, анализа отдельного отделения или одного заболевания иерархическая кластеризация идеальна. В частной российской клинике дендрограмму можно вывести на экран врачебной комиссии и совместно утвердить сегменты, что повышает доверие к алгоритму.
Сравнительная таблица алгоритмов
| Алгоритм | Коэффициент силуэта | Индекс Дэвиса-Болдина | Интерпретируемость | Ограничения |
|---|---|---|---|---|
| Метод k-средних | Средний/высокий после стандартизации | Средний | Средняя – центры могут быть неочевидны | Необходимо задать число групп; чувствителен к выбросам |
| DBSCAN | Высокий на разреженных данных | Низкий (лучший) | Средняя – шумовая метка требует трактовки | Чувствителен к параметрам ε и минимальному числу точек |
| Иерархический | Хороший при малых выборках | Средний | Высокая – дендрограмма наглядна | Не масштабируется на большие объёмы |
| Гауссовы смеси (GMM) | Средний | Средний | Низкая – смеси сложны для объяснения | Предположение о нормальности распределения |
| Спектральный | Нестабильный | Хуже среднего | Низкая – абстрактное преобразование | Вычислительно затратен, трудно настраивать |
Что это значит для российской клиники
Перенос методов на отечественные данные требует решения двух ключевых задач.
Регуляторная. Федеральный закон №152-ФЗ «О персональных данных» обязывает обезличивать все записи перед анализом. Надёжный анонимизирующий слой должен исключать любые прямые и косвенные идентификаторы, иначе построить единую RFM-таблицу по всем визитам конкретного пациента будет невозможно. Российские медицинские информационные системы (МИС) — «1С:Медицина», «Интерин», «МедИс» и другие — обычно поддерживают выгрузку обезличенных данных, но для полной картины может потребоваться интеграция нескольких систем (регистратура, стационар, лаборатория).
Инфраструктурная. Даже небольшая частная клиника может развернуть Python-скрипты на локальном сервере, а крупные многопрофильные центры — встроить алгоритмы в собственную аналитическую платформу. При этом важно помнить, что иерархическая кластеризация с наглядной дендрограммой особенно удобна для утверждения сегментов на врачебной комиссии — прозрачность метода снижает сопротивление коллектива и ускоряет внедрение.
Ответы на частые вопросы
Вопрос: Какой алгоритм выбрать для пилотного проекта в клинике с тремя тысячами пациентов? Ответ: Исследование рекомендует иерархическую кластеризацию с методом Варда — она даёт наглядную дендрограмму и наиболее понятные врачам группы при выборке до пяти тысяч записей.
Вопрос: Можно ли использовать метод k-средних, если в данных много пропусков? Ответ: Пропуски необходимо предварительно обработать (восстановление или удаление). Метод k-средних очень чувствителен к выбросам и отсутствующим значениям, поэтому на «грязных» данных предпочтительнее DBSCAN.
Вопрос: DBSCAN автоматически выделяет шум — что делать с такими пациентами? Ответ: Пациенты с меткой «шум» (−1) не попали ни в один плотный кластер. Их стоит анализировать отдельно — например, выделить в группу «редких посетителей с нетипичным профилем затрат», не смешивая с основными сегментами.
Вопрос: Какие показатели давности, частоты и затрат наиболее информативны? Ответ: Давность (дни с последнего визита), частота (число обращений за период) и совокупные затраты (сумма оплат или себестоимость лечения). В медицинской практике затраты нередко заменяют на общую стоимость (брутто) или количество услуг по ДМС либо ОМС.
Вопрос: Требуется ли предварительная нормализация данных ЭМК перед кластеризацией? Ответ: Обязательна для метода k-средних и иерархической кластеризации — стандартизация (Z-оценка) каждого признака приводит их к единому масштабу. DBSCAN также выигрывает от такой обработки при использовании евклидовой метрики расстояния.