Анализ 234 674 пациентов многопрофильного госпиталя в Тегеране за четыре года показал: менее 1.5% всех пациентов создают непропорционально большую долю совокупной выручки. Сравнивались два подхода к сегментации. Первый — взвешенная модель на основе давности, частоты и суммы визитов с добавлением длительности отношений (eRFM) и последующее ранжирование по пожизненной ценности пациента (CLV). Второй — кластеризация методом k‑средних (k‑means) с интерпретацией через дерево решений CHAID. Второй метод оказался значительно точнее. Результат прямо применим для выбора программ удержания в частной медицинской организации.
Зачем клинике сегментировать пациентов по ценности
Традиционные модели, основанные на давности последнего визита, частоте обращений и сумме расходов (RFM), широко применяются в рознице. Однако в медицине помимо этих метрик критически важен стаж отношений с пациентом и неравномерный финансовый вклад разных групп. Исследователи госпиталя расширили классическую схему, добавив продолжительность истории визитов — количество дней от первого до последнего обращения. Так получилась метрика LRFM, или взвешенный eRFM, которая дополнительно учитывает лояльность и срок взаимодействия с клиникой.
Веса каждого компонента (давность, частота, сумма, длительность) определялись не поровну, а методом анализа иерархий (AHP) — это позволило объективизировать их значимость на основе экспертных оценок. Полученный композитный индекс точнее отражает экономический «вес» пациента, чем простая сумма его трат.
Для российской частной клиники это означает возможность выявить подобных «тяжёлых» пациентов в собственной базе. Данные для расчёта доступны из медицинской информационной системы (МИС, например, «Медиалог», «Интерин») или биллинга – достаточно записей о датах, количестве обращений и стоимости услуг за два-три года.
Как рассчитать взвешенный RFM с длительностью и пожизненную ценность пациента
Четырёхлетний массив включал все транзакции пациентов: приёмы, исследования, стационарные услуги. Для каждого человека вычислялись:
- Длительность отношений (Length) — число дней между первым и последним зафиксированным визитом;
- Давность последнего визита (Recency) — сколько дней прошло с последнего обращения;
- Частота обращений (Frequency) — общее число визитов;
- Денежная ценность (Monetary) — суммарная стоимость всех оказанных услуг.
На базе взвешенных через AHP значений строили единый балл. Параллельно для каждого пациента рассчитывали пожизненную ценность (CLV) — прогнозную прибыль за всё время взаимодействия, основанную на исторических тратах и вероятности продолжения отношений. Двойная оценка позволила сравнить два принципиально разных подхода к выделению ценных групп: сортировку по одному обобщённому показателю CLV и многомерную кластеризацию без учителя.
Российским клиникам для воспроизведения подобного анализа достаточно выгрузить из МИС обезличенные идентификаторы, даты и суммы оплат. При этом необходимо соблюдать требования Федерального закона № 152-ФЗ «О персональных данных»: аналитические ID должны быть необратимо отделены от любой информации, позволяющей идентифицировать личность пациента, если не получено отдельное согласие на исследовательскую обработку.
Сравнение двух стратегий: ранжирование по CLV и кластеризация k‑средних с деревом решений
Исследователи применили два алгоритма группировки:
- Ранжирование по CLV — пациентов отсортировали по рассчитанной пожизненной ценности и разделили на квинтили (пять равных по численности групп).
- Кластеризация методом k‑средних — в качестве входных переменных использовались все четыре LRFM-признака; оптимальное число кластеров определили по индексу силуэта. Затем к полученным группам применили дерево решений CHAID (автоматическое обнаружение взаимодействий по критерию хи-квадрат), которое наглядно интерпретирует, по каким правилам пациент попадает в тот или иной кластер.
Ключевой результат: подход с k‑средними плюс CHAID гораздо точнее разделяет аудиторию по реальной экономической ценности. Простое разрезание по CLV сглаживает границы, не улавливает нелинейные паттерны и не выделяет микро-сегменты сверхценных пациентов. Там, где сортировка по CLV давала усреднённую картину, кластеризация показывала действительно концентрированную группу, приносящую основную прибыль.
| Критерий | Ранжирование по CLV (квинтили) | Кластеризация k‑средних + дерево CHAID |
|---|---|---|
| Тип разделения | Равномерное по численности | Естественные плотные группы |
| Учёт взаимодействия LRFM-факторов | Нет, только агрегированный CLV | Да, все четыре переменных |
| Выделение микро‑сегментов | Невозможно, смазано | Да, вплоть до <1.5% популяции |
| Интерпретируемость | Прямая, но примитивная | Понятные правила из CHAID-дерева |
| Точность обнаружения концентрации выручки | Ниже | Выше: выявлена сверхконцентрация |
Для российской клиники практический вывод таков: построчная сортировка пациентов по сумме выручки из 1С или Excel даст лишь приблизительную «элиту», а автоматическая кластеризация в аналитической платформе (Python, R, Power BI) вскроет истинную узкую группу, на которой и фокусироваться.
Ключевая находка: менее 1.5% пациентов — генераторы основной выручки
Расчёты на выборке 234 674 человек продемонстрировали резко асимметричное распределение: менее полутора процентов пациентов обеспечивают непропорционально высокую долю совокупного денежного потока госпиталя. Остальные 98.5% формируют относительно небольшой и предсказуемый доход. Это распределение жёстче классического принципа Парето (20/80) — сегмент супер-ценных пациентов оказался чрезвычайно узким.
Кластеризация k‑средними с последующей классификацией деревом решений позволила чётко описать портрет такого пациента: высокая частота многопрофильных обращений, длительная история без больших перерывов и значительные суммарные затраты. Если бы использовали только пороговый уровень CLV (например, верхний квинтиль), группа была бы размыта и включала бы пациентов с меньшим потенциалом, а истинные генераторы выручки остались бы незамеченными.
Применительно к российской частной практике это означает, что анализ 2–3 лет данных конкретной клиники с высокой вероятностью выявит аналогичную микро-группу. Направив основные усилия службы сервиса и персонализированные программы именно на неё, можно ощутимо повысить финансовую стабильность.
Как использовать модель для программ удержания и маркетинга
Обнаружение сверхдоходного сегмента позволяет сконцентрировать бюджет лояльности не на всей базе, а точечно. Практические шаги на основе результатов исследования:
- Идентифицировать супер-ценных пациентов по правилам, извлечённым из дерева решений: давность последнего визита, частота обращений, стаж в клинике, средний чек.
- Разработать персональный план сопровождения: проактивный обзвон (рекóлл), выделенный менеджер-куратор, особые условия постлечебного наблюдения и приоритетная запись.
- Настроить автоматические триггеры в CRM-системе (например, интегрированной с МИС): если ключевые метрики пациента начинают снижаться (увеличилась давность, уменьшилась частота), запускается «спасательный» сценарий – персональное приглашение, бонусное предложение.
- Для основной массы пациентов оставить стандартные программы повышения частоты: чекап-пакеты, напоминания о профилактических осмотрах, а также инструменты увеличения длительности отношений через долгосрочные абонементы и семейные программы.
Такая сегментация снижает расходы на коммуникацию, фокусируя усилия там, где потенциал пожизненной ценности максимален. Одновременно она предотвращает потерю самых доходных пациентов из-за недостатка персонализированного внимания. Российские клиники, уже использующие CRM-системы (AmoCRM, Битрикс24 или отраслевые решения), могут запрограммировать правила кластеризации в виде сегментов и сценариев удержания без пересчёта модели в реальном времени — достаточно обновлять распределение раз в квартал.
Применимость в российских частных клиниках
Методология полностью переносима на отечественную базу: все RFM-признаки вычисляются по данным МИС, алгоритм k‑средних доступен в любых аналитических пакетах (Python, R, даже сводные таблицы Excel с надстройкой). Дерево решений CHAID реализовано в популярных средах статистического анализа.
Главное ограничение — нормативное. Обработка медицинских данных попадает под действие 152-ФЗ «О персональных данных» и отраслевых требований Минздрава. Перед построением модели необходимо обезличить записи до аналитического ID, исключив возможность обратной деанонимизации без специального ключа. Зарубежный аналог — американский закон HIPAA, обязывающий проводить строгую деидентификацию, — здесь схож по духу, хотя прямого аналога в российском праве нет. Если обезличивание выполнено необратимо, согласие пациента не требуется; в противном случае следует получить письменное разрешение на исследовательскую аналитику.
Инфраструктурный аспект: не все клиники располагают единой экосистемой учёта за много лет, но даже накопленной глубины в 2–3 года достаточно, чтобы выявить собственный процент сверхдоходных пациентов и построить работающие правила сегментации. Главное — начать, а полученные сегменты можно сразу зашить в сценарии удержания, повышая возврат на вложенный маркетинговый бюджет.
FAQ
Q: Что такое расширенная RFM-модель (eRFM) в медицинской практике? A: Это модель, в которой кроме давности последнего визита, частоты обращений и суммы расходов учитывается длительность отношений пациента с клиникой (Length). Веса факторов подбираются аналитически, например, методом анализа иерархий (AHP), что даёт взвешенный балл ценности.
Q: Зачем сравнивать ранжирование по пожизненной ценности (CLV) и кластеризацию методом k‑средних? A: Чтобы выяснить, какой метод точнее разделяет пациентов по реальной экономической отдаче. Исследование показало, что кластеризация плюс дерево решений намного чётче выделяет микро-сегмент наиболее прибыльных пациентов.
Q: Какие данные нужны для построения модели в частной клинике? A: Потребуются обезличенные записи о каждом пациенте: даты и стоимость всех оказанных услуг за продолжительный период (минимум 2–3 года). Источником может служить медицинская информационная система или биллинговый модуль.
Q: Можно ли обойтись без сложной аналитики? A: Простая сортировка по сумме выручки или CLV даст приблизительную картину. Однако кластеризация с деревом решений существенно точнее идентифицирует узкий сегмент самых ценных пациентов и предоставляет готовые правила для его автоматического определения.
Q: Как быстро внедрение такой модели окупается? A: Конкретный срок окупаемости в исследовании не указан. Но концентрация усилий по удержанию на сверхдоходной группе, составляющей менее 1.5% пациентов, снижает затраты на неперсонализированные широкие кампании и предотвращает потерю ключевых генераторов выручки, что ускоряет возврат инвестиций.