LRFM-модель: сегментация 321 908 пациентов медицинского центра

Анализ лояльности амбулаторных пациентов через LRFM: устойчивость модели на выборке 321 908 человек, 5 управленческих типов и алгоритмы SOM+k-means. Практические выводы для частных клиник.

В 2021 году исследование на базе крупного медицинского центра Тайваня подтвердило устойчивость LRFM-подхода для сегментации амбулаторных пациентов. Выборка в 321 908 человек — на два порядка больше оригинальной работы Wu (2014) — доказала, что комбинация показателей длительности, давности, частоты и денежной ценности (Length, Recency, Frequency, Monetary) позволяет выделять 5 стратегических групп: ядро, потенциальные, новые, потерянные и ресурсоёмкие клиенты.

Чем LRFM-модель отличается от классической RFM-сегментации

Традиционная модель RFM использует три метрики: давность последнего визита, частоту обращений и денежную ценность пациента. В медицинской практике к этим трём добавляют четвёртый параметр — длительность отношений с клиникой от первого до последнего контакта. Так получается LRFM: L (длительность), R (давность), F (частота) и M (денежная ценность).

Именно длительность позволяет отделить давно обслуживаемых лояльных пациентов от тех, кто лишь недавно начал посещать учреждение, но уже показывает высокую частоту. Модель впервые предложена Wu в 2014 году на ограниченной выборке. Тайваньское исследование 2021 года масштабировало методику, применив её ко всем амбулаторным пациентам медцентра за длительный период, — 321 908 уникальных записей. Такой объём данных даёт право говорить о надёжности LRFM как инструмента принятия управленческих решений.

Методология: от 12 кластеров самоорганизующихся карт до 5 стратегических типов

Авторы использовали двухэтапную кластеризацию. Сначала данные по каждому пациенту — значения длительности, давности, частоты и денежной ценности — подавались на самоорганизующиеся карты (Self-Organizing Maps, SOM). Это нейросетевой алгоритм, который снижает размерность и строит карту похожих профилей. SOM-слой выявил 12 первичных сегментов, сохранив топологическую близость клиентов со схожими паттернами поведения.

Затем к полученной структуре применили классический алгоритм k-средних для уточнения границ и окончательного разделения на 12 групп. Эти 12 кластеров были интерпретированы и сведены в пять управленческих типов, удобных для практического маркетинга:

  • Ядро — самая ценная группа, максимальные значения всех четырёх показателей.
  • Потенциальные — средние показатели, но с тенденцией к росту частоты.
  • Новые — недавно привлечённые, с низкой длительностью и высокой денежной ценностью (возможен вклад дорогостоящих процедур).
  • Потерянные — пациенты с низкой давностью, давно не приходившие.
  • Ресурсоёмкие — высокая денежная ценность при слабой лояльности, то есть разовые дорогие обращения.

Такая агрегация позволила предложить адресные стратегии удержания и развития для каждого типа.

Портрет сегментов и ключевые различия

СегментДлительностьДавностьЧастотаДенежная ценностьУправленческий фокус
ЯдроВысокаяВысокая (недавние визиты)ВысокаяВысокаяУдержание, программы привилегий
ПотенциальныеСредняяСредняяРастущаяСредняя/высокаяСтимуляция частоты через напоминания
НовыеНизкаяОчень высокая (недавно)Низкая/единичнаяМожет быть высокойОнбординг, информирование о базовых услугах
ПотерянныеВысокая/средняяНизкая (давно не приходили)НизкаяНизкаяРеактивация специальными предложениями
РесурсоёмкиеЛюбаяНизкаяНизкаяОчень высокаяКонтроль затрат, профилактика вместо эпизодических дорогих вмешательств

Границы между сегментами не жёсткие: 12 исходных кластеров, полученных с помощью самоорганизующихся карт, отражают нюансы внутри типов, например, «потерянные с высоким историческим вкладом» или «потенциальные, но уже снижающие частоту». Однако для бизнес-решений пятигрупповая классификация оказалась достаточной.

Почему модель устойчива: проверка на 321 908 записях

Оригинальное исследование Wu строилось на выборке порядка нескольких тысяч пациентов. Репликация 2021 года увеличила объём данных примерно в 100 раз, при этом структура сегментов и их интерпретируемость сохранились. Это доказывает, что LRFM-подход не переобучается на малых данных и воспроизводим на уровне крупного медицинского центра.

Использование самоорганизующихся карт перед k-средних дополнительно повышает стабильность: карта Кохонена сглаживает шумы и выбросы, поэтому последующая кластеризация менее чувствительна к начальной инициализации. Полученные пять типов легко объясняются с точки зрения управленческих метрик и не требуют глубокой математической подготовки для интерпретации.

Применимость для РФ

Что переносится напрямую:

  • Методология LRFM полностью применима в российских частных клиниках при наличии данных о визитах и финансовых показателях в CRM или медицинской информационной системе.
  • Расчёт четырёх метрик по каждому пациенту реализуется штатными средствами SQL или BI‑систем (Яндекс DataLens, Power BI и др.).
  • Сегментация на пять описанных типов даёт готовую карту для маркетинга удержания и реактивации.

Что не переносится или требует адаптации:

  • Прямая реализация самоорганизующихся карт в промышленных инструментах маловероятна; для большинства клиник достаточно алгоритма k-средних или иерархической кластеризации на нескольких параметрах, что не снижает ценности подхода.
  • Регуляторные ограничения: при анализе персональных данных необходимо соблюдать 152-ФЗ. В частности, показатель денежной ценности предполагает привязку к финансовым данным пациента — потребуется обезличивание или согласие на обработку.
  • Инфраструктурная разница: не все региональные клиники имеют централизованное хранилище визитов за несколько лет, однако накопив данные за 2–3 года, можно получить устойчивую LRFM-картину.

При использовании профильных CRM для медицины показатели длительности, давности, частоты и денежной ценности могут рассчитываться автоматически и обновляться по расписанию, а готовые сегменты — выгружаться для e-mail или SMS-кампаний.

FAQ

Q: Чем LRFM отличается от обычного RFM? A: LRFM добавляет параметр «длительность отношений» (L), что критично для медицины, где длительно обслуживаемый пациент ценнее разового.

Q: Как вычислить длительность отношений для амбулаторного пациента? A: Это разница в днях между первым и последним визитом. При неполных данных используют доступный период.

Q: Что такое самоорганизующиеся карты (SOM) и зачем они нужны? A: Самоорганизующиеся карты (SOM) — нейросетевой алгоритм, проецирующий многомерные данные на двумерную карту. В исследовании он позволил визуализировать 12 микрокластеров и повысить устойчивость итоговой сегментации.

Q: Можно ли применить LRFM в клинике с 5 000 пациентов? A: Да, метод не требует больших данных. На нескольких тысячах записей кластеризация даст осмысленные группы для точечного маркетинга.

Q: Какие стратегии работают для «ресурсоёмких» пациентов? A: Упор на профилактические программы и регулярный скрининг, чтобы перевести разовые дорогие обращения в плановую модель наблюдения и снизить среднюю стоимость эпизода.

Свежие статьи