Обзор
Модуль Advanced Segmentation в SurveyAnalytica позволяет разделять данные на значимые группы на основе общих характеристик. Платформа поддерживает три подхода к сегментации: сегментация на основе правил (rules-based) с использованием бизнес-логики, автосегментация с применением алгоритмов машинного обучения без учителя (unsupervised) и предиктивная сегментация с использованием классификаторов машинного обучения с учителем (supervised). Доступ к сегментации осуществляется из любого раздела аналитики через вкладку Segments.
Сегментация на основе правил
Сегментация на основе правил позволяет определять сегменты с помощью явных условий и бизнес-правил. Этот подход идеально подходит, когда вы точно знаете, как хотите классифицировать данные.
Создание правила сегмента
- Перейдите в раздел Segments в Analytics.
- Нажмите Create Segment и выберите Rules-Based.
- Дайте сегменту описательное название.
- Добавьте условия с помощью конструктора условий.
Операторы условий
Каждое условие сравнивает поле со значением с помощью одного из следующих операторов:
- EQUALS / NOT_EQUALS: точное совпадение (без учёта регистра для строк)
- CONTAINS / NOT_CONTAINS: совпадение подстроки
- STARTS_WITH / ENDS_WITH: совпадение по началу или концу строки
- GREATER_THAN / LESS_THAN: числовое сравнение
- GREATER_THAN_OR_EQUAL / LESS_THAN_OR_EQUAL: числовое сравнение включительно
- BETWEEN: проверка диапазона (требует второе значение)
- IN / NOT_IN: принадлежность к списку
- IS_EMPTY / IS_NOT_EMPTY: проверка на пустое значение
- MATCHES_REGEX: сопоставление с регулярным выражением
Комбинирование условий
Условия организованы в группы. Внутри группы условия комбинируются с помощью логики AND или OR. Несколько групп также могут комбинироваться между собой по логике AND/OR, что даёт полную гибкость для выражения сложных бизнес-правил.
Статистика сегмента
После применения правила сегмента система рассчитывает и отображает:
- Общее число записей, соответствующих сегменту
- Процент от общего набора данных
- Распределение значений внутри сегмента
Автосегментация (ML-кластеризация)
Автосегментация использует машинное обучение без учителя для автоматического выявления естественных группировок в данных. Платформа поддерживает три алгоритма кластеризации:
Кластеризация K-Means
Наиболее часто используемый алгоритм, идеально подходящий для поиска сферических кластеров схожего размера.
- Как это работает: разбивает данные на K кластеров, минимизируя расстояние между точками данных и центром их кластера.
- Настройка: укажите число кластеров (K) или позвольте системе автоматически определить оптимальное K с помощью метода локтя (elbow method) и силуэтного анализа.
- Масштабируемость: оптимизирована для эффективной работы с большими наборами данных.
Иерархическая кластеризация
Строит древовидную иерархию кластеров, полезную для изучения данных на разных уровнях детализации.
- Как это работает: использует агломеративный (снизу вверх) подход с методами связывания, включая ward, complete, average и single.
- Лучше всего подходит для: небольших наборов данных, когда требуется изучить вложенные структуры кластеров.
- Результат: визуализация в виде дендрограммы, показывающая, как кластеры объединяются при разных порогах расстояния.
DBSCAN (плотностная пространственная кластеризация)
Обнаруживает кластеры произвольной формы на основе плотности данных, автоматически определяя выбросы.
- Как это работает: группирует точки, расположенные близко друг к другу, помечая точки в областях низкой плотности как выбросы.
- Ключевые параметры:
eps (радиус окрестности) и min_samples (минимальное число точек для формирования кластера).
- Лучше всего подходит для: наборов данных с кластерами неправильной формы или когда ожидаются выбросы.
Поддержка смешанных типов данных
Механизм кластеризации обрабатывает как числовые, так и категориальные данные:
- Числовые признаки: стандартизируются с помощью нормализации перед кластеризацией.
- Категориальные признаки: кодируются соответствующим образом в зависимости от кардинальности.
- Автоопределение: система автоматически определяет типы признаков по типам вопросов (RADIO, CHECKBOX, DROPDOWN считаются категориальными; NPS, SLIDER и числовые поля — числовыми).
Feature Studio
Перед запуском кластеризации вы можете использовать Feature Studio для подготовки и преобразования признаков данных. Доступные преобразования включают:
- Normalize: стандартное масштабирование, min-max нормализация
- Encode: кодирование категориальных переменных
- Impute: обработка пропущенных значений с помощью среднего, медианы, моды или пользовательских стратегий
- Bin: преобразование непрерывных переменных в дискретные бины (равной ширины, равной частоты или пользовательские)
- Scale: применение логарифмических, квадратно-корневых или других преобразований масштабирования
- Derived features: создание новых признаков на основе существующих с помощью пользовательских выражений
- Feature selection: автоматическое определение наиболее важных признаков для кластеризации
Метрики качества кластеризации
После выполнения автосегментации платформа предоставляет метрики качества для оценки полученных кластеров:
- Silhouette Score: измеряет, насколько точка похожа на свой кластер по сравнению с другими кластерами. Значения находятся в диапазоне от -1 до 1, более высокие значения указывают на более чётко выраженные кластеры.
- Davies-Bouldin Index: измеряет среднее сходство между кластерами. Более низкие значения указывают на лучшее разделение кластеров.
- Размеры кластеров: число записей в каждом кластере, помогающее выявить несбалансированные сегменты.
- Профили кластеров: статистические сводки по каждому кластеру, показывающие отличительные характеристики.
Предиктивная сегментация
После того как сегменты установлены (с помощью правил или кластеризации), вы можете обучить модель машинного обучения с учителем для прогнозирования принадлежности к сегменту для новых данных. Предиктивная сегментация поддерживает:
- Logistic Regression: быстрая, интерпретируемая модель для классификации по сегментам.
- Random Forest: более сложная модель, способная улавливать нелинейные зависимости.
Обучение предиктивной модели
- Выберите признаки для использования в прогнозировании.
- Выберите целевой столбец (существующие назначения сегментов).
- Настройте соотношение тестовой/обучающей выборки (по умолчанию: 80/20).
- Выберите тип модели (логистическая регрессия или случайный лес).
- Обучите модель и просмотрите метрики (accuracy, precision, recall, F1 score, confusion matrix).
Важность признаков
После обучения система извлекает оценки важности признаков, показывающие, какие переменные оказывают наибольшее влияние на назначение сегмента. Это помогает понять, что определяет различия между вашими сегментами.
Применение сегментов
После определения сегментов они сохраняются в каждой записи данных. Каждая запись сегмента включает:
- configId: идентификатор конфигурации сегментации
- configName: название конфигурации сегментации
- segmentName: назначенное имя сегмента
- appliedAt: временная метка применения сегмента
Сегменты можно использовать в качестве фильтров во всём аналитическом интерфейсе, а также в качестве критериев таргетинга в рабочих процессах кампаний.