Aperçu
Le module de segmentation avancée de SurveyAnalytica’s vous permet de diviser vos données en groupes significatifs selon des caractéristiques communes. La plateforme prend en charge trois approches de segmentation : la segmentation basée sur des règles utilisant la logique métier, l’auto-segmentation utilisant des algorithmes de machine learning non supervisé, et la segmentation prédictive utilisant des classificateurs ML supervisés. Accédez à la segmentation depuis n’importe quelle vue analytique en cliquant sur l’onglet Segments.
Segmentation basée sur des règles
La segmentation basée sur des règles vous permet de définir des segments à l’aide de conditions explicites et de règles métier. Cette approche est idéale lorsque vous savez exactement comment vous souhaitez catégoriser vos données.
Créer une règle de segment
- Accédez à la vue Segments dans Analytics.
- Cliquez sur Créer un segment et sélectionnez Basé sur des règles.
- Donnez à votre segment un nom descriptif.
- Ajoutez des conditions à l’aide du générateur de conditions.
Opérateurs de condition
Chaque condition évalue un champ par rapport à une valeur à l’aide de l’un de ces opérateurs :
- EQUALS / NOT_EQUALS : Correspondance exacte (insensible à la casse pour les chaînes)
- CONTAINS / NOT_CONTAINS : Correspondance de sous-chaîne
- STARTS_WITH / ENDS_WITH : Correspondance de préfixe ou de suffixe
- GREATER_THAN / LESS_THAN : Comparaison numérique
- GREATER_THAN_OR_EQUAL / LESS_THAN_OR_EQUAL : Comparaison numérique inclusive
- BETWEEN : Vérification de plage (nécessite une seconde valeur)
- IN / NOT_IN : Appartenance à une liste
- IS_EMPTY / IS_NOT_EMPTY : Vérification de valeur nulle ou vide
- MATCHES_REGEX : Correspondance par expression régulière
Combiner les conditions
Les conditions sont organisées en groupes. Au sein d’un groupe, les conditions sont combinées à l’aide de la logique ET ou OU. Plusieurs groupes peuvent eux-mêmes être combinés avec une logique ET/OU, vous offrant une flexibilité totale pour exprimer des règles métier complexes.
Statistiques du segment
Après application d’une règle de segment, le système calcule et affiche :
- Le nombre total d’enregistrements correspondant au segment
- Le pourcentage du jeu de données total
- La distribution des valeurs au sein du segment
Auto-segmentation (regroupement par ML)
L’auto-segmentation utilise le machine learning non supervisé pour découvrir automatiquement des regroupements naturels dans vos données. La plateforme prend en charge trois algorithmes de clustering :
Clustering K-Means
L’algorithme le plus couramment utilisé, idéal pour trouver des clusters sphériques de taille similaire.
- Fonctionnement : Partitionne les données en K clusters en minimisant la distance entre les points de données et le centre de leur cluster.
- Configuration : Spécifiez le nombre de clusters (K) ou laissez le système détecter automatiquement le K optimal à l’aide de la méthode du coude et de l’analyse de silhouette.
- Scalabilité : Optimisé pour traiter efficacement de grands jeux de données.
Clustering hiérarchique
Construit une hiérarchie de clusters en arborescence, utile pour explorer les données à différents niveaux de granularité.
- Fonctionnement : Utilise une approche agglomérative (ascendante) avec des méthodes de liaison incluant ward, complete, average et single.
- Idéal pour : Les jeux de données plus petits où vous souhaitez explorer des structures de clusters imbriquées.
- Résultat : Une visualisation en dendrogramme montrant comment les clusters fusionnent à différents seuils de distance.
DBSCAN (clustering spatial basé sur la densité)
Découvre des clusters de forme arbitraire en fonction de la densité des données, en détectant automatiquement les valeurs aberrantes.
- Fonctionnement : Regroupe les points étroitement rassemblés, en marquant les points situés dans des régions à faible densité comme des valeurs aberrantes.
- Paramètres clés :
eps (rayon du voisinage) et min_samples (nombre minimum de points pour former un cluster).
- Idéal pour : Les jeux de données avec des clusters de forme irrégulière ou lorsque vous vous attendez à des valeurs aberrantes.
Prise en charge des types de données mixtes
Le moteur de clustering gère à la fois les données numériques et catégorielles :
- Caractéristiques numériques : Standardisées par normalisation avant le clustering.
- Caractéristiques catégorielles : Encodées de manière appropriée selon la cardinalité.
- Détection automatique : Le système identifie automatiquement les types de caractéristiques à partir des types de questions (RADIO, CHECKBOX, DROPDOWN sont traités comme catégoriels ; NPS, SLIDER et les champs numériques comme numériques).
Feature Studio
Avant d’exécuter le clustering, vous pouvez utiliser Feature Studio pour préparer et transformer les caractéristiques de vos données. Les transformations disponibles incluent :
- Normaliser : Mise à l’échelle standard, normalisation min-max
- Encoder : Encodage des variables catégorielles
- Imputer : Gérer les valeurs manquantes avec la moyenne, la médiane, le mode ou des stratégies personnalisées
- Discrétiser : Convertir les variables continues en classes discrètes (largeur égale, fréquence égale ou personnalisée)
- Mettre à l’échelle : Appliquer des transformations logarithmiques, en racine carrée ou d’autres mises à l’échelle
- Caractéristiques dérivées : Créer de nouvelles caractéristiques à partir des caractéristiques existantes à l’aide d’expressions personnalisées
- Sélection de caractéristiques : Identifier automatiquement les caractéristiques les plus importantes pour le clustering
Métriques de qualité du clustering
Après avoir exécuté l’auto-segmentation, la plateforme fournit des métriques de qualité pour évaluer vos clusters :
- Score de silhouette : Mesure à quel point un point est similaire à son propre cluster par rapport aux autres clusters. Varie de -1 à 1, des valeurs plus élevées indiquant des clusters mieux définis.
- Indice de Davies-Bouldin : Mesure la similarité moyenne entre les clusters. Des valeurs plus basses indiquent une meilleure séparation entre les clusters.
- Tailles des clusters : Le nombre d’enregistrements dans chaque cluster, vous aidant à identifier les segments déséquilibrés.
- Profils de clusters : Résumés statistiques de chaque cluster montrant les caractéristiques distinctives.
Segmentation prédictive
Une fois que vous avez établi des segments (par des règles ou par clustering), vous pouvez entraîner un modèle ML supervisé pour prédire l’appartenance à un segment pour de nouvelles données. La segmentation prédictive prend en charge :
- Régression logistique : Modèle rapide et interprétable pour la classification des segments.
- Forêt aléatoire : Modèle plus complexe capable de capturer des relations non linéaires.
Entraîner un modèle prédictif
- Sélectionnez les caractéristiques à utiliser pour la prédiction.
- Choisissez la colonne cible (affectations de segments existantes).
- Configurez le ratio de répartition test/entraînement (par défaut : 80/20).
- Sélectionnez le type de modèle (régression logistique ou forêt aléatoire).
- Entraînez le modèle et examinez les métriques (précision, exactitude, rappel, score F1, matrice de confusion).
Importance des caractéristiques
Après l’entraînement, le système extrait des scores d’importance des caractéristiques montrant quelles variables ont le plus d’influence sur l’affectation des segments. Cela vous aide à comprendre ce qui motive les différences entre vos segments.
Application des segments
Une fois les segments définis, ils sont stockés sur chaque enregistrement des données. Chaque enregistrement de segment inclut :
- configId : L’ID de la configuration de segmentation
- configName : Nom de la configuration de segmentation
- segmentName : Le nom du segment attribué
- appliedAt : Horodatage de l’application du segment
Les segments peuvent être utilisés comme filtres dans toute l’interface analytique et comme critères de ciblage dans les workflows de campagne.