Panoramica
Il modulo di Segmentazione Avanzata di SurveyAnalytica’s ti consente di suddividere i tuoi dati in gruppi significativi in base a caratteristiche condivise. La piattaforma supporta tre approcci di segmentazione: la segmentazione basata su regole che utilizza la logica di business, l’auto-segmentazione che utilizza algoritmi di machine learning non supervisionato e la segmentazione predittiva che utilizza classificatori ML supervisionati. Accedi alla segmentazione da qualsiasi vista di analisi facendo clic sulla scheda Segments.
Segmentazione Basata su Regole
La segmentazione basata su regole ti consente di definire segmenti utilizzando condizioni esplicite e regole di business. Questo approccio è ideale quando sai esattamente come vuoi categorizzare i tuoi dati.
Creazione di una Regola di Segmento
- Vai alla vista Segments all’interno di Analytics.
- Fai clic su Create Segment e seleziona Rules-Based.
- Assegna al tuo segmento un nome descrittivo.
- Aggiungi condizioni utilizzando il generatore di condizioni.
Operatori di Condizione
Ogni condizione valuta un campo rispetto a un valore utilizzando uno di questi operatori:
- EQUALS / NOT_EQUALS: Corrispondenza esatta (senza distinzione tra maiuscole e minuscole per le stringhe)
- CONTAINS / NOT_CONTAINS: Corrispondenza di sottostringa
- STARTS_WITH / ENDS_WITH: Corrispondenza di prefisso o suffisso
- GREATER_THAN / LESS_THAN: Confronto numerico
- GREATER_THAN_OR_EQUAL / LESS_THAN_OR_EQUAL: Confronto numerico inclusivo
- BETWEEN: Controllo di intervallo (richiede un secondo valore)
- IN / NOT_IN: Appartenenza a una lista
- IS_EMPTY / IS_NOT_EMPTY: Controllo di valore nullo o vuoto
- MATCHES_REGEX: Corrispondenza con espressione regolare
Combinazione delle Condizioni
Le condizioni sono organizzate in gruppi. All’interno di un gruppo, le condizioni vengono combinate utilizzando la logica AND o OR. Più gruppi possono a loro volta essere combinati con logica AND/OR, offrendoti piena flessibilità per esprimere regole di business complesse.
Statistiche del Segmento
Dopo aver applicato una regola di segmento, il sistema calcola e visualizza:
- Totale dei record corrispondenti al segmento
- Percentuale sul totale del dataset
- Distribuzione dei valori all’interno del segmento
Auto-Segmentazione (Clustering ML)
L’auto-segmentazione utilizza il machine learning non supervisionato per scoprire automaticamente raggruppamenti naturali nei tuoi dati. La piattaforma supporta tre algoritmi di clustering:
K-Means Clustering
L’algoritmo più comunemente usato, ideale per trovare cluster sferici di dimensioni simili.
- Come funziona: Suddivide i dati in K cluster minimizzando la distanza tra i punti dati e il centro del loro cluster.
- Configurazione: Specifica il numero di cluster (K) oppure lascia che il sistema rilevi automaticamente il K ottimale utilizzando il metodo del gomito e l’analisi della silhouette.
- Scalabilità: Ottimizzato per gestire in modo efficiente grandi dataset.
Clustering Gerarchico
Costruisce una gerarchia ad albero di cluster, utile per esplorare i dati a diversi livelli di granularità.
- Come funziona: Utilizza un approccio agglomerativo (dal basso verso l’alto) con metodi di collegamento tra cui ward, complete, average e single.
- Ideale per: Dataset più piccoli in cui si desidera esplorare strutture di cluster annidate.
- Output: Una visualizzazione a dendrogramma che mostra come i cluster si uniscono a diverse soglie di distanza.
DBSCAN (Clustering Spaziale Basato sulla Densità)
Scopre cluster di forma arbitraria in base alla densità dei dati, rilevando automaticamente i valori anomali.
- Come funziona: Raggruppa punti strettamente ravvicinati, contrassegnando i punti nelle regioni a bassa densità come valori anomali.
- Parametri chiave:
eps (raggio del vicinato) e min_samples (numero minimo di punti per formare un cluster).
- Ideale per: Dataset con cluster di forma irregolare o quando si prevedono valori anomali.
Supporto per Tipi di Dati Misti
Il motore di clustering gestisce sia dati numerici che categorici:
- Caratteristiche numeriche: Standardizzate mediante normalizzazione prima del clustering.
- Caratteristiche categoriche: Codificate in modo appropriato a seconda della cardinalità.
- Rilevamento automatico: Il sistema identifica automaticamente i tipi di caratteristiche dai tipi di domanda (RADIO, CHECKBOX, DROPDOWN sono trattati come categorici; NPS, SLIDER e campi numerici come numerici).
Feature Studio
Prima di eseguire il clustering, puoi utilizzare Feature Studio per preparare e trasformare le caratteristiche dei tuoi dati. Le trasformazioni disponibili includono:
- Normalize: Scaling standard, normalizzazione min-max
- Encode: Codifica per le variabili categoriche
- Impute: Gestione dei valori mancanti con media, mediana, moda o strategie personalizzate
- Bin: Conversione di variabili continue in bin discreti (larghezza uguale, frequenza uguale o personalizzato)
- Scale: Applicazione di trasformazioni di scaling logaritmiche, radice quadrata o di altro tipo
- Derived features: Creazione di nuove caratteristiche da quelle esistenti utilizzando espressioni personalizzate
- Feature selection: Identificazione automatica delle caratteristiche più importanti per il clustering
Metriche di Qualità del Clustering
Dopo aver eseguito l’auto-segmentazione, la piattaforma fornisce metriche di qualità per valutare i tuoi cluster:
- Silhouette Score: Misura quanto un punto sia simile al proprio cluster rispetto ad altri cluster. Varia da -1 a 1, con valori più alti che indicano cluster meglio definiti.
- Davies-Bouldin Index: Misura la somiglianza media tra i cluster. Valori più bassi indicano una migliore separazione tra i cluster.
- Dimensioni dei cluster: Il numero di record in ciascun cluster, per aiutarti a identificare segmenti sbilanciati.
- Profili dei cluster: Riepiloghi statistici di ciascun cluster che mostrano le caratteristiche distintive.
Segmentazione Predittiva
Una volta stabiliti i segmenti (tramite regole o clustering), puoi addestrare un modello ML supervisionato per prevedere l’appartenenza ai segmenti per i nuovi dati. La segmentazione predittiva supporta:
- Logistic Regression: Modello veloce e interpretabile per la classificazione dei segmenti.
- Random Forest: Modello più complesso in grado di catturare relazioni non lineari.
Addestramento di un Modello Predittivo
- Seleziona le caratteristiche da utilizzare per la previsione.
- Scegli la colonna target (assegnazioni di segmento esistenti).
- Configura il rapporto di divisione test/train (predefinito: 80/20).
- Seleziona il tipo di modello (regressione logistica o random forest).
- Addestra il modello e rivedi le metriche (accuratezza, precisione, richiamo, punteggio F1, matrice di confusione).
Importanza delle Caratteristiche
Dopo l’addestramento, il sistema estrae i punteggi di importanza delle caratteristiche che mostrano quali variabili hanno maggiore influenza sull’assegnazione dei segmenti. Questo ti aiuta a capire cosa determina le differenze tra i tuoi segmenti.
Applicazione dei Segmenti
Una volta definiti i segmenti, questi vengono memorizzati su ciascun record nei dati. Ogni record di segmento include:
- configId: L’ID della configurazione di segmentazione
- configName: Nome della configurazione di segmentazione
- segmentName: Il nome del segmento assegnato
- appliedAt: Timestamp di quando il segmento è stato applicato
I segmenti possono essere utilizzati come filtri in tutta l’interfaccia di analisi e come criteri di targeting nei flussi di lavoro delle campagne.