Panoramica
Il modulo Data Management di SurveyAnalytica’s consente di caricare, organizzare e preparare dataset per analisi, machine learning e flussi di lavoro delle campagne. Che tu stia importando record clienti da un CSV, caricando immagini per la computer vision o collegandoti a un flusso di dati in tempo reale, la sezione Data offre un’esperienza guidata tramite wizard, dal caricamento fino all’analisi.
Accesso a Data Management
Dalla barra di navigazione principale, fai clic su Data. Verrà visualizzata la vista Data Listing, che mostra tutti i dataset presenti nel tuo workspace. Ogni riga mostra il nome del dataset, il tipo, l’origine dati, la data dell’ultima modifica e le dimensioni. Puoi cercare, filtrare, ordinare e navigare tra le pagine dei tuoi dataset.
Creazione di un nuovo dataset
Per creare un nuovo dataset, fai clic sul pulsante + New nella vista Data listing. Si aprirà il Dataset Wizard, un processo guidato in più passaggi che ti accompagna nell’intera configurazione del dataset.
Passaggio 1: Caricamento
Il passaggio di caricamento consente di trascinare e rilasciare i file oppure di sfogliare il computer per selezionarli. I formati di file supportati includono:
- Dati tabellari: CSV, Excel (.xlsx, .xls), Parquet, Avro, JSON
- Immagini: PNG, JPG, JPEG, GIF, BMP, WebP
- Documenti: PDF
- Archivi: ZIP (estratto automaticamente dopo il caricamento)
Funzionalità principali di caricamento:
- Caricamenti ripristinabili: i file di grandi dimensioni vengono caricati a blocchi con monitoraggio dell’avanzamento per ciascun file. Se un blocco fallisce, viene ritentato automaticamente.
- Caricamento multiplo: carica più file contemporaneamente. Ogni file mostra la propria barra di avanzamento con dettagli a livello di blocco.
- Rilevamento automatico: il sistema rileva automaticamente il tipo di dati (TABLE, IMAGE, ecc.) dai file caricati e suggerisce un nome per il dataset in base al primo file.
- Gestione ZIP: gli archivi ZIP vengono estratti e analizzati dopo il caricamento. Per i dataset di classificazione delle immagini, la struttura delle cartelle viene mantenuta e utilizzata per l’etichettatura delle classi.
- Miniature delle immagini: durante il caricamento di immagini, viene visualizzata una griglia di anteprima con miniature per verificare i file prima di procedere.
Caricamento diretto su cloud (Avanzato)
Per dataset molto grandi (oltre 5 GB), puoi utilizzare l’opzione Advanced: Direct Cloud Upload. Questa genera un percorso dropzone di storage cloud e un comando da eseguire dal terminale per caricare i file direttamente. Dopo il caricamento, fai clic su Scan Dropzone per rilevare i file caricati.
Passaggio 2: Configurazione
Dopo il caricamento, configura l’identità del tuo dataset:
- Nome del dataset: suggerito automaticamente in base al primo file caricato, oppure inserisci un nome descrittivo personalizzato.
- Descrizione: testo facoltativo che descrive lo scopo o il contenuto del dataset.
- Team / Workspace: seleziona a quale workspace o team appartiene questo dataset. Se appartieni a un solo team, viene selezionato automaticamente.
- Tipo di dati: rilevato automaticamente dai tuoi file. I tipi disponibili includono TABLE, IMAGE, VIDEO, AUDIO, TEXT, FILE e OTHER.
In Advanced Settings, puoi impostare:
- Periodo di conservazione (mesi): per quanto tempo mantenere questi dati prima dell’archiviazione. Il valore predefinito è 6 mesi.
- Periodo di archiviazione (mesi): per quanto tempo mantenere i dati archiviati prima dell’eliminazione. Il valore predefinito è 6 mesi.
Passaggio 3: Revisione e salvataggio
Rivedi un riepilogo della configurazione del tuo dataset: nome, descrizione, team, tipo di dati, numero totale di file caricati e impostazioni di conservazione. Fai clic su Save and Continue per salvare il dataset. Dopo il salvataggio, il sistema ti porta al passaggio di anteprima dei dati.
Dataset Wizard — Passaggi successivi al caricamento
Dopo il caricamento iniziale e il salvataggio, il Dataset Wizard offre passaggi aggiuntivi che dipendono dal fatto che i tuoi dati siano tabellari o basati su immagini.
Dataset tabellari (CSV, Excel, Parquet, JSON, Avro)
- Upload — carica i tuoi file.
- Prepare — anteprima dello schema. Il sistema legge i nomi e i tipi delle colonne dai file caricati. Rivedi lo schema rilevato, visualizza le metriche di qualità a livello di colonna e modifica i tipi di dati.
- Refine (Clean and Transform) — applica trasformazioni ai dati tramite una pipeline visiva. Le operazioni disponibili includono campi calcolati, pulizia dei dati e passaggi di trasformazione.
- Publish (Validate and Publish) — convalida l’integrità dei dati e pubblica il dataset per l’analisi.
- Analyze — apre la dashboard Analytics completa direttamente all’interno del contesto dei dati.
Dataset di immagini
- Upload — carica le immagini singolarmente, in blocco o come archivio ZIP.
- Prepare (Label) — assegna etichette alle immagini per la classificazione. Le etichette possono provenire dalla struttura delle cartelle, da file di mappatura CSV o da etichettatura manuale.
- Refine (Curate) — rivedi la qualità delle immagini, rileva valori anomali, escludi immagini problematiche e bilancia la distribuzione delle classi.
- Publish (Split and Export) — genera suddivisioni train/validation/test con rapporti configurabili. Esporta in più formati, incluse cartelle organizzate e manifest CSV.
- Analyze — visualizza le analisi sul tuo dataset di immagini, incluse le distribuzioni delle classi e le statistiche dei tag.
Definizione e mappatura dello schema
Quando crei un dataset tramite l’editor dello schema, definisci le colonne con le seguenti proprietà:
- Nome colonna e Descrizione
- Tipo di colonna: DATETIME, DATE, BOOL, BYTES, GEOGRAPHY, INTERVAL, INT64, NUMERIC, BIGNUMERIC, FLOAT64, RANGE, STRING, TIMESTAMP, TIME, STRUCT, ARRAY
- Proprietà colonna: isPrimaryKey, isUnique, isNullable, isAutoIncrement, isEncrypted, isAnonymized, isClassified, isCategorized, isNormalized, isStandardized
Archiviazione dei dati
Tutti i dataset tabellari sono archiviati in un data warehouse cloud scalabile per analisi ad alte prestazioni. Ogni dataset è organizzato all’interno del tuo workspace per una gestione e un controllo degli accessi semplificati.
Funzionalità di Data Listing
- Edit: apri il dataset nel wizard per modificarne la configurazione o lo schema.
- Clone: crea una copia del dataset e della sua configurazione.
- Lock / Unlock: impedisci modifiche accidentali a un dataset.
- Analyze: vai direttamente alla dashboard di analisi per questo dataset.
- Share: apri la vista della dashboard di analisi per la condivisione.
- Delete: rimuovi definitivamente il dataset. Supporta l’eliminazione singola e in blocco.
Salvataggio automatico e cronologia delle versioni
Il Dataset Wizard include una funzionalità di salvataggio automatico che conserva il tuo lavoro in modo automatico. La cronologia annulla/ripristina viene mantenuta fino a 50 versioni, così puoi annullare le modifiche.
Suggerimenti e best practice
- Usa nomi di dataset descrittivi in modo che siano facili da trovare nell’elenco.
- Per i dataset di classificazione delle immagini, organizza le immagini in cartelle per nome di classe prima di caricarle come ZIP — il sistema rileverà automaticamente le etichette delle classi dalla struttura delle cartelle.
- Imposta periodi di conservazione e archiviazione appropriati in base ai requisiti di governance dei dati.
- Usa l’opzione Direct Cloud Upload per dataset più grandi di 5 GB per evitare le limitazioni di caricamento del browser.
- Rivedi sempre lo schema rilevato automaticamente prima della pubblicazione per assicurarti che i tipi di colonna siano corretti.