Aperçu
Le module Gestion des données de SurveyAnalytica vous permet de charger, organiser et préparer des jeux de données pour l’analytique, le machine learning et les workflows de campagne. Que vous importiez des fiches clients depuis un CSV, que vous chargiez des images pour la vision par ordinateur, ou que vous vous connectiez à un flux de données en direct, la section Data vous offre une expérience guidée par assistant, du chargement jusqu’à l’analyse.
Accéder à la gestion des données
Depuis la barre de navigation principale, cliquez sur Data. Vous verrez la vue Liste des données, qui affiche tous les jeux de données de votre espace de travail. Chaque ligne indique le nom du jeu de données, son type, sa source, la date de dernière modification et sa taille. Vous pouvez rechercher, filtrer, trier et paginer vos jeux de données.
Créer un nouveau jeu de données
Pour créer un nouveau jeu de données, cliquez sur le bouton + New dans la vue Liste des données. Cela ouvre l’Assistant de jeu de données, un processus guidé en plusieurs étapes qui vous accompagne dans toute la configuration du jeu de données.
Étape 1 : Chargement
L’étape de chargement vous permet de glisser-déposer des fichiers ou de parcourir votre ordinateur pour les sélectionner. Les formats de fichiers pris en charge incluent :
- Données tabulaires : CSV, Excel (.xlsx, .xls), Parquet, Avro, JSON
- Images : PNG, JPG, JPEG, GIF, BMP, WebP
- Documents : PDF
- Archives : ZIP (extraction automatique après le chargement)
Principales fonctionnalités de chargement :
- Chargements reprenables : Les fichiers volumineux sont chargés par blocs avec suivi de la progression pour chaque fichier. En cas d’échec d’un bloc, celui-ci est automatiquement retenté.
- Chargement multi-fichiers : Chargez plusieurs fichiers à la fois. Chaque fichier affiche sa propre barre de progression avec le détail au niveau des blocs.
- Détection automatique : Le système détecte automatiquement le type de données (TABLE, IMAGE, etc.) à partir des fichiers chargés et suggère un nom de jeu de données basé sur le premier fichier.
- Gestion des ZIP : Les archives ZIP sont extraites et analysées après le chargement. Pour les jeux de données de classification d’images, la structure des dossiers est conservée et utilisée pour l’étiquetage des classes.
- Miniatures d’images : Lors du chargement d’images, une grille d’aperçu en miniatures s’affiche afin que vous puissiez vérifier les fichiers avant de continuer.
Chargement direct vers le cloud (Avancé)
Pour les jeux de données très volumineux (plus de 5 Go), vous pouvez utiliser l’option Avancé : Chargement direct vers le cloud. Cela génère un chemin de dépôt de stockage cloud et une commande que vous pouvez exécuter depuis votre terminal pour charger les fichiers directement. Après le chargement, cliquez sur Scan Dropzone pour détecter les fichiers chargés.
Étape 2 : Configuration
Après le chargement, configurez l’identité de votre jeu de données :
- Nom du jeu de données : Suggéré automatiquement à partir du premier fichier chargé, ou saisissez votre propre nom descriptif.
- Description : Texte facultatif décrivant l’objectif ou le contenu du jeu de données.
- Équipe / Espace de travail : Sélectionnez l’espace de travail ou l’équipe auquel appartient ce jeu de données. Si vous n’appartenez qu’à une seule équipe, elle est sélectionnée automatiquement.
- Type de données : Détecté automatiquement à partir de vos fichiers. Les types disponibles incluent TABLE, IMAGE, VIDEO, AUDIO, TEXT, FILE et OTHER.
Dans les Paramètres avancés, vous pouvez définir :
- Période de rétention (mois) : Durée de conservation de ces données avant archivage. La valeur par défaut est 6 mois.
- Période d’archivage (mois) : Durée de conservation des données archivées avant suppression. La valeur par défaut est 6 mois.
Étape 3 : Vérification et enregistrement
Vérifiez un résumé de la configuration de votre jeu de données : nom, description, équipe, type de données, nombre total de fichiers chargés et paramètres de rétention. Cliquez sur Save and Continue pour enregistrer le jeu de données. Une fois l’enregistrement effectué, le système vous dirige vers l’étape d’aperçu des données.
Assistant de jeu de données — Étapes après le chargement
Après le chargement initial et l’enregistrement, l’Assistant de jeu de données propose des étapes supplémentaires qui dépendent du fait que vos données soient tabulaires ou de type image.
Jeux de données tabulaires (CSV, Excel, Parquet, JSON, Avro)
- Upload — Chargez vos fichiers.
- Prepare — Prévisualisez le schéma. Le système lit les noms de colonnes et leurs types à partir de vos fichiers chargés. Vérifiez le schéma détecté, consultez les indicateurs de qualité au niveau des colonnes et ajustez les types de données.
- Refine (Clean and Transform) — Appliquez des transformations de données via un pipeline visuel. Les opérations disponibles incluent les champs calculés, le nettoyage des données et les étapes de transformation.
- Publish (Validate and Publish) — Validez l’intégrité des données et publiez le jeu de données pour l’analyse.
- Analyze — Ouvre le tableau de bord Analytics complet directement dans le contexte des données.
Jeux de données d’images
- Upload — Chargez des images individuellement, en masse, ou sous forme d’archive ZIP.
- Prepare (Label) — Attribuez des étiquettes aux images pour la classification. Les étiquettes peuvent provenir de la structure des dossiers, de fichiers de mappage CSV ou d’un étiquetage manuel.
- Refine (Curate) — Vérifiez la qualité des images, détectez les valeurs aberrantes, excluez les images problématiques et équilibrez la répartition des classes.
- Publish (Split and Export) — Générez des répartitions train/validation/test avec des ratios configurables. Exportez dans plusieurs formats, y compris des dossiers organisés et des manifestes CSV.
- Analyze — Consultez les analyses de votre jeu de données d’images, y compris la répartition des classes et les statistiques d’étiquettes.
Définition et mappage du schéma
Lors de la création d’un jeu de données via l’éditeur de schéma, vous définissez des colonnes avec les propriétés suivantes :
- Nom de colonne et Description
- Type de colonne : DATETIME, DATE, BOOL, BYTES, GEOGRAPHY, INTERVAL, INT64, NUMERIC, BIGNUMERIC, FLOAT64, RANGE, STRING, TIMESTAMP, TIME, STRUCT, ARRAY
- Propriétés de colonne : isPrimaryKey, isUnique, isNullable, isAutoIncrement, isEncrypted, isAnonymized, isClassified, isCategorized, isNormalized, isStandardized
Stockage des données
Tous les jeux de données tabulaires sont stockés dans un entrepôt de données cloud évolutif pour une analytique haute performance. Chaque jeu de données est organisé au sein de votre espace de travail pour faciliter la gestion et le contrôle des accès.
Fonctionnalités de la liste des données
- Edit : Ouvrez le jeu de données dans l’assistant pour modifier la configuration ou le schéma.
- Clone : Créez une copie du jeu de données et de sa configuration.
- Lock / Unlock : Empêchez les modifications accidentelles d’un jeu de données.
- Analyze : Accédez directement au tableau de bord analytique de ce jeu de données.
- Share : Ouvrez la vue du tableau de bord analytique pour le partage.
- Delete : Supprimez définitivement le jeu de données. La suppression unique et groupée est prise en charge.
Enregistrement automatique et historique des versions
L’Assistant de jeu de données inclut une fonctionnalité d’enregistrement automatique qui sauvegarde votre travail automatiquement. L’historique d’annulation/rétablissement est conservé jusqu’à 50 versions afin que vous puissiez annuler des modifications.
Conseils et bonnes pratiques
- Utilisez des noms de jeux de données descriptifs afin qu’ils soient faciles à retrouver dans la liste.
- Pour les jeux de données de classification d’images, organisez les images en dossiers par nom de classe avant de les charger sous forme de ZIP — le système détectera automatiquement les étiquettes de classe à partir de la structure des dossiers.
- Définissez des périodes de rétention et d’archivage adaptées à vos exigences de gouvernance des données.
- Utilisez l’option de chargement direct vers le cloud pour les jeux de données de plus de 5 Go afin d’éviter les limitations de chargement du navigateur.
- Vérifiez toujours le schéma auto-détecté avant la publication pour vous assurer que les types de colonnes sont corrects.