Aperçu
Le module de balisage d’images de SurveyAnalytica offre un flux de travail complet pour organiser, étiqueter et préparer des jeux de données d’images pour le machine learning. Que vous construisiez un modèle de classification d’images, que vous constituiez un catalogue de produits ou que vous analysiez du contenu visuel issu d’enquêtes, les outils de balisage d’images vous offrent un balisage automatique via une vision par ordinateur alimentée par l’IA, des interfaces de balisage manuel, des opérations groupées et une exportation directe vers votre moteur d’analyse.
Prise en main du balisage d’images
Téléverser des images
Téléversez des images via l’assistant de gestion des données. Vous pouvez téléverser des images individuelles, plusieurs images à la fois, ou une archive ZIP contenant des images organisées en dossiers. Les formats d’image pris en charge incluent PNG, JPG, JPEG, GIF, BMP et WebP.
Indexation des images
Après le téléversement, les images doivent être indexées. Le processus d’indexation analyse vos fichiers téléversés et crée des enregistrements dans la base de données de balisage d’images avec des métadonnées complètes. Accédez à votre jeu de données d’images et le système tentera automatiquement d’indexer les images de vos dossiers de téléversement.
Pendant l’indexation, le système extrait :
- Métadonnées du fichier : Nom de fichier, extension, taille, type de contenu, date de téléversement
- Structure des dossiers : Segments de chemin, dossiers parents
- Indices de classification : Détecte automatiquement les noms de classe à partir des noms de dossiers et les indicateurs de répartition train/test/validation à partir des chemins de dossiers
- Tags suggérés : Générés à partir des noms de classe basés sur les dossiers et des affectations de répartition
Utilisez Forcer la réindexation pour supprimer tous les enregistrements d’images existants et réindexer depuis le début.
Balisage automatique avec la vision par ordinateur
La fonctionnalité de balisage automatique utilise la vision par ordinateur alimentée par l’IA pour analyser automatiquement les images et générer des tags descriptifs.
- Accédez à votre jeu de données d’images.
- Cliquez sur Balisage automatique pour démarrer le processus.
- Le système traite toutes les images par lot, en analysant chaque image à l’aide de la vision par ordinateur.
- Les résultats sont enregistrés avec les tags, les scores de confiance, et la source marquée comme générée automatiquement.
Chaque tag comprend :
- tag : Le texte du libellé (par exemple, “chien”, “extérieur”, “montagne”)
- source : La manière dont le tag a été créé — généré automatiquement, manuel, dossier, classification, répartition
- confidence : Un score de 0 à 1 indiquant le degré de certitude du tag
- approved : Booléen indiquant si le tag a été révisé et approuvé
Balisage manuel
Vous pouvez ajouter, modifier ou supprimer manuellement des tags sur n’importe quelle image :
- Ajouter des tags : Saisissez de nouveaux noms de tags et attribuez-les à des images individuelles ou en masse.
- Modifier des tags : Modifiez les libellés de tags existants ou les scores de confiance.
- Supprimer des tags : Supprimez les tags incorrects ou indésirables.
- Approuver des tags : Révisez les tags générés automatiquement et marquez-les comme approuvés.
Opérations groupées
Pour les grands jeux de données, les opérations groupées sont essentielles :
Balisage groupé
Appliquez des tags à plusieurs images à la fois. Vous pouvez cibler des images par :
- Identifiants d’images explicites : Sélectionnez des images spécifiques à baliser.
- Critères de filtre : Appliquez des tags à toutes les images correspondant à une répartition, un nom de classe ou un dossier.
- Mode : Choisissez “ajouter” pour ajouter des tags sans supprimer les existants, ou “remplacer” pour écraser tous les tags.
Approbation groupée
Révisez et approuvez des tags sur plusieurs images simultanément. Approuvez tous les tags pour les images sélectionnées ou pour l’ensemble du jeu de données.
Convertissez les tags suggérés (générés à partir de la structure des dossiers, des noms de fichiers ou de la détection de répartition) en tags confirmés. Sélectionnez les sources de suggestion à promouvoir (dossier, répartition, nom de fichier).
Restauration groupée
Restaurez les tags de plusieurs images à la fois, utile pour les opérations d’annulation après des modifications groupées.
Filtrage et recherche
L’interface de balisage d’images offre un filtrage puissant :
- Par répartition : Filtrez les images par répartition train, test, validation ou dev
- Par nom de classe : Filtrez par étiquette de classe détectée ou assignée
- Par dossier : Filtrez par dossier source
- Par recherche : Recherchez par nom de fichier ou identifiant d’image
- Par statut de tag : Affichez les images non balisées, balisées ou approuvées
Les facettes sont calculées dynamiquement avec un comportement en cascade — sélectionner un filtre de répartition met à jour les noms de classe disponibles en conséquence.
Options de tri
- Nom de fichier (croissant/décroissant)
- Date (croissante/décroissante)
- Nombre de tags (croissant/décroissant)
Exclusion d’images
Excluez les images problématiques de votre jeu de données sans les supprimer :
- Marquez les images comme exclues avec un motif (manuel, doublon, mauvaise qualité, etc.)
- Restaurez les images exclues en cas de besoin
- Consultez le nombre d’images exclues réparties par motif
- Les images exclues sont automatiquement filtrées lors de la génération des données d’entraînement
Statistiques des images
La fonctionnalité de statistiques d’images fournit des métadonnées détaillées sur votre jeu de données :
- Dimensions : Largeur et hauteur minimales, maximales, moyennes et médianes sur toutes les images
- Formats : Répartition des formats d’image (JPEG, PNG, etc.)
- Tailles de fichier : Tailles de fichier minimales, maximales, moyennes en Ko et taille totale en Mo
- Valeurs aberrantes : Images dont les dimensions dépassent 3 fois la médiane, signalées pour révision
Flux de travail de classification
Pour la construction de modèles de classification d’images, la plateforme fournit un pipeline de classification complet :
Analyser la structure du jeu de données
Le système analyse la structure de vos dossiers pour détecter les classes, les répartitions et les images non classifiées. Il prend en charge à la fois l’analyse de dossiers standard et l’analyse intelligente alimentée par l’IA.
Attribution des étiquettes
Les étiquettes peuvent être attribuées à partir de plusieurs sources :
- Structure des dossiers : Détectée automatiquement à partir des noms de sous-dossiers
- Fichier CSV : Téléversez ou sélectionnez un fichier CSV avec des correspondances nom de fichier-étiquette. Le système détecte automatiquement les colonnes de nom de fichier et d’étiquette.
- Tags existants : Convertissez les tags d’images approuvés en étiquettes de classification.
- Attribution manuelle : Attribuez des étiquettes à des images spécifiques via l’interface utilisateur.
Détection du déséquilibre des classes
La plateforme analyse la distribution des classes et fournit :
- Le nombre et le pourcentage par classe
- Le ratio de déséquilibre (plus grande classe / plus petite classe)
- Le niveau de gravité (faible, modéré, élevé)
- Des recommandations pour l’équilibrage (sous-échantillonnage, sur-échantillonnage, ou collecte de données supplémentaires)
Équilibrage du jeu de données
Équilibrez automatiquement votre jeu de données en excluant les images excédentaires des classes les plus grandes (sous-échantillonnage). Le système utilise un échantillonnage aléatoire avec une graine fixe pour garantir la reproductibilité.
Génération des données d’entraînement
Générez des répartitions train/validation/test avec des ratios configurables :
- Répartition par défaut : 70 % entraînement, 15 % validation, 15 % test
- Échantillonnage stratifié : Garantit que chaque classe est représentée proportionnellement dans chaque répartition
- Formats d’exportation : Structure de dossiers (images organisées en dossiers train/val/test) et manifeste CSV
- Exclusion des images exclues : Filtre automatiquement les images exclues des données d’entraînement
Exportation des données
Exportez les tags approuvés et les métadonnées d’images pour l’analyse. L’exportation crée un jeu de données structuré avec l’identifiant d’image, le chemin du fichier, le nom du fichier, les tags et les champs personnalisés, permettant l’analyse de votre jeu de données d’images.
Toutes les opérations de balisage sont enregistrées dans un journal d’historique, y compris les opérations groupées, les modifications manuelles, les promotions, les approbations et les restaurations. Cela fournit une piste d’audit complète de la manière dont votre jeu de données a été constitué au fil du temps.