Vue d’ensemble
SurveyAnalytica offre un cycle de vie complet de machine learning au sein de la plateforme, vous permettant de créer, entraîner, versionner, évaluer et déployer des modèles ML sans écrire de code. Les capacités ML couvrent la classification et la régression sur données tabulaires, la classification d’images avec AutoML et l’apprentissage par transfert, ainsi que l’entraînement de modèles personnalisés avec des ressources de calcul dédiées.
Accéder aux modèles
Accédez à l’interface de gestion des modèles ML depuis la section Data. Lors de la consultation d’un jeu de données, la vue Predictions au sein des analyses affiche les modèles entraînés et leurs résultats.
Créer un modèle
Pour créer un nouveau modèle, indiquez les informations suivantes :
- Nom : Un nom descriptif pour votre modèle.
- Catégorie : Le type de tâche ML — classification, régression, clustering ou prévision.
- Type de modèle : L’algorithme à utiliser. Les options incluent :
- Modèles tabulaires : Régression logistique, arbre boosté, réseau neuronal profond, forêt aléatoire, XGBoost, série temporelle ARIMA, clustering K-means
- Modèles d’image : AutoML vision, modèles d’apprentissage par transfert
- Modèles de texte : Modèles de langage, AutoML texte
- AutoML : Modèles tabulaires et de classification automatisés
- Espace de travail : L’espace de travail auquel ce modèle appartient.
- Entité de données : Le jeu de données sur lequel entraîner le modèle.
- Schéma d’entrée/sortie : Définissez les caractéristiques d’entrée attendues et les prédictions de sortie.
Entraîner un modèle
Démarrer l’entraînement
Une fois un modèle créé, démarrez l’entraînement en configurant :
- Jeu de données : La source de données pour l’entraînement — données tabulaires ou données image.
- Colonne cible : La colonne à prédire (pour l’apprentissage supervisé).
- Hyperparamètres : Paramètres spécifiques à l’algorithme tels que le taux d’apprentissage, la taille de lot, les epochs, le nombre d’arbres, etc.
- Ressources de calcul : Le niveau de ressources de calcul alloué pour l’entraînement.
- Accélération GPU : Ressources GPU optionnelles pour les modèles d’image et d’apprentissage profond.
- Heures de budget : Durée maximale d’entraînement autorisée.
Options d’entraînement
Entraînement sur données tabulaires
Pour les données structurées, l’entraînement s’exécute sur un backend optimisé conçu pour un ML rapide et évolutif sur données tabulaires. C’est l’option la plus rapide pour les jeux de données structurés et elle prend en charge tous les types de modèles ML standard.
Entraînement de modèles d’image et personnalisés
Pour la classification d’images, l’apprentissage par transfert et les modèles personnalisés, l’entraînement s’exécute sur des ressources de calcul dédiées avec accélération GPU. Parcours d’entraînement pris en charge :
- AutoML Tabulaire : Ingénierie des caractéristiques et sélection de modèle automatisées.
- AutoML Image : Entraînement automatisé de modèles de classification d’images.
- Apprentissage par transfert : Affinez des modèles pré-entraînés sur vos données. Epochs, taux d’apprentissage, taille de lot et taille d’image configurables.
- Modèles personnalisés : Entraînez des modèles d’apprentissage profond personnalisés avec un contrôle total sur l’architecture.
Suivi de l’entraînement
La progression de l’entraînement est suivie en temps réel via :
- Flux de progression en direct : Mises à jour de progression en temps réel envoyées à l’interface, indiquant l’étape (initialisation, entraînement, terminé), le pourcentage et les messages.
- Vérification du statut : Vérification du statut par sondage avec détection et récupération automatiques des statuts périmés.
- Suivi de l’activité : Toutes les activités d’entraînement sont enregistrées avec horodatages, coûts et métriques.
Recherche par grille (réglage des hyperparamètres)
Pour une optimisation systématique des hyperparamètres, utilisez la recherche par grille afin d’entraîner automatiquement plusieurs variantes de modèle :
- Définissez une grille de paramètres spécifiant les valeurs à tester pour chaque hyperparamètre.
- Définissez le nombre maximal de tâches parallèles (par défaut : 5).
- Le système génère toutes les combinaisons de paramètres et soumet chacune comme une tâche d’entraînement distincte.
- Les résultats sont suivis et comparés, affichant les métriques pour chaque combinaison.
Exemple de grille de paramètres :
{
"learning_rate": [0.001, 0.01, 0.1],
"batch_size": [16, 32, 64],
"epochs": [10, 20, 50]
}
Cela générerait 27 combinaisons (3 x 3 x 3) et entraînerait chacune d’elles.
Versionnage des modèles
Chaque modèle prend en charge plusieurs versions, vous permettant d’itérer et de comparer :
- Ajouter une version : Chaque exécution d’entraînement crée une nouvelle version avec ses propres hyperparamètres, métriques et références d’artefacts.
- Version en direct : Promouvez une version spécifique au statut “live” pour le déploiement et l’inférence.
- Archiver une version : Archivez les anciennes versions pour faire le ménage tout en préservant l’historique. Nettoyage optionnel des artefacts cloud.
- Supprimer une version : Supprimez définitivement une version et ses artefacts.
- Actualiser les métriques : Récupérez à nouveau les métriques pour toutes les versions, en récupérant tout statut d’entraînement périmé.
Métadonnées de version
Chaque version stocke :
- Les hyperparamètres utilisés pour l’entraînement
- La configuration d’entraînement (colonne cible, jeu de données, type de modèle)
- La référence de la tâche d’entraînement
- Les métriques (précision, précision positive, rappel, F1, AUC, perte, etc.)
- Les minutes d’exécution et le coût estimé en USD
- Les références d’artefacts du modèle (pour le déploiement)
Déploiement de modèles
Les modèles entraînés peuvent être déployés en tant qu’agents API pour l’inférence en temps réel :
- Modèles tabulaires : Déployés avec résolution automatique des références de modèle. Le système vérifie que le modèle existe avant le déploiement.
- Modèles d’image/personnalisés : Déployés avec des artefacts de modèle exportés. Le système s’assure que l’export est disponible avant de créer l’agent.
Le déploiement crée un service conteneurisé qui expose le modèle en tant qu’API REST. Consultez l’article sur les Agents IA pour plus de détails sur la gestion des agents.
Téléchargement des modèles
Téléchargez les artefacts de modèles entraînés dans divers formats via des liens de téléchargement sécurisés et à durée limitée. Sélectionnez le modèle, la version et le format pour générer un lien de téléchargement.
Chronologie des activités
La chronologie des activités ML affiche un historique chronologique de toutes les opérations ML dans votre espace de travail, y compris les exécutions d’entraînement, les recherches par grille, les déploiements et leurs statuts (en cours, terminé, échoué). Chaque activité inclut des horodatages, des coûts et des liens vers le modèle et la version associés.