Descripción general
SurveyAnalytica ofrece un ciclo de vida completo de machine learning dentro de la plataforma, que le permite crear, entrenar, versionar, evaluar e implementar modelos de ML sin escribir código. Las capacidades de ML abarcan la clasificación y regresión de datos tabulares, la clasificación de imágenes con AutoML y transfer learning, y el entrenamiento de modelos personalizados con recursos de cómputo dedicados.
Navegar a Modelos
Acceda a la interfaz de gestión de modelos de ML desde la sección Data. Al ver un conjunto de datos, la vista Predictions dentro de analíticas muestra los modelos entrenados y sus resultados.
Crear un modelo
Para crear un nuevo modelo, proporcione la siguiente información:
- Nombre: Un nombre descriptivo para su modelo.
- Categoría: El tipo de tarea de ML: clasificación, regresión, clustering o pronóstico.
- Tipo de modelo: El algoritmo a utilizar. Las opciones incluyen:
- Modelos tabulares: Regresión logística, árbol potenciado (boosted tree), red neuronal profunda, random forest, XGBoost, series temporales ARIMA, clustering K-means
- Modelos de imagen: AutoML vision, modelos de transfer learning
- Modelos de texto: Modelos de lenguaje, AutoML text
- AutoML: Modelos tabulares y de clasificación automatizados
- Workspace: El espacio de trabajo al que pertenece este modelo.
- Entidad de datos: El conjunto de datos sobre el que se entrenará.
- Esquema de entrada/salida: Defina las características de entrada esperadas y las predicciones de salida.
Entrenar un modelo
Iniciar el entrenamiento
Una vez creado un modelo, inicie el entrenamiento configurando:
- Conjunto de datos: La fuente de datos para el entrenamiento: datos tabulares o datos de imagen.
- Columna objetivo: La columna a predecir (para aprendizaje supervisado).
- Hiperparámetros: Configuraciones específicas del algoritmo, como la tasa de aprendizaje, el tamaño de lote, las épocas, el número de árboles, etc.
- Recursos de cómputo: El nivel de recursos de cómputo asignados para el entrenamiento.
- Aceleración por GPU: Recursos de GPU opcionales para modelos de imagen y deep learning.
- Horas de presupuesto: Tiempo máximo de entrenamiento permitido.
Opciones de entrenamiento
Entrenamiento con datos tabulares
Para datos estructurados, el entrenamiento se ejecuta en un backend optimizado, diseñado para ML rápido y escalable sobre datos tabulares. Esta es la opción más rápida para conjuntos de datos estructurados y admite todos los tipos de modelos de ML estándar.
Entrenamiento de imágenes y modelos personalizados
Para la clasificación de imágenes, el transfer learning y los modelos personalizados, el entrenamiento se ejecuta en recursos de cómputo dedicados con aceleración por GPU. Rutas de entrenamiento admitidas:
- AutoML Tabular: Ingeniería de características y selección de modelo automatizadas.
- AutoML Image: Entrenamiento automatizado de modelos de clasificación de imágenes.
- Transfer Learning: Ajuste fino de modelos preentrenados con sus datos. Épocas, tasa de aprendizaje, tamaño de lote y tamaño de imagen configurables.
- Modelos personalizados: Entrene modelos de deep learning personalizados con control total sobre la arquitectura.
Monitoreo del entrenamiento
El progreso del entrenamiento se rastrea en tiempo real mediante:
- Flujo de progreso en vivo: Actualizaciones de progreso en tiempo real enviadas a la interfaz, mostrando la etapa (inicializando, entrenando, completo), el porcentaje y los mensajes.
- Verificación de estado: Verificación de estado mediante sondeo (polling), con detección y recuperación automática de estados obsoletos.
- Seguimiento de actividad: Todas las actividades de entrenamiento se registran con marcas de tiempo, costos y métricas.
Grid Search (ajuste de hiperparámetros)
Para la optimización sistemática de hiperparámetros, use Grid Search para entrenar automáticamente múltiples variantes del modelo:
- Defina una cuadrícula de parámetros especificando los valores a probar para cada hiperparámetro.
- Establezca el máximo de trabajos en paralelo (predeterminado: 5).
- El sistema genera todas las combinaciones de parámetros y envía cada una como un trabajo de entrenamiento independiente.
- Los resultados se rastrean y comparan, mostrando las métricas de cada combinación.
Ejemplo de cuadrícula de parámetros:
{
"learning_rate": [0.001, 0.01, 0.1],
"batch_size": [16, 32, 64],
"epochs": [10, 20, 50]
}
Esto generaría 27 combinaciones (3 x 3 x 3) y entrenaría cada una.
Versionado de modelos
Cada modelo admite múltiples versiones, lo que le permite iterar y comparar:
- Agregar versión: Cada ejecución de entrenamiento crea una nueva versión con sus propios hiperparámetros, métricas y referencias de artefactos.
- Versión activa (live): Promueva una versión específica al estado “live” para su implementación e inferencia.
- Archivar versión: Archive versiones antiguas para hacer limpieza conservando el historial. Opcionalmente, elimine los artefactos en la nube.
- Eliminar versión: Elimine permanentemente una versión y sus artefactos.
- Actualizar métricas: Vuelva a obtener las métricas de todas las versiones, recuperando cualquier estado de entrenamiento obsoleto.
Cada versión almacena:
- Hiperparámetros usados para el entrenamiento
- Configuración de entrenamiento (columna objetivo, conjunto de datos, tipo de modelo)
- Referencia del trabajo de entrenamiento
- Métricas (accuracy, precision, recall, F1, AUC, loss, etc.)
- Minutos de ejecución y costo estimado en USD
- Referencias de artefactos del modelo (para implementación)
Implementación de modelos
Los modelos entrenados pueden implementarse como agentes de API para inferencia en tiempo real:
- Modelos tabulares: Se implementan con resolución automática de referencia del modelo. El sistema verifica que el modelo exista antes de la implementación.
- Modelos de imagen/personalizados: Se implementan con artefactos de modelo exportados. El sistema garantiza que la exportación esté disponible antes de crear el agente.
La implementación crea un servicio en contenedor que expone el modelo como una API REST. Consulte el artículo de AI Agents para más detalles sobre la gestión de agentes.
Descarga de modelos
Descargue los artefactos de modelos entrenados en varios formatos mediante enlaces de descarga seguros y de tiempo limitado. Seleccione el modelo, la versión y el formato para generar un enlace de descarga.
Línea de tiempo de actividad
La línea de tiempo de ML Activities muestra un historial cronológico de todas las operaciones de ML en su espacio de trabajo, incluyendo ejecuciones de entrenamiento, grid searches, implementaciones y sus estados (en ejecución, completado, fallido). Cada actividad incluye marcas de tiempo, costos y enlaces al modelo y la versión asociados.