Обзор
SurveyAnalytica предоставляет полный жизненный цикл машинного обучения в рамках платформы, позволяя создавать, обучать, версионировать, оценивать и развертывать модели ML без написания кода. Возможности ML охватывают классификацию и регрессию табличных данных, классификацию изображений с помощью AutoML и transfer learning, а также обучение пользовательских моделей с выделенными вычислительными ресурсами.
Переход к моделям
Доступ к интерфейсу управления моделями ML осуществляется из раздела Data. При просмотре набора данных представление Predictions в аналитике показывает обученные модели и их результаты.
Создание модели
Чтобы создать новую модель, укажите следующую информацию:
- Name: Описательное название модели.
- Category: Тип задачи ML — классификация, регрессия, кластеризация или прогнозирование.
- Model Type: Используемый алгоритм. Доступные варианты:
- Табличные модели: Логистическая регрессия, boosted tree, глубокая нейронная сеть, random forest, XGBoost, ARIMA временные ряды, кластеризация K-means
- Модели для изображений: AutoML vision, модели transfer learning
- Текстовые модели: Языковые модели, AutoML text
- AutoML: Автоматизированные табличные модели и модели классификации
- Workspace: Рабочее пространство, к которому относится эта модель.
- Data Entity: Набор данных для обучения.
- Input/Output Schema: Определите ожидаемые входные признаки и выходные прогнозы.
Обучение модели
Запуск обучения
После создания модели запустите обучение, настроив следующее:
- Dataset: Источник данных для обучения — табличные данные или данные изображений.
- Target column: Столбец для прогнозирования (для обучения с учителем).
- Hyperparameters: Настройки, специфичные для алгоритма, такие как скорость обучения, размер батча, количество эпох, число деревьев и т. д.
- Compute resources: Уровень вычислительных ресурсов, выделенных для обучения.
- GPU acceleration: Дополнительные ресурсы GPU для моделей изображений и глубокого обучения.
- Budget hours: Максимально допустимое время обучения.
Варианты обучения
Обучение на табличных данных
Для структурированных данных обучение выполняется на оптимизированном бэкенде, предназначенном для быстрого, масштабируемого ML на табличных данных. Это самый быстрый вариант для структурированных наборов данных, поддерживающий все стандартные типы моделей ML.
Обучение моделей для изображений и пользовательских моделей
Для классификации изображений, transfer learning и пользовательских моделей обучение выполняется на выделенных вычислительных ресурсах с ускорением GPU. Поддерживаемые варианты обучения:
- AutoML Tabular: Автоматизированная инженерия признаков и выбор модели.
- AutoML Image: Автоматизированное обучение модели классификации изображений.
- Transfer Learning: Дообучение предварительно обученных моделей на ваших данных. Настраиваемые эпохи, скорость обучения, размер батча и размер изображения.
- Custom Models: Обучение пользовательских моделей глубокого обучения с полным контролем над архитектурой.
Мониторинг обучения
Прогресс обучения отслеживается в реальном времени с помощью:
- Live progress stream: Обновления прогресса в реальном времени, передаваемые в интерфейс и показывающие этап (инициализация, обучение, завершено), процент выполнения и сообщения.
- Status checking: Проверка статуса на основе опроса с автоматическим обнаружением и восстановлением устаревших статусов.
- Activity tracking: Все действия по обучению регистрируются с указанием времени, стоимости и метрик.
Grid Search (подбор гиперпараметров)
Для систематической оптимизации гиперпараметров используйте Grid Search, чтобы автоматически обучить несколько вариантов модели:
- Определите сетку параметров, указав значения для перебора по каждому гиперпараметру.
- Задайте максимальное количество параллельных заданий (по умолчанию: 5).
- Система генерирует все комбинации параметров и отправляет каждую как отдельное задание на обучение.
- Результаты отслеживаются и сравниваются, показывая метрики для каждой комбинации.
Пример сетки параметров:
{
"learning_rate": [0.001, 0.01, 0.1],
"batch_size": [16, 32, 64],
"epochs": [10, 20, 50]
}
Это создаст 27 комбинаций (3 x 3 x 3) и обучит каждую из них.
Версионирование моделей
Каждая модель поддерживает несколько версий, что позволяет итерировать и сравнивать:
- Add version: Каждый запуск обучения создает новую версию со своими гиперпараметрами, метриками и ссылками на артефакты.
- Live version: Присвойте конкретной версии статус “live” для развертывания и инференса.
- Archive version: Архивируйте старые версии, чтобы навести порядок, сохранив при этом историю. Опционально можно очистить облачные артефакты.
- Delete version: Безвозвратно удалите версию и ее артефакты.
- Refresh metrics: Повторно получите метрики для всех версий, восстанавливая устаревшие статусы обучения.
Метаданные версии
Каждая версия хранит:
- Гиперпараметры, использованные для обучения
- Конфигурацию обучения (целевой столбец, набор данных, тип модели)
- Ссылку на задание обучения
- Метрики (accuracy, precision, recall, F1, AUC, loss и т. д.)
- Время выполнения в минутах и оценочную стоимость в USD
- Ссылки на артефакты модели (для развертывания)
Развертывание модели
Обученные модели могут быть развернуты как агенты API для инференса в реальном времени:
- Табличные модели: Развертываются с автоматическим разрешением ссылки на модель. Система проверяет наличие модели перед развертыванием.
- Модели для изображений и пользовательские модели: Развертываются с экспортированными артефактами модели. Система гарантирует доступность экспорта перед созданием агента.
Развертывание создает контейнеризированный сервис, который предоставляет модель в виде REST API. Дополнительную информацию об управлении агентами см. в статье об AI Agents.
Скачивание моделей
Скачивайте артефакты обученных моделей в различных форматах по защищенным, ограниченным по времени ссылкам для скачивания. Выберите модель, версию и формат, чтобы сгенерировать ссылку для скачивания.
Хронология активности
Хронология ML Activities показывает историю всех операций ML в вашем рабочем пространстве в хронологическом порядке, включая запуски обучения, grid search, развертывания и их статусы (выполняется, завершено, ошибка). Каждая активность включает временные метки, стоимость и ссылки на связанную модель и версию.