Обзор
Модуль Image Tagging от SurveyAnalytica’s предоставляет полный рабочий процесс для организации, маркировки и подготовки наборов изображений для машинного обучения. Независимо от того, создаёте ли вы модель классификации изображений, курируете каталог продуктов или анализируете визуальный контент из опросов, инструменты Image Tagging предоставляют автоматическую разметку на базе компьютерного зрения с использованием AI, интерфейсы ручной разметки, массовые операции и прямой экспорт в ваш аналитический движок.
Начало работы с Image Tagging
Загрузка изображений
Загружайте изображения через мастер управления данными. Вы можете загрузить отдельные изображения, несколько изображений сразу или ZIP-архив с изображениями, организованными по папкам. Поддерживаемые форматы изображений включают PNG, JPG, JPEG, GIF, BMP и WebP.
Индексация изображений
После загрузки изображения необходимо проиндексировать. Процесс индексации сканирует загруженные файлы и создаёт записи в базе данных разметки изображений с полными метаданными. Перейдите к своему набору изображений, и система автоматически попытается проиндексировать изображения из ваших папок загрузки.
Во время индексации система извлекает:
- Метаданные файла: имя файла, расширение, размер, тип содержимого, дату загрузки
- Структуру папок: сегменты пути, родительские папки
- Подсказки классификации: автоматически определяет имена классов по названиям папок и индикаторы разбиения train/test/validation по путям папок
- Предлагаемые теги: генерируются на основе имён классов из папок и назначений разбиения
Используйте функцию Force re-index, чтобы удалить все существующие записи изображений и переиндексировать заново.
Автоматическая разметка с помощью компьютерного зрения
Функция автоматической разметки использует компьютерное зрение на базе AI для автоматического анализа изображений и генерации описательных тегов.
Как выполнить автоматическую разметку
- Перейдите к своему набору изображений.
- Нажмите Auto-Tag, чтобы начать процесс.
- Система обрабатывает все изображения пакетно, анализируя каждое изображение с помощью компьютерного зрения.
- Результаты сохраняются с тегами, показателями уверенности и источником, помеченным как сгенерированный автоматически.
Структура тега
Каждый тег включает:
- tag: текст метки (например, “dog”, “outdoor”, “mountain”)
- source: способ создания тега — auto-generated, manual, folder, classification, split
- confidence: показатель от 0 до 1, указывающий степень уверенности в теге
- approved: булево значение, указывающее, был ли тег проверен и утверждён
Ручная разметка
Вы можете вручную добавлять, редактировать или удалять теги для любого изображения:
- Добавление тегов: введите названия новых тегов и назначьте их отдельным изображениям или массово.
- Редактирование тегов: измените существующие метки тегов или показатели уверенности.
- Удаление тегов: удалите неверные или нежелательные теги.
- Утверждение тегов: просмотрите автоматически сгенерированные теги и отметьте их как утверждённые.
Массовые операции
Для больших наборов данных массовые операции необходимы:
Массовая разметка
Применяйте теги к нескольким изображениям одновременно. Вы можете выбирать изображения по:
- Явным ID изображений: выберите конкретные изображения для разметки.
- Критериям фильтрации: примените теги ко всем изображениям, соответствующим разбиению, имени класса или папке.
- Режиму: выберите “append” для добавления тегов без удаления существующих, или “replace” для перезаписи всех тегов.
Массовое утверждение
Просматривайте и утверждайте теги для нескольких изображений одновременно. Утвердите все теги для выбранных изображений или для всего набора данных.
Продвижение предложений
Преобразуйте предлагаемые теги (сгенерированные на основе структуры папок, имён файлов или определения разбиения) в подтверждённые теги. Выберите, какие источники предложений продвигать (folder, split, filename).
Массовое восстановление
Восстанавливайте теги для нескольких изображений одновременно — полезно для операций отмены после массовых изменений.
Фильтрация и поиск
Интерфейс разметки изображений предоставляет мощную фильтрацию:
- По разбиению: фильтрация изображений по train, test, validation или dev split
- По имени класса: фильтрация по обнаруженной или назначенной метке класса
- По папке: фильтрация по исходной папке
- По поиску: поиск по имени файла или ID изображения
- По статусу тега: просмотр неразмеченных, размеченных или утверждённых изображений
Фасеты вычисляются динамически с каскадным поведением — при выборе фильтра разбиения соответствующим образом обновляются доступные имена классов.
Параметры сортировки
- Имя файла (по возрастанию/убыванию)
- Дата (по возрастанию/убыванию)
- Количество тегов (по возрастанию/убыванию)
Исключение изображений
Исключайте проблемные изображения из набора данных без их удаления:
- Помечайте изображения как исключённые с указанием причины (manual, duplicate, low quality и т.д.)
- Восстанавливайте исключённые изображения при необходимости
- Просматривайте количество исключённых изображений с разбивкой по причинам
- Исключённые изображения автоматически отфильтровываются при генерации обучающих данных
Статистика изображений
Функция статистики изображений предоставляет подробные метаданные о вашем наборе данных:
- Размеры: минимальная, максимальная, средняя и медианная ширина и высота по всем изображениям
- Форматы: распределение форматов изображений (JPEG, PNG и т.д.)
- Размеры файлов: минимальный, максимальный, средний размер файлов в КБ и общий размер в МБ
- Выбросы: изображения с размерами более чем в 3 раза превышающими медиану, помечаются для проверки
Рабочий процесс классификации
Для построения моделей классификации изображений платформа предоставляет полный конвейер классификации:
Анализ структуры набора данных
Система сканирует структуру ваших папок для определения классов, разбиений и неклассифицированных изображений. Поддерживается как стандартный анализ папок, так и интеллектуальный анализ на базе AI.
Назначение меток
Метки могут назначаться из нескольких источников:
- Структура папок: автоматически определяется по названиям подпапок
- CSV-файл: загрузите или выберите CSV-файл с сопоставлением имени файла и метки. Система автоматически определяет столбцы имени файла и метки.
- Существующие теги: преобразуйте утверждённые теги изображений в метки классификации.
- Ручное назначение: назначайте метки конкретным изображениям через интерфейс.
Обнаружение дисбаланса классов
Платформа анализирует распределение классов и предоставляет отчёт:
- Количество и проценты по каждому классу
- Коэффициент дисбаланса (самый большой класс / самый маленький класс)
- Уровень серьёзности (низкий, умеренный, высокий)
- Рекомендации по балансировке (undersample, oversample или сбор дополнительных данных)
Балансировка набора данных
Автоматически балансируйте набор данных, исключая избыточные изображения из более крупных классов (undersampling). Система использует случайную выборку с фиксированным seed для воспроизводимости.
Генерация обучающих данных
Генерируйте разбиения train/validation/test с настраиваемыми соотношениями:
- Разбиение по умолчанию: 70% train, 15% validation, 15% test
- Стратифицированная выборка: гарантирует пропорциональное представление каждого класса в каждом разбиении
- Форматы экспорта: структура папок (изображения, организованные по папкам train/val/test) и CSV-манифест
- Исключение исключённых изображений: автоматически отфильтровывает исключённые изображения из обучающих данных
Экспорт данных
Экспортируйте утверждённые теги и метаданные изображений для аналитики. Экспорт создаёт структурированный набор данных с ID изображения, путём к файлу, именем файла, тегами и пользовательскими полями, позволяя анализировать ваш набор изображений.
История тегов
Все операции разметки записываются в журнал истории, включая массовые операции, ручные правки, продвижения, утверждения и восстановления. Это обеспечивает полный аудиторский след того, как курировался ваш набор данных с течением времени.