Обзор
Модуль управления данными SurveyAnalytica позволяет загружать, систематизировать и подготавливать наборы данных для аналитики, машинного обучения и рабочих процессов кампаний. Независимо от того, импортируете ли вы записи о клиентах из CSV, загружаете изображения для компьютерного зрения или подключаетесь к потоку данных в реальном времени, раздел Data предоставляет пошаговый мастер — от загрузки до анализа.
Переход в раздел управления данными
В основной боковой панели навигации нажмите Data. Откроется представление списка данных, где отображаются все наборы данных вашего рабочего пространства. В каждой строке показаны название набора данных, тип, источник данных, дата последнего изменения и размер. Вы можете выполнять поиск, фильтрацию, сортировку и постраничный просмотр наборов данных.
Создание нового набора данных
Чтобы создать новый набор данных, нажмите кнопку + New в представлении списка данных. Откроется Dataset Wizard — пошаговый мастер, который проведёт вас через весь процесс настройки набора данных.
Шаг 1: Загрузка
На этапе загрузки вы можете перетащить файлы или выбрать их вручную с компьютера. Поддерживаемые форматы файлов:
- Табличные данные: CSV, Excel (.xlsx, .xls), Parquet, Avro, JSON
- Изображения: PNG, JPG, JPEG, GIF, BMP, WebP
- Документы: PDF
- Архивы: ZIP (автоматически распаковывается после загрузки)
Основные возможности загрузки:
- Возобновляемая загрузка: большие файлы загружаются частями с отслеживанием прогресса для каждого файла. При сбое части загрузка автоматически повторяется.
- Загрузка нескольких файлов: вы можете загружать несколько файлов одновременно. Для каждого файла отображается собственный индикатор прогресса с детализацией по частям.
- Автоопределение: система автоматически определяет тип данных (TABLE, IMAGE и т. д.) по загруженным файлам и предлагает название набора данных на основе первого файла.
- Обработка ZIP: ZIP-архивы распаковываются и анализируются после загрузки. Для наборов данных классификации изображений структура папок сохраняется и используется для маркировки классов.
- Миниатюры изображений: при загрузке изображений отображается сетка предпросмотра миниатюр, чтобы вы могли проверить файлы перед продолжением.
Прямая загрузка в облако (расширенная)
Для очень больших наборов данных (более 5 ГБ) можно использовать опцию Advanced: Direct Cloud Upload. Она формирует путь к папке для загрузки в облачное хранилище и команду, которую можно выполнить в терминале для прямой загрузки файлов. После загрузки нажмите Scan Dropzone, чтобы обнаружить загруженные файлы.
Шаг 2: Настройка
После загрузки настройте параметры набора данных:
- Dataset Name: название, предложенное автоматически на основе первого загруженного файла, либо введите собственное описательное название.
- Description: необязательный текст с описанием назначения или содержимого набора данных.
- Team / Workspace: выберите рабочее пространство или команду, к которой относится этот набор данных. Если вы состоите только в одной команде, она выбирается автоматически.
- Data Type: определяется автоматически по вашим файлам. Доступные типы: TABLE, IMAGE, VIDEO, AUDIO, TEXT, FILE и OTHER.
В разделе Advanced Settings можно задать:
- Retention Period (months): сколько месяцев хранить эти данные перед архивированием. Значение по умолчанию — 6 месяцев.
- Archival Period (months): сколько месяцев хранить архивированные данные перед удалением. Значение по умолчанию — 6 месяцев.
Шаг 3: Проверка и сохранение
Проверьте сводку конфигурации набора данных: название, описание, команду, тип данных, общее количество загруженных файлов и настройки хранения. Нажмите Save and Continue, чтобы сохранить набор данных. После сохранения система перенаправит вас на этап предпросмотра данных.
Dataset Wizard — этапы после загрузки
После первоначальной загрузки и сохранения Dataset Wizard предлагает дополнительные этапы, которые зависят от того, являются ли ваши данные табличными или основанными на изображениях.
Табличные наборы данных (CSV, Excel, Parquet, JSON, Avro)
- Upload — загрузите ваши файлы.
- Prepare — предварительный просмотр схемы. Система считывает имена и типы столбцов из загруженных файлов. Проверьте обнаруженную схему, ознакомьтесь с метриками качества на уровне столбцов и при необходимости скорректируйте типы данных.
- Refine (Clean and Transform) — примените преобразования данных с помощью визуального конвейера. Доступные операции включают вычисляемые поля, очистку данных и этапы преобразования.
- Publish (Validate and Publish) — проверьте целостность данных и опубликуйте набор данных для анализа.
- Analyze — открывает полноценную панель аналитики прямо в контексте данных.
Наборы данных изображений
- Upload — загружайте изображения по одному, массово или в виде ZIP-архива.
- Prepare (Label) — назначайте изображениям метки для классификации. Метки могут браться из структуры папок, файлов сопоставления CSV или проставляться вручную.
- Refine (Curate) — проверяйте качество изображений, выявляйте выбросы, исключайте проблемные изображения и балансируйте распределение классов.
- Publish (Split and Export) — создавайте разбиения на обучающую/валидационную/тестовую выборки с настраиваемыми пропорциями. Экспортируйте в различных форматах, включая организованные папки и CSV-манифесты.
- Analyze — просматривайте аналитику по вашему набору изображений, включая распределение классов и статистику меток.
Определение и сопоставление схемы
При создании набора данных через редактор схемы вы определяете столбцы со следующими свойствами:
- Column Name и Description
- Column Type: DATETIME, DATE, BOOL, BYTES, GEOGRAPHY, INTERVAL, INT64, NUMERIC, BIGNUMERIC, FLOAT64, RANGE, STRING, TIMESTAMP, TIME, STRUCT, ARRAY
- Column Properties: isPrimaryKey, isUnique, isNullable, isAutoIncrement, isEncrypted, isAnonymized, isClassified, isCategorized, isNormalized, isStandardized
Хранение данных
Все табличные наборы данных хранятся в масштабируемом облачном хранилище данных для высокопроизводительной аналитики. Каждый набор данных организован в рамках вашего рабочего пространства для удобного управления и контроля доступа.
Возможности списка данных
- Edit: откройте набор данных в мастере, чтобы изменить конфигурацию или схему.
- Clone: создайте копию набора данных и его конфигурации.
- Lock / Unlock: предотвратите случайные изменения набора данных.
- Analyze: перейдите напрямую к панели аналитики для этого набора данных.
- Share: откройте представление панели аналитики для совместного доступа.
- Delete: безвозвратно удалите набор данных. Поддерживается как одиночное, так и массовое удаление.
Автосохранение и история версий
Dataset Wizard включает функцию автосохранения, которая автоматически сохраняет вашу работу. История отмены/повтора действий сохраняется до 50 версий, что позволяет откатывать изменения.
Советы и рекомендации
- Используйте описательные названия наборов данных, чтобы их было легко находить в списке.
- Для наборов данных классификации изображений организуйте изображения по папкам в соответствии с названием класса перед загрузкой в виде ZIP — система автоматически определит метки классов по структуре папок.
- Устанавливайте подходящие периоды хранения и архивирования в соответствии с требованиями управления данными вашей организации.
- Используйте опцию Direct Cloud Upload для наборов данных объёмом более 5 ГБ, чтобы избежать ограничений загрузки через браузер.
- Всегда проверяйте автоматически определённую схему перед публикацией, чтобы убедиться в правильности типов столбцов.