Resumen
El módulo de Gestión de Datos de SurveyAnalytica’s le permite cargar, organizar y preparar conjuntos de datos para analítica, machine learning y flujos de trabajo de campañas. Ya sea que esté importando registros de clientes desde un CSV, cargando imágenes para visión por computadora o conectándose a un flujo de datos en vivo, la sección Data le ofrece una experiencia guiada mediante asistente, desde la carga hasta el análisis.
Navegar a Gestión de Datos
Desde la barra de navegación principal, haga clic en Data. Verá la vista de Listado de Datos, que muestra todos los conjuntos de datos de su espacio de trabajo. Cada fila muestra el nombre del conjunto de datos, el tipo, la fuente de datos, la fecha de última modificación y el tamaño. Puede buscar, filtrar, ordenar y paginar entre sus conjuntos de datos.
Creación de un nuevo conjunto de datos
Para crear un nuevo conjunto de datos, haga clic en el botón + New en la vista de listado de datos. Esto abre el Dataset Wizard, un proceso guiado de varios pasos que lo lleva a través de toda la configuración del conjunto de datos.
Paso 1: Carga
El paso de carga le permite arrastrar y soltar archivos o explorar para seleccionarlos desde su computadora. Los formatos de archivo compatibles incluyen:
- Datos tabulares: CSV, Excel (.xlsx, .xls), Parquet, Avro, JSON
- Imágenes: PNG, JPG, JPEG, GIF, BMP, WebP
- Documentos: PDF
- Archivos comprimidos: ZIP (extraído automáticamente después de la carga)
Características clave de la carga:
- Cargas reanudables: Los archivos grandes se cargan en fragmentos con seguimiento de progreso por archivo. Si un fragmento falla, se reintenta automáticamente.
- Carga de múltiples archivos: Cargue varios archivos a la vez. Cada archivo muestra su propia barra de progreso con detalle a nivel de fragmento.
- Detección automática: El sistema detecta automáticamente el tipo de datos (TABLE, IMAGE, etc.) a partir de los archivos cargados y sugiere un nombre de conjunto de datos basado en el primer archivo.
- Manejo de ZIP: Los archivos ZIP se extraen y analizan después de la carga. Para conjuntos de datos de clasificación de imágenes, se conserva la estructura de carpetas y se utiliza para el etiquetado de clases.
- Miniaturas de imágenes: Al cargar imágenes, se muestra una cuadrícula de vista previa de miniaturas para que pueda verificar los archivos antes de continuar.
Carga directa en la nube (avanzado)
Para conjuntos de datos muy grandes (más de 5 GB), puede usar la opción Advanced: Direct Cloud Upload. Esto genera una ruta de zona de carga en el almacenamiento en la nube y un comando que puede ejecutar desde su terminal para cargar archivos directamente. Después de cargar, haga clic en Scan Dropzone para detectar los archivos cargados.
Paso 2: Configuración
Después de la carga, configure la identidad de su conjunto de datos:
- Nombre del conjunto de datos: Sugerido automáticamente a partir del primer archivo cargado, o ingrese su propio nombre descriptivo.
- Descripción: Texto opcional que describe el propósito o el contenido del conjunto de datos.
- Equipo / Espacio de trabajo: Seleccione a qué espacio de trabajo o equipo pertenece este conjunto de datos. Si pertenece a un solo equipo, se selecciona automáticamente.
- Tipo de datos: Detectado automáticamente a partir de sus archivos. Los tipos disponibles incluyen TABLE, IMAGE, VIDEO, AUDIO, TEXT, FILE y OTHER.
En Advanced Settings, puede configurar:
- Período de retención (meses): Cuánto tiempo conservar estos datos antes de archivarlos. El valor predeterminado es 6 meses.
- Período de archivado (meses): Cuánto tiempo conservar los datos archivados antes de eliminarlos. El valor predeterminado es 6 meses.
Paso 3: Revisión y guardado
Revise un resumen de la configuración de su conjunto de datos: nombre, descripción, equipo, tipo de datos, total de archivos cargados y ajustes de retención. Haga clic en Save and Continue para guardar el conjunto de datos. Después de guardar, el sistema lo lleva al paso de vista previa de datos.
Dataset Wizard — Pasos posteriores a la carga
Después de la carga y el guardado iniciales, el Dataset Wizard ofrece pasos adicionales que dependen de si sus datos son tabulares o basados en imágenes.
Conjuntos de datos tabulares (CSV, Excel, Parquet, JSON, Avro)
- Upload — Cargue sus archivos.
- Prepare — Vista previa del esquema. El sistema lee los nombres y tipos de columnas de los archivos cargados. Revise el esquema detectado, vea las métricas de calidad a nivel de columna y ajuste los tipos de datos.
- Refine (Clean and Transform) — Aplique transformaciones de datos mediante una canalización visual. Las operaciones disponibles incluyen campos calculados, limpieza de datos y pasos de transformación.
- Publish (Validate and Publish) — Valide la integridad de los datos y publique el conjunto de datos para su análisis.
- Analyze — Abre el panel completo de Analytics directamente dentro del contexto de datos.
Conjuntos de datos de imágenes
- Upload — Cargue imágenes individualmente, en bloque o como un archivo ZIP.
- Prepare (Label) — Asigne etiquetas a las imágenes para clasificación. Las etiquetas pueden provenir de la estructura de carpetas, archivos de mapeo CSV o etiquetado manual.
- Refine (Curate) — Revise la calidad de las imágenes, detecte valores atípicos, excluya imágenes problemáticas y equilibre la distribución de clases.
- Publish (Split and Export) — Genere divisiones de entrenamiento/validación/prueba con proporciones configurables. Exporte en múltiples formatos, incluidas carpetas organizadas y manifiestos CSV.
- Analyze — Vea análisis de su conjunto de datos de imágenes, incluidas distribuciones de clases y estadísticas de etiquetas.
Definición y mapeo de esquema
Al crear un conjunto de datos mediante el editor de esquema, define columnas con las siguientes propiedades:
- Nombre de columna y Descripción
- Tipo de columna: DATETIME, DATE, BOOL, BYTES, GEOGRAPHY, INTERVAL, INT64, NUMERIC, BIGNUMERIC, FLOAT64, RANGE, STRING, TIMESTAMP, TIME, STRUCT, ARRAY
- Propiedades de columna: isPrimaryKey, isUnique, isNullable, isAutoIncrement, isEncrypted, isAnonymized, isClassified, isCategorized, isNormalized, isStandardized
Almacenamiento de datos
Todos los conjuntos de datos tabulares se almacenan en un almacén de datos en la nube escalable para analítica de alto rendimiento. Cada conjunto de datos se organiza dentro de su espacio de trabajo para facilitar la gestión y el control de acceso.
Funciones del listado de datos
- Edit: Abra el conjunto de datos en el asistente para modificar la configuración o el esquema.
- Clone: Cree una copia del conjunto de datos y su configuración.
- Lock / Unlock: Evite modificaciones accidentales en un conjunto de datos.
- Analyze: Vaya directamente al panel de analítica de este conjunto de datos.
- Share: Abra la vista del panel de analítica para compartir.
- Delete: Elimine permanentemente el conjunto de datos. Admite eliminación individual y masiva.
Guardado automático e historial de versiones
El Dataset Wizard incluye una función de guardado automático que conserva su trabajo de forma automática. El historial de deshacer/rehacer se mantiene hasta 50 versiones para que pueda revertir cambios.
Consejos y buenas prácticas
- Use nombres de conjuntos de datos descriptivos para que sean fáciles de encontrar en el listado.
- Para conjuntos de datos de clasificación de imágenes, organice las imágenes en carpetas por nombre de clase antes de cargarlas como un ZIP — el sistema detectará automáticamente las etiquetas de clase a partir de la estructura de carpetas.
- Establezca períodos de retención y archivado adecuados según sus requisitos de gobernanza de datos.
- Use la opción Direct Cloud Upload para conjuntos de datos de más de 5 GB para evitar las limitaciones de carga del navegador.
- Siempre revise el esquema detectado automáticamente antes de publicar para asegurarse de que los tipos de columna sean correctos.