Überblick
Mit dem Data-Management-Modul von SurveyAnalytica können Sie Datensätze hochladen, organisieren und für Analysen, maschinelles Lernen und Kampagnen-Workflows vorbereiten. Egal, ob Sie Kundendaten aus einer CSV-Datei importieren, Bilder für Computer Vision hochladen oder eine Live-Datenquelle verbinden – der Bereich Data bietet Ihnen einen geführten Assistenten von Upload bis Analyse.
Zum Data-Management navigieren
Klicken Sie in der Hauptnavigationsleiste auf Data. Sie sehen die Data-Listing-Ansicht, die alle Datensätze in Ihrem Workspace anzeigt. Jede Zeile zeigt den Datensatznamen, Typ, die Datenquelle, das Datum der letzten Änderung und die Größe. Sie können Ihre Datensätze durchsuchen, filtern, sortieren und blättern.
Einen neuen Datensatz erstellen
Um einen neuen Datensatz zu erstellen, klicken Sie in der Data-Listing-Ansicht auf die Schaltfläche + New. Dadurch öffnet sich der Dataset Wizard, ein geführter mehrstufiger Prozess, der Sie durch die gesamte Datensatz-Einrichtung führt.
Schritt 1: Upload
Im Upload-Schritt können Sie Dateien per Drag-and-Drop ablegen oder über die Dateiauswahl von Ihrem Computer hochladen. Unterstützte Dateiformate sind:
- Tabellarische Daten: CSV, Excel (.xlsx, .xls), Parquet, Avro, JSON
- Bilder: PNG, JPG, JPEG, GIF, BMP, WebP
- Dokumente: PDF
- Archive: ZIP (wird nach dem Upload automatisch entpackt)
Wichtige Upload-Funktionen:
- Fortsetzbare Uploads: Große Dateien werden in Blöcken mit Fortschrittsanzeige pro Datei hochgeladen. Schlägt ein Block fehl, wird er automatisch erneut versucht.
- Mehrfach-Upload: Laden Sie mehrere Dateien gleichzeitig hoch. Jede Datei zeigt ihre eigene Fortschrittsanzeige mit Details auf Blockebene.
- Automatische Erkennung: Das System erkennt automatisch den Datentyp (TABLE, IMAGE usw.) anhand Ihrer hochgeladenen Dateien und schlägt basierend auf der ersten Datei einen Datensatznamen vor.
- ZIP-Verarbeitung: ZIP-Archive werden nach dem Upload entpackt und analysiert. Bei Bildklassifizierungs-Datensätzen bleibt die Ordnerstruktur erhalten und wird für die Klassenbeschriftung verwendet.
- Bild-Miniaturansichten: Beim Hochladen von Bildern wird ein Miniaturansichtsraster angezeigt, damit Sie die Dateien vor dem Fortfahren überprüfen können.
Direkter Cloud-Upload (Erweitert)
Für sehr große Datensätze (über 5 GB) können Sie die Option Advanced: Direct Cloud Upload verwenden. Diese generiert einen Cloud-Storage-Dropzone-Pfad sowie einen Befehl, den Sie über Ihr Terminal ausführen können, um Dateien direkt hochzuladen. Klicken Sie nach dem Hochladen auf Scan Dropzone, um die hochgeladenen Dateien zu erkennen.
Schritt 2: Konfiguration
Konfigurieren Sie nach dem Hochladen die Identität Ihres Datensatzes:
- Dataset Name: Automatisch aus der ersten hochgeladenen Datei vorgeschlagen, oder geben Sie einen eigenen aussagekräftigen Namen ein.
- Description: Optionaler Text, der den Zweck oder Inhalt des Datensatzes beschreibt.
- Team / Workspace: Wählen Sie aus, zu welchem Workspace oder Team dieser Datensatz gehört. Wenn Sie nur einem Team angehören, wird dieses automatisch ausgewählt.
- Data Type: Automatisch anhand Ihrer Dateien erkannt. Verfügbare Typen sind TABLE, IMAGE, VIDEO, AUDIO, TEXT, FILE und OTHER.
Unter Advanced Settings können Sie Folgendes festlegen:
- Retention Period (months): Wie lange diese Daten vor der Archivierung aufbewahrt werden. Standardmäßig 6 Monate.
- Archival Period (months): Wie lange archivierte Daten vor der Löschung aufbewahrt werden. Standardmäßig 6 Monate.
Schritt 3: Überprüfen und speichern
Überprüfen Sie eine Zusammenfassung Ihrer Datensatzkonfiguration: Name, Beschreibung, Team, Datentyp, Gesamtzahl der hochgeladenen Dateien und Aufbewahrungseinstellungen. Klicken Sie auf Save and Continue, um den Datensatz zu speichern. Nach dem Speichern führt Sie das System zum Schritt der Datenvorschau.
Dataset Wizard — Schritte nach dem Upload
Nach dem ersten Upload und Speichern bietet der Dataset Wizard weitere Schritte, die davon abhängen, ob Ihre Daten tabellarisch oder bildbasiert sind.
Tabellarische Datensätze (CSV, Excel, Parquet, JSON, Avro)
- Upload — Laden Sie Ihre Dateien hoch.
- Prepare — Vorschau des Schemas. Das System liest Spaltennamen und -typen aus Ihren hochgeladenen Dateien. Überprüfen Sie das erkannte Schema, sehen Sie Qualitätsmetriken auf Spaltenebene und passen Sie Datentypen an.
- Refine (Clean and Transform) — Wenden Sie Datentransformationen über eine visuelle Pipeline an. Verfügbare Operationen umfassen berechnete Felder, Datenbereinigung und Transformationsschritte.
- Publish (Validate and Publish) — Validieren Sie die Datenintegrität und veröffentlichen Sie den Datensatz zur Analyse.
- Analyze — Öffnet das vollständige Analytics-Dashboard direkt im Datenkontext.
Bild-Datensätze
- Upload — Laden Sie Bilder einzeln, in großen Mengen oder als ZIP-Archiv hoch.
- Prepare (Label) — Weisen Sie Bildern Labels zur Klassifizierung zu. Labels können aus der Ordnerstruktur, CSV-Zuordnungsdateien oder manueller Kennzeichnung stammen.
- Refine (Curate) — Überprüfen Sie die Bildqualität, erkennen Sie Ausreißer, schließen Sie problematische Bilder aus und gleichen Sie Klassenverteilungen aus.
- Publish (Split and Export) — Erzeugen Sie Train-/Validierungs-/Test-Splits mit konfigurierbaren Verhältnissen. Exportieren Sie in mehreren Formaten, einschließlich organisierter Ordner und CSV-Manifeste.
- Analyze — Zeigen Sie Analysen zu Ihrem Bild-Datensatz an, einschließlich Klassenverteilungen und Tag-Statistiken.
Schemadefinition und Zuordnung
Beim Erstellen eines Datensatzes über den Schema-Editor definieren Sie Spalten mit den folgenden Eigenschaften:
- Column Name und Description
- Column Type: DATETIME, DATE, BOOL, BYTES, GEOGRAPHY, INTERVAL, INT64, NUMERIC, BIGNUMERIC, FLOAT64, RANGE, STRING, TIMESTAMP, TIME, STRUCT, ARRAY
- Column Properties: isPrimaryKey, isUnique, isNullable, isAutoIncrement, isEncrypted, isAnonymized, isClassified, isCategorized, isNormalized, isStandardized
Datenspeicherung
Alle tabellarischen Datensätze werden in einem skalierbaren Cloud-Data-Warehouse für Hochleistungsanalysen gespeichert. Jeder Datensatz ist innerhalb Ihres Workspace organisiert, um eine einfache Verwaltung und Zugriffskontrolle zu ermöglichen.
Funktionen der Data-Listing-Ansicht
- Edit: Öffnen Sie den Datensatz im Assistenten, um Konfiguration oder Schema zu ändern.
- Clone: Erstellen Sie eine Kopie des Datensatzes und seiner Konfiguration.
- Lock / Unlock: Verhindern Sie versehentliche Änderungen an einem Datensatz.
- Analyze: Springen Sie direkt zum Analytics-Dashboard für diesen Datensatz.
- Share: Öffnen Sie die Analytics-Dashboard-Ansicht zum Teilen.
- Delete: Entfernen Sie den Datensatz dauerhaft. Unterstützt Einzel- und Massenlöschung.
Auto-Save und Versionsverlauf
Der Dataset Wizard enthält eine Auto-Save-Funktion, die Ihre Arbeit automatisch speichert. Der Undo/Redo-Verlauf wird für bis zu 50 Versionen geführt, sodass Sie Änderungen rückgängig machen können.
Tipps und Best Practices
- Verwenden Sie aussagekräftige Datensatznamen, damit sie in der Listing-Ansicht leicht zu finden sind.
- Organisieren Sie bei Bildklassifizierungs-Datensätzen die Bilder vor dem Hochladen als ZIP in Ordnern nach Klassenname — das System erkennt Klassenlabels automatisch anhand der Ordnerstruktur.
- Legen Sie geeignete Aufbewahrungs- und Archivierungszeiträume entsprechend Ihren Data-Governance-Anforderungen fest.
- Verwenden Sie die Option Direct Cloud Upload für Datensätze über 5 GB, um Beschränkungen beim Browser-Upload zu vermeiden.
- Überprüfen Sie stets das automatisch erkannte Schema vor der Veröffentlichung, um sicherzustellen, dass die Spaltentypen korrekt sind.