अवलोकन
SurveyAnalytica का Data Management मॉड्यूल आपको एनालिटिक्स, मशीन लर्निंग, और कैंपेन वर्कफ़्लो के लिए डेटासेट अपलोड, व्यवस्थित और तैयार करने देता है। चाहे आप CSV से ग्राहक रिकॉर्ड इम्पोर्ट कर रहे हों, कंप्यूटर विज़न के लिए इमेज अपलोड कर रहे हों, या किसी लाइव डेटा स्ट्रीम से कनेक्ट कर रहे हों, Data सेक्शन आपको अपलोड से लेकर विश्लेषण तक एक गाइडेड विज़ार्ड अनुभव देता है।
Data Management पर जाना
मुख्य नेविगेशन साइडबार से, Data पर क्लिक करें। आपको Data Listing व्यू दिखाई देगा, जो आपके वर्कस्पेस में सभी डेटासेट प्रदर्शित करता है। प्रत्येक पंक्ति डेटासेट का नाम, प्रकार, डेटा स्रोत, अंतिम संशोधित तिथि, और आकार दिखाती है। आप अपने डेटासेट को खोज, फ़िल्टर, सॉर्ट और पेजिनेट कर सकते हैं।
नया डेटासेट बनाना
नया डेटासेट बनाने के लिए, Data listing व्यू में + New बटन पर क्लिक करें। इससे Dataset Wizard खुलता है, जो एक गाइडेड मल्टी-स्टेप प्रक्रिया है जो आपको पूरी डेटासेट सेटअप प्रक्रिया से गुज़ारती है।
चरण 1: अपलोड
अपलोड चरण आपको फ़ाइलें ड्रैग एंड ड्रॉप करने या अपने कंप्यूटर से चुनने के लिए ब्राउज़ करने देता है। समर्थित फ़ाइल प्रारूपों में शामिल हैं:
- टैबुलर डेटा: CSV, Excel (.xlsx, .xls), Parquet, Avro, JSON
- इमेज: PNG, JPG, JPEG, GIF, BMP, WebP
- दस्तावेज़: PDF
- आर्काइव: ZIP (अपलोड के बाद स्वतः एक्सट्रैक्ट किया जाता है)
मुख्य अपलोड सुविधाएँ:
- रिज्यूमेबल अपलोड: बड़ी फ़ाइलें प्रति-फ़ाइल प्रोग्रेस ट्रैकिंग के साथ चंक्स में अपलोड की जाती हैं। यदि कोई चंक विफल होता है, तो उसे स्वतः पुनः प्रयास किया जाता है।
- मल्टी-फ़ाइल अपलोड: एक साथ कई फ़ाइलें अपलोड करें। प्रत्येक फ़ाइल अपनी खुद की प्रोग्रेस बार चंक-स्तरीय विवरण के साथ दिखाती है।
- ऑटो-डिटेक्शन: सिस्टम आपकी अपलोड की गई फ़ाइलों से डेटा प्रकार (TABLE, IMAGE, आदि) को स्वतः पहचानता है और पहली फ़ाइल के आधार पर एक डेटासेट नाम सुझाता है।
- ZIP हैंडलिंग: ZIP आर्काइव अपलोड के बाद एक्सट्रैक्ट और विश्लेषित किए जाते हैं। इमेज क्लासिफिकेशन डेटासेट के लिए, फ़ोल्डर संरचना को संरक्षित किया जाता है और क्लास लेबलिंग के लिए उपयोग किया जाता है।
- इमेज थंबनेल: इमेज अपलोड करते समय, एक थंबनेल प्रीव्यू ग्रिड प्रदर्शित होता है ताकि आप आगे बढ़ने से पहले फ़ाइलों को सत्यापित कर सकें।
डायरेक्ट क्लाउड अपलोड (एडवांस्ड)
बहुत बड़े डेटासेट के लिए (5 GB से अधिक), आप Advanced: Direct Cloud Upload विकल्प का उपयोग कर सकते हैं। यह एक क्लाउड स्टोरेज ड्रॉपज़ोन पाथ और एक कमांड जनरेट करता है जिसे आप फ़ाइलों को सीधे अपलोड करने के लिए अपने टर्मिनल से चला सकते हैं। अपलोड करने के बाद, अपलोड की गई फ़ाइलों का पता लगाने के लिए Scan Dropzone पर क्लिक करें।
चरण 2: कॉन्फ़िगर करें
अपलोड करने के बाद, अपने डेटासेट की पहचान कॉन्फ़िगर करें:
- Dataset Name: पहली अपलोड की गई फ़ाइल से स्वतः सुझाया जाता है, या अपना खुद का वर्णनात्मक नाम दर्ज करें।
- Description: डेटासेट के उद्देश्य या सामग्री का वर्णन करने वाला वैकल्पिक टेक्स्ट।
- Team / Workspace: चुनें कि यह डेटासेट किस वर्कस्पेस या टीम से संबंधित है। यदि आप केवल एक टीम से संबंधित हैं, तो यह स्वतः चयनित हो जाता है।
- Data Type: आपकी फ़ाइलों से स्वतः पहचाना जाता है। उपलब्ध प्रकारों में TABLE, IMAGE, VIDEO, AUDIO, TEXT, FILE, और OTHER शामिल हैं।
Advanced Settings के अंतर्गत, आप सेट कर सकते हैं:
- Retention Period (महीने): इस डेटा को आर्काइव करने से पहले कितने समय तक रखा जाए। डिफ़ॉल्ट 6 महीने है।
- Archival Period (महीने): डिलीशन से पहले आर्काइव किए गए डेटा को कितने समय तक रखा जाए। डिफ़ॉल्ट 6 महीने है।
चरण 3: समीक्षा करें और सेव करें
अपने डेटासेट कॉन्फ़िगरेशन का सारांश देखें: नाम, विवरण, टीम, डेटा प्रकार, अपलोड की गई कुल फ़ाइलें, और रिटेंशन सेटिंग्स। डेटासेट को सुरक्षित रखने के लिए Save and Continue पर क्लिक करें। सेव करने के बाद, सिस्टम आपको डेटा प्रीव्यू चरण पर ले जाता है।
Dataset Wizard — अपलोड के बाद के चरण
प्रारंभिक अपलोड और सेव के बाद, Dataset Wizard अतिरिक्त चरण प्रदान करता है जो इस पर निर्भर करते हैं कि आपका डेटा टैबुलर है या इमेज-आधारित।
टैबुलर डेटासेट (CSV, Excel, Parquet, JSON, Avro)
- Upload — अपनी फ़ाइलें अपलोड करें।
- Prepare — स्कीमा का पूर्वावलोकन करें। सिस्टम आपकी अपलोड की गई फ़ाइलों से कॉलम नाम और प्रकार पढ़ता है। पहचानी गई स्कीमा की समीक्षा करें, कॉलम-स्तरीय गुणवत्ता मेट्रिक्स देखें, और डेटा प्रकार समायोजित करें।
- Refine (Clean and Transform) — एक विज़ुअल पाइपलाइन के माध्यम से डेटा ट्रांसफ़ॉर्मेशन लागू करें। उपलब्ध ऑपरेशनों में कैलकुलेटेड फ़ील्ड, डेटा क्लीनिंग, और ट्रांसफ़ॉर्मेशन चरण शामिल हैं।
- Publish (Validate and Publish) — डेटा अखंडता को सत्यापित करें और विश्लेषण के लिए डेटासेट प्रकाशित करें।
- Analyze — डेटा संदर्भ के भीतर सीधे पूर्ण Analytics डैशबोर्ड खोलता है।
इमेज डेटासेट
- Upload — इमेज को व्यक्तिगत रूप से, बल्क में, या ZIP आर्काइव के रूप में अपलोड करें।
- Prepare (Label) — वर्गीकरण के लिए इमेज को लेबल असाइन करें। लेबल फ़ोल्डर संरचना, CSV मैपिंग फ़ाइलों, या मैनुअल टैगिंग से आ सकते हैं।
- Refine (Curate) — इमेज गुणवत्ता की समीक्षा करें, आउटलायर का पता लगाएं, समस्याग्रस्त इमेज को बाहर करें, और क्लास वितरण को संतुलित करें।
- Publish (Split and Export) — कॉन्फ़िगर करने योग्य अनुपात के साथ train/validation/test स्प्लिट जनरेट करें। व्यवस्थित फ़ोल्डर और CSV मैनिफ़ेस्ट सहित कई प्रारूपों में एक्सपोर्ट करें।
- Analyze — क्लास वितरण और टैग सांख्यिकी सहित अपने इमेज डेटासेट पर एनालिटिक्स देखें।
स्कीमा परिभाषा और मैपिंग
स्कीमा एडिटर के माध्यम से डेटासेट बनाते समय, आप निम्नलिखित गुणों के साथ कॉलम परिभाषित करते हैं:
- Column Name और Description
- Column Type: DATETIME, DATE, BOOL, BYTES, GEOGRAPHY, INTERVAL, INT64, NUMERIC, BIGNUMERIC, FLOAT64, RANGE, STRING, TIMESTAMP, TIME, STRUCT, ARRAY
- Column Properties: isPrimaryKey, isUnique, isNullable, isAutoIncrement, isEncrypted, isAnonymized, isClassified, isCategorized, isNormalized, isStandardized
डेटा स्टोरेज
सभी टैबुलर डेटासेट उच्च-प्रदर्शन एनालिटिक्स के लिए एक स्केलेबल क्लाउड डेटा वेयरहाउस में संग्रहीत किए जाते हैं। आसान प्रबंधन और एक्सेस नियंत्रण के लिए प्रत्येक डेटासेट आपके वर्कस्पेस के अंतर्गत व्यवस्थित है।
Data Listing सुविधाएँ
- Edit: कॉन्फ़िगरेशन या स्कीमा को संशोधित करने के लिए विज़ार्ड में डेटासेट खोलें।
- Clone: डेटासेट और उसके कॉन्फ़िगरेशन की एक कॉपी बनाएं।
- Lock / Unlock: किसी डेटासेट में आकस्मिक संशोधनों को रोकें।
- Analyze: इस डेटासेट के लिए सीधे एनालिटिक्स डैशबोर्ड पर जाएं।
- Share: साझा करने के लिए एनालिटिक्स डैशबोर्ड व्यू खोलें।
- Delete: डेटासेट को स्थायी रूप से हटाएं। एकल और बल्क डिलीशन का समर्थन करता है।
ऑटो-सेव और वर्शन हिस्ट्री
Dataset Wizard में ऑटो-सेव फ़ंक्शनैलिटी शामिल है जो आपके काम को स्वतः सुरक्षित रखती है। Undo/redo हिस्ट्री 50 वर्शन तक बनाए रखी जाती है ताकि आप परिवर्तनों को पूर्ववत कर सकें।
सुझाव और सर्वोत्तम अभ्यास
- वर्णनात्मक डेटासेट नामों का उपयोग करें ताकि उन्हें लिस्टिंग में ढूंढना आसान हो।
- इमेज क्लासिफिकेशन डेटासेट के लिए, ZIP के रूप में अपलोड करने से पहले इमेज को क्लास नाम के अनुसार फ़ोल्डरों में व्यवस्थित करें — सिस्टम स्वतः फ़ोल्डर संरचना से क्लास लेबल का पता लगाएगा।
- अपनी डेटा गवर्नेंस आवश्यकताओं के आधार पर उपयुक्त रिटेंशन और आर्काइवल अवधि सेट करें।
- ब्राउज़र अपलोड सीमाओं से बचने के लिए 5 GB से बड़े डेटासेट के लिए Direct Cloud Upload विकल्प का उपयोग करें।
- कॉलम प्रकार सही हैं यह सुनिश्चित करने के लिए प्रकाशित करने से पहले हमेशा स्वतः-पहचानी गई स्कीमा की समीक्षा करें।