अवलोकन
SurveyAnalytica प्लेटफ़ॉर्म के भीतर एक संपूर्ण मशीन लर्निंग लाइफसाइकिल प्रदान करता है, जिससे आप बिना कोड लिखे ML मॉडल बना सकते हैं, प्रशिक्षित कर सकते हैं, वर्जन कर सकते हैं, मूल्यांकन कर सकते हैं, और डिप्लॉय कर सकते हैं। ML क्षमताएँ टैबुलर डेटा वर्गीकरण और रिग्रेशन, AutoML और ट्रांसफर लर्निंग के साथ इमेज वर्गीकरण, और डेडिकेटेड कंप्यूट संसाधनों के साथ कस्टम मॉडल ट्रेनिंग तक फैली हुई हैं।
मॉडल्स में नेविगेट करना
Data सेक्शन से ML मॉडल प्रबंधन इंटरफ़ेस एक्सेस करें। किसी डेटासेट को देखते समय, एनालिटिक्स के भीतर Predictions व्यू प्रशिक्षित मॉडल और उनके परिणाम दिखाता है।
मॉडल बनाना
नया मॉडल बनाने के लिए, निम्नलिखित जानकारी प्रदान करें:
- Name: आपके मॉडल के लिए एक वर्णनात्मक नाम।
- Category: ML टास्क का प्रकार — वर्गीकरण, रिग्रेशन, क्लस्टरिंग, या पूर्वानुमान।
- Model Type: उपयोग किया जाने वाला एल्गोरिदम। विकल्पों में शामिल हैं:
- टैबुलर मॉडल: लॉजिस्टिक रिग्रेशन, बूस्टेड ट्री, डीप न्यूरल नेटवर्क, रैंडम फ़ॉरेस्ट, XGBoost, ARIMA टाइम सीरीज़, K-means क्लस्टरिंग
- इमेज मॉडल: AutoML विज़न, ट्रांसफर लर्निंग मॉडल
- टेक्स्ट मॉडल: लैंग्वेज मॉडल, AutoML टेक्स्ट
- AutoML: स्वचालित टैबुलर और वर्गीकरण मॉडल
- Workspace: वह वर्कस्पेस जिससे यह मॉडल संबंधित है।
- Data Entity: प्रशिक्षण के लिए डेटासेट।
- Input/Output Schema: अपेक्षित इनपुट फ़ीचर्स और आउटपुट प्रेडिक्शन परिभाषित करें।
मॉडल को प्रशिक्षित करना
प्रशिक्षण शुरू करना
एक बार मॉडल बन जाने के बाद, निम्नलिखित कॉन्फ़िगर करके प्रशिक्षण शुरू करें:
- Dataset: प्रशिक्षण के लिए डेटा स्रोत — टैबुलर डेटा या इमेज डेटा।
- Target column: जिस कॉलम की भविष्यवाणी करनी है (सुपरवाइज़्ड लर्निंग के लिए)।
- Hyperparameters: एल्गोरिदम-विशिष्ट सेटिंग्स जैसे लर्निंग रेट, बैच साइज़, epochs, ट्रीज़ की संख्या, आदि।
- Compute resources: प्रशिक्षण के लिए आवंटित कंप्यूट संसाधनों का स्तर।
- GPU acceleration: इमेज और डीप लर्निंग मॉडल के लिए वैकल्पिक GPU संसाधन।
- Budget hours: अनुमत अधिकतम प्रशिक्षण समय।
प्रशिक्षण विकल्प
टैबुलर डेटा प्रशिक्षण
संरचित डेटा के लिए, प्रशिक्षण एक ऑप्टिमाइज़्ड बैकएंड पर चलता है जो टैबुलर डेटा पर तेज़, स्केलेबल ML के लिए डिज़ाइन किया गया है। यह संरचित डेटासेट के लिए सबसे तेज़ विकल्प है और सभी मानक ML मॉडल प्रकारों का समर्थन करता है।
इमेज और कस्टम मॉडल प्रशिक्षण
इमेज वर्गीकरण, ट्रांसफर लर्निंग, और कस्टम मॉडल के लिए, प्रशिक्षण GPU एक्सेलरेशन के साथ डेडिकेटेड कंप्यूट संसाधनों पर चलता है। समर्थित प्रशिक्षण पथ:
- AutoML Tabular: स्वचालित फ़ीचर इंजीनियरिंग और मॉडल चयन।
- AutoML Image: स्वचालित इमेज वर्गीकरण मॉडल प्रशिक्षण।
- Transfer Learning: अपने डेटा पर पूर्व-प्रशिक्षित मॉडल को फ़ाइन-ट्यून करें। कॉन्फ़िगर करने योग्य epochs, लर्निंग रेट, बैच साइज़, और इमेज साइज़।
- Custom Models: आर्किटेक्चर पर पूर्ण नियंत्रण के साथ कस्टम डीप लर्निंग मॉडल प्रशिक्षित करें।
प्रशिक्षण की निगरानी
प्रशिक्षण प्रगति को वास्तविक समय में इनके माध्यम से ट्रैक किया जाता है:
- Live progress stream: UI पर पुश किए गए वास्तविक-समय प्रगति अपडेट, जो चरण (initializing, training, complete), प्रतिशत, और संदेश दिखाते हैं।
- Status checking: पॉल-आधारित स्टेटस जांच, जिसमें स्टेल स्टेटस का स्वचालित पता लगाना और उसकी रिकवरी शामिल है।
- Activity tracking: सभी प्रशिक्षण गतिविधियाँ टाइमस्टैंप, लागत, और मेट्रिक्स के साथ लॉग की जाती हैं।
Grid Search (हाइपरपैरामीटर ट्यूनिंग)
व्यवस्थित हाइपरपैरामीटर ऑप्टिमाइज़ेशन के लिए, कई मॉडल वेरिएंट को स्वचालित रूप से प्रशिक्षित करने के लिए Grid Search का उपयोग करें:
- प्रत्येक हाइपरपैरामीटर के लिए आज़माए जाने वाले मानों को निर्दिष्ट करते हुए एक पैरामीटर ग्रिड परिभाषित करें।
- अधिकतम समानांतर जॉब सेट करें (डिफ़ॉल्ट: 5)।
- सिस्टम सभी पैरामीटर संयोजन उत्पन्न करता है और प्रत्येक को एक अलग प्रशिक्षण जॉब के रूप में सबमिट करता है।
- परिणामों को ट्रैक और तुलना किया जाता है, जो प्रत्येक संयोजन के लिए मेट्रिक्स दिखाते हैं।
उदाहरण पैरामीटर ग्रिड:
{
"learning_rate": [0.001, 0.01, 0.1],
"batch_size": [16, 32, 64],
"epochs": [10, 20, 50]
}
यह 27 संयोजन (3 x 3 x 3) उत्पन्न करेगा और प्रत्येक को प्रशिक्षित करेगा।
मॉडल वर्जनिंग
प्रत्येक मॉडल कई वर्जन का समर्थन करता है, जिससे आप पुनरावृत्ति और तुलना कर सकते हैं:
- Add version: प्रत्येक प्रशिक्षण रन अपने स्वयं के हाइपरपैरामीटर, मेट्रिक्स, और आर्टिफ़ैक्ट संदर्भों के साथ एक नया वर्जन बनाता है।
- Live version: डिप्लॉयमेंट और इन्फ़रेंस के लिए किसी विशिष्ट वर्जन को “live” स्टेटस पर प्रोमोट करें।
- Archive version: इतिहास को संरक्षित रखते हुए साफ़ करने के लिए पुराने वर्जन को आर्काइव करें। वैकल्पिक रूप से क्लाउड आर्टिफ़ैक्ट साफ़ करें।
- Delete version: किसी वर्जन और उसके आर्टिफ़ैक्ट को स्थायी रूप से हटाएँ।
- Refresh metrics: सभी वर्जन के लिए मेट्रिक्स को फिर से प्राप्त करें, किसी भी स्टेल प्रशिक्षण स्टेटस को रिकवर करें।
वर्जन मेटाडेटा
प्रत्येक वर्जन संग्रहीत करता है:
- प्रशिक्षण के लिए उपयोग किए गए हाइपरपैरामीटर
- प्रशिक्षण कॉन्फ़िगरेशन (टारगेट कॉलम, डेटासेट, मॉडल प्रकार)
- प्रशिक्षण जॉब संदर्भ
- मेट्रिक्स (accuracy, precision, recall, F1, AUC, loss, आदि)
- रनटाइम मिनट और USD में अनुमानित लागत
- मॉडल आर्टिफ़ैक्ट संदर्भ (डिप्लॉयमेंट के लिए)
मॉडल डिप्लॉयमेंट
प्रशिक्षित मॉडल को वास्तविक-समय इन्फ़रेंस के लिए API एजेंट के रूप में डिप्लॉय किया जा सकता है:
- टैबुलर मॉडल: स्वचालित मॉडल संदर्भ समाधान के साथ डिप्लॉय किए जाते हैं। डिप्लॉयमेंट से पहले सिस्टम यह सत्यापित करता है कि मॉडल मौजूद है।
- इमेज/कस्टम मॉडल: एक्सपोर्ट किए गए मॉडल आर्टिफ़ैक्ट के साथ डिप्लॉय किए जाते हैं। एजेंट बनाने से पहले सिस्टम यह सुनिश्चित करता है कि एक्सपोर्ट उपलब्ध है।
डिप्लॉयमेंट एक कंटेनराइज़्ड सर्विस बनाता है जो मॉडल को REST API के रूप में एक्सपोज़ करता है। एजेंट प्रबंधन पर अधिक जानकारी के लिए AI Agents लेख देखें।
मॉडल डाउनलोड करना
सुरक्षित, समय-सीमित डाउनलोड लिंक के माध्यम से प्रशिक्षित मॉडल आर्टिफ़ैक्ट को विभिन्न फ़ॉर्मेट में डाउनलोड करें। डाउनलोड लिंक जनरेट करने के लिए मॉडल, वर्जन, और फ़ॉर्मेट चुनें।
Activity Timeline
ML Activities टाइमलाइन आपके वर्कस्पेस में सभी ML ऑपरेशन का कालानुक्रमिक इतिहास दिखाती है, जिसमें प्रशिक्षण रन, ग्रिड सर्च, डिप्लॉयमेंट, और उनके स्टेटस (running, completed, failed) शामिल हैं। प्रत्येक गतिविधि में टाइमस्टैंप, लागत, और संबंधित मॉडल तथा वर्जन के लिंक शामिल हैं।