वीडियो में भाषण को सादे पाठ में ट्रांसक्राइब करें। ऑडियो ट्रैक को डिकोड किया गया है और अपनी मशीन पर व्हिस्पर के माध्यम से चलाया जाता है, इसलिए रिकॉर्डिंग इसे कभी नहीं छोड़ती है, और जब यह किया जाता है तो प्रतिलेख .txt के रूप में डाउनलोड होता है।
यह कैसे काम करता है
- एक ऑडियो फ़ाइल या एक वीडियो छोड़ें, और ऑडियो ट्रैक आपके डिवाइस पर डिकोड हो जाएगा।
- एक मॉडल चुनें: तेज़ (≈41 एमबी, एक बार डाउनलोड किया गया) या सटीक (≈77 एमबी)।
- ट्रांसक्राइब करें, टेक्स्ट को लाइव दिखाई देते हुए देखें, और .txt, .srt या .vtt डाउनलोड करें।
अक्सर पूछे जाने वाले प्रश्न
- क्या मेरी फ़ाइल अपलोड हो जाती है?
- नहीं। मॉडल और सभी प्रसंस्करण आपके अपने डिवाइस पर आपके ब्राउज़र के अंदर चलते हैं। आप इसे स्वयं सत्यापित कर सकते हैं: अपने ब्राउज़र का DevToolsखोलें, नेटवर्क टैब देखें, और एक फ़ाइल संसाधित करें: कोई अपलोड नहीं हैं। पहली विज़िट के बाद अधिकांश टूल पूरी तरह से ऑफ़लाइन भी काम करते हैं।
- यह कितना सटीक है?
- मॉडल OpenAI के व्हिस्पर (छोटे और बेस टियर) हैं। स्पष्ट भाषण पर वे बहुत उपयोगी हैं; भारी लहजे, क्रॉसस्टॉक और शोर वाले कमरे त्रुटियां दिखाएंगे। कठिन ऑडियो पर सटीक टियर काफी बेहतर है।
- कौन सी भाषाएँ काम करती हैं?
- मॉडल बहुभाषी हैं, और ट्रांसक्रिप्शन वर्तमान में अंग्रेजी में चलता है। अधिक भाषाओं की योजना बनाई गई है: मॉडल पहले से ही 99 का समर्थन करता है।
- इसमें कितना समय लगता है?
- एक समर्थित GPUवाली मशीन पर , प्रति मिनट कुछ सेकंड का ऑडियो। सीपीयू-केवल मशीनों पर यह धीमा है लेकिन फिर भी व्यावहारिक है, रिकॉर्डिंग की लंबाई का लगभग एक चौथाई।