छोटी रिकॉर्डिंग की आवाज से कैप्शन बनाएँ
बोली गई जानकारी के साथ उसके शब्द और समय भी दिखें तो उसे जाँचना आसान होता है। यह टूल छोटे हिंदी या इंग्लिश ऑडियो से कैप्शन का शुरुआती मसौदा बनाता है। पहचान में मिले शब्द बदल सकते हैं, शुरुआत और अंत का समय सुधार सकते हैं और सबटाइटल फाइल डाउनलोड कर सकते हैं। नाम, संख्या और तकनीकी शब्दों को खुद सुनकर जाँचना जरूरी है।
ऑडियो फाइल या ऐसा वीडियो चुनें जिसकी आवाज आपका ब्राउज़र पढ़ सकता हो। पहचान के लिए आवाज इस्तेमाल होती है और प्रीव्यू में ऑडियो प्लेयर के साथ वर्तमान कैप्शन दिखता है। यह वीडियो में अक्षर स्थायी जोड़कर नई वीडियो फाइल नहीं बनाता। वक्ता पहचानने, भाषा का अनुवाद करने या लाइव माइक्रोफोन रिकॉर्ड करने की सुविधा भी नहीं है।
सही फाइल और भाषा चुनें
रिकॉर्डिंग कम से कम आधा सेकंड और अधिकतम 60 सेकंड की होनी चाहिए। फाइल का आकार 50 MB या उससे कम रखें। WAV, MP3, M4A, AAC, OGG, FLAC, MP4, WebM और MOV नाम वाली फाइल मान्य है, लेकिन उसके अंदर का ऑडियो कोडेक भी ब्राउज़र में पढ़ा जाना चाहिए। केवल परिचित एक्सटेंशन होने से फाइल खुलने की गारंटी नहीं मिलती।
वीडियो की आवाज पढ़ने में दिक्कत आए तो छोटी WAV या MP3 आजमाएँ। लंबी रिकॉर्डिंग का जरूरी हिस्सा पहले अलग करें। टूल लंबी फाइल का केवल शुरुआती मिनट छिपकर नहीं पढ़ता; सीमा से बड़ी अवधि को रोकता है। एक मुख्य व्यक्ति की साफ आवाज, संगीत या एक साथ बोलते कई लोगों की तुलना में जाँचने योग्य मसौदा देने के लिए बेहतर स्रोत है।
बोली गई भाषा में हिंदी या इंग्लिश चुनें। इसका चुनाव पेज की भाषा से अलग है। अधिकतर हिंदी बोलते हुए बीच में इंग्लिश शब्द इस्तेमाल किए हैं तो पहले हिंदी चुनकर उन शब्दों को ध्यान से सुनें। मिलीजुली भाषा में लिपि, वर्तनी और विराम चिह्न बदल सकते हैं। किसी भी विकल्प में हर उच्चारण या हर मिश्रित वाक्य की सही पहचान का दावा नहीं है।
पहली बार मॉडल डाउनलोड होता है
मॉडल लोड करके कैप्शन बनाएँ दबाने पर जरूरी रनटाइम और speech model लोड होते हैं। Transformers.js का निश्चित संस्करण jsDelivr से और इंग्लिश के लिए Whisper Base और हिंदी के लिए बहुभाषी Whisper Small की फाइलें Hugging Face से आती हैं। पहली बार इंग्लिश में लगभग 150 MB या ज्यादा और हिंदी में लगभग 400 MB या ज्यादा डेटा लग सकता है। वास्तविक मात्रा जरूरी फाइलों और ब्राउज़र में पहले से मौजूद कैश पर निर्भर होती है। बोली गई भाषा बदलने पर पिछला वर्कर बंद होता है और चुनी भाषा का मॉडल लोड होता है। हिंदी में देवनागरी टेक्स्ट बनाना उद्देश्य है; किसी भी खंड में देवनागरी न मिलने पर परिणाम सफल कैप्शन की तरह नहीं दिया जाता।
डाउनलोड के बाद आवाज की पहचान WebAssembly वाले ब्राउज़र वर्कर में होती है। टूल चुनी आवाज को स्थानीय रूप से पढ़ता है, एक चैनल में मिलाता है और मॉडल के लिए 16 kHz पर तैयार करता है। अपना कोड रिकॉर्डिंग किसी ऑनलाइन ट्रांसक्रिप्शन सेवा को नहीं भेजता और वेबसाइट सर्वर पर बातचीत का टेक्स्ट जमा नहीं करता। फाइल देने वाले बाहरी प्रदाताओं को सामान्य डाउनलोड अनुरोध और कनेक्शन की जानकारी मिलती है।
कुछ मॉडल फाइलें ब्राउज़र के कैश में रह सकती हैं, जिससे अगली बार कम डाउनलोड हो। इसका मतलब हर अगली बार पूरी तरह ऑफलाइन चलने की गारंटी नहीं है। कैश हटने, दूसरा ब्राउज़र इस्तेमाल करने, स्टोरेज की सीमा या रनटाइम की कमी पर नेटवर्क फिर जरूरी हो सकता है। पेज बंद करने से चुनी रिकॉर्डिंग और कैप्शन का इंटरफेस हटता है; मॉडल का कैश जरूरी नहीं मिटता।
प्रीव्यू सुनकर टेक्स्ट सुधारें
काम पूरा होने पर ऑडियो प्लेयर और क्रमांक वाले कैप्शन दिखते हैं। हर कैप्शन में शुरुआत, अंत और टेक्स्ट का खाना होता है। आवाज चलाएँ और उसके साथ दिख रहे वर्तमान कैप्शन को मिलाएँ। समय AI का अनुमान है। वाक्य का पहला और आखिरी शब्द कब सुनाई देता है, दोनों देखकर सीमा सुधारें। केवल टेक्स्ट सही दिखना समय सही होने का प्रमाण नहीं है।
व्यक्ति का नाम, जगह, तारीख, रकम और कठिन शब्द खास ध्यान से जाँचें। पढ़ने में सहज वाक्य भी असली आवाज से अलग हो सकता है। संगीत या चुप्पी पर मॉडल कभी ऐसा टेक्स्ट दे सकता है जो बोला ही नहीं गया। गलत शब्द बदलें और जरूरत पर उसी खंड का समय सुधारें। इस इंटरफेस में नया खंड जोड़ना, हटाना या क्रम बदलना नहीं है; बड़े बदलाव के लिए डाउनलोड के बाद सबटाइटल एडिटर इस्तेमाल करें।
समय सेकंड में लिखा जाता है और मिलीसेकंड तक रखा जाता है। शुरुआत शून्य या ज्यादा हो, अंत उससे आगे हो और क्लिप की अवधि के अंदर रहे। दो कैप्शन का समय आपस में न चढ़े। हर टेक्स्ट में एक से हजार अक्षर मान्य हैं; खाली पैराग्राफ और समय वाले तीर का क्रम न रखें। बदलाव के बाद प्रीव्यू और डाउनलोड अपडेट करें दबाएँ।
तीन तरह की डाउनलोड फाइलें
SRT में क्रमांक, समय और कैप्शन टेक्स्ट होता है। VTT में WEBVTT की शुरुआत और वेब प्लेयर के लिए समय का तरीका मिलता है। TXT में कैप्शन का टेक्स्ट क्रम से होता है, समय नहीं। तीनों UTF-8 टेक्स्ट फाइलें हैं। इन्हें टेक्स्ट एडिटर में खोलकर पढ़ सकते हैं। ये MP4 वीडियो, आवाज की नई फाइल या कैप्शन की तस्वीर नहीं हैं।
छोटे ट्यूटोरियल में पहले पहचान चलाएँ, सामान का नाम और बोलने का समय सुधारें, फिर अपने वीडियो एडिटर के लिए SRT लें। पढ़ने योग्य मसौदा चाहिए तो TXT रखें। अलग सबटाइटल ट्रैक स्वीकार करने वाले वेब प्लेयर में VTT आजमाएँ और उसी में प्रदर्शन जाँचें। जिस ऐप में फाइल डालनी है, उसका फॉर्मेट समर्थन पहले देख लें।
डाउनलोड में टेक्स्ट लगभग 42 यूनिकोड अक्षर की पंक्ति के अनुसार बाँटा जाता है। यह किसी तय पिक्सेल चौड़ाई, हमेशा दो पंक्तियाँ या सही पढ़ने की गति की गारंटी नहीं है। हिंदी की मात्राएँ, इमोजी और चुना फॉन्ट अलग जगह लेते हैं। आखिर में इस्तेमाल होने वाले प्लेयर में पढ़कर जरूरत हो तो घना टेक्स्ट छोटा करें या खंड अलग करें।
फोन, ब्राउज़र और समस्या का हल
ऑडियो पढ़ने, OfflineAudioContext, module worker और WebAssembly की सुविधा चाहिए। यह एक WebAssembly थ्रेड इस्तेमाल करता है और कैमरा या माइक्रोफोन की अनुमति नहीं माँगता। कम मेमोरी वाले फोन की तुलना में सक्षम कंप्यूटर व्यावहारिक हो सकता है। फोन पर काम धीमा हो सकता है, गर्मी बढ़ सकती है या पृष्ठभूमि में जाने से ब्राउज़र काम रोक सकता है।
मॉडल लोड न होने की वजह बाहरी डाउनलोड रुकना, कमजोर कनेक्शन, मेमोरी की कमी या ब्राउज़र की सेटिंग हो सकती है। आवाज पढ़ने की त्रुटि फाइल और कोडेक से जुड़ी होती है। काम रोकें दबाने पर वर्कर बंद होता है और अधूरे कैप्शन नहीं रखे जाते। दोबारा शुरू करने पर मॉडल फिर लोड हो सकता है। पाँच मिनट से ज्यादा लगने पर काम रुकता है और छोटी क्लिप आजमाने का संदेश आता है।
संबंधित टूल और लेख
कैप्शन साझा करते समय आवाज में बोले गए फोन नंबर, पते या दूसरे निजी विवरण भी टेक्स्ट में आ सकते हैं। निजी जानकारी उजागर होने के असर समझें
अक्सर पूछे जाने वाले सवाल
क्या आवाज से कैप्शन अपने आप बनते हैं?
हाँ, अगर ब्राउज़र आवाज पढ़ सके और जरूरी मॉडल लोड हो जाए। हिंदी या इंग्लिश के अनुमानित समय वाले खंड मिलते हैं। यह सत्यापित बातचीत का रिकॉर्ड नहीं है; साझा करने से पहले शब्द और समय जाँचें।
क्या कैप्शन लगा MP4 डाउनलोड मिलेगा?
नहीं। यहाँ SRT, VTT और TXT निकलते हैं। प्लेयर मूल आवाज का प्रीव्यू है। वीडियो में अक्षर स्थायी जोड़ने हों तो जाँची हुई SRT किसी उपयुक्त टूल या एडिटर में लगाएँ।
क्या मेरी रिकॉर्डिंग ऑनलाइन भेजी जाती है?
टूल का अपना कोड चुनी रिकॉर्डिंग ट्रांसक्रिप्शन सर्वर को नहीं भेजता। पहचान स्थानीय है, लेकिन मॉडल और रनटाइम बाहरी प्रदाताओं से डाउनलोड होते हैं। वेबसाइट के सामान्य संसाधन भी नेटवर्क इस्तेमाल कर सकते हैं।
हिंदी नाम या इंग्लिश शब्द गलत क्यों आते हैं?
पहचान का मॉडल उच्चारण, लिपि और नए शब्दों में गलती कर सकता है। मिलीजुली भाषा में कठिनाई बढ़ती है। मुख्य बोली गई भाषा चुनें और जरूरी नाम, तारीख तथा संख्या खुद सुधारें।
क्या फोन या बिना इंटरनेट के चलेगा?
जरूरी सुविधा वाला मोबाइल ब्राउज़र कोशिश कर सकता है, लेकिन मेमोरी और गति की सीमा रहती है। पहली बार डाउनलोड जरूरी है। बाद में कैश डेटा बचा सकता है, फिर भी पूरी ऑफलाइन उपलब्धता की गारंटी नहीं है।
बदले हुए कैप्शन डाउनलोड में क्यों नहीं दिखे?
बदलाव होने पर पुराने लिंक हटते हैं। प्रीव्यू और डाउनलोड अपडेट करें दबाकर नया परिणाम बनाएँ। पहले से फोन में रखी फाइल पुरानी कॉपी ही रहेगी; नई फाइल अलग से डाउनलोड करनी होगी।