वाक् से पाठ: यह कैसे काम करता है
लेखक: Hushscript प्रकाशित: अंतिम समीक्षा:
स्पीच टू टेक्स्ट एक सॉफ्टवेयर है जो बोले गए ऑडियो को लिखित शब्दों में बदल देता है। यह शब्द दो अलग-अलग नौकरियों को शामिल करता है जो समान लगती हैं लेकिन अलग तरह से काम करती हैं: लाइव डिक्टेशन, जहां आप बोलते हैं और आपके जाते ही टेक्स्ट दिखाई देता है, और ट्रांसक्रिप्शन, जहां आप एक रिकॉर्डिंग सौंपते हैं और एक तैयार ट्रांसक्रिप्ट वापस प्राप्त करते हैं। दोनों का मूल विचार एक ही है. वर्कफ़्लो, सटीकता, और परिणाम के साथ आप क्या कर सकते हैं, ये नहीं हैं।
यह मार्गदर्शिका सरल भाषा में स्पष्ट करती है कि वास्तव में पाठ का भाषण क्या है, इंजन ध्वनि से शब्दों तक कैसे पहुंचता है, और दोनों मोड कैसे भिन्न होते हैं। फिर यह Hushscript पर एक रिकॉर्डिंग को पाठ में परिवर्तित करने के माध्यम से चलता है, एक काम किए गए उदाहरण के साथ, लोगों को परेशान करने वाली समस्याएं, और अंत में एक संक्षिप्त FAQ।
वास्तव में पाठ के लिए भाषण क्या है
अपने सबसे सरल रूप में, स्वचालित वाक् पहचान (ASR) एक ध्वनि तरंग लेता है और शब्दों का एक अनुक्रम उत्पन्न करता है। एक माइक्रोफ़ोन भाषण को एक सतत तरंग के रूप में कैप्चर करता है, एक डगमगाती रेखा जो समय के साथ बदलते वायु दबाव को दर्शाती है। वह तरंग रूप सब कुछ वहन करता है: शब्द, वक्ता की आवाज, कमरा, एयर कंडीशनर की गड़गड़ाहट। इंजन का कार्य उस मिश्रण से शब्दों को बाहर निकालना और उन्हें लिखना है।
ऐसा करने के लिए, इंजन ऑडियो को छोटे-छोटे स्लाइस में काटता है, आमतौर पर 10 से 30 मिलीसेकंड, और प्रत्येक स्लाइस में ध्वनि को मापता है। वे माप एक प्रशिक्षित मॉडल को फीड करते हैं जो किसी भाषा की वाक् इकाइयों पर, फिर शब्दों पर, फिर संपूर्ण वाक्यांशों पर ध्वनि के पैटर्न को मैप करता है। आपको इसमें से कुछ भी नजर नहीं आता. आप देखते हैं कि एक रिकॉर्डिंग अंदर जाती है और एक प्रतिलेख बाहर आता है। लेकिन मोटे तौर पर यह जानना कि अंदर क्या होता है, यह बताता है कि क्यों कुछ रिकॉर्डिंग साफ-सुथरी तरीके से लिखी जाती हैं और अन्य खराब हो जाती हैं।
ज्ञान की दो परतें एक साथ काम करती हैं। एक है ध्वनिक: किसी भाषा की ध्वनियाँ क्या हैं और उन्हें विभिन्न स्वरों और उच्चारणों में कैसे उच्चारित किया जाता है। दूसरा भाषाई है: कौन से शब्द अनुक्रम प्रशंसनीय हैं। भाषाई परत यही है कि एक अच्छा इंजन “वहां कार खराब हो गई” के बजाय “उनकी कार खराब हो गई” लिखता है, भले ही दोनों एक जैसे लगते हों। यह उस वर्तनी को चुनने के लिए संदर्भ का उपयोग कर रहा है जो मनुष्य चाहता है।
पुरानी वाक् पहचान हाथ से लिखे नियमों और छोटे प्रशिक्षण सेटों पर निर्भर करती थी, और यह नाजुक थी। आधुनिक इंजन बड़े एआई मॉडल हैं जो कई वक्ताओं, उच्चारण और रिकॉर्डिंग स्थितियों से हजारों घंटे के रिकॉर्ड किए गए भाषण पर प्रशिक्षित होते हैं। वह व्यापकता ही आज के प्रतिलेखों के प्रयोग योग्य होने का संपूर्ण कारण है। एक सभ्य रिकॉर्डिंग में स्पष्ट भाषण पर, वर्तमान मॉडल लगभग 90 से 97 प्रतिशत शब्द सटीकता तक पहुँचते हैं। शेष कुछ प्रतिशत वह है जहां इस गाइड में बाद में समस्या निवारण किया जाता है।
रिकॉर्ड किया गया भाषण बनाम लाइव श्रुतलेख
व्यवहार में जो विभाजन सबसे अधिक मायने रखता है वह यह है कि ऑडियो को लाइव संसाधित किया जा रहा है या तथ्य के बाद।
लाइव श्रुतलेख वास्तविक समय में चलता है। आप किसी फ़ोन, वॉइस असिस्टेंट, या वर्ड प्रोसेसर में वॉइस-टाइपिंग सुविधा से बात करते हैं, और शब्द लगभग उतनी ही तेज़ी से प्रकट होते हैं जितनी तेज़ी से आप उन्हें बोलते हैं। बनाए रखने के लिए, इंजन को प्रत्येक शब्द के लिए बहुत कम वाक्य के साथ प्रतिबद्ध होना होगा। यह एक कठिन बाधा है, और यही कारण है कि श्रुतलेख कभी-कभी किसी शब्द का अनुमान लगाता है, फिर अगले कुछ शब्द आने पर चुपचाप उसे फिर से लिख देता है। लाइव डिक्टेशन एक सही उपकरण है, जब बात आपके खुद के भाषण को कैद करने की होती है: हैंड्स-फ़्री नोट लिखना, आवाज से ईमेल ड्राफ्ट करना, डिवाइस को नियंत्रित करना।
ट्रांसक्रिप्शन पूरी रिकॉर्डिंग पर काम करता है। आप इंजन को एक तैयार ऑडियो या वीडियो फ़ाइल देते हैं, यह पूरी चीज़ को संसाधित करता है, और बदले में आपको एक पूर्ण प्रतिलेख मिलता है। क्योंकि वास्तविक समय में कुछ भी नहीं होना है, इंजन आगे पढ़ सकता है और किसी भी शब्द पर निर्णय लेने से पहले पूरा वाक्य देख सकता है, जिससे सटीकता बढ़ जाती है। यह वह काम भी कर सकता है जो लाइव डिक्टेशन नहीं कर सकता। यह वक्ता को अलग कर सकता है, प्रत्येक पंक्ति को जिसने भी कहा है उसे जिम्मेदार ठहराया जा सकता है, और यह टाइमस्टैम्प संलग्न कर सकता है ताकि आप पाठ की एक पंक्ति से सीधे ऑडियो में उस क्षण पर जा सकें।
यदि आप किसी मीटिंग, साक्षात्कार, व्याख्यान, पॉडकास्ट एपिसोड, या आपके द्वारा रिकॉर्ड किए गए फोन कॉल से निपट रहे हैं, तो आप एक सहेजी गई फ़ाइल से ट्रांसक्रिप्शन कर रहे हैं, लाइव डिक्टेशन नहीं। दोनों भ्रमित हो जाते हैं क्योंकि दोनों को “भाषण से पाठ” के रूप में विपणन किया जाता है, लेकिन आपके पास पहले से मौजूद रिकॉर्डिंग एक श्रुतलेख उपकरण के लिए गलत आकार और एक प्रतिलेखक के लिए सही आकार है। Hushscript रिकॉर्डिंग के लिए बनाया गया है। कोई लाइव-डिक्टेशन मोड नहीं है, और वह फोकस जानबूझकर किया गया है: पूर्ण फ़ाइल से काम करने से वह सटीकता के लिए आगे पढ़ सकता है और उसी पास में वक्ता को लेबल कर सकता है।
रिकॉर्ड किए गए भाषण को टेक्स्ट में कैसे परिवर्तित करें
यहां Hushscript पर वास्तविक प्रवाह है, जिस क्रम में आप इसे पूरा करते हैं। आपको अपने डिवाइस पर एक फ़ाइल के रूप में रिकॉर्डिंग, किसी भी सामान्य प्रारूप में एक ऑडियो या वीडियो फ़ाइल और साइन अप करने के लिए एक ईमेल पते की आवश्यकता है। वह पूरी सूची है. इंस्टॉल करने के लिए कुछ भी नहीं है।
- फ़ाइल को छोड़ें और पूर्वावलोकन देखें।ऑडियो-टू-टेक्स्ट पेज खोलें और अपनी फ़ाइल को उस पर छोड़ें। Hushscript पहले 30 सेकंड को तुरंत ट्रांसक्रिप्ट करता है और आपको पहले से ही अलग किए गए वक्ता के साथ परिणाम दिखाता है। इस चरण के लिए किसी खाते की आवश्यकता नहीं है. पूर्वावलोकन मौजूद है ताकि आप कुछ भी करने से पहले अपनी रिकॉर्डिंग पर सटीकता का आकलन कर सकें।
- बाकी को ट्रांसक्राइब करने के लिए साइन अप करें। यदि पूर्वावलोकन सही लगता है, तो अपने ईमेल से साइन अप करें। पूरी फ़ाइल को ट्रांसक्रिप्ट करना गेटेड है, इसलिए यह चरण वह है जहां एक खाता आता है। नए खातों को सेवा को ठीक से आज़माने के लिए 30 निःशुल्क मिनट मिलते हैं।
- पूरी फ़ाइल अपलोड करें। एक बार जब आप अंदर आ जाएं, तो पूरी रिकॉर्डिंग अपलोड करें। यदि यह एक वीडियो है, तो ऑडियो पहले आपके ब्राउज़र में निकाला जाता है और केवल ऑडियो भेजा जाता है, इसलिए वीडियो स्वयं आपके डिवाइस पर रहता है।
- पढ़ें, पुनः लेबल करें और निर्यात करें। प्रतिलेख प्रत्येक मोड़ के साथ एक वक्ता (वक्ता A, वक्ता B, और इसी तरह) और टाइमस्टैम्प के साथ वापस आता है। किसी भी वक्ता लेबल का नाम बदलने के लिए उस पर क्लिक करें, और नया नाम उस व्यक्ति द्वारा बोले गए हर जगह अपडेट हो जाता है। जब यह आपके इच्छित तरीके से पढ़ता है, तो सादे पाठ के लिए TXT, उपशीर्षक के लिए SRT या VTT, संरचित डेटा के लिए CSV या JSON, नोट्स प्रकाशित करने के लिए मार्कडाउन, संपादन के लिए DOCX, या साझा करने के लिए PDF में निर्यात करें।
यदि आप आगे बढ़ने से पहले सटीकता की जांच करना चाहते हैं तो एक लघु साक्षात्कार, 10 मिनट की व्याख्यान क्लिप, या लंबी रिकॉर्डिंग के पहले खंड को लिखने के लिए तीस मिनट पर्याप्त हैं। निःशुल्क मिनट त्वरित कार्ड जांच से तुरंत अनलॉक हो जाते हैं: कार्ड की जांच करने के लिए $1 का होल्ड अधिकृत होता है, फिर तुरंत उठा लिया जाता है और कभी शुल्क नहीं लिया जाता है। किसी अन्य भुगतान विधि का उपयोग करें और वे आपकी पहली खरीदारी के साथ पहुंच जाएंगे। कार्ड की आवश्यकता नहीं है; यह बोनस पाने का सबसे तेज़ मार्ग है। मुफ़्त मिनटों के बाद, आप केवल उन मिनटों के लिए भुगतान करते हैं जिन्हें आप ट्रांसक्राइब करते हैं, बिना किसी सदस्यता के। मूल्य निर्धारण पृष्ठ में वर्तमान दरें हैं।
एक कारगर उदाहरण
मान लीजिए कि आपने अपने फोन पर 38 मिनट का ग्राहक साक्षात्कार रिकॉर्ड किया है। इसे M4A के रूप में सहेजा गया, दो आवाज़ें, कभी-कभी कॉफ़ी कप की गड़गड़ाहट, एक सामान्य मीटिंग रूम में रिकॉर्ड की गई।
आप M4A को ऑडियो-टू-टेक्स्ट पेज पर छोड़ दें। 30 सेकंड का पूर्वावलोकन एक छोटी बातचीत के रूप में दिखाई देता है:
वक्ता A 00:00 समय देने के लिए धन्यवाद। क्या आप मुझे यह बताकर शुरुआत कर सकते हैं
किस कारण से सबसे पहले आपने इस तरह के टूल की तलाश की?
वक्ता B 00:11 निश्चित रूप से। हम समर्थन टिकटों में डूब रहे थे और पुराना
सिस्टम चल नहीं पा रहा था, इसलिए मैंने चारों ओर देखना शुरू कर दिया।
वह असंपादित पूर्वावलोकन है। दो आवाजें विभाजित हैं, प्रत्येक पंक्ति टाइमस्टैम्प्ड है, और शब्दांकन साफ है। आप साइन अप करें, पूरी 38 मिनट की फ़ाइल अपलोड करें, और कुछ मिनट बाद पूरी प्रतिलिपि उसी आकार में तैयार हो जाएगी। वक्ता A आप हैं और वक्ता B आपका साक्षात्कारकर्ता है, इसलिए आप “वक्ता A” लेबल पर क्लिक करें, अपना नाम टाइप करें, और उनका नाम टाइप करने के लिए “वक्ता B” पर क्लिक करें। दोनों एक बार में पूरे दस्तावेज़ का नाम बदल देते हैं। आप DOCX को निर्यात करते हैं, इसे अपने वर्ड प्रोसेसर में खोलते हैं, उन दो या तीन स्थानों को ठीक करते हैं जहां उत्पाद का नाम ध्वन्यात्मक रूप से लिखा गया है, और आपके पास एक तैयार साक्षात्कार प्रतिलेख है। 38 मिनट आपके संतुलन से बाहर हो गए, यही कारण है कि मुफ्त 30 मिनट केवल एक परीक्षण क्लिप के बजाय पहली वास्तविक नौकरी के लिए उपयोगी होते हैं।
सामान्य समस्याएं, और उन्हें कैसे ठीक करें
अधिकांश निराशाजनक प्रतिलेख इंजन से नहीं, बल्कि रिकॉर्डिंग से संबंधित होते हैं। ये वे मुद्दे हैं जो सबसे अधिक सामने आते हैं, और प्रत्येक के बारे में क्या करना है।
रिकॉर्डिंग शांत या गंदी है। यदि आवाजें धीमी हैं या कमरे में शोर मच रहा है, तो इंजन को काम करने में कम समय लगता है और सटीकता कम हो जाती है। वक्ता के करीब एक माइक्रोफोन, एक लैपेल माइक या मुंह के 10 से 20 सेंटीमीटर के भीतर एक हेडसेट, किसी भी सेटिंग से बड़ा अंतर पैदा करता है। एक बड़ा, खाली कमरा प्रतिध्वनि जोड़ता है जो ध्वनियों के बीच की सीमाओं को नष्ट कर देता है; एक छोटी या नरम-सुसज्जित जगह बेहतर रिकॉर्ड करती है। इस तथ्य के बाद आप इसे ठीक नहीं कर सकते हैं, इसलिए अगली बार रिकॉर्ड करने से पहले इसे ठीक करना उचित है।
दो लोग एक साथ बात करते हैं। जब आवाजें ओवरलैप होती हैं, तो शब्दांकन और किसने-क्या कहा, दोनों कठिन हो जाते हैं, क्योंकि ध्वनि के दो सेट ऑडियो के एक ही हिस्से में प्रतिस्पर्धा कर रहे हैं। वास्तविक ओवरलैप के लिए कोई साफ़ सॉफ़्टवेयर समाधान नहीं है। जिस रिकॉर्डिंग को आप नियंत्रित करते हैं, उसमें टर्न के बीच एक बीट छोड़ने से बाद में लाभ मिलता है। एक में जिसे आप दोबारा नहीं कर सकते हैं, रुकावटों के आसपास कुछ क्रॉस-ओवर लाइनों की अपेक्षा करें और उन्हें हाथ से साफ करें।
एक विशेषज्ञ शब्द गलत निकलता है। सामान्य प्रयोजन के मॉडल रोजमर्रा की भाषा को अच्छी तरह से जानते हैं लेकिन जरूरी नहीं कि उन्होंने आपके उद्योग का शब्दजाल, एक असामान्य उपनाम या उत्पाद का नाम देखा हो। इन्हें वर्तनी के तरीके के बजाय उनकी ध्वनि के आधार पर प्रतिलेखित किया जाता है। निर्यातित DOCX में ढूँढें और बदलें एक आवर्ती शब्द को सेकंडों में साफ़ कर देता है, जो एक कारण है कि DOCX सही करने के लिए सबसे आसान निर्यात है।
एक फ़ाइल लोड नहीं होगी। अधिकांश मानक ऑडियो और वीडियो फ़ाइलें बस काम करती हैं। यदि कोई इनकार करता है, तो यह आमतौर पर एक असामान्य या बहुत पुराना कंटेनर होता है। मुफ़्त इन-ब्राउज़र टूल के साथ इसे सादे MP3 या WAV में परिवर्तित करना, जो आपके डिवाइस पर चलता है और कुछ भी अपलोड नहीं करता है, लगभग हमेशा इसे हल करता है। यदि कोई प्रारूप अभी भी नहीं चल रहा है, तो support@hushscript.com पर ईमेल करें और टीम इसे जोड़ देगी।
एक वक्ता दो भागों में विभाजित हो जाता है। कभी-कभी एक ही व्यक्ति को दो वक्ता के रूप में लेबल किया जाता है, आमतौर पर क्योंकि उनकी आवाज आंशिक रूप से बदल जाती है: वे माइक के करीब चले गए, हेडसेट से स्पीकरफ़ोन पर स्विच कर दिया, या लाइन की गुणवत्ता बदल गई। इंजन इस आधार पर समूह बनाता है कि आवाज कैसी है, इसलिए एक नया व्यक्ति एक बड़े बदलाव को पढ़ सकता है। संपादक में दो लेबल को मर्ज करने से यह एक चरण में ठीक हो जाता है। इसके यांत्रिकी वक्ता डायराइजेशन कैसे काम करता है पर गाइड में रहते हैं।
सटीकता और उच्चारण
एक्सेंट कवरेज मॉडल और भाषा पर निर्भर करता है। अंग्रेजी के लिए, व्यापक डेटासेट पर प्रशिक्षित मॉडल यूएस, यूके, ऑस्ट्रेलियाई और भारतीय अंग्रेजी को अच्छी तरह से संभालते हैं, और Hushscript चार अलग-अलग अंग्रेजी लहजे प्रदान करता है। एक भारी क्षेत्रीय बोली या कम-प्रतिनिधित्व वाली उच्चारण विविधता को थोड़ा और सुधार की आवश्यकता होगी, लेकिन आप अभी भी कुछ भी नहीं टाइप करने के बजाय एक ड्राफ्ट संपादित कर रहे हैं।
कुछ आदतें किसी भी रिकॉर्डिंग में सटीकता बढ़ाती हैं, चाहे उच्चारण कुछ भी हो। बंद माइक्रोफ़ोन से रिकॉर्ड करें. प्रत्येक व्यक्ति को अगला शुरू होने से पहले समाप्त करने दें। बड़े इकोय कमरे से बचें। एक मिनट में 200 शब्दों से अधिक की गति से बोलने की तुलना में मध्यम बोलने की गति से बेहतर ढंग से लिखा जा सकता है। और एक उचित बिटरेट मायने रखता है: 128 केबीपीएस MP3 ठीक है, जबकि नैरोबैंड में अत्यधिक संपीड़ित ध्वनि-संदेश ऑडियो इंजन के लिए आवश्यक विवरण खो देता है। प्रारूपों और प्रत्येक की विशिष्टताओं के बारे में पूरी जानकारी के लिए, देखें किसी भी ऑडियो फ़ाइल को कैसे ट्रांसक्राइब करें।
Hushscript स्वचालित रूप से भाषा का पता लगाता है और लगभग 99 भाषाओं को ट्रांसक्राइब करता है, जिनमें से 18 में शीर्ष स्तर की सटीकता होती है। एक रिकॉर्डिंग जो एक भाषा में रहती है वह सबसे अधिक सफाई से ट्रांसक्राइब होती है; वाक्य के बीच में भाषा बदलना किसी भी इंजन के लिए कठिन है।
वक्ता लेबल, एक ही पास में
वक्ता को अलग करना, जिसे औपचारिक रूप से वक्ता डायराइजेशन कहा जाता है, भाषण पहचान के साथ-साथ चलता है, न कि दूसरे काम के रूप में जिसके लिए आप अतिरिक्त भुगतान करते हैं। आपको प्रत्येक प्रतिलेख पर शब्द और एट्रिब्यूशन एक साथ निःशुल्क मिलते हैं। दो व्यक्तियों के साक्षात्कार या छोटी बैठक के लिए, वह अलगाव आम तौर पर सटीक होता है और हर पंक्ति को हाथ से टैग करने के कठिन काम से बचाता है। एक फ़ाइल में कितने वक्ता हो सकते हैं, इसकी कोई सीमा नहीं है, हालाँकि सटीकता तब सबसे अधिक होती है जब आवाज़ें अलग-अलग हों, ओवरलैप न हों और एक जैसी ध्वनि न हों। वह वक्ता लेबलिंग हर प्रतिलेख के साथ बिना किसी अतिरिक्त लागत के आती है, यह उस प्रकार का ईमानदार-बाय-डिफ़ॉल्ट विवरण है जिस पर यह संपूर्ण दृष्टिकोण बनाया गया है: उपयोगी भाग शामिल है, किसी उच्च स्तर के पीछे नहीं रखा गया है।
पकड़ने का स्पष्ट अंतर यह है। यदि आप बोलते समय भाषण, ध्वनि टाइपिंग या श्रुतलेख को कैप्चर करना चाहते हैं, तो अपने डिवाइस या वर्ड प्रोसेसर में निर्मित लाइव टूल तक पहुंचें। यदि आपके पास पहले से ही एक रिकॉर्डिंग है जो आपको टेक्स्ट के रूप में चाहिए, तो इसे ऑडियो-टू-टेक्स्ट पेज से ट्रांसक्रिप्ट करना तेज़, अधिक सटीक है, और आपको एक ही चरण में वक्ता लेबल और निर्यात योग्य आउटपुट प्रदान करता है।
स्वतंत्र स्रोत और मानक
Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।
स्रोतों की समीक्षा: