WAV फ़ाइल को टेक्स्ट में कैसे बदलें (आज़माएं मुफ़्त)
लेखक: Hushscript प्रकाशित: अंतिम समीक्षा:
एक WAV फ़ाइल असंपीड़ित ऑडियो है, जो इसे एक सटीक प्रतिलेख के लिए एक मजबूत प्रारंभिक बिंदु बनाती है। व्यापार-बंद का आकार है: WAV फ़ाइलें बड़ी होती हैं, हालांकि हिट करने के लिए फ़ाइल-आकार की कोई सीमा नहीं है - यहां तक कि एक बहुत बड़ी फ़ाइल को भी आसानी से चरणबद्ध किया जाता है और आपके लिए तैयार किया जाता है। यह मार्गदर्शिका संपूर्ण कार्य को कवर करती है: WAV फ़ाइल को टेक्स्ट में बदलना, साफ़ वक्ता लेबल प्राप्त करना, बड़ी फ़ाइलों को संभालना, और प्रतिलेख को उस प्रारूप में निर्यात करना जिसकी आपको वास्तव में आवश्यकता है।
WAV जहां भी गुणवत्ता मायने रखती है वहां काम करता है: फ़ील्ड रिकॉर्डर को SD कार्ड में सहेजना, ऑडियो को DAW से मिश्रित करना और निर्यात करना, Windows वॉयस रिकॉर्डर आउटपुट और प्रसारण साक्षात्कार उपकरण। प्रतिलेखन स्वयं किसी भी अन्य प्रारूप के समान ही काम करता है: अपलोड, प्रतिलेखन, निर्यात। सबसे पहले जानने योग्य बात यह है कि दोषरहित ऑडियो क्यों मदद करता है, और फ़ाइल आकार को प्रबंधनीय कैसे रखा जाए।
WAV सटीकता के लिए क्यों अच्छा है
WAV एक असम्पीडित कंटेनर है। MP3 या M4A के विपरीत, कोई हानिपूर्ण संपीड़न चरण नहीं है, इसलिए इंजन द्वारा प्राप्त ऑडियो वही है जो रिकॉर्ड किया गया था, जिसमें कोई एन्कोडिंग कलाकृतियाँ जोड़ी और फेंकी नहीं गईं।
व्यवहार में यह दो मामलों में सबसे अधिक मायने रखता है:
- स्रोत रिकॉर्डिंग पहले से ही सीमा रेखा है: एक शांत वक्ता, एक शोर वाला कमरा, एक सस्ता माइक्रोफोन। सिग्नल का प्रत्येक बिट मायने रखता है, और एक हानिपूर्ण कोडेक इसमें से कुछ को हटा देगा।
- आपने ऑडियो को DAW में संसाधित किया है और इसे फिर से निर्यात किया है। प्रत्येक MP3 पास अपनी स्वयं की कलाकृतियाँ जोड़ता है; संपादनों के बीच फ़ाइल को WAV के रूप में रखने से उन्हें ढेर होने से बचाया जा सकता है।
एक साफ स्टूडियो रिकॉर्डिंग या एक अच्छी तरह से सेट-अप साक्षात्कार के लिए, एक ही स्रोत से 128 केबीपीएस MP3 लगभग समान सटीकता देता है। WAV लाभ वास्तविक है लेकिन मामूली है जब तक कि परिस्थितियाँ कठिन न हों। तो “क्या मुझे बेहतर ट्रांसक्रिप्ट के लिए WAV में रिकॉर्ड करना चाहिए” का ईमानदार उत्तर यह है: यह थोड़ी मदद करता है, और यह आपके रिकॉर्डिंग वातावरण के खराब होने पर और अधिक मदद करता है।
इंजन वास्तव में क्या उपयोग करता है
स्पीच मॉडल को ज्यादातर 16 kHz मोनो ऑडियो पर प्रशिक्षित किया जाता है। जब आप 48 kHz स्टीरियो WAV अपलोड करते हैं, तो इंजन कुछ भी करने से पहले सैंपल डाउन कर देता है और मोनो में मिल जाता है। भाषण के लिए उपयोगी सीमा लगभग 300 हर्ट्ज और 8 किलोहर्ट्ज़, टेलीफोनी बैंड के बीच बैठती है। उस रेंज को साफ़-साफ़ कैप्चर करना मायने रखता है, और 16 kHz या उससे ऊपर का कोई भी अच्छा माइक्रोफ़ोन पहले से ही ऐसा करता है।
व्यावहारिक परिणाम: एक ही भाषण का 48 kHz WAV और एक 16 kHz WAV एक ही प्रतिलेख का उत्पादन करता है। उच्च नमूना दरें नुकसान नहीं पहुंचाती हैं, लेकिन वे शब्दों की भी मदद नहीं करती हैं। वे बस फ़ाइल को बड़ा कर देते हैं। यदि आप रिकॉर्डिंग सेटिंग्स को नियंत्रित करते हैं और बिना कुछ छोड़े सबसे छोटा अपलोड चाहते हैं, तो 16 किलोहर्ट्ज़ मोनो फर्श है।
आपको क्या चाहिए
- 10 घंटे तक की WAV फ़ाइल, बिना फ़ाइल-आकार की सीमा के। अधिकांश फ़ाइलें जैसे हैं वैसे ही सीधे अपलोड हो जाती हैं; एक बहुत बड़ा मंच तैयार किया गया है और सीधे आपके ब्राउज़र में तैयार किया गया है।
- एक Hushscript खाता। साइन अप करने और भुगतान विधि जोड़ने के बाद आपको 30 मुफ्त मिनट मिलते हैं: जब आप कार्ड जोड़ते हैं तो तुरंत दिए जाते हैं (एक $1 होल्ड इसे मान्य करता है, फिर तुरंत जारी करता है और कभी शुल्क नहीं लिया जाता है), या यदि आप अपने देश में उपलब्ध किसी अन्य भुगतान विधि का उपयोग करते हैं तो आपके पहले मिनट पैक के साथ। कार्ड की आवश्यकता नहीं है; यह मुफ़्त मिनटों का त्वरित मार्ग है।
- इंस्टॉल करने के लिए कुछ भी नहीं है। पूरा कार्य ब्राउज़र में चलता है, इसलिए सेट अप करने के लिए कोई ऐप, प्लगइन या एक्सटेंशन नहीं है।
ट्रांसक्रिप्शन का बिल ऑडियो अवधि के आधार पर किया जाता है, फ़ाइल आकार के आधार पर नहीं। 44.1 किलोहर्ट्ज़ और 16-बिट पर एक घंटे का WAV लगभग 600 एमबी है लेकिन इसकी लागत एक घंटे के MP3 के समान है। पूर्ण बैच के लिए प्रतिबद्ध होने से पहले खाली मिनट एक छोटा सा नमूना लिखने और अपनी रिकॉर्डिंग पर सटीकता की जांच करने के लिए पर्याप्त हैं।
एक WAV फ़ाइल को तीन चरणों में टेक्स्ट में कनवर्ट करें
- कनवर्टर खोलें और साइन इन करें।/audio-to-text पर जाएं और साइन इन करें। नए खाते प्राप्त करें एक बार भुगतान विधि जोड़ने पर 30 निःशुल्क मिनट, जो एक रिकॉर्डिंग का शुरू से अंत तक परीक्षण करने के लिए पर्याप्त है।
- WAV फ़ाइल अपलोड करें। इसे अपलोड ज़ोन पर खींचें या ब्राउज़ करने के लिए क्लिक करें। अधिकांश फ़ाइलें सीधे पथ का अनुसरण करती हैं। डिवाइस की क्षमता के आधार पर, आपके ब्राउज़र में ही एक बड़ी फ़ाइल तैयार की जाती है; स्थानीय 16 kHz मोनो FLAC रूपांतरण का उपयोग केवल तब किया जाता है जब फ़ाइल यथावत अपलोड नहीं हो पाती है।
- प्रतिलेख डाउनलोड करें। जब प्रसंस्करण समाप्त हो जाता है, तो प्रतिलेख पहले से ही लागू वक्ता लेबल और टाइमस्टैम्प के साथ आपके डैशबोर्ड में आ जाता है। इसे TXT, SRT, VTT, DOCX, और PDF सहित 21 प्रारूपों में से किसी में निर्यात करें, या पासवर्ड-संरक्षित .husharchive के रूप में।
वक्ता लेबल वक्ता A,वक्ता B, इत्यादि के रूप में दिखाई देते हैं। किसी लेबल का नाम बदलने के लिए उस पर क्लिक करें। एक बार जब आप “वक्ता A” को वास्तविक नाम पर सेट करते हैं, तो उस वक्ता की प्रत्येक पंक्ति अपडेट हो जाती है।
एक काम किया हुआ उदाहरण: एक फ़ील्ड-रिकॉर्डेड साक्षात्कार
मान लीजिए कि आपने एक हैंडहेल्ड फ़ील्ड रिकॉर्डर पर 40 मिनट का साक्षात्कार रिकॉर्ड किया, दो लोगों ने, जिसे 44.1 kHz / 16-बिट स्टीरियो WAV के रूप में सहेजा गया हैfield-interview.wav. वह फ़ाइल लगभग 400 एमबी की है। यहां बताया गया है कि काम वास्तव में कैसे होता है।
फ़ाइल सामान्य आकार की है, इसलिए कुछ भी परिवर्तित करने की कोई आवश्यकता नहीं है; आप इसे वैसे ही अपलोड करें. क्योंकि कमरे में कुछ एयर कंडीशनिंग की आवाज़ थी, आप पहले अपने ऑडियो एडिटर में 80 हर्ट्ज़ पर एक हाई-पास फ़िल्टर चलाते हैं और फिर से निर्यात करते हैं; यह धीमी गड़गड़ाहट को दूर करता है जिसे इंजन अन्यथा शोर के रूप में पढ़ता है, और WAV को पुनः निर्यात करने से ऑडियो दोषरहित रहता है। आप साफ़ की गई फ़ाइल अपलोड करें.
जब प्रसंस्करण पूरा हो जाता है, तो प्रतिलेख प्रत्येक मोड़ पर एक टाइमस्टैम्प के साथ, वक्ता A (आप) और वक्ता B (आपका विषय) में विभाजित होकर वापस आता है। आप दो वक्ताों का नाम बदलते हैं, इंजन द्वारा अनुमान लगाए गए उचित संज्ञाओं पर एक बार नज़र डालते हैं, जैसे कि कंपनी का नाम या स्थान, फिर खोज-और-प्रतिस्थापन के साथ बार-बार होने वाली त्रुटियों को ठीक करते हैं। फिर आप निर्यात करते हैं: पढ़ने योग्य साक्षात्कार के लिए DOCX, और यदि आपको वीडियो कट के लिए टाइमस्टैम्प की भी आवश्यकता है तो SRT।
वह पैटर्न (लाइट प्री-प्रोसेसिंग, अपलोड, रीलेबल, स्किम, एक्सपोर्ट) लगभग किसी भी साक्षात्कार या मीटिंग WAV के लिए लागू होता है। केवल एक चीज जो बहुत लंबी या बड़ी फ़ाइल के साथ बदलती है वह यह है कि क्या आप इसे पहले संपीड़ित करते हैं।
बड़ी WAV फ़ाइलों को संभालना
एक 44.1 kHz / 16-बिट स्टीरियो WAV लगभग 10 एमबी प्रति मिनट चलता है। दो घंटे का सत्र लगभग 1.2 जीबी का है, और एक लंबा मल्टी-ट्रैक निर्यात बड़ा हो सकता है। दो चीजें योजना बनाने लायक हैं।
योजना बनाने के लिए कोई फ़ाइल-आकार सीमा नहीं है। आपको आमतौर पर एक बड़े WAV को हाथ से सिकोड़ने की ज़रूरत नहीं है - Hushscript चरणों और ब्राउज़र में एक बहुत बड़ी फ़ाइल भी तैयार करता है, केवल स्थानीय 16 kHz मोनो FLAC फ़ॉलबैक का उपयोग करके जब फ़ाइल सीधे अपलोड पथ का अनुसरण नहीं कर सकती है। यदि आपका उपकरण आराम से स्रोत तैयार नहीं कर सकता है, तो मुफ़्त इन-ब्राउज़र WAV to MP3 कनवर्टर या एक ऑडियो संपादक पहले एक छोटी फ़ाइल बना सकता है।
अपलोड समय। 10 एमबीपीएस कनेक्शन पर 1 जीबी WAV को अपलोड करने में लगभग पंद्रह मिनट लगते हैं। धीमे लिंक पर, अपलोड से पहले कंप्रेस करने से प्रतीक्षा अवधि काफी कम हो जाती है। यदि आपको बिट-फॉर-बिट दोषरहित की आवश्यकता नहीं है, तो कंप्रेस-ऑडियो टूल एक छोटी, आमतौर पर अश्रव्य गुणवत्ता लागत के साथ फ़ाइल को और छोटा कर देता है, जो भाषण के लिए शायद ही कभी एक समस्या है।
मोनो सामग्री ले जाने वाला स्टीरियो। बहुत सारी रिकॉर्डिंग स्टीरियो के रूप में सहेजी जाती हैं लेकिन वास्तव में दोनों चैनलों पर एक ही ऑडियो होता है: बाईं ओर एक ही माइक डुप्लिकेट होता है और ठीक है. इसे मोनो WAV या FLAC में परिवर्तित करने से फ़ाइल का आकार बिना किसी सटीकता हानि के आधा हो जाता है, क्योंकि इंजन वैसे भी मोनो में मिल जाता है। जब यह लागू होता है तो यह सबसे आसान आकार की जीत है।
कठिन रिकॉर्डिंग के लिए प्री-प्रोसेसिंग
आपके द्वारा बॉर्डरलाइन फ़ाइल अपलोड करने से पहले एक ऑडियो एडिटर में दो त्वरित संपादन फायदेमंद होते हैं:
- शांत ऑडियो को सामान्य करें। यदि तरंग रूप में शिखर लगभग -12 dBFS से ऊपर नहीं पहुंचते हैं दर्शक, रिकॉर्डिंग बहुत शांत है और सटीकता प्रभावित होती है। सामान्यीकरण से स्तर बढ़ता है और आमतौर पर ट्रांसक्रिप्ट में उल्लेखनीय सुधार होता है।
- गुनगुनाहट वाले कमरे को हाई-पास करें। लगातार कम-आवृत्ति शोर (एचवीएसी, एक लैपटॉप पंखा, ट्रैफिक गड़गड़ाहट) इंजन को भ्रमित करता है। 80 हर्ट्ज़ पर एक हाई-पास फ़िल्टर बास ह्यूम को हटा देता है और भाषण को अछूता छोड़ देता है। अधिकांश संपादक इसे एक-क्लिक फ़िल्टर के रूप में पेश करते हैं।
स्वच्छ रिकॉर्डिंग के लिए किसी भी चरण की आवश्यकता नहीं है। वे रिकॉर्डिंग के लिए लक्षित समाधान हैं जिन्हें सहायता की आवश्यकता है, और किसी भी संपादन के बाद WAV में पुनः निर्यात करने से ऑडियो दोषरहित रहता है।
प्रतिलेखन के लिए WAV बनाम MP3: क्या दोषरहित वास्तव में मदद करता है?
अधिकांश WAV निर्णयों के पीछे यही प्रश्न है, इसलिए यहां सादा संस्करण है।
सटीकता के लिए, दोषरहित थोड़ी मदद करता है, और जितना खराब स्रोत उतना अधिक मदद करता है। एक साफ़ रिकॉर्डिंग पर ट्रांस्क्रिप्ट में WAV और एक अच्छे 128 kbps MP3 के बीच अंतर का पता लगाना कठिन होता है। शांत या शोर वाली रिकॉर्डिंग पर, WAV की अतिरिक्त निष्ठा इंजन को काम करने के लिए थोड़ा और अधिक समय देती है। किसी भी तरह से, प्रारूप आपके और प्रयोग करने योग्य प्रतिलेख के बीच शायद ही कभी खड़ा होता है। रिकॉर्डिंग गुणवत्ता है.
वर्कफ़्लो के लिए, MP3 आकार और अपलोड गति पर जीतता है, और WAV एक कामकाजी मास्टर के रूप में जीतता है जिसे आप संपादनों के बीच रखते हैं। एक सामान्य मध्य पथ: अपने संपादित मास्टर को WAV या FLAC के रूप में रखें, और यदि आपको धीमे कनेक्शन पर अपलोड करने की आवश्यकता है, तो एक उच्च-बिटरेट MP3 भेजें। आप प्रतिलेख में लगभग कुछ भी नहीं खोते हैं और बहुत सारा अपलोड समय बचाते हैं। MP3-to-text गाइड उस पथ को पूर्ण रूप से कवर करता है।
संक्षिप्त संस्करण: यदि गुणवत्ता मायने रखती है तो WAV में रिकॉर्ड और संग्रह करें, लेकिन जब 100 एमबी का ट्रांसक्राइब होता है तो 1 जीबी फ़ाइल अपलोड करने के लिए बाध्य महसूस नहीं होता है।
के लिए सटीकता युक्तियाँ WAV
- स्पीच बैंड को सफाई से कैप्चर करें। 16 kHz से ऊपर की कोई भी चीज़ ट्रांसक्रिप्शन पर बर्बाद हो जाती है, लेकिन एक साफ़ 300 Hz-8 kHz ही सब कुछ है। वक्ता के करीब एक अच्छा माइक हर बार उच्च नमूना दर को मात देता है।
- प्रति वक्ता माइक जहां आप कर सकते हैं। एक साझा माइक पर दो लोगों को अपने ट्रैक पर दो लोगों की तुलना में अलग करना कठिन होता है। यदि आपका फ़ील्ड रिकॉर्डर इसका समर्थन करता है, तो प्रत्येक वक्ता को एक चैनल पर रिकॉर्ड करें।
- प्रति फ़ाइल एक भाषा रखें। डिटेक्शन प्रति फ़ाइल चलता है; एक रिकॉर्डिंग जो भाषाओं को बीच में बदलती है, वह दो साफ एकल-भाषा फ़ाइलों की तुलना में कठिन होती है।
- निर्यात के बाद एक बार स्किम करें। व्यक्तिवाचक संज्ञा (नाम, स्थान, ब्रांड, तकनीकी शब्द) वे हैं जहां कोई भी इंजन अनुमान लगाता है। एक खोज-और-प्रतिस्थापन पास उनमें से अधिकांश को कुछ ही मिनटों में साफ़ कर देता है।
वक्ता लेबल और टाइमस्टैम्प
प्रत्येक WAV प्रतिलेख में स्वचालित वक्ता पृथक्करण, प्रत्येक कार्य पर निःशुल्क लाभ शामिल है, न कि भुगतान स्तर या प्रति-वक्ता अपसेल। दो-व्यक्ति की रिकॉर्डिंग, जैसे कि एक साक्षात्कारकर्ता और एक विषय या स्टीरियो ट्रैक पर कैप्चर की गई दो-तरफा कॉल, स्पष्ट रूप से विभाजित हो जाती है। बड़े समूह की रिकॉर्डिंग (कॉन्फ्रेंस टेबल के आसपास चार या अधिक लोग) किसी भी डायराइजेशन इंजन के लिए कठिन होते हैं, इसलिए शोर वाले कमरे की रिकॉर्डिंग पर कुछ लेबल क्लीनअप करने की अपेक्षा करें।
SRT निर्यात विशेष रूप से WAV फ़ाइलों के लिए उपयोगी है जो वीडियो उत्पादन से आती हैं। यदि आपने ऑडियो को अलग से रिकॉर्ड किया है (एक बूम माइक या पोस्ट में सिंक किया गया लैव ट्रैक), तो SRT टाइमस्टैम्प आपको हाथ से ऑडियो को रगड़े बिना चित्र में प्रतिलेख को फिर से लाइन करने देता है।
निर्यात विकल्प
| प्रारूप | नोट्स |
|---|---|
| TXT | वक्ता लेबल के साथ सादा प्रतिलेख, कोई टाइमस्टैम्प नहीं। खोज, उद्धरण और किसी अन्य टूल में फीड करने के लिए अच्छा है। |
| SRT | प्रत्येक उच्चारण पर टाइमस्टैम्प। मानक उपशीर्षक और कैप्शन प्रारूप जो वीएलसी, वीडियो संपादकों और कैप्शन टूल में खुलता है। |
| VTT | HTML5 वीडियो और प्रकाशन वर्कफ़्लो के लिए वेब उपशीर्षक प्रारूप। |
| CSV | वक्ता, समय और पाठ फ़ील्ड के साथ स्प्रेडशीट-अनुकूल निर्यात। |
| मार्कडाउन | नोट्स, दस्तावेज़ और प्रकाशन के लिए संपादन योग्य सादा-पाठ संरचना। |
| JSON | कस्टम प्रोसेसिंग पाइपलाइनों के लिए संरचित आउटपुट ({ speaker, start, end, text } प्रति उच्चारण)। |
| DOCX | शब्द-संगत, साझा करने या एनोटेट करने के लिए पढ़ने योग्य लेआउट में वक्ता लेबल और टाइमस्टैम्प के साथ। |
| साझा करने या संग्रह करने के लिए फिक्स्ड-लेआउट ट्रांसक्रिप्ट। |
किसी भी प्रारूप पर कोई वॉटरमार्क नहीं है, और प्रत्येक ट्रांसक्रिप्ट के साथ निर्यात शामिल है। ऊंचे स्तर के पीछे कुछ भी गेट नहीं है।
यदि आपका WAV एक बॉर्डरलाइन रिकॉर्डिंग है और सटीकता प्राथमिकता है, तो MP3-to-text गाइड सामान्यीकरण और अन्य प्री-प्रोसेसिंग चरणों को शामिल करता है जो यहां समान रूप से लागू होते हैं। यदि आप इसे MP3 में कनवर्ट करना चाहते हैं और उसे ट्रांसक्राइब करना चाहते हैं, तो मुफ्त कनवर्टर फ़ाइल अपलोड किए बिना आपके ब्राउज़र में चलता है। और एक ही स्थान पर स्वीकृत प्रारूपों और सुविधाओं की पूरी सूची के लिए, ऑडियो-टू-टेक्स्ट पेज में सब कुछ है।
स्वतंत्र स्रोत और मानक
Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।
स्रोतों की समीक्षा: