मुख्य सामग्री पर जाएं

WAV फ़ाइल को टेक्स्ट में कैसे बदलें (आज़माएं मुफ़्त)

लेखक: प्रकाशित: अंतिम समीक्षा:

एक WAV फ़ाइल असंपीड़ित ऑडियो है, जो इसे एक सटीक प्रतिलेख के लिए एक मजबूत प्रारंभिक बिंदु बनाती है। व्यापार-बंद का आकार है: WAV फ़ाइलें बड़ी होती हैं, हालांकि हिट करने के लिए फ़ाइल-आकार की कोई सीमा नहीं है - यहां तक ​​​​कि एक बहुत बड़ी फ़ाइल को भी आसानी से चरणबद्ध किया जाता है और आपके लिए तैयार किया जाता है। यह मार्गदर्शिका संपूर्ण कार्य को कवर करती है: WAV फ़ाइल को टेक्स्ट में बदलना, साफ़ वक्ता लेबल प्राप्त करना, बड़ी फ़ाइलों को संभालना, और प्रतिलेख को उस प्रारूप में निर्यात करना जिसकी आपको वास्तव में आवश्यकता है।

WAV जहां भी गुणवत्ता मायने रखती है वहां काम करता है: फ़ील्ड रिकॉर्डर को SD कार्ड में सहेजना, ऑडियो को DAW से मिश्रित करना और निर्यात करना, Windows वॉयस रिकॉर्डर आउटपुट और प्रसारण साक्षात्कार उपकरण। प्रतिलेखन स्वयं किसी भी अन्य प्रारूप के समान ही काम करता है: अपलोड, प्रतिलेखन, निर्यात। सबसे पहले जानने योग्य बात यह है कि दोषरहित ऑडियो क्यों मदद करता है, और फ़ाइल आकार को प्रबंधनीय कैसे रखा जाए।

WAV सटीकता के लिए क्यों अच्छा है

WAV एक असम्पीडित कंटेनर है। MP3 या M4A के विपरीत, कोई हानिपूर्ण संपीड़न चरण नहीं है, इसलिए इंजन द्वारा प्राप्त ऑडियो वही है जो रिकॉर्ड किया गया था, जिसमें कोई एन्कोडिंग कलाकृतियाँ जोड़ी और फेंकी नहीं गईं।

व्यवहार में यह दो मामलों में सबसे अधिक मायने रखता है:

एक साफ स्टूडियो रिकॉर्डिंग या एक अच्छी तरह से सेट-अप साक्षात्कार के लिए, एक ही स्रोत से 128 केबीपीएस MP3 लगभग समान सटीकता देता है। WAV लाभ वास्तविक है लेकिन मामूली है जब तक कि परिस्थितियाँ कठिन न हों। तो “क्या मुझे बेहतर ट्रांसक्रिप्ट के लिए WAV में रिकॉर्ड करना चाहिए” का ईमानदार उत्तर यह है: यह थोड़ी मदद करता है, और यह आपके रिकॉर्डिंग वातावरण के खराब होने पर और अधिक मदद करता है।

इंजन वास्तव में क्या उपयोग करता है

स्पीच मॉडल को ज्यादातर 16 kHz मोनो ऑडियो पर प्रशिक्षित किया जाता है। जब आप 48 kHz स्टीरियो WAV अपलोड करते हैं, तो इंजन कुछ भी करने से पहले सैंपल डाउन कर देता है और मोनो में मिल जाता है। भाषण के लिए उपयोगी सीमा लगभग 300 हर्ट्ज और 8 किलोहर्ट्ज़, टेलीफोनी बैंड के बीच बैठती है। उस रेंज को साफ़-साफ़ कैप्चर करना मायने रखता है, और 16 kHz या उससे ऊपर का कोई भी अच्छा माइक्रोफ़ोन पहले से ही ऐसा करता है।

व्यावहारिक परिणाम: एक ही भाषण का 48 kHz WAV और एक 16 kHz WAV एक ही प्रतिलेख का उत्पादन करता है। उच्च नमूना दरें नुकसान नहीं पहुंचाती हैं, लेकिन वे शब्दों की भी मदद नहीं करती हैं। वे बस फ़ाइल को बड़ा कर देते हैं। यदि आप रिकॉर्डिंग सेटिंग्स को नियंत्रित करते हैं और बिना कुछ छोड़े सबसे छोटा अपलोड चाहते हैं, तो 16 किलोहर्ट्ज़ मोनो फर्श है।

आपको क्या चाहिए

ट्रांसक्रिप्शन का बिल ऑडियो अवधि के आधार पर किया जाता है, फ़ाइल आकार के आधार पर नहीं। 44.1 किलोहर्ट्ज़ और 16-बिट पर एक घंटे का WAV लगभग 600 एमबी है लेकिन इसकी लागत एक घंटे के MP3 के समान है। पूर्ण बैच के लिए प्रतिबद्ध होने से पहले खाली मिनट एक छोटा सा नमूना लिखने और अपनी रिकॉर्डिंग पर सटीकता की जांच करने के लिए पर्याप्त हैं।

एक WAV फ़ाइल को तीन चरणों में टेक्स्ट में कनवर्ट करें

  1. कनवर्टर खोलें और साइन इन करें।/audio-to-text पर जाएं और साइन इन करें। नए खाते प्राप्त करें एक बार भुगतान विधि जोड़ने पर 30 निःशुल्क मिनट, जो एक रिकॉर्डिंग का शुरू से अंत तक परीक्षण करने के लिए पर्याप्त है।
  2. WAV फ़ाइल अपलोड करें। इसे अपलोड ज़ोन पर खींचें या ब्राउज़ करने के लिए क्लिक करें। अधिकांश फ़ाइलें सीधे पथ का अनुसरण करती हैं। डिवाइस की क्षमता के आधार पर, आपके ब्राउज़र में ही एक बड़ी फ़ाइल तैयार की जाती है; स्थानीय 16 kHz मोनो FLAC रूपांतरण का उपयोग केवल तब किया जाता है जब फ़ाइल यथावत अपलोड नहीं हो पाती है।
  3. प्रतिलेख डाउनलोड करें। जब प्रसंस्करण समाप्त हो जाता है, तो प्रतिलेख पहले से ही लागू वक्ता लेबल और टाइमस्टैम्प के साथ आपके डैशबोर्ड में आ जाता है। इसे TXT, SRT, VTT, DOCX, और PDF सहित 21 प्रारूपों में से किसी में निर्यात करें, या पासवर्ड-संरक्षित .husharchive के रूप में।

वक्ता लेबल वक्ता A,वक्ता B, इत्यादि के रूप में दिखाई देते हैं। किसी लेबल का नाम बदलने के लिए उस पर क्लिक करें। एक बार जब आप “वक्ता A” को वास्तविक नाम पर सेट करते हैं, तो उस वक्ता की प्रत्येक पंक्ति अपडेट हो जाती है।

एक काम किया हुआ उदाहरण: एक फ़ील्ड-रिकॉर्डेड साक्षात्कार

मान लीजिए कि आपने एक हैंडहेल्ड फ़ील्ड रिकॉर्डर पर 40 मिनट का साक्षात्कार रिकॉर्ड किया, दो लोगों ने, जिसे 44.1 kHz / 16-बिट स्टीरियो WAV के रूप में सहेजा गया हैfield-interview.wav. वह फ़ाइल लगभग 400 एमबी की है। यहां बताया गया है कि काम वास्तव में कैसे होता है।

फ़ाइल सामान्य आकार की है, इसलिए कुछ भी परिवर्तित करने की कोई आवश्यकता नहीं है; आप इसे वैसे ही अपलोड करें. क्योंकि कमरे में कुछ एयर कंडीशनिंग की आवाज़ थी, आप पहले अपने ऑडियो एडिटर में 80 हर्ट्ज़ पर एक हाई-पास फ़िल्टर चलाते हैं और फिर से निर्यात करते हैं; यह धीमी गड़गड़ाहट को दूर करता है जिसे इंजन अन्यथा शोर के रूप में पढ़ता है, और WAV को पुनः निर्यात करने से ऑडियो दोषरहित रहता है। आप साफ़ की गई फ़ाइल अपलोड करें.

जब प्रसंस्करण पूरा हो जाता है, तो प्रतिलेख प्रत्येक मोड़ पर एक टाइमस्टैम्प के साथ, वक्ता A (आप) और वक्ता B (आपका विषय) में विभाजित होकर वापस आता है। आप दो वक्ताों का नाम बदलते हैं, इंजन द्वारा अनुमान लगाए गए उचित संज्ञाओं पर एक बार नज़र डालते हैं, जैसे कि कंपनी का नाम या स्थान, फिर खोज-और-प्रतिस्थापन के साथ बार-बार होने वाली त्रुटियों को ठीक करते हैं। फिर आप निर्यात करते हैं: पढ़ने योग्य साक्षात्कार के लिए DOCX, और यदि आपको वीडियो कट के लिए टाइमस्टैम्प की भी आवश्यकता है तो SRT।

वह पैटर्न (लाइट प्री-प्रोसेसिंग, अपलोड, रीलेबल, स्किम, एक्सपोर्ट) लगभग किसी भी साक्षात्कार या मीटिंग WAV के लिए लागू होता है। केवल एक चीज जो बहुत लंबी या बड़ी फ़ाइल के साथ बदलती है वह यह है कि क्या आप इसे पहले संपीड़ित करते हैं।

बड़ी WAV फ़ाइलों को संभालना

एक 44.1 kHz / 16-बिट स्टीरियो WAV लगभग 10 एमबी प्रति मिनट चलता है। दो घंटे का सत्र लगभग 1.2 जीबी का है, और एक लंबा मल्टी-ट्रैक निर्यात बड़ा हो सकता है। दो चीजें योजना बनाने लायक हैं।

योजना बनाने के लिए कोई फ़ाइल-आकार सीमा नहीं है। आपको आमतौर पर एक बड़े WAV को हाथ से सिकोड़ने की ज़रूरत नहीं है - Hushscript चरणों और ब्राउज़र में एक बहुत बड़ी फ़ाइल भी तैयार करता है, केवल स्थानीय 16 kHz मोनो FLAC फ़ॉलबैक का उपयोग करके जब फ़ाइल सीधे अपलोड पथ का अनुसरण नहीं कर सकती है। यदि आपका उपकरण आराम से स्रोत तैयार नहीं कर सकता है, तो मुफ़्त इन-ब्राउज़र WAV to MP3 कनवर्टर या एक ऑडियो संपादक पहले एक छोटी फ़ाइल बना सकता है।

अपलोड समय। 10 एमबीपीएस कनेक्शन पर 1 जीबी WAV को अपलोड करने में लगभग पंद्रह मिनट लगते हैं। धीमे लिंक पर, अपलोड से पहले कंप्रेस करने से प्रतीक्षा अवधि काफी कम हो जाती है। यदि आपको बिट-फॉर-बिट दोषरहित की आवश्यकता नहीं है, तो कंप्रेस-ऑडियो टूल एक छोटी, आमतौर पर अश्रव्य गुणवत्ता लागत के साथ फ़ाइल को और छोटा कर देता है, जो भाषण के लिए शायद ही कभी एक समस्या है।

मोनो सामग्री ले जाने वाला स्टीरियो। बहुत सारी रिकॉर्डिंग स्टीरियो के रूप में सहेजी जाती हैं लेकिन वास्तव में दोनों चैनलों पर एक ही ऑडियो होता है: बाईं ओर एक ही माइक डुप्लिकेट होता है और ठीक है. इसे मोनो WAV या FLAC में परिवर्तित करने से फ़ाइल का आकार बिना किसी सटीकता हानि के आधा हो जाता है, क्योंकि इंजन वैसे भी मोनो में मिल जाता है। जब यह लागू होता है तो यह सबसे आसान आकार की जीत है।

कठिन रिकॉर्डिंग के लिए प्री-प्रोसेसिंग

आपके द्वारा बॉर्डरलाइन फ़ाइल अपलोड करने से पहले एक ऑडियो एडिटर में दो त्वरित संपादन फायदेमंद होते हैं:

स्वच्छ रिकॉर्डिंग के लिए किसी भी चरण की आवश्यकता नहीं है। वे रिकॉर्डिंग के लिए लक्षित समाधान हैं जिन्हें सहायता की आवश्यकता है, और किसी भी संपादन के बाद WAV में पुनः निर्यात करने से ऑडियो दोषरहित रहता है।

प्रतिलेखन के लिए WAV बनाम MP3: क्या दोषरहित वास्तव में मदद करता है?

अधिकांश WAV निर्णयों के पीछे यही प्रश्न है, इसलिए यहां सादा संस्करण है।

सटीकता के लिए, दोषरहित थोड़ी मदद करता है, और जितना खराब स्रोत उतना अधिक मदद करता है। एक साफ़ रिकॉर्डिंग पर ट्रांस्क्रिप्ट में WAV और एक अच्छे 128 kbps MP3 के बीच अंतर का पता लगाना कठिन होता है। शांत या शोर वाली रिकॉर्डिंग पर, WAV की अतिरिक्त निष्ठा इंजन को काम करने के लिए थोड़ा और अधिक समय देती है। किसी भी तरह से, प्रारूप आपके और प्रयोग करने योग्य प्रतिलेख के बीच शायद ही कभी खड़ा होता है। रिकॉर्डिंग गुणवत्ता है.

वर्कफ़्लो के लिए, MP3 आकार और अपलोड गति पर जीतता है, और WAV एक कामकाजी मास्टर के रूप में जीतता है जिसे आप संपादनों के बीच रखते हैं। एक सामान्य मध्य पथ: अपने संपादित मास्टर को WAV या FLAC के रूप में रखें, और यदि आपको धीमे कनेक्शन पर अपलोड करने की आवश्यकता है, तो एक उच्च-बिटरेट MP3 भेजें। आप प्रतिलेख में लगभग कुछ भी नहीं खोते हैं और बहुत सारा अपलोड समय बचाते हैं। MP3-to-text गाइड उस पथ को पूर्ण रूप से कवर करता है।

संक्षिप्त संस्करण: यदि गुणवत्ता मायने रखती है तो WAV में रिकॉर्ड और संग्रह करें, लेकिन जब 100 एमबी का ट्रांसक्राइब होता है तो 1 जीबी फ़ाइल अपलोड करने के लिए बाध्य महसूस नहीं होता है।

के लिए सटीकता युक्तियाँ WAV

वक्ता लेबल और टाइमस्टैम्प

प्रत्येक WAV प्रतिलेख में स्वचालित वक्ता पृथक्करण, प्रत्येक कार्य पर निःशुल्क लाभ शामिल है, न कि भुगतान स्तर या प्रति-वक्ता अपसेल। दो-व्यक्ति की रिकॉर्डिंग, जैसे कि एक साक्षात्कारकर्ता और एक विषय या स्टीरियो ट्रैक पर कैप्चर की गई दो-तरफा कॉल, स्पष्ट रूप से विभाजित हो जाती है। बड़े समूह की रिकॉर्डिंग (कॉन्फ्रेंस टेबल के आसपास चार या अधिक लोग) किसी भी डायराइजेशन इंजन के लिए कठिन होते हैं, इसलिए शोर वाले कमरे की रिकॉर्डिंग पर कुछ लेबल क्लीनअप करने की अपेक्षा करें।

SRT निर्यात विशेष रूप से WAV फ़ाइलों के लिए उपयोगी है जो वीडियो उत्पादन से आती हैं। यदि आपने ऑडियो को अलग से रिकॉर्ड किया है (एक बूम माइक या पोस्ट में सिंक किया गया लैव ट्रैक), तो SRT टाइमस्टैम्प आपको हाथ से ऑडियो को रगड़े बिना चित्र में प्रतिलेख को फिर से लाइन करने देता है।

निर्यात विकल्प

प्रारूप नोट्स
TXT वक्ता लेबल के साथ सादा प्रतिलेख, कोई टाइमस्टैम्प नहीं। खोज, उद्धरण और किसी अन्य टूल में फीड करने के लिए अच्छा है।
SRT प्रत्येक उच्चारण पर टाइमस्टैम्प। मानक उपशीर्षक और कैप्शन प्रारूप जो वीएलसी, वीडियो संपादकों और कैप्शन टूल में खुलता है।
VTT HTML5 वीडियो और प्रकाशन वर्कफ़्लो के लिए वेब उपशीर्षक प्रारूप।
CSV वक्ता, समय और पाठ फ़ील्ड के साथ स्प्रेडशीट-अनुकूल निर्यात।
मार्कडाउन नोट्स, दस्तावेज़ और प्रकाशन के लिए संपादन योग्य सादा-पाठ संरचना।
JSON कस्टम प्रोसेसिंग पाइपलाइनों के लिए संरचित आउटपुट ({ speaker, start, end, text } प्रति उच्चारण)।
DOCX शब्द-संगत, साझा करने या एनोटेट करने के लिए पढ़ने योग्य लेआउट में वक्ता लेबल और टाइमस्टैम्प के साथ।
PDF साझा करने या संग्रह करने के लिए फिक्स्ड-लेआउट ट्रांसक्रिप्ट।

किसी भी प्रारूप पर कोई वॉटरमार्क नहीं है, और प्रत्येक ट्रांसक्रिप्ट के साथ निर्यात शामिल है। ऊंचे स्तर के पीछे कुछ भी गेट नहीं है।


यदि आपका WAV एक बॉर्डरलाइन रिकॉर्डिंग है और सटीकता प्राथमिकता है, तो MP3-to-text गाइड सामान्यीकरण और अन्य प्री-प्रोसेसिंग चरणों को शामिल करता है जो यहां समान रूप से लागू होते हैं। यदि आप इसे MP3 में कनवर्ट करना चाहते हैं और उसे ट्रांसक्राइब करना चाहते हैं, तो मुफ्त कनवर्टर फ़ाइल अपलोड किए बिना आपके ब्राउज़र में चलता है। और एक ही स्थान पर स्वीकृत प्रारूपों और सुविधाओं की पूरी सूची के लिए, ऑडियो-टू-टेक्स्ट पेज में सब कुछ है।

स्वतंत्र स्रोत और मानक

Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।

स्रोतों की समीक्षा:

अक्सर पूछे जाने वाले सवाल

क्या मुझे अपलोड करने से पहले अपनी WAV फ़ाइल को संपीड़ित करने की आवश्यकता है?

आमतौर पर नहीं। अधिकांश WAV फ़ाइलें बिना किसी फ़ाइल-आकार सीमा के सीधे अपलोड हो जाती हैं। विशेष रूप से बड़ी फ़ाइल के लिए, Hushscript आपके ब्राउज़र में स्थानीय रूप से एक कॉम्पैक्ट 16 kHz मोनो FLAC तैयार करता है, ताकि आपको कभी भी हाथ से कुछ भी संपीड़ित न करना पड़े।

क्या ट्रांसक्रिप्शन के लिए WAV MP3 से अधिक सटीक है?

सीमांत रूप से। WAV में कोई हानिपूर्ण संपीड़न नहीं है, लेकिन एक ही स्रोत से 128 केबीपीएस या उच्चतर MP3 व्यवहार में लगभग समान परिणाम देता है। WAV की बढ़त मुख्य रूप से तब दिखाई देती है जब स्रोत रिकॉर्डिंग पहले से ही कम गुणवत्ता वाली थी, जैसे कि एक शांत कमरा या एक सस्ता माइक्रोफोन।

कौन सी नमूना दरें समर्थित हैं?

8 kHz से 48 kHz तक कोई भी मानक दर। भाषण के लिए 16 किलोहर्ट्ज़ से ऊपर कोई सटीकता लाभ नहीं है, क्योंकि इंजन स्पीच बैंड में काम करता है, अल्ट्रासोनिक रेंज में नहीं। समान ऑडियो का 48 किलोहर्ट्ज़ और 16 किलोहर्ट्ज़ WAV समान ट्रांसक्रिप्ट उत्पन्न करता है।

क्या मुझे WAV फ़ाइल पर वक्ता लेबल मिल सकते हैं?

हां. बिना किसी अतिरिक्त लागत के, प्रारूप की परवाह किए बिना प्रत्येक प्रतिलेख पर वक्ता पृथक्करण चलता है। दो व्यक्तियों का साक्षात्कार साफ़-साफ़ विभाजित होकर सामने आता है; आप एक क्लिक में वक्ता A और वक्ता B का नाम बदलकर वास्तविक नाम रख सकते हैं।

क्या होगा यदि मेरी WAV फ़ाइल बहुत शांत है?

शांत ऑडियो इंजन को कम सिग्नल देता है, जिससे सटीकता कम हो जाती है। यदि तरंगरूप व्यूअर में शिखर मोटे तौर पर -12 dBFS से ऊपर नहीं पहुंचते हैं, तो अपलोड करने से पहले फ़ाइल को ऑडियो संपादक में सामान्य करें।

क्या WAV फ़ाइल के लिए मोनो या स्टीरियो मायने रखता है?

सटीकता के लिए, नहीं। इंजन आंतरिक रूप से मोनो से मिश्रित होता है। लेकिन यदि दोनों चैनल समान सामग्री रखते हैं, तो मोनो फ़ाइल को निर्यात करने से गुणवत्ता में कोई हानि नहीं होने पर आकार आधा हो जाता है, जिससे अपलोड की गति तेज हो जाती है।

मुफ्त मिनटों के बाद इसकी लागत कितनी है?

आप केवल उन मिनटों के लिए भुगतान करते हैं जिन्हें आप ट्रांसक्राइब करते हैं, बिना किसी सदस्यता के। बिलिंग ऑडियो अवधि के अनुसार होती है, फ़ाइल आकार के अनुसार नहीं, इसलिए एक बड़े WAV की लागत समान लंबाई के छोटे MP3 के समान होती है। वर्तमान प्रति मिनट दर के लिए मूल्य निर्धारण पृष्ठ देखें।

30 मुफ़्त मिनट के साथ शुरू करें

शुरू करें – 30 मुफ़्त मिनट