MP3 को टेक्स्ट में कैसे बदलें (मुफ़्त, वक्ता लेबल सहित)
लेखक: Hushscript प्रकाशित: अंतिम समीक्षा:
MP3 को टेक्स्ट में कनवर्ट करना सबसे आम ट्रांसक्रिप्शन कार्यों में से एक है, और चरण स्रोत के साथ नहीं बदलते हैं: एक पॉडकास्ट एपिसोड, एक रिकॉर्ड किया गया साक्षात्कार, एक व्याख्यान, या आपके फोन से एक वॉयस मेमो सभी एक ही प्रवाह से गुजरते हैं। फ़ाइल अपलोड करें, प्रतिलेख की प्रतीक्षा करें, इसे अपने आवश्यक प्रारूप में निर्यात करें।
परिवर्तन यह है कि MP3 स्वयं परिणाम को कैसे प्रभावित करता है। अधिकांश मार्गदर्शक इसे छोड़ देते हैं। एक MP3 एक हानिपूर्ण, संपीड़ित फ़ाइल है, और जिस बिटरेट पर इसे सहेजा गया था वह इस बात पर सीमा निर्धारित करता है कि स्पीच इंजन को कितने विवरण के साथ काम करना है। यह मार्गदर्शिका तीन चरणों को कवर करती है, फिर गहराई में जाती है: वास्तविक वक्ता-लेबल आउटपुट के साथ एक काम किया हुआ उदाहरण, सटीकता के लिए बिटरेट का वास्तव में क्या मतलब है, और जो रिकॉर्डिंग खराब हो जाती है उसे कैसे ठीक किया जाए।
आपको क्या चाहिए
- एक MP3 फ़ाइल। कोई भी बिटरेट लोड होगा। सटीकता के लिए, 64 केबीपीएस व्यावहारिक स्तर है और 128 केबीपीएस आराम से उस बिंदु से आगे निकल जाता है जहां संख्या मायने रखती है (उस पर अधिक जानकारी नीचे दी गई है)।
- एक Hushscript खाता। आज़माने के लिए आपको 30 निःशुल्क मिनट मिलते हैं। उन्हें अनलॉक करने का सबसे तेज़ तरीका एक कार्ड जोड़ना है: $1 होल्ड इसे मान्य करता है, फिर तुरंत रिलीज़ कर देता है और कभी चार्ज नहीं किया जाता है। यदि आप कार्ड का उपयोग नहीं करना चाहते हैं, तो एक वैकल्पिक भुगतान विधि भी काम करती है, और आपकी पहली खरीदारी 30 मिनट में होती है। किसी भी तरह से कार्ड की आवश्यकता नहीं है।
इंस्टॉल करने के लिए कुछ भी नहीं है; कोई डेस्कटॉप ऐप नहीं, कोई ब्राउज़र एक्सटेंशन नहीं। सब कुछ ब्राउज़र और खाते में चलता है।
मुफ़्त मिनटों के अलावा, ट्रांसक्रिप्शन भुगतान के रूप में किया जाता है: आप केवल तभी मिनट खरीदते हैं जब आपको उनकी आवश्यकता होती है, बिना किसी सदस्यता के। लागत मूल्य निर्धारण पृष्ठ पर हैं।
तीन चरणों में एक MP3 को टेक्स्ट में बदलें
- अपनी फ़ाइल अपलोड करें।/audio-to-text खोलें, फिर MP3 को ड्रॉप ज़ोन पर खींचें या ब्राउज़ करने के लिए क्लिक करें। 10 घंटे तक की फ़ाइलें स्वीकार की जाती हैं, फ़ाइल आकार की कोई सीमा नहीं है। साइन इन करने से पहले सीधे ब्राउज़र में पहले 30 सेकंड का पूर्वावलोकन करें, ताकि आप कमिट करने से पहले वक्ता-लेबल शैली देख सकें।
- इसे ट्रांसक्राइब करने दें। एक बार जब आप साइन इन हो जाते हैं और फ़ाइल अपलोड हो जाती है, तो स्पीच इंजन इसे प्रोसेस करता है और पहले से अलग किए गए वक्ता के साथ एक ट्रांसक्रिप्ट लौटाता है। प्रसंस्करण समय अलग-अलग होता है, और कार्य पृष्ठभूमि में चलता है, इसलिए आपको टैब खुला रखने की आवश्यकता नहीं है।
- निर्यात करें। परिणाम को 21 प्रारूपों में से किसी एक में डाउनलोड करें। इसमें सादा TXT, टाइमस्टैम्प्ड SRT, Word DOCX, PDF और उपशीर्षक और संपादक-टाइमलाइन प्रारूप, साथ ही एक पासवर्ड-संरक्षित .husharchive शामिल है। प्रत्येक प्रारूप शामिल है, निर्यात पर कोई पेवॉल नहीं है और उनमें से किसी पर कोई वॉटरमार्क नहीं है।
समाप्त प्रतिलेख आपके डैशबोर्ड में खुलता है। वक्तावक्ता A,वक्ता B, इत्यादि के रूप में दिखाई देते हैं, और आप इसे वास्तविक नाम में बदलने के लिए किसी भी लेबल पर क्लिक कर सकते हैं, जो वक्ता की प्रत्येक पंक्ति को अपडेट करता है।
एक काम किया हुआ उदाहरण: एक दो-व्यक्ति साक्षात्कार
मान लें कि आपके पास founder-interview.mp3 है: a 42 मिनट की रिकॉर्डिंग, 128 केबीपीएस, एक साक्षात्कारकर्ता और एक अतिथि, एक कॉल पर रिकॉर्ड की गई। आपके द्वारा इसे अपलोड करने के बाद, प्रतिलेख वक्ता टर्न के अनुसार खंडित होकर वापस आता है, प्रत्येक पर एक टाइमस्टैम्प के साथ:
[00:00:04] वक्ता A: समय देने के लिए धन्यवाद। आइए शुरुआत से शुरू करें -
वास्तव में यह विचार कहां से आया?
[00:00:11] वक्ता B: ईमानदारी से कहूं तो, यह उस समस्या से निकला है जो हमारे पास थी। हम थे
रिकॉर्ड की गई कॉल में डूब गया और उनमें से कोई भी खोजने योग्य नहीं था।
[00:00:23] वक्ता A: तो आपने वह चीज़ बना ली जिसकी आपको आवश्यकता थी।
[00:00:25] वक्ता B: बहुत ज्यादा। पहला संस्करण टेप के साथ रखा गया था।
वहां से संपादन हल्का है। आप एक बार साक्षात्कारकर्ता के लिए वक्ता A और अतिथि के लिए वक्ता B का नाम बदल देते हैं, और हर पंक्ति अपडेट हो जाती है। आप उन मुट्ठी भर उचित संज्ञाओं को खोजते हैं जिनका इंजन अनुमान लगाता है, जैसे किसी उत्पाद का नाम या किसी व्यक्ति का उपनाम, और उन्हें ढूंढें-और-प्रतिस्थापन के साथ ठीक करें, जो प्रत्येक उदाहरण को एक ही बार में सही कर देता है। इस तरह के एक साफ 128 केबीपीएस साक्षात्कार के लिए, वह स्किम आमतौर पर प्रतिलेख को उद्धृत करने से पहले आवश्यक सभी सफाई है।
यह वह जगह है जहां प्रतिलेखन जो वक्ता को मुफ्त में लेबल करता है वह अपनी जगह अर्जित करता है। एक साक्षात्कार से अविभाजित पाठ की एक दीवार लगभग बेकार है जब तक कि आप वापस नहीं जाते और चिह्नित नहीं करते कि किसने क्या कहा; एक प्रतिलेख जो पहले से ही बारी-बारी से विभाजित होकर आता है, वह ऐसी चीज़ है जिसे आप सीधे उद्धृत कर सकते हैं।
सटीकता के लिए बिटरेट का क्या अर्थ है
MP3 एक हानिपूर्ण प्रारूप है: एन्कोडिंग फ़ाइल को छोटा रखने के लिए ऑडियो के उन हिस्सों को फेंक देता है जिन्हें कम से कम सुना जा सकता है।बिटरेट यह है कि एनकोडर ऐसा करने में प्रति सेकंड कितने किलोबाइट खर्च करता है। यह जितना निचला होता है, उतना ही अधिक त्यागता है। MDN का वर्तमान MP3 कोडेक संदर्भ प्रारूप के समर्थित बिटरेट और नमूना दरों का दस्तावेजीकरण करता है और इसके संपीड़न को हानिपूर्ण के रूप में पहचानता है।
वाक् पहचान व्यंजन में उच्च-आवृत्ति विवरण पर बहुत अधिक निर्भर करती है। “पंद्रह” और “सोलह” या “कर सकते हैं” और “नहीं” के बीच का अंतर वहाँ रहता है। आक्रामक संपीड़न बिल्कुल वही है जहां वह विवरण सबसे पहले जाता है। इसलिए बिटरेट किसी प्रतिलेख को समान रूप से ख़राब नहीं करता है; यह भाषण के किनारों पर सुनने में सबसे कठिन शब्दों को खाता है।
व्यवहार में:
- 32 kbps और नीचे: यहां तक कि मानव कान तक भी स्पष्ट रूप से संकुचित होता है, और इंजन उसी तरह प्रतिक्रिया करता है। शब्द त्रुटियाँ चढ़ती हैं। ऐसी किसी भी चीज़ के लिए इससे बचें जिसे आप प्रतिलेखित करना चाहते हैं।
- 64 kbps: विश्वसनीय वाक्-से-पाठ के लिए यथार्थवादी स्तर। स्पष्ट, क्लोज़-माइक आवाज़ के लिए ठीक है।
- 128 केबीपीएस और उससे अधिक: प्रतिलेखन के लिए पर्याप्त आराम से। ऊपर जाने से प्रतिलेख में सुधार नहीं होगा। इंजन के पास वे सभी विवरण हैं जिनका वह इससे पहले अच्छी तरह से उपयोग कर सकता है।
कुछ स्पष्टीकरण जो अनावश्यक पुन: एन्कोडिंग को बचाते हैं।परिवर्तनीय बिटरेट (VBR) ठीक है; इसमें भाषण के लिए ** निरंतर बिटरेट (CBR)** पर कोई सटीकता दंड नहीं है, इसलिए इसे “ठीक” करने के लिए VBR फ़ाइल को परिवर्तित न करें। और ट्रांसक्रिप्शन के लिए ** मोनो स्टीरियो की तरह ही काम करता है**, क्योंकि आवाज को दो चैनलों की आवश्यकता नहीं होती है। यदि कुछ है, तो नीचे स्टीरियो डबल-एंडर्स पर नोट देखें।
MP3 बनाम दोषरहित: इसके बजाय कब दोबारा रिकॉर्ड करें
एक स्वाभाविक प्रश्न यह है कि क्या आपके MP3 को पहले WAV जैसे दोषरहित प्रारूप में परिवर्तित करने से मदद मिलेगी। ऐसा नहीं होगा. एक बार जब ऑडियो 128 केबीपीएस MP3 के रूप में सहेजा जाता है, तो गायब विवरण गायब हो जाता है; उसी ऑडियो को WAV कंटेनर में लपेटने से बस एक बड़ी फ़ाइल बन जाती है जिसमें कोई अतिरिक्त जानकारी नहीं होती है। यदि आप नई रिकॉर्डिंग कर रहे हैं और आपके पास विकल्प है, तो दोषरहित या उच्च-बिटरेट स्रोत बेहतर शुरुआती बिंदु है (उस मामले के लिए WAV-टू-टेक्स्ट गाइड देखें), लेकिन मौजूदा MP3 को ऊपर की ओर परिवर्तित करने से कुछ भी नहीं मिलता है।
ईमानदार निर्णय नियम: यदि आपकी एकमात्र प्रतिलिपि एक उचित-बिटरेट MP3 है, तो इसे वैसे ही ट्रांसक्राइब करें। यदि रिकॉर्डिंग वास्तव में खराब है (क्लिप की गई, शोर में दबी हुई, या 32 केबीपीएस पर सहेजी गई) और आप इसे फिर से कैप्चर कर सकते हैं, तो दोबारा रिकॉर्डिंग किसी भी रूपांतरण से कहीं अधिक मदद करेगी। जब आप ताज़ा रिकॉर्ड करते हैं, तो दो आदतें बिटरेट से अधिक मायने रखती हैं: जो भी बोल रहा है उसके पास माइक्रोफ़ोन रखें, और यदि आप कर सकते हैं तो प्रत्येक व्यक्ति को अपना माइक दें, क्योंकि स्रोत पर साफ़ अलगाव ही शब्द और वक्ता लेबल दोनों को सही बनाता है।
सामान्य समस्याओं को ठीक करना
अधिकांश रफ ट्रांस्क्रिप्ट रिकॉर्डिंग में वापस आते हैं, उपकरण में नहीं। यहां बताया गया है कि सामान्य अपराधियों के बारे में क्या करना है।
कम मात्रा। यदि तरंगरूप सपाट दिखता है (एक बहुत ही शांत रिकॉर्डिंग), तो इंजन के पास काम करने के लिए कम सिग्नल होते हैं और सटीकता कम हो जाती है। पहले किसी भी ऑडियो एडिटर में ऑडियो को सामान्य करें या बढ़ाएं, फिर तेज़ संस्करण अपलोड करें। कमजोर रिकॉर्डिंग के लिए बूस्टिंग स्तर उच्चतम-रिटर्न फिक्स में से एक है।
पृष्ठभूमि शोर। स्थिर शोर (एक एयर कंडीशनर, सड़क पर गड़गड़ाहट) को उचित रूप से अच्छी तरह से नियंत्रित किया जाता है; अचानक आने वाला शोर जो बोलचाल में ओवरलैप हो जाता है, जैसे दरवाज़ा, खाँसी, या कटलरी, शब्दों के गिरने का कारण बनता है। यदि आप अपलोड करने से पहले हल्का शोर कम करने वाला पास चला सकते हैं, तो ऐसा करें, लेकिन अति-प्रक्रिया न करें: भारी डीनोइज़िंग कलाकृतियों का परिचय देता है जो शोर की तुलना में सटीकता को अधिक नुकसान पहुंचाते हैं।
भारी उच्चारण या विशेषज्ञ शब्दावली। आधुनिक इंजन अंग्रेजी लहजे की एक विस्तृत श्रृंखला को अच्छी तरह से संभालते हैं। विश्वसनीय चूक वे डोमेन शब्द हैं जिनकी इंजन के पास अपेक्षा करने का कोई कारण नहीं है, जैसे दवा के नाम, कानूनी उद्धरण, या विशिष्ट ब्रांड नाम। इन्हें पकड़ने के लिए निर्यात के बाद एक स्किम पर योजना बनाएं, और ढूंढें-और-बदलें पर निर्भर रहें: यदि किसी कंपनी का नाम हर बार एक ही तरह से गलत हो जाता है, तो एक सुधार पूरी फ़ाइल को साफ़ कर देता है।
बहुत लंबे MP3। 6 घंटे की रिकॉर्डिंग अपने आप में कोई समस्या नहीं है। 10-घंटे की सीमा लगभग किसी भी चीज़ को कवर करती है, और इसके ऊपर फ़ाइल-आकार की कोई सीमा नहीं है, इसलिए पहले एक लंबी फ़ाइल को टुकड़ों में काटने की कोई ज़रूरत नहीं है। जो चीज़ वास्तव में एक लंबी फ़ाइल को ख़राब करती है, वह है उसमें रिकॉर्डिंग की गुणवत्ता में कमी: एक वक्ता जो माइक से दूर चला जाता है, एक ऐसा स्तर जो पहले घंटे के बाद धीमा हो जाता है, एक ऐसा स्थान जो भर जाता है और शोर हो जाता है। जहां आप कर सकते हैं, स्रोत को स्थिर रखें; जहां आप नहीं कर सकते, वहां साफ-सुथरे हिस्सों की तुलना में खुरदुरे हिस्सों को अधिक संपादन की आवश्यकता होने की उम्मीद है। टाइमस्टैम्प इसे प्रबंधित करना आसान बनाते हैं: आप पूरी बात को दोबारा सुनने के बजाय सीधे उस पैच पर जा सकते हैं जो खराब पढ़ता है।
ओवरलैपिंग वक्ता। जब दो लोग एक साथ बात करते हैं, तो इंजन तेज आवाज में शब्दों को असाइन करता है, आमतौर पर वक्ता को अलग करने की एक सीमा होती है, किसी एक टूल की नहीं। कोई अपलोड-साइड फिक्स नहीं है; एक जीवंत समूह रिकॉर्डिंग के क्रॉस-टॉक अनुभागों के लिए बजट संपादन का समय।
वक्ताों को साफ-साफ अलग रखना
वक्ता पृथक्करण (डायराइजेशन) बिना किसी अतिरिक्त लागत के प्रत्येक प्रतिलेख पर चलता है, और MP3 स्तर पर कुछ चीजें प्रभावित करती हैं कि यह कितनी साफ-सुथरी आती है। यदि आप विस्तार से जानना चाहते हैं कि यह हुड के नीचे कैसे काम करता है, तो देखें वक्ता डायराइजेशन क्या है; यहां व्यावहारिक बिंदु हैं:
- स्टीरियो डबल-एंडर्स। कुछ पॉडकास्ट और कॉल सेटअप प्रत्येक वक्ता को एक अलग स्टीरियो चैनल पर रिकॉर्ड करते हैं। प्रतिकूल रूप से, अपलोड करने से पहले इसे एक एकल मोनो ट्रैक में मिलाने से मदद मिलती है: इंजन दो अलग-अलग धाराओं के बजाय एक मिश्रित वार्तालाप सुनता है। अधिकांश संपादक एक मोनो “मिक्स-डाउन” निर्यात करते हैं।
- तेज़ी से आगे-पीछे। बहुत कम आदान-प्रदान (दो-सेकंड से कम मोड़) कभी-कभी एक लेबल वाले कथन में विलय हो सकते हैं। यह शायद ही कभी पठनीयता को नुकसान पहुंचाता है, और यदि किसी विशिष्ट उद्धरण की आवश्यकता होती है तो आप हाथ से एक मोड़ को विभाजित कर सकते हैं।
- स्वच्छ मोड़ सबसे अधिक मदद करते हैं। वक्ता के बीच हैंड-ऑफ जितना साफ होगा (कम रुकावट, कम क्रॉसस्टॉक), लेबल उतना ही अधिक विश्वसनीय होगा। कॉन्फ़िगर करने के लिए कुछ भी नहीं है; यह पूरी तरह से रिकॉर्डिंग का गुण है।
अपनी प्रतिलेख निर्यात करना
सही प्रारूप इस बात पर निर्भर करता है कि आप पाठ के साथ क्या कर रहे हैं। नीचे दी गई तालिका में प्रस्तावित 21 प्रारूपों में से उन प्रारूपों की सूची दी गई है जिन तक लोग सबसे अधिक पहुंचते हैं; संपूर्ण ट्रेड-ऑफ़ के लिए, देखें आपको वास्तव में किस प्रतिलेख प्रारूप की आवश्यकता है:
| फ़ॉर्मेट | के लिए सर्वोत्तम |
|---|---|
| TXT | नोट्स, कॉपी-पेस्ट, फीडिंग किसी अन्य टूल में टेक्स्ट |
| SRT | वीडियो पर कैप्शन जोड़ने या टाइमस्टैम्प से नेविगेट करने के लिए; यदि आपका स्रोत MP4 जैसी वीडियो फ़ाइल है, तो भी यही सही विकल्प है |
| VTT | वेब कैप्शन और ब्राउज़र-नेटिव वीडियो प्लेयर |
| CSV | स्प्रेडशीट समीक्षा और हल्के डेटा हैंडऑफ़ |
| मार्कडाउन | प्रकाशन नोट्स, README-शैली फ़ाइलें, और संपादन योग्य ड्राफ्ट |
| JSON | प्रोग्रामेटिक प्रोसेसिंग और कस्टम टूलींग |
| DOCX | वर्ड में काम करने वाले संपादकों या एनोटेटर्स के साथ साझा करना |
| केवल-पढ़ने के लिए साझा करना और संग्रह करना |
प्रत्येक निर्यात में वक्ता लेबल और टाइमस्टैम्प शामिल होते हैं, उनमें से किसी पर कोई वॉटरमार्क नहीं होता है।
टाइमस्टैम्प और संपादन
संपादक प्रत्येक उच्चारण को उसके प्रारंभ समय, वक्ता लेबल और पाठ के साथ दिखाता है। पाठ के सामने ऑडियो के उस खंड को चलाने के लिए किसी भी पंक्ति पर क्लिक करें। पूरी फ़ाइल को हाथ से रगड़े बिना किसी पेचीदा मार्ग की जाँच करना आसान है।
SRT निर्यात में टाइमस्टैम्प उच्चारण स्तर पर बैठते हैं: प्रति वक्ता बारी में एक प्रविष्टि, प्रति शब्द नहीं। कैप्शनिंग, नेविगेशन और टाइमस्टैम्प के साथ उद्धरण के लिए, यह सही ग्रैन्युलैरिटी है। यदि आपको कोड में संसाधित करने के लिए शब्द-स्तरीय संरचना की आवश्यकता है, तो JSON निर्यात करें: प्रत्येक प्रविष्टि आपको वक्ता लेबल, मिलीसेकंड में प्रारंभ और समाप्ति समय और उस मोड़ के लिए टेक्स्ट देती है।
अपलोड, ट्रांसक्राइब, निर्यात: यह पूरा काम है, MP3-विशिष्ट विवरण के साथ जो तय करता है कि परिणाम कितना साफ है। MP3-to-text पेज में संपूर्ण सुविधा अवलोकन है, और यदि आप किसी अन्य कंटेनर में रिकॉर्डिंग के साथ काम कर रहे हैं, तो ऑडियो-टू-टेक्स्ट पेज हर प्रारूप को उसी तरह कवर करता है। पूरा शो कर रहे हैं? पॉडकास्ट ट्रांसक्रिप्शन गाइड ट्रांसक्रिप्ट को शो नोट्स में बदलता है, और यदि आपकी फ़ाइल MP3 के बजाय WAV है, तो WAV-टू-टेक्स्ट गाइड में बड़ी दोषरहित फ़ाइलों को संभालने पर नोट्स हैं।
स्वतंत्र स्रोत और मानक
Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।
स्रोतों की समीक्षा: