मुख्य सामग्री पर जाएं

MP3 को टेक्स्ट में कैसे बदलें (मुफ़्त, वक्ता लेबल सहित)

लेखक: प्रकाशित: अंतिम समीक्षा:

MP3 को टेक्स्ट में कनवर्ट करना सबसे आम ट्रांसक्रिप्शन कार्यों में से एक है, और चरण स्रोत के साथ नहीं बदलते हैं: एक पॉडकास्ट एपिसोड, एक रिकॉर्ड किया गया साक्षात्कार, एक व्याख्यान, या आपके फोन से एक वॉयस मेमो सभी एक ही प्रवाह से गुजरते हैं। फ़ाइल अपलोड करें, प्रतिलेख की प्रतीक्षा करें, इसे अपने आवश्यक प्रारूप में निर्यात करें।

परिवर्तन यह है कि MP3 स्वयं परिणाम को कैसे प्रभावित करता है। अधिकांश मार्गदर्शक इसे छोड़ देते हैं। एक MP3 एक हानिपूर्ण, संपीड़ित फ़ाइल है, और जिस बिटरेट पर इसे सहेजा गया था वह इस बात पर सीमा निर्धारित करता है कि स्पीच इंजन को कितने विवरण के साथ काम करना है। यह मार्गदर्शिका तीन चरणों को कवर करती है, फिर गहराई में जाती है: वास्तविक वक्ता-लेबल आउटपुट के साथ एक काम किया हुआ उदाहरण, सटीकता के लिए बिटरेट का वास्तव में क्या मतलब है, और जो रिकॉर्डिंग खराब हो जाती है उसे कैसे ठीक किया जाए।

आपको क्या चाहिए

इंस्टॉल करने के लिए कुछ भी नहीं है; कोई डेस्कटॉप ऐप नहीं, कोई ब्राउज़र एक्सटेंशन नहीं। सब कुछ ब्राउज़र और खाते में चलता है।

मुफ़्त मिनटों के अलावा, ट्रांसक्रिप्शन भुगतान के रूप में किया जाता है: आप केवल तभी मिनट खरीदते हैं जब आपको उनकी आवश्यकता होती है, बिना किसी सदस्यता के। लागत मूल्य निर्धारण पृष्ठ पर हैं।

तीन चरणों में एक MP3 को टेक्स्ट में बदलें

  1. अपनी फ़ाइल अपलोड करें।/audio-to-text खोलें, फिर MP3 को ड्रॉप ज़ोन पर खींचें या ब्राउज़ करने के लिए क्लिक करें। 10 घंटे तक की फ़ाइलें स्वीकार की जाती हैं, फ़ाइल आकार की कोई सीमा नहीं है। साइन इन करने से पहले सीधे ब्राउज़र में पहले 30 सेकंड का पूर्वावलोकन करें, ताकि आप कमिट करने से पहले वक्ता-लेबल शैली देख सकें।
  2. इसे ट्रांसक्राइब करने दें। एक बार जब आप साइन इन हो जाते हैं और फ़ाइल अपलोड हो जाती है, तो स्पीच इंजन इसे प्रोसेस करता है और पहले से अलग किए गए वक्ता के साथ एक ट्रांसक्रिप्ट लौटाता है। प्रसंस्करण समय अलग-अलग होता है, और कार्य पृष्ठभूमि में चलता है, इसलिए आपको टैब खुला रखने की आवश्यकता नहीं है।
  3. निर्यात करें। परिणाम को 21 प्रारूपों में से किसी एक में डाउनलोड करें। इसमें सादा TXT, टाइमस्टैम्प्ड SRT, Word DOCX, PDF और उपशीर्षक और संपादक-टाइमलाइन प्रारूप, साथ ही एक पासवर्ड-संरक्षित .husharchive शामिल है। प्रत्येक प्रारूप शामिल है, निर्यात पर कोई पेवॉल नहीं है और उनमें से किसी पर कोई वॉटरमार्क नहीं है।

समाप्त प्रतिलेख आपके डैशबोर्ड में खुलता है। वक्तावक्ता A,वक्ता B, इत्यादि के रूप में दिखाई देते हैं, और आप इसे वास्तविक नाम में बदलने के लिए किसी भी लेबल पर क्लिक कर सकते हैं, जो वक्ता की प्रत्येक पंक्ति को अपडेट करता है।

एक काम किया हुआ उदाहरण: एक दो-व्यक्ति साक्षात्कार

मान लें कि आपके पास founder-interview.mp3 है: a 42 मिनट की रिकॉर्डिंग, 128 केबीपीएस, एक साक्षात्कारकर्ता और एक अतिथि, एक कॉल पर रिकॉर्ड की गई। आपके द्वारा इसे अपलोड करने के बाद, प्रतिलेख वक्ता टर्न के अनुसार खंडित होकर वापस आता है, प्रत्येक पर एक टाइमस्टैम्प के साथ:

[00:00:04] वक्ता A: समय देने के लिए धन्यवाद। आइए शुरुआत से शुरू करें -
           वास्तव में यह विचार कहां से आया?
[00:00:11] वक्ता B: ईमानदारी से कहूं तो, यह उस समस्या से निकला है जो हमारे पास थी। हम थे
           रिकॉर्ड की गई कॉल में डूब गया और उनमें से कोई भी खोजने योग्य नहीं था।
[00:00:23] वक्ता A: तो आपने वह चीज़ बना ली जिसकी आपको आवश्यकता थी।
[00:00:25] वक्ता B: बहुत ज्यादा। पहला संस्करण टेप के साथ रखा गया था।

वहां से संपादन हल्का है। आप एक बार साक्षात्कारकर्ता के लिए वक्ता A और अतिथि के लिए वक्ता B का नाम बदल देते हैं, और हर पंक्ति अपडेट हो जाती है। आप उन मुट्ठी भर उचित संज्ञाओं को खोजते हैं जिनका इंजन अनुमान लगाता है, जैसे किसी उत्पाद का नाम या किसी व्यक्ति का उपनाम, और उन्हें ढूंढें-और-प्रतिस्थापन के साथ ठीक करें, जो प्रत्येक उदाहरण को एक ही बार में सही कर देता है। इस तरह के एक साफ 128 केबीपीएस साक्षात्कार के लिए, वह स्किम आमतौर पर प्रतिलेख को उद्धृत करने से पहले आवश्यक सभी सफाई है।

यह वह जगह है जहां प्रतिलेखन जो वक्ता को मुफ्त में लेबल करता है वह अपनी जगह अर्जित करता है। एक साक्षात्कार से अविभाजित पाठ की एक दीवार लगभग बेकार है जब तक कि आप वापस नहीं जाते और चिह्नित नहीं करते कि किसने क्या कहा; एक प्रतिलेख जो पहले से ही बारी-बारी से विभाजित होकर आता है, वह ऐसी चीज़ है जिसे आप सीधे उद्धृत कर सकते हैं।

सटीकता के लिए बिटरेट का क्या अर्थ है

MP3 एक हानिपूर्ण प्रारूप है: एन्कोडिंग फ़ाइल को छोटा रखने के लिए ऑडियो के उन हिस्सों को फेंक देता है जिन्हें कम से कम सुना जा सकता है।बिटरेट यह है कि एनकोडर ऐसा करने में प्रति सेकंड कितने किलोबाइट खर्च करता है। यह जितना निचला होता है, उतना ही अधिक त्यागता है। MDN का वर्तमान MP3 कोडेक संदर्भ प्रारूप के समर्थित बिटरेट और नमूना दरों का दस्तावेजीकरण करता है और इसके संपीड़न को हानिपूर्ण के रूप में पहचानता है।

वाक् पहचान व्यंजन में उच्च-आवृत्ति विवरण पर बहुत अधिक निर्भर करती है। “पंद्रह” और “सोलह” या “कर सकते हैं” और “नहीं” के बीच का अंतर वहाँ रहता है। आक्रामक संपीड़न बिल्कुल वही है जहां वह विवरण सबसे पहले जाता है। इसलिए बिटरेट किसी प्रतिलेख को समान रूप से ख़राब नहीं करता है; यह भाषण के किनारों पर सुनने में सबसे कठिन शब्दों को खाता है।

व्यवहार में:

कुछ स्पष्टीकरण जो अनावश्यक पुन: एन्कोडिंग को बचाते हैं।परिवर्तनीय बिटरेट (VBR) ठीक है; इसमें भाषण के लिए ** निरंतर बिटरेट (CBR)** पर कोई सटीकता दंड नहीं है, इसलिए इसे “ठीक” करने के लिए VBR फ़ाइल को परिवर्तित न करें। और ट्रांसक्रिप्शन के लिए ** मोनो स्टीरियो की तरह ही काम करता है**, क्योंकि आवाज को दो चैनलों की आवश्यकता नहीं होती है। यदि कुछ है, तो नीचे स्टीरियो डबल-एंडर्स पर नोट देखें।

MP3 बनाम दोषरहित: इसके बजाय कब दोबारा रिकॉर्ड करें

एक स्वाभाविक प्रश्न यह है कि क्या आपके MP3 को पहले WAV जैसे दोषरहित प्रारूप में परिवर्तित करने से मदद मिलेगी। ऐसा नहीं होगा. एक बार जब ऑडियो 128 केबीपीएस MP3 के रूप में सहेजा जाता है, तो गायब विवरण गायब हो जाता है; उसी ऑडियो को WAV कंटेनर में लपेटने से बस एक बड़ी फ़ाइल बन जाती है जिसमें कोई अतिरिक्त जानकारी नहीं होती है। यदि आप नई रिकॉर्डिंग कर रहे हैं और आपके पास विकल्प है, तो दोषरहित या उच्च-बिटरेट स्रोत बेहतर शुरुआती बिंदु है (उस मामले के लिए WAV-टू-टेक्स्ट गाइड देखें), लेकिन मौजूदा MP3 को ऊपर की ओर परिवर्तित करने से कुछ भी नहीं मिलता है।

ईमानदार निर्णय नियम: यदि आपकी एकमात्र प्रतिलिपि एक उचित-बिटरेट MP3 है, तो इसे वैसे ही ट्रांसक्राइब करें। यदि रिकॉर्डिंग वास्तव में खराब है (क्लिप की गई, शोर में दबी हुई, या 32 केबीपीएस पर सहेजी गई) और आप इसे फिर से कैप्चर कर सकते हैं, तो दोबारा रिकॉर्डिंग किसी भी रूपांतरण से कहीं अधिक मदद करेगी। जब आप ताज़ा रिकॉर्ड करते हैं, तो दो आदतें बिटरेट से अधिक मायने रखती हैं: जो भी बोल रहा है उसके पास माइक्रोफ़ोन रखें, और यदि आप कर सकते हैं तो प्रत्येक व्यक्ति को अपना माइक दें, क्योंकि स्रोत पर साफ़ अलगाव ही शब्द और वक्ता लेबल दोनों को सही बनाता है।

सामान्य समस्याओं को ठीक करना

अधिकांश रफ ट्रांस्क्रिप्ट रिकॉर्डिंग में वापस आते हैं, उपकरण में नहीं। यहां बताया गया है कि सामान्य अपराधियों के बारे में क्या करना है।

कम मात्रा। यदि तरंगरूप सपाट दिखता है (एक बहुत ही शांत रिकॉर्डिंग), तो इंजन के पास काम करने के लिए कम सिग्नल होते हैं और सटीकता कम हो जाती है। पहले किसी भी ऑडियो एडिटर में ऑडियो को सामान्य करें या बढ़ाएं, फिर तेज़ संस्करण अपलोड करें। कमजोर रिकॉर्डिंग के लिए बूस्टिंग स्तर उच्चतम-रिटर्न फिक्स में से एक है।

पृष्ठभूमि शोर। स्थिर शोर (एक एयर कंडीशनर, सड़क पर गड़गड़ाहट) को उचित रूप से अच्छी तरह से नियंत्रित किया जाता है; अचानक आने वाला शोर जो बोलचाल में ओवरलैप हो जाता है, जैसे दरवाज़ा, खाँसी, या कटलरी, शब्दों के गिरने का कारण बनता है। यदि आप अपलोड करने से पहले हल्का शोर कम करने वाला पास चला सकते हैं, तो ऐसा करें, लेकिन अति-प्रक्रिया न करें: भारी डीनोइज़िंग कलाकृतियों का परिचय देता है जो शोर की तुलना में सटीकता को अधिक नुकसान पहुंचाते हैं।

भारी उच्चारण या विशेषज्ञ शब्दावली। आधुनिक इंजन अंग्रेजी लहजे की एक विस्तृत श्रृंखला को अच्छी तरह से संभालते हैं। विश्वसनीय चूक वे डोमेन शब्द हैं जिनकी इंजन के पास अपेक्षा करने का कोई कारण नहीं है, जैसे दवा के नाम, कानूनी उद्धरण, या विशिष्ट ब्रांड नाम। इन्हें पकड़ने के लिए निर्यात के बाद एक स्किम पर योजना बनाएं, और ढूंढें-और-बदलें पर निर्भर रहें: यदि किसी कंपनी का नाम हर बार एक ही तरह से गलत हो जाता है, तो एक सुधार पूरी फ़ाइल को साफ़ कर देता है।

बहुत लंबे MP3। 6 घंटे की रिकॉर्डिंग अपने आप में कोई समस्या नहीं है। 10-घंटे की सीमा लगभग किसी भी चीज़ को कवर करती है, और इसके ऊपर फ़ाइल-आकार की कोई सीमा नहीं है, इसलिए पहले एक लंबी फ़ाइल को टुकड़ों में काटने की कोई ज़रूरत नहीं है। जो चीज़ वास्तव में एक लंबी फ़ाइल को ख़राब करती है, वह है उसमें रिकॉर्डिंग की गुणवत्ता में कमी: एक वक्ता जो माइक से दूर चला जाता है, एक ऐसा स्तर जो पहले घंटे के बाद धीमा हो जाता है, एक ऐसा स्थान जो भर जाता है और शोर हो जाता है। जहां आप कर सकते हैं, स्रोत को स्थिर रखें; जहां आप नहीं कर सकते, वहां साफ-सुथरे हिस्सों की तुलना में खुरदुरे हिस्सों को अधिक संपादन की आवश्यकता होने की उम्मीद है। टाइमस्टैम्प इसे प्रबंधित करना आसान बनाते हैं: आप पूरी बात को दोबारा सुनने के बजाय सीधे उस पैच पर जा सकते हैं जो खराब पढ़ता है।

ओवरलैपिंग वक्ता। जब दो लोग एक साथ बात करते हैं, तो इंजन तेज आवाज में शब्दों को असाइन करता है, आमतौर पर वक्ता को अलग करने की एक सीमा होती है, किसी एक टूल की नहीं। कोई अपलोड-साइड फिक्स नहीं है; एक जीवंत समूह रिकॉर्डिंग के क्रॉस-टॉक अनुभागों के लिए बजट संपादन का समय।

वक्ताों को साफ-साफ अलग रखना

वक्ता पृथक्करण (डायराइजेशन) बिना किसी अतिरिक्त लागत के प्रत्येक प्रतिलेख पर चलता है, और MP3 स्तर पर कुछ चीजें प्रभावित करती हैं कि यह कितनी साफ-सुथरी आती है। यदि आप विस्तार से जानना चाहते हैं कि यह हुड के नीचे कैसे काम करता है, तो देखें वक्ता डायराइजेशन क्या है; यहां व्यावहारिक बिंदु हैं:

अपनी प्रतिलेख निर्यात करना

सही प्रारूप इस बात पर निर्भर करता है कि आप पाठ के साथ क्या कर रहे हैं। नीचे दी गई तालिका में प्रस्तावित 21 प्रारूपों में से उन प्रारूपों की सूची दी गई है जिन तक लोग सबसे अधिक पहुंचते हैं; संपूर्ण ट्रेड-ऑफ़ के लिए, देखें आपको वास्तव में किस प्रतिलेख प्रारूप की आवश्यकता है:

फ़ॉर्मेट के लिए सर्वोत्तम
TXT नोट्स, कॉपी-पेस्ट, फीडिंग किसी अन्य टूल में टेक्स्ट
SRT वीडियो पर कैप्शन जोड़ने या टाइमस्टैम्प से नेविगेट करने के लिए; यदि आपका स्रोत MP4 जैसी वीडियो फ़ाइल है, तो भी यही सही विकल्प है
VTT वेब कैप्शन और ब्राउज़र-नेटिव वीडियो प्लेयर
CSV स्प्रेडशीट समीक्षा और हल्के डेटा हैंडऑफ़
मार्कडाउन प्रकाशन नोट्स, README-शैली फ़ाइलें, और संपादन योग्य ड्राफ्ट
JSON प्रोग्रामेटिक प्रोसेसिंग और कस्टम टूलींग
DOCX वर्ड में काम करने वाले संपादकों या एनोटेटर्स के साथ साझा करना
PDF केवल-पढ़ने के लिए साझा करना और संग्रह करना

प्रत्येक निर्यात में वक्ता लेबल और टाइमस्टैम्प शामिल होते हैं, उनमें से किसी पर कोई वॉटरमार्क नहीं होता है।

टाइमस्टैम्प और संपादन

संपादक प्रत्येक उच्चारण को उसके प्रारंभ समय, वक्ता लेबल और पाठ के साथ दिखाता है। पाठ के सामने ऑडियो के उस खंड को चलाने के लिए किसी भी पंक्ति पर क्लिक करें। पूरी फ़ाइल को हाथ से रगड़े बिना किसी पेचीदा मार्ग की जाँच करना आसान है।

SRT निर्यात में टाइमस्टैम्प उच्चारण स्तर पर बैठते हैं: प्रति वक्ता बारी में एक प्रविष्टि, प्रति शब्द नहीं। कैप्शनिंग, नेविगेशन और टाइमस्टैम्प के साथ उद्धरण के लिए, यह सही ग्रैन्युलैरिटी है। यदि आपको कोड में संसाधित करने के लिए शब्द-स्तरीय संरचना की आवश्यकता है, तो JSON निर्यात करें: प्रत्येक प्रविष्टि आपको वक्ता लेबल, मिलीसेकंड में प्रारंभ और समाप्ति समय और उस मोड़ के लिए टेक्स्ट देती है।


अपलोड, ट्रांसक्राइब, निर्यात: यह पूरा काम है, MP3-विशिष्ट विवरण के साथ जो तय करता है कि परिणाम कितना साफ है। MP3-to-text पेज में संपूर्ण सुविधा अवलोकन है, और यदि आप किसी अन्य कंटेनर में रिकॉर्डिंग के साथ काम कर रहे हैं, तो ऑडियो-टू-टेक्स्ट पेज हर प्रारूप को उसी तरह कवर करता है। पूरा शो कर रहे हैं? पॉडकास्ट ट्रांसक्रिप्शन गाइड ट्रांसक्रिप्ट को शो नोट्स में बदलता है, और यदि आपकी फ़ाइल MP3 के बजाय WAV है, तो WAV-टू-टेक्स्ट गाइड में बड़ी दोषरहित फ़ाइलों को संभालने पर नोट्स हैं।

स्वतंत्र स्रोत और मानक

Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।

स्रोतों की समीक्षा:

अक्सर पूछे जाने वाले सवाल

मैं अधिकतम MP3 फ़ाइल आकार क्या अपलोड कर सकता हूं?

प्रति फ़ाइल 10 घंटे तक, फ़ाइल-आकार की कोई सीमा नहीं। प्रत्येक फ़ाइल आपके प्रीपेड मिनटों से आती है; सेवा सुरक्षा और सक्रिय-नौकरी सुरक्षा उपाय भी लागू होते हैं।

क्या MP3 बिटरेट ट्रांसक्रिप्शन सटीकता को प्रभावित करता है?

लगभग 64 केबीपीएस से नीचे यह हो सकता है। बहुत कम बिटरेट पर संपीड़न उन व्यंजनों को नष्ट कर देता है जिन पर भाषण पहचान निर्भर करती है, इसलिए भाषण के किनारों पर शब्द खो जाते हैं। 128 केबीपीएस या उससे अधिक पर आप पहले से ही उस बिंदु को पार कर चुके हैं जहां बिटरेट मायने रखता है, और उच्च संख्या ट्रांसक्रिप्ट को बेहतर नहीं बनाएगी।

क्या मैं केवल-ऑडियो MP3 से SRT उपशीर्षक फ़ाइल प्राप्त कर सकता हूं?

हां। Hushscript किसी भी स्रोत से SRT, TXT, DOCX और JSON निर्यात करता है। भले ही इनपुट ऑडियो था और कोई वीडियो संलग्न नहीं था, तब भी SRT प्रति-उच्चारण टाइमस्टैम्प रखता है, ताकि आप इसे बाद में सीधे वीडियो पर छोड़ सकें।

क्या मुझे शुरू करने के लिए क्रेडिट कार्ड की आवश्यकता है?

नहीं। 30 निःशुल्क मिनटों के लिए एक कार्ड सबसे तेज़ मार्ग है। $1 का होल्ड इसे मान्य करता है, फिर तुरंत रिलीज़ कर देता है और कभी शुल्क नहीं लिया जाता है। यदि आप अपने देश में उपलब्ध किसी अन्य भुगतान विधि का उपयोग करना चाहते हैं, तो आपके 30 मिनट आपके पहले मिनट पैक के साथ आते हैं।

प्रतिलेखित होने के बाद मेरे MP3 का क्या होता है?

प्रतिलेख तैयार होते ही इसे सर्वर से हटा दिया जाता है। भंडारण या मॉडल प्रशिक्षण के लिए कुछ भी नहीं रखा गया है। आप एक क्लिक में अपने डैशबोर्ड से प्रतिलेख को भी हटा सकते हैं।

MP3 पर वक्ता का पृथक्करण कितना सटीक है?

वक्ता लेबल तब सबसे विश्वसनीय होते हैं जब लोग बारी-बारी से काम करते हैं और रिकॉर्डिंग यथोचित रूप से साफ होती है। दो व्यक्तियों का साक्षात्कार आमतौर पर स्पष्ट रूप से अलग हो जाता है; शोर-शराबे वाली समूह कॉल जिसमें लोग एक-दूसरे के बारे में बात कर रहे हों, उसके बाद अधिक हाथ से संपादन की आवश्यकता होती है।

क्या एक वेरिएबल-बिटरेट (VBR) MP3 काम करेगा?

हाँ। VBR ठीक है. इसमें भाषण के लिए निरंतर बिटरेट (CBR) की तुलना में कोई सटीकता संबंधी कमी नहीं है। मोनो और स्टीरियो दोनों भी काम करते हैं; आपको अपलोड करने से पहले कुछ भी दोबारा एनकोड करने की आवश्यकता नहीं है।

क्या यह उस MP3 को ट्रांसक्राइब कर सकता है जो अंग्रेजी में नहीं है?

हाँ। लगभग 99 भाषाओं में भाषा का स्वचालित रूप से पता लगाया जाता है। एक साफ-सुथरी एकल-भाषा रिकॉर्डिंग सर्वोत्तम ढंग से प्रतिलेखन करती है; भारी कोड-स्विचिंग मध्य-वाक्य किसी भी इंजन के लिए कठिन है।

30 मुफ़्त मिनट के साथ शुरू करें

शुरू करें – 30 मुफ़्त मिनट