वक्ता डायराइजेशन: वक्ता लेबल कैसे काम करते हैं
लेखक: Hushscript प्रकाशित: अंतिम समीक्षा:
वक्ता डायराइजेशन एक रिकॉर्डिंग को वक्ता द्वारा खंडों में अलग करने की स्वचालित प्रक्रिया है, जिसमें उत्तर दिया जाता है “कौन कब बोला?” इससे पहले कि कोई भी इंसान प्रतिलेख पढ़े। वर्तमान ACL एंथोलॉजी में वक्ता-डायराइजेशन शोध बहु-पक्षीय वार्तालापों के लिए समान कार्य का वर्णन करता है। यह शब्दों की दीवार और संरचित बातचीत के बीच का अंतर है, और यही कारण है कि दो व्यक्तियों के साक्षात्कार की प्रतिलिपि एक लंबे पैराग्राफ के बजाय एक पठनीय संवाद के रूप में वापस आती है।
सादे शब्दों में: आप एक रिकॉर्डिंग अपलोड करते हैं, डायराइजेशन इंजन उन बिंदुओं को ढूंढता है जहां आवाज बदलती है, उन खंडों को समूहित करता है जो एक ही व्यक्ति की तरह लगते हैं, और एक प्रतिलेख सौंपता है जो एक स्क्रिप्ट की तरह पढ़ता है: प्रति मोड़ एक पंक्ति, आवाज द्वारा लेबल किया गया। यह पोस्ट बताती है कि यह कैसे काम करता है, क्यों डायराइजेशन एक आवाज को पहचानने के समान नहीं है, और जेनेरिक लेबल को वास्तविक नामों में कैसे बदला जाए।
वक्ता डायराइजेशन, सरल भाषा में
90 मिनट के साक्षात्कार को हाथ से लिखते हुए चित्र। भाषण को पाठ में बदलने के बाद, अगली चीज़ जो आप करेंगे वह विशेषताएँ जोड़ना है: “साक्षात्कारकर्ता:”, “विषय:”, आगे और पीछे, हर बार आवाज बदलने पर। वह एट्रिब्यूशन कार्य, यह तय करना कि किसी भी सेकंड में कौन बोल रहा है, वास्तव में डायराइजेशन आपके लिए क्या करता है।
आउटपुट एक संवाद-प्रारूप प्रतिलेख है:
वक्ता A [00:00:12]: समझने वाली पहली बात यह है कि डेटा केवल एक पल के लिए मौजूद होता है।
वक्ता B [00:00:27]: ठीक है, और यह वह हिस्सा है जिसका अधिकांश लोगों को तब तक एहसास नहीं होता जब तक कि बहुत देर नहीं हो जाती।
वक्ता A [00:00:34]: बिल्कुल। तो असली सवाल यह है कि आप उस विंडो में क्या करते हैं।
प्रत्येक कथन एक वक्ता और एक टाइमस्टैम्प से बंधा होता है। फिर आप वक्ता A और वक्ता B का नाम बदलकर वास्तविक नाम रख सकते हैं; प्रति वक्ता एक संपादन, और लेबल जहां भी दिखाई देता है वहां अद्यतन होता है।
विकल्प, बिना किसी डायराइजेशन के एक सादा प्रतिलेख, पाठ का एक सतत ब्लॉक है जहां आपको यह पता लगाने के लिए ऑडियो को फिर से चलाना होगा कि किसने क्या कहा है। दो या दो से अधिक आवाजों के साथ कुछ मिनटों के लिए, यह वास्तविक मैन्युअल काम है, और यह वह काम है जिसे डायराइजेशन पास हटा देता है।
शुरू करने से पहले आपको क्या चाहिए
कॉन्फ़िगर करने के लिए कोई सेटिंग नहीं है और इंस्टॉल करने के लिए कुछ भी नहीं है। डायराइजेशन रिकॉर्डिंग पर ही चलता है, इसलिए एकमात्र वास्तविक शर्त ऑडियो है जहां वक्ता उचित रूप से अलग हैं:
- प्रत्येक आवाज के साथ एक रिकॉर्डिंग। डायराइजेशन एक फ़ाइल के भीतर काम करता है, इसलिए सभी वक्ता उस फ़ाइल में मौजूद होने चाहिए। एक गोलमेज जहां हर कोई एक ही कमरे में माइक काम करता है; दो लोगों में से प्रत्येक ने अपने अलग डिवाइस पर रिकॉर्ड किया, दो अलग फ़ाइलों के रूप में सहेजा, ऐसा नहीं है। पहले उन्हें एक मिश्रण में मिला लें।
- पर्याप्त ऑडियो साफ़ करें। इसके लिए स्टूडियो गुणवत्ता की आवश्यकता नहीं है। इसके लिए आवश्यक है कि प्रत्येक व्यक्ति को बिना तनाव के, सीमित क्रॉस-टॉक और पृष्ठभूमि शोर के साथ सुना जा सके। आवाजों के बीच अलगाव जितना साफ होगा, लेबल उतने ही साफ होंगे।
- कितने लोग बात कर रहे हैं इसका एक मोटा अंदाजा। आपको इसे प्रदान करने की आवश्यकता नहीं है, लेकिन यह जानने से आपको परिणाम की विवेक-जांच करने में मदद मिलती है: यदि आपने तीन लोगों को रिकॉर्ड किया है और प्रतिलेख छह वक्ता दिखाता है, तो आप जानते हैं कि कहां देखना है।
बस। कोई माइक्रोफ़ोन नामांकन नहीं, कोई आवाज़ के नमूने नहीं, कोई प्रति-वक्ता सेटअप नहीं।
स्वचालित वक्ता पहचान कैसे काम करती है
डायराइज़ेशन कुछ अलग चरणों में टूट जाता है। उन्हें जानने से आउटपुट को पढ़ना आसान हो जाता है, और कुछ गलत होने पर उसे ठीक करना आसान हो जाता है।
सुविधा निष्कर्षण। ऑडियो को छोटे फ्रेम में विभाजित किया जाता है, आमतौर पर प्रत्येक 10 से 40 मिलीसेकंड, और इंजन प्रत्येक फ्रेम में ध्वनिक सुविधाओं को मापता है। वक्ता को अलग-अलग बताने के लिए जो विशेषताएँ मायने रखती हैं वे फ़्रीक्वेंसी डोमेन में रहती हैं: पिच, फॉर्मेंट और वर्णक्रमीय पैटर्न जो एक व्यक्ति की आवाज़ के भीतर सुसंगत रहते हैं और लोगों के बीच भिन्न होते हैं।
विभाजन। इंजन वक्ता परिवर्तन बिंदुओं की तलाश करता है: ऐसे क्षण जहां आवाज की विशेषताएं बदल जाती हैं। यह कठिन भाग है। जब कोई बीच में टोकता है तो वाक्य के मध्य में परिवर्तन हो सकता है, और शोर या ओवरलैपिंग भाषण वास्तविक सीमा को छिपा सकता है या झूठी सीमा का आविष्कार कर सकता है।
क्लस्टरिंग। जो खंड एक ही आवाज की तरह लगते हैं उन्हें एक साथ समूहीकृत किया जाता है। इंजन को यह नहीं बताया जाता कि कमरे में कितने लोग हैं; यह ऑडियो से वक्ता की गिनती का अनुमान लगाता है। यदि आप समय से पहले गिनती जानते हैं, तो कुछ सेटअप आपको इसकी आपूर्ति करने देते हैं; यदि नहीं, तो इंजन इसका अनुमान लगाता है, जहां अधिकांश “एक व्यक्ति को दो में विभाजित” और “दो लोगों को एक में विलय” त्रुटियां आती हैं।
लेबलिंग। प्रत्येक क्लस्टर को एक लेबल मिलता है:वक्ता A,वक्ता B,वक्ता C, यावक्ता 0,वक्ता 1. लेबल मनमाने प्लेसहोल्डर हैं. उनके पीछे कोई पहचान नहीं है, पूरी रिकॉर्डिंग में एक आवाज के लिए बस एक स्थिर हैंडल है।
पूरी पाइपलाइन ट्रांसक्रिप्शन के साथ-साथ एक स्वचालित पास के रूप में चलती है, इसलिए आप एक अलग वक्ता-लेबलिंग कार्य नहीं चलाते हैं।
डायराइजेशन बनाम आवाज पहचान
ये दोनों लगातार मिलते रहते हैं, लेकिन वे अलग-अलग उत्तर देते हैं प्रश्न।
डायराइजेशन पूछता है: इस फ़ाइल में अन्य आवाज़ों के सापेक्ष, इस समय कौन बोल रहा है? यह आवाज़ों को अलग करता है लेकिन यह नहीं जानता कि वे किसकी हैं। इसे किसी पूर्व ज्ञान की आवश्यकता नहीं है और काम पूरा होने के बाद किसी भी आवाज का कोई रिकॉर्ड नहीं रखता है।
आवाज पहचान, जिसे वक्ता पहचान भी कहा जाता है, पूछता है: क्या यह वही व्यक्ति है जो ज्ञात संदर्भ रिकॉर्डिंग में था? इसकी तुलना करने के लिए एक नामांकित आवाज नमूने की आवश्यकता है, और यह “आवाज द्वारा अपनी पहचान सत्यापित करें” सिस्टम के पीछे की तकनीक है।
Hushscript का उपयोग करता है डायराइजेशन, आवाज पहचान नहीं। नामांकित आवाज़ों का कोई डेटाबेस नहीं है, और आपकी रिकॉर्डिंग की तुलना कभी भी किसी और से नहीं की जाती है। वक्ता लेबल पूरी तरह से उस एक फ़ाइल के अंदर ध्वनि विशेषताओं से प्राप्त होते हैं।
यह अंतर ही कारण है कि डायराइज़ेशन आपके लिए लोगों का नाम नहीं दे सकता है। यह आत्मविश्वास से कह सकता है कि “एक ही व्यक्ति ने पूरे घंटे में 200 बार बात की,” लेकिन यह नहीं कह सकता कि वह व्यक्ति कौन है। वह कदम आपका है, और इसमें प्रति वक्ता एक क्लिक लगता है। यदि आप गहराई से देखना चाहते हैं कि Hushscript मल्टी-वक्ता रिकॉर्डिंग को शुरू से अंत तक कैसे संभालता है, तो वक्ता पहचान पृष्ठ इसे कवर करता है।
एक काम किया हुआ उदाहरण: एक तीन-व्यक्ति मीटिंग
मान लीजिए कि आप एक कमरे में तीन लोगों के साथ 40 मिनट की प्रोजेक्ट मीटिंग रिकॉर्ड करते हैं, एक ही लैपटॉप माइक साझा करते हुए, इस रूप में सहेजा गया है एक एकल .m4a फ़ाइल। आप इसे छोड़ देते हैं, और ट्रांसक्रिप्शन के बाद आउटपुट इस तरह दिखता है:
वक्ता A [00:00:04]: ठीक है, चलिए लॉन्च की तारीख से शुरू करते हैं। हम कहाँ हैं?
वक्ता B [00:00:09]: डिज़ाइन हो गया है। हमने अंतिम स्क्रीन सोमवार को सौंप दी।
वक्ता C [00:00:14]: भुगतान प्रवाह के लिए इंजीनियरिंग को लगभग दो सप्ताह और चाहिए।
वक्ता A [00:00:21]: दो सप्ताह हमें उस तारीख से आगे ले जाते हैं जिसका हमने विपणन करने का वादा किया था।
वक्ता B [00:00:27]: क्या हम नए भुगतान प्रवाह और अनुवर्ती कार्रवाई के बिना जहाज भेज सकते हैं?
वक्ता C [00:00:33]: साफ-सुथरा नहीं। नई कीमत पर पुराना प्रवाह टूट जाता है।
तीन आवाजें, अलग और लेबल, हर मोड़ पर टाइमस्टैम्प के साथ। अब आप पुनः लेबल करें:वक्ता A“प्रिया” बन जाता है (वह मीटिंग चला रही है),वक्ता B“टॉम” बन जाता है,वक्ता C“दाना” बन जाता है। तीन क्लिक के बाद, प्रत्येक पंक्ति में एक वास्तविक नाम होता है, और प्रतिलेख सही एट्रिब्यूशन के साथ मीटिंग नोट्स में चिपकाने के लिए तैयार होता है।
दो-व्यक्ति साक्षात्कार, चार-व्यक्ति पॉडकास्ट, या दो-तरफा फोन कॉल के लिए एक ही आकार होता है: इंजन जो सुनता है उसे अलग करता है, और आप नाम डालते हैं।
वक्ताों को फिर से लेबल कैसे करें Hushscript
लेबल उद्देश्य पर सामान्य आते हैं; उनका नामकरण एक त्वरित संपादक कदम है। आपके वहां पहुंचने से पहले का प्रवाह यह है: अपनी फ़ाइल छोड़ें और बिना किसी खाते की आवश्यकता के 30 सेकंड का वक्ता-लेबल पूर्वावलोकन रेंडर करें, बाकी को ट्रांसक्रिप्ट करने के लिए साइन अप करें, फिर तैयार ट्रांसक्रिप्ट खोलें। वहां से:
- ट्रांसक्रिप्ट एडिटर में किसी भी वक्ता लेबल पर क्लिक करें, जैसे
वक्ता B। - असली नाम टाइप करें, जैसे “टॉम”।
- उस वक्ता का प्रत्येक उदाहरण पहली पंक्ति से लेकर आखिरी तक एक ही बार में अपडेट होता है।
नाम बदलना वैश्विक है, इसलिए आप कभी भी एक ही लेबल को दो बार संपादित नहीं करेंगे। दो वक्ताओं के साथ 90 मिनट के साक्षात्कार के लिए, पूर्ण रीलेबलिंग पास में एक मिनट से भी कम समय लगता है, और अंत में आपके पास एक उद्धरण-तैयार प्रतिलेख होता है जो प्रत्येक पंक्ति का सही वर्णन करता है। इसके बाद आप इसे TXT, SRT, DOCX, PDF और JSON जैसे 21 प्रारूपों में से किसी एक में, साथ ही पासवर्ड से सुरक्षित .husharchive में, बेक किए गए नामों के साथ निर्यात कर सकते हैं।
सामान्य डायराइजेशन समस्याओं का निवारण
स्वच्छ रिकॉर्डिंग पर डायराइजेशन विश्वसनीय है और जैसे-जैसे ऑडियो खराब होता जाता है, यह कठिन होता जाता है। सामान्य समस्याएं, और उनके बारे में क्या करें:
ओवरलैपिंग स्पीच। जब दो लोग एक साथ बात करते हैं, तो इंजन को एक ही वक्ता को ओवरलैपिंग ऑडियो असाइन करना पड़ता है, और यह क्रॉसओवर को गलत लेबल कर सकता है या कुछ शब्दों को हटा सकता है। सॉफ़्टवेयर में कोई सुधार नहीं है; ऑडियो में वास्तव में एक ही क्षण में दो आवाजें हैं। रोकथाम लीवर है: एक रिकॉर्डिंग जहां लोग बारी-बारी से रुकावटों से भरी रिकॉर्डिंग की तुलना में कहीं अधिक सफाई से डायरी लिखते हैं। जहां ओवरलैप्स होते हैं, ऑडियो के सामने एक त्वरित अध्ययन कुछ प्रभावित पंक्तियों को पकड़ लेता है।
समान ध्वनि वाली आवाजें। समान स्वर और उच्चारण वाले दो वक्ताओं (जैसे, समान उम्र के दो पुरुष, या भाई-बहन) को एक विपरीत जोड़ी की तुलना में अलग करना कठिन होता है, क्योंकि उनकी आवाज की विशेषताएं वास्तव में ओवरलैप होती हैं। इंजन कभी-कभी उनके बीच एक मोड़ बदल सकता है। निर्दिष्ट वक्ता के लिए अजीब तरह से पढ़ने वाली पंक्तियों के लिए प्रतिलेख को स्कैन करें; वे वे हैं जिन्हें हाथ से पुन: असाइन किया जाता है।
एक व्यक्ति दो लेबल में विभाजित हो जाता है। यदि किसी का ऑडियो रिकॉर्डिंग के बीच में बदल जाता है (वे माइक के करीब जाते हैं, हेडसेट से स्पीकरफ़ोन पर स्विच करते हैं, या कनेक्शन ख़राब हो जाता है), तो इंजन दूसरी छमाही को एक नई आवाज़ के रूप में पढ़ सकता है और एक अतिरिक्त लेबल बना सकता है। दोनों को एक ही नाम से पुनः लेबल करके दोनों को मिला दें; डुप्लिकेट एक वक्ता में समा जाते हैं।
दो लोग एक लेबल में विलीन हो जाते हैं। इसका विपरीत तब होता है जब दो शांत या दूर की आवाजें इतनी एक जैसी लगती हैं कि इंजन विभाजित नहीं हो सकता। इस तथ्य के बाद इसे सुधारना सबसे कठिन है, इसलिए इसे रोकने के लायक है: माइक को वक्ता के करीब ले जाएं, और बड़े कमरे से रिकॉर्डिंग करने से बचें।
दूर-क्षेत्र या शोर ऑडियो। कॉन्फ्रेंस टेबल के अंत में एक लैपटॉप माइक, समूह चैट के दौरान टेबल पर एक फोन, या भारी कमरे की गूंज, ये सभी आवाजों के बीच की सीमाओं को धुंधला कर देते हैं। नज़दीकी माइक प्लेसमेंट से प्रत्येक वक्ता को मदद मिलती है, और पृष्ठभूमि शोर (पंखे, ट्रैफ़िक, संगीत) को कम करने से अलगाव तेज होता है। डायराइज़ेशन गुणवत्ता ऑडियो गुणवत्ता को बारीकी से ट्रैक करती है।
फ़ोन कॉल को दो अलग-अलग फ़ाइलों के रूप में रिकॉर्ड किया जाता है। यदि आपके रिकॉर्डर ने कॉल के प्रत्येक पक्ष को अपनी मोनो फ़ाइल के रूप में सहेजा है, तो किसी भी फ़ाइल पर डायराइज़ेशन में केवल एक ही आवाज़ दिखाई देती है। पहले दोनों को एक मिश्रित रिकॉर्डिंग में मिलाएं, ताकि दोनों आवाजें एक फ़ाइल में मौजूद हों, फिर उसे ट्रांसक्राइब करें।
सटीकता युक्तियाँ जो वास्तव में सुई को घुमाती हैं
कुछ आदतें डायराइजेशन को काफी बेहतर बनाती हैं, और उनमें से अधिकांश रिकॉर्डिंग के बारे में हैं, सॉफ्टवेयर के बारे में नहीं:
- लोगों को लेने दें बदल जाता है। क्रॉस-टॉक डायराइज़ेशन त्रुटियों का एकमात्र सबसे बड़ा स्रोत है। एक नियंत्रित चर्चा सभी के लिए निःशुल्क चर्चा से बेहतर है।
- माइक को करीब ले जाएं। दूरी और कमरे में धुंधली आवाजें एक साथ गूंजती हैं। प्रति व्यक्ति एक क्लोज़ माइक आदर्श है; टेबल के बीच में एक साझा माइक कोने में एक को बजाता है।
- स्पष्ट पृष्ठभूमि शोर को काटें। संगीत, एक चलता हुआ पंखा, या एक व्यस्त कैफे सभी आवाज़ों के साथ प्रतिस्पर्धा करते हैं और सीमाओं को गंदा करते हैं।
- हर आवाज़ को उस फ़ाइल में रखें जिसे आप ट्रांसक्राइब करते हैं। डायराइज़ेशन एक रिकॉर्डिंग के भीतर वक्ता की तुलना करता है। यदि कोई रिकॉर्डर अलग-अलग प्रतिभागी ट्रैक तैयार करता है, तो पहले उन्हें एक फ़ाइल में मिलाएं या मर्ज करें ताकि डायराइज़ेशन पास पूरी बातचीत सुन सके।
इसमें से किसी को भी सही होने की आवश्यकता नहीं है। स्पष्ट घुमाव और उचित माइक स्थिति अधिकांश रिकॉर्डिंग को लेबल साफ करने में मदद करती है, और संपादक बाकी काम संभालता है।
यह साक्षात्कार और बैठकों के लिए क्यों महत्वपूर्ण है
डायराइजेशन के बिना, एक बहु-व्यक्ति वार्तालाप की प्रतिलिपि अपने सबसे सामान्य कार्यों के लिए अनुपयोगी के करीब है:
- डायरेक्ट उद्धरण। यदि आप नहीं जानते कि कौन सी पंक्तियाँ उनकी हैं, तो आप किसी को उद्धृत नहीं कर सकते।
- सारांश एट्रिब्यूशन। एक बैठक सारांश जो यह नहीं बताता कि किसने क्या कहा, बिना सारांश के बमुश्किल अधिक उपयोगी है।
- वक्ता द्वारा खोजना। यदि आप किसी एक व्यक्ति द्वारा कही गई किसी बात की तलाश कर रहे हैं, तो आप एक भी अविभाजित फ़िल्टर नहीं कर सकते पाठ का खंड।
डायराइजेशन के साथ, इनमें से प्रत्येक सीधा है, और प्रतिलेख कच्चे पाठ के बजाय एक दस्तावेज़ बन जाता है। जो कुछ भी प्रकाशित या उद्धृत किया जाएगा, चाहे वह पत्रकारिता, शोध, या पॉडकास्ट शो नोट्स हो, सटीक एट्रिब्यूशन वैकल्पिक नहीं है, और इसे ऑडियो से पुनर्निर्माण करने के बजाय प्रतिलेख से प्राप्त करना समय बचाता है। मीटिंग नोट्स, साक्षात्कार अनुसंधान, या एचआर रिकॉर्ड जैसे आंतरिक कार्यों के लिए, लेबल की गई संरचना उतनी ही मूल्यवान है: किसी संवाद को स्कैन करना पाठ की दीवार को पढ़ने की तुलना में कहीं अधिक तेज़ है।
संदर्भ में पूर्ण पूर्वाभ्यास के लिए, देखें किसी साक्षात्कार को कैसे प्रतिलेखित करें, जिसमें पत्रकारिता और अनुसंधान के लिए रिकॉर्डिंग, प्रतिलेखन और पुन: लेबलिंग शामिल है, और एक एपिसोड में मेजबानों और मेहमानों को लेबल करने के लिए पॉडकास्ट को कैसे ट्रांसक्राइब करें।
प्रत्येक Hushscript ट्रांसक्रिप्ट पर वक्ता लेबल निःशुल्क हैं
प्रत्येक Hushscript ट्रांसक्रिप्ट पर वक्ता डायराइजेशन बिना किसी अतिरिक्त लागत के शामिल है। इसमें कोई डायराइज़ेशन ऐड-ऑन नहीं है, इसके लिए कोई अलग योजना स्तर नहीं है, और रिकॉर्डिंग में कितने वक्ता हो सकते हैं, इसकी कोई सीमा नहीं है। Hushscript स्वयं बिना किसी सदस्यता के भुगतान के रूप में उपलब्ध है। आज़माने के लिए 30 निःशुल्क मिनट हैं, और आप केवल उसके बाद उपयोग किए गए मिनटों के लिए भुगतान करते हैं; विवरण के लिए मूल्य निर्धारण पृष्ठ देखें।
वक्ता पृथक्करण मुफ़्त है क्योंकि इसके बिना बातचीत का प्रतिलेख केवल आधा प्रतिलेख है: पढ़ने योग्य पाठ जिसमें यह पता नहीं चलता कि इसे किसने कहा है। एक रिकॉर्डिंग डालें, स्वचालित रूप से लेबल प्राप्त करें, एक क्लिक में उनका नाम बदलें और परिणाम निर्यात करें। यह सब एक साथ कैसे फिट बैठता है, इसके बारे में अधिक जानकारी ऑडियो से टेक्स्ट पृष्ठ पर है।
स्वतंत्र स्रोत और मानक
Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।
स्रोतों की समीक्षा: