मुख्य सामग्री पर जाएं

ब्लॉग

साक्षात्कार और फोकस ग्रुप के लिए Research Transcription

लेखक: प्रकाशित: अंतिम समीक्षा:

रिकॉर्डिंग अभी डेटा नहीं है। यह डेटा तब बनती है जब कोई तय कर चुका हो कि क्या लिखा जाएगा, वक्ताओं को कैसे मार्क किया जाएगा, पहचान बताने वाली कौन-सी डिटेल्स हटाई जाएंगी, और आपके coding software तक पहुंचने पर file कैसी दिखेगी। ये चार फैसले ही research transcription हैं, और हर एक क्लर्किकल काम नहीं बल्कि पद्धतिगत (methodological) फैसला है।

पहले interview से पहले ये फैसले लेना, चौदहवें interview पर लेने से कहीं सस्ता पड़ता है। यहां बताया गया है कि हर फैसला क्या बदलता है, आपके methods section में क्या शामिल होना चाहिए, और automatic transcription किसी study की असल मदद कहां करता है, न कि सिर्फ folder को पूरा दिखाने में।

पहले session से पहले transcript का प्रकार चुनें

कोई neutral transcript नहीं होता। हर convention कुछ चीज़ें दिखाता है और कुछ छिपा देता है, इसलिए वही चुनें जो आप वाकई करने वाले analysis के लिए सही हो।

Transcript का प्रकार क्या रखता है किसके लिए सही
Verbatim पूरक शब्द, गलत शुरुआत, ठहराव, ओवरलैप बातचीत और discourse analysis
Intelligent verbatim शब्द, बिना पूरक शब्दों और repairs के Thematic analysis, grounded theory
Clean व्याकरण और पठनीयता के लिए संपादित प्रकाशन और रिपोर्ट के लिए उद्धरण
Denaturalized पूरे corpus में मानकीकृत व्याकरण Cross-case comparison, बड़े samples

महंगी गलती गलत चुनाव नहीं, दो बार चुनना है। आधा verbatim और आधा clean किया हुआ corpus लगातार code नहीं हो सकता, और उसे ठीक करने के लिए बीस interviews दोबारा transcribe करना एक ऐसा महीना है जिसके लिए किसी ने budget नहीं रखा। convention को पहले से लिख लें, यह भी शामिल करके कि हंसी, बीच में टोकना, और सुनाई न देने वाले हिस्सों को कैसे मार्क करेंगे।

मशीनें कहां सही होती हैं, और कहां चूक जाती हैं

Automatic transcription लगभग किसी भी study का पहला draft बनने लायक अच्छा है, लेकिन आखिरी draft बनने लायक नहीं। Pew Research Center ने रिकॉर्ड किए गए sermons पर इंसान और मशीन की transcription की तुलना की और पाया कि साफ़, लगातार चलने वाली speech पर मशीनें बराबरी करती हैं, जबकि proper names, विशेषज्ञ शब्दों और उन हिस्सों में पीछे रह जाती हैं जहां वक्ता ने tone या volume बदला। ये वही हिस्से हैं जिन्हें qualitative researchers अक्सर quote करते हैं।

तो काम करने वाला pattern यह है: एक draft जो आपने खुद टाइप नहीं किया, उसके बाद एक review pass जो आपने किया। audio के साथ एक बार पढ़ें, नाम और terminology ठीक करें, crosstalk में वक्ता की attribution ठीक करें, और वहीं रुक जाएं। review वही हिस्सा है जिसमें असली समय लगता है, और जिसे टाला नहीं जा सकता।

वक्ता लेबल पहले से ही pseudonyms हैं

Automatic speaker separation किसी recording को आवाज़ के हिसाब से बांटता है और नतीजों को वक्ता 1, वक्ता 2, वगैरह लेबल करता है। यह आवाज़ों को पहचानता है, लोगों को नहीं, जो चुपचाप काम का साबित होता है: लेबल डिफ़ॉल्ट रूप से एक pseudonym है और तब तक वैसा ही रहता है जब तक कोई उसमें असली नाम न टाइप करे।

इसे वैसा ही रहने दें। वक्ता 1 को एक बार P07 या किसी role label में rename कर दें और यह बदलाव पूरे transcript और हर export में अपने आप आ जाता है, ताकि participant ID scheme चालीस जगहों पर हाथ से करने की बजाय एक बार में consistent तरीके से लागू हो जाए। हर Hushscript transcript पर वक्ता लेबल मुफ़्त हैं और आवाज़ों की संख्या पर कोई सीमा नहीं है, जो छह-व्यक्ति वाले focus group के लिए ज़रूरी होता है।

ईमानदार सीमा crosstalk है। जब participants एक-दूसरे के ऊपर बोलते हैं तो split के लिए इंसानी नज़र चाहिए, और timecodes ही बताते हैं कि किन मिनटों को दोबारा सुनना है।

Transcription method को अपने paper में लिखें

Reviewers अब सिर्फ यह नहीं पूछते कि text में क्या लिखा है, बल्कि यह भी पूछते हैं कि वह text तैयार कैसे हुआ। qualitative research के लिए APA के Journal Article Reporting Standards authors से यह बताने को कहते हैं कि data कैसे रिकॉर्ड और transform किया गया, जिससे transcription कोई माना-मानाया तथ्य नहीं बल्कि रिपोर्ट की जाने वाली चीज़ बन जाता है।

इन सबका जवाब देने वाला एक methods paragraph आमतौर पर काफी होता है:

De-identify transcribe करते वक्त करें, बाद में नहीं

पहचान बताने वाली डिटेल बीच वाक्य में आती है: कोई नियोक्ता, कोई वार्ड, कोई सड़क, कोई अदालत की तारीख, वह एक सहकर्मी जो कहानी को पहचान लेगा। इसे बाद में हटाने का मतलब है पूरे corpus को दोबारा पढ़ना, इसलिए इसे transcription pass में ही शामिल कर लें।

इसे exported copies में नहीं बल्कि transcript के अंदर ही करने का मतलब यह भी है कि सिर्फ pseudonymized version ही कभी बाहर घूमता है। Find-and-replace एक ही काम में पूरे document में बार-बार आने वाले किसी जगह के नाम को ठीक कर देता है, और saved dictionaries study के नाम, जगहें, और technical vocabulary को recognition तक पहुंचा देती हैं ताकि शुरुआत में ही कम गलतियां आएं।

platform के बारे में आप क्या कह सकते हैं, यह redaction जितना ही मायने रखता है। Hushscript हर transcript तैयार होते ही audio delete कर देता है और उसे कभी model train करने के लिए इस्तेमाल नहीं करता; transcripts आपके तय किए retention window के तहत आराम में encrypted रहते हैं, 7 से 365 दिन तक और per-transcript overrides के साथ; deletion होने पर receipt मिलती है। EU, EEA, Switzerland, और UK से आने वाला audio EU में ही process होता है। जो recording बिल्कुल भी stored transcript के रूप में नहीं रहनी चाहिए, उसके लिए private transcription एक password-protected .husharchive file वापस देता है।

जिस software में transcript जाएगा, उसी के हिसाब से export करें

transcript शायद ही कभी वहीं रहता है जहां वह बना था। यह NVivo, ATLAS.ti, MAXQDA, या किसी spreadsheet में जाता है, और बाद में किसी manuscript में। plain text वह जगह है जहां वक्ता लेबल और timecodes खत्म हो जाते हैं, इसलिए format को उसकी मंज़िल के हिसाब से चुनें।

Hushscript बिना watermark के 21 formats में export करता है और relevant formats को एक Research pack के रूप में bundle करता है। export के बाद भी timecodes का बने रहना ही वह वजह है जिससे आपके findings में कोई quote उस exact सेकंड तक वापस ले जा सकता है जब वह बोला गया था, और यही एक citable transcript और एक लंबे document के बीच का फर्क है।

हर देश के लिए अलग vendor के बिना multilingual fieldwork

किसी comparative study को हर site पर अलग transcription supplier की ज़रूरत नहीं होनी चाहिए। Recognition automatic detection के साथ करीब 99 भाषाओं को cover करता है, और सबसे मज़बूत accuracy 18 flagship language variants पर मिलती है, इसलिए एक ही workflow पूरे sample को संभाल लेता है।

Translation, transcription से अलग फैसला है, और क्रम मायने रखता है: जिस भाषा में बोला गया है उसी में transcribe करें, फिर translate करें। हर translation target recording की duration का 25% लगता है और original तथा आपकी working language को एक ही document के अलग tabs में रख देता है, हर एक अलग से exportable, ताकि आप participant के शब्दों को quote कर सकें और जिस भाषा में सोचते हैं उसी में code कर सकें। किसने translate किया और असहमतियां कैसे सुलझाई गईं, यह भी रिपोर्ट करें, क्योंकि दो translators एक ही वाक्य को एक जैसा नहीं लिखेंगे।

Grant line के हिसाब से इसकी लागत आंकना

Manual transcription की कीमत researcher के घंटों में लगती है, और बीस घंटे भर के interviews वह संख्या है जो चुपचाप एक पूरा term खा जाती है। Automatic transcription इसे एक इतने छोटे budget line में बदल देता है कि यह sample size पर रुकावट बनना बंद कर देता है।

Hushscript subscription की बजाय prepaid minutes बेचता है, इसलिए fieldwork वाले महीनों में उतना ही खर्च होता है जितना इस्तेमाल हो, और लिखने वाले महीनों में कुछ भी नहीं। सबसे बड़े pack पर, $49.99 में 100 घंटे, बीस घंटे भर के interviews की कीमत करीब $10 पड़ती है और 90-मिनट के focus group की करीब $0.75। Minutes 365 दिन तक valid रहते हैं और कोई भी transcription या purchase उस window को रीसेट कर देता है, जो ethics approval के लिए रुकने वाली किसी study के लिए ठीक बैठता है। नए accounts को 30 मुफ़्त मिनट मिलते हैं, जो या तो एक $1 card check से मिलते हैं जिसे authorize करके तुरंत release कर दिया जाता है और कभी charge नहीं किया जाता, या अगर आप किसी और तरीके से भुगतान करें तो आपकी पहली purchase से मिलते हैं।

शुरुआत कहां से करें

किसी साफ़-सुथरी test file की बजाय अपना आखिरी असली रिकॉर्ड किया गया interview इस्तेमाल करें। इसे research transcription से गुज़ारें और वापस आए पहले 5 मिनट पढ़ें: इससे पता चलता है कि आपके participants, आपके कमरे, और आपके accents पर speaker identification कैसा perform करता है, और आपकी study के लिए बस यही accuracy का असली आंकड़ा मायने रखता है।

फिर उस convention को अपने protocol में लिख दें, जब तक कि उसे लागू करने के लिए अभी भी तीस interviews बाकी हों।

स्वतंत्र स्रोत और मानक

Hushscript ने इन स्वतंत्र, गैर-प्रतिस्पर्धी स्रोतों का संदर्भ लिया है। ये शोध, मानकों या प्लेटफ़ॉर्म के काम करने के तरीके को समझाते हैं और Hushscript का समर्थन नहीं करते।

स्रोतों की समीक्षा:

अक्सर पूछे जाने वाले सवाल

क्या qualitative research के लिए automatic transcription काफी accurate है?

पहले draft के तौर पर, हां। अंतिम transcript के तौर पर, अकेले नहीं। Machine recognition साफ़, लगातार speech के साथ बराबरी करता है और proper names, विशेषज्ञ शब्दावली, और उन पलों में पीछे रह जाता है जहां वक्ता अपना register बदलता है, जो ठीक वही पल हैं जिन्हें researchers quote करते हैं। काम करने वाला तरीका है: एक automatic draft, साथ में audio के मुकाबले एक review pass।

Transcript में participants anonymous कैसे रहते हैं?

वक्ता लेबल कोई पहचान नहीं रखते। Automatic separation आवाज़ों को जानता है, लोगों को नहीं, इसलिए लेबल वक्ता 1 और वक्ता 2 के रूप में आते हैं और तब तक pseudonyms बने रहते हैं जब तक आप उनमें असली नाम न टाइप करें। इन्हें एक बार अपने participant ID scheme में rename कर दें और transcript तथा हर export में वही दिखेगा।

मैं ethics committee को platform के बारे में क्या बता सकता हूं?

छोटे-छोटे तथ्य। Hushscript हर transcript तैयार होते ही audio delete कर देता है और उसे कभी model train करने के लिए इस्तेमाल नहीं करता। Transcripts आपके तय किए retention window के तहत आराम में encrypted रहते हैं, 7 से 365 दिन तक और per-transcript overrides के साथ, और deletion होने पर receipt मिलती है। EU, EEA, Switzerland, और UK से आने वाला audio EU में ही process होता है। ये capabilities हैं जिन्हें आप अपने protocol के मुकाबले जांच सकते हैं, कोई compliance certification नहीं।

NVivo या ATLAS.ti के साथ कौन-सा export format काम करता है?

plain text की बजाय एक structured format इस्तेमाल करें, क्योंकि plain text वक्ता लेबल और timecodes दोनों गिरा देता है। CSV, TSV, और XLSX दोनों को spreadsheet और software-based coding के लिए columns में रखते हैं, और JSON scripted pipelines के लिए सही है। Hushscript बिना watermark के 21 formats में export करता है और काम के formats को एक Research pack के रूप में bundle करता है।

किसी study को transcribe करने में कितना खर्च आता है?

सबसे बड़े prepaid pack पर, $49.99 में 100 घंटे, बीस घंटे भर के interviews की कीमत करीब $10 पड़ती है और 90-मिनट के focus group की करीब $0.75। कोई subscription नहीं है और कोई academic tier भी नहीं: minutes prepaid होते हैं, तभी खर्च होते हैं जब कोई file transcribe होती है, और 365 दिन तक valid रहते हैं, जिन्हें कोई भी transcription या purchase रीसेट कर देती है।

क्या मैं पूरा corpus देने से पहले अपनी खुद की recordings पर इसे जांच सकता हूं?

हां। किसी file के पहले 5 मिनट बिना account के speaker-labeled होकर वापस आते हैं, जो आपके असली participants, कमरे, और accents पर वक्ता के split को परखने के लिए काफी है। पूरे corpus को transcribe करने के लिए account चाहिए।

एक से ज़्यादा भाषा वाले interviews को कैसे संभालूं?

जिस भाषा में बोला गया है उसी में transcribe करें, फिर translate करें। Recognition automatic detection के साथ करीब 99 भाषाओं को cover करता है, और कोई translation target जोड़ने पर recording की duration का 25% लगता है और original तथा आपकी working language एक ही document के tabs में आ जाती हैं। एक ही वाक्य के अंदर code-switching अब भी सबसे मुश्किल मामला है, और इसका हल एक bilingual reviewer है।

30 मुफ़्त मिनट के साथ शुरू करें

एक temporary $1 hold आपके card को confirm करता है और तुरंत release हो जाता है — आपसे कभी charge नहीं लिया जाता, और आपके 30 free minutes तुरंत मिल जाते हैं।

शुरू करें – 30 मुफ़्त मिनट