如何私密轉錄訪談
作者: Hushscript 發布: 最後審閱:
出色地轉錄訪談內容同時意味著兩件事:準確的文字和清晰的出處。一堵大段文字,你無法分辨誰說了什麼,這幾乎與原始錄音一樣繁重。當對話敏感、法律問題、機密消息來源、人力資源情況時,音訊的處理方式與逐字稿本身一樣重要。本指南涵蓋了整個過程:在錄製之前獲取乾淨的音訊、運行轉錄、將訪談者和主題分開、使用時間戳準確引用以及保持整個內容的私密性。
開始之前您需要什麼
這個清單很短。您需要將採訪錄音為音訊或視訊檔案。 Hushscript 接受任何常見格式,因此電話語音備忘錄、Zoom 錄音、專用錄音機的 WAV 或 MP4 螢幕截圖都無需轉換即可使用。您需要徵得所有記錄者的同意,這在下面有所介紹,並且不是可選的。您需要一種查看和編輯逐字稿的方法,這就是瀏覽器中的 Hushscript 應用程式。無需安裝,無需插件。
您無需選擇語言。 Hushscript 可自動偵測約 99 種語言,因此無需您進行任何設定即可處理雙語訪談或中途切換的主題。如果您想查看完整列表,語言頁面提供了該列表。
錄製前
錄製時的音訊品質是影響轉錄準確性的最大因素。沒有任何轉錄引擎,無論是自動的還是人工的,都無法恢復麥克風從未清晰捕捉到的單字。一些具體細節比您以後做的任何事情都更有價值。
**麥克風放置。**對於面對面採訪,放在桌子上與兩個說話者等距的小型錄音機比放在口袋裡的手機要好。如果您可以為每個人提供自己的麥克風,請這樣做:兩個乾淨的輸入比一個混合房間更容易分開。對於視訊通話中的遠端採訪,請在平台允許的情況下將每一方記錄為自己的軌道,因為兩個軌道比單一下混流更清晰地分開。
**安靜的環境。**暖通空調的嗡嗡聲、窗外的交通聲、咖啡館的背景噪音和空蕩蕩的房間混響都會影響準確性。一間鋪著地毯的小房間,甚至是掛著衣服的衣櫃,聽起來都比開放式辦公室好。在現場,指向拍攝對象的定向麥克風有助於提高他們的聲音高於周圍環境。
**先徵得同意。**在某人不知情的情況下對其進行錄音在許多地方都是非法的,在任何地方都是不可接受的。在開始之前告訴你的拍攝對像你正在錄音。一些司法管轄區是一方同意的,但包括美國的一些州和許多國家在內的一些司法管轄區要求在場的所有人都同意。如有疑問,請在開始後立即對錄音本身明確口頭表示同意,這樣協議就成為文件的一部分。
**合理的格式設定。**您不需要錄音室品質。 128 kbps 或更高的 WAV 或 MP3 就足夠了,16 kHz 或更高的取樣率也很舒服。要避免的一件事是壓縮到約 8 kHz 左右的電話品質,此時輔音會混在一起,準確性會明顯下降。
逐步轉錄訪談內容
建構流程的目的是讓您在提交之前就可以看到品質。這是真正的順序。
- **將錄音放在 /audio-to-text 中。**如果是影片,則首先在瀏覽器中提取音訊,因此影片文件本身永遠不會離開您的設備。這裡僅涉及音訊。
- **閱讀 30 秒預覽。**在您建立帳戶之前,Hushscript 會轉錄前半分鐘並向您顯示已套用的說話者標籤。這是無帳戶步驟:您可以在實際文件(而不是示範)上判斷說話者的分離和措辭。
- **註冊以轉錄其餘部分。**建立帳戶可解鎖完整轉錄。新帳號有 30 分鐘免費試用時間,足以進行簡短訪談或長篇訪談的一部分。此後,Hushscript 是一種即用即付的方式,無需訂閱,因此您只需在需要時購買分鐘數。
- **重新標記並匯出。**完成的逐字稿會以每句話一行的形式返回,每行都標有說話者標籤和時間戳。將標籤重新命名為真實姓名,然後匯出。
關於免費分鐘的說明,因為人們會問「免費」部分如何運作。 30 分鐘授予一次。解鎖它們的最快方法是快速卡檢查:授權持有 1 美元以確認該卡,然後立即釋放,無需付費。如果您願意以其他方式付款,您所在國家/地區提供的替代方法也可以使用,首次購買時可享受 30 分鐘的服務。無論哪種方式都不需要卡片。
將訪談者和主題分開
這是可以使用訪談記錄的地方,而不是無論如何都必須重新聽的記錄。 說話者辨識功能為每個不同的聲音分配自己的標籤,無需設定,也無需額外費用。對於意味著這樣對話的兩人訪談:
說話者 A [00:00:07]:你能帶我回顧一下你第一次意識到該專案遇到麻煩的時候嗎?
說話者 B [00:00:13]:那是 2019 年初。我正在運行部署,但數字剛剛停止增加。
說話者 A [00:00:28]:你對此做了什麼?
說話者 B [00:00:31]:老實說,一開始什麼也沒做。這是我感到遺憾的部分。
要在其上新增真實姓名:
- 按一下記錄中的任何
說話者 A實例。 - 輸入您想要的名稱,例如「訪談者」或您的受試者姓名。
- 該說話者的每一行都會更新於一次。
每個說話者都執行一次此操作。對於 90 分鐘的兩人訪談,整個過程不到一分鐘,最後你會得到一份準備好引用的文件,其中每一行都歸因於指定的人。如果您想詳細了解這種分離實際上是如何運作的,說話者分離的工作原理將以淺白方式進行介紹。
一個有效範例:一小時的研究訪談
假設您在手機上將一段 58 分鐘的研究訪談錄製為.m4a檔案。房間很安靜,你們倆都靠近手機,當你的主題變得動畫時,通常會出現一些重疊。
您將文件放在/audio-to-text處。 30 秒的預覽顯示您作為說話者 A 的開場問題和您的拍攝對像作為說話者 B 的第一個答案,這告訴您分離是乾淨的。您註冊並轉錄完整文件。 58 分鐘的面試會佔用您餘額中的 58 分鐘,因此 30 分鐘的免費時間剛好涵蓋一半,您可以將剩餘的時間充值。
該逐字稿讀起來乾淨俐落。您點選第一個說話者 A,輸入自己的名字,點選第一個說話者 B,輸入您的主題名稱,然後整個文件都會更新。瀏覽一下,您會注意到三個短片段,引擎將您的主題分割成第二個標籤,因為它們遠離手機,因此您將它們合併回來。您可以將筆記匯出為 DOCX 並匯出為 JSON,以便您的分析腳本可以提取每個話語及其開始時間、結束時間和說話者。上傳後的總操作時間:幾分鐘。
使用時間戳準確引用
記錄中的每句話都帶有時間戳,這使得輸出可以安全引用。當您引用文章、報告或論文時,請注意其旁邊的時間戳記。這為你在事實核查過程中提供了一個精確的觀點供你回聽,為編輯提供了一種驗證引用的方法,並且在消息來源後來對他們所說的內容提出異議時為你提供了一些可以指出的東西。一旦獲得引用,要對其進行多少整理,是保留每一個錯誤的開頭還是將措辭平滑成乾淨的散文,都是值得有意做出的風格選擇,清稿逐字稿與完整逐字稿列出了這兩種約定。
DOCX 匯出使時間戳保持內聯。如果您需要原始結構,JSON 匯出將為您提供話語級數據,每個條目都有開始時間、結束時間、說話者和文字,您可以透過程式處理這些數據。 TXT 匯出是乾淨的閱讀副本,如果採訪將位於影片下方,SRT 會為您提供定時字幕行。
值得了解的一個限制:時間戳位於話語級別,而不是單字。對於大多數採訪工作來說,這正是您想要的,因為您引用的是一個句子,而不是一個音節。如果您特別需要將字幕刻錄到素材上的字級計時,SRT 行計時對於幾乎所有目的來說都足夠接近。
常見問題以及如何解決這些問題
大多數訪談錄音都能清晰地轉錄。當出現問題時,它幾乎總是少數問題之一,每個問題都有一個簡單的解決方案。
**一個說話者分成兩個標籤。**這是最常見的意外情況。這通常意味著人的聲音在中途發生了變化:他們離麥克風更近或更遠,從耳機切換到擴音模式,或者通話時線路品質發生變化。該引擎根據聲音的發音進行聚類,因此大的轉變可以解讀為新的聲音。在編輯器中合併兩個標籤,一次即可修復,如上面的實例所示。
**兩人合併為一個標籤。**相反。當兩個聲音確實相似,或者錄音很安靜並且很難聽出差異時,就會發生這種情況。事後很難徹底修復,這就是為什麼錄音時兩個單獨的輸入(每人一個)是防止這種情況的最佳保險。
**串擾和人們互相交談。**當兩個人同時說話時,任何轉錄員,無論是自動還是人類,都會陷入困境,因為單字在音訊中物理上重疊。預計在激烈的採訪中最繁忙的時刻需要人工回聽。時間戳可以讓您快速找到這些時刻。
**重音或專業術語。**跨重音的準確度都很好,但不熟悉的專有名詞、技術術語和名稱是自動轉錄最有可能出現問題的地方。對一些特定於你的面試的名稱和術語進行搜尋和替換,並確認你想要引用的任何內容。當訪談是充滿專業詞彙的臨床或研究對話時,用於聽寫和訪談的醫學轉錄涵蓋瞭如何處理這些術語。
**安靜或遠處的錄音。**如果拍攝對象距離麥克風較遠或說話輕聲,則準確度會全面下降,並且事後沒有軟體修復。 「錄製之前」部分就是為了防止這種情況發生。如果您對品質較差的錄音感到困惑,請將其轉錄為草稿,然後根據音訊進行更正。
**非常長或很大的檔案。**錄音可以運行長達 10 小時,沒有檔案大小限制 - 即使是非常大的錄音也是在瀏覽器中準備的。僅分割超過 10 小時限制的錄音,使用自然停頓,然後轉錄每個部分。
音訊源或影片源:上傳哪個
如果您同時擁有同一採訪的音訊文件和影片,請上傳其中一個。逐字稿是相同的,因為 Hushscript 在這兩種情況下都是根據音訊工作的。實際的差別在於隱私。當您給它一個影片時,音訊會在您的瀏覽器中提取,並且只發送音訊,因此影片(通常是更具識別性和更敏感的工件)永遠不會離開您的機器。對於敏感的採訪,這是更好的預設。如果您已經有一個乾淨的純音訊文件,上傳是最簡單的。
將敏感採訪保密
對於涉及法律事務、機密消息來源、人力資源案例或個人披露的採訪,音訊的處理方式超出了逐字稿品質的範圍。 Hushscript 正是為此而建構的。
轉錄完成後,音訊將從伺服器中刪除。沒有保留窗口,也沒有錄音的備份副本。如果您上傳影片,則只會發送提取的音訊,並且該音訊也會消失。語音引擎不會對您的錄音進行訓練,因此您提交的任何內容都不會提供給模型。
逐字稿本身在靜態時是加密的。簡單來說,如果儲存被破壞,攻擊者會發現的是無法讀取的密文,而不是物件的文字。這是洩漏保護,而不是聲稱我們無法讀取您的逐字稿:鑰匙在我們這邊,因此產品可以向您展示您自己的作品。這確實意味著資料外洩(對任何雲端工具來說都是現實的威脅)不會交出可讀的採訪內容。
對於最嚴重的情況,新聞來源保護、特權法律資料,請採取標準預防措施:在您控制的裝置上保留您自己的音訊離線副本和完成的逐字稿,並且不將任何雲端服務(包括此雲端服務)視為唯一副本。如果您想了解資料處理的全貌,私人轉錄頁面會列出它。
如果您的錄音是多主機播客而不是一對一採訪,工作流程是相同的,如何轉錄播客涵蓋了多語音細節。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: