說話者分離:說話者標籤如何運作
作者: Hushscript 發布: 最後審閱:
說話者分離是按說話者將錄音分成片段的自動過程,回答「誰在何時發言?」在任何人閱讀逐字稿之前。目前 ACL 選集中的說話者分離研究描述了多方對話的相同任務。這就是大段文字和結構化對話之間的區別,也是兩人訪談的筆錄返回為可讀對話而不是一長段的原因。
簡單來說:您上傳一段錄音,說話者分離引擎會找到聲音變化的點,對聽起來像同一個人的片段進行分組,然後返回一份讀起來像腳本的逐字稿:每輪一行,用聲音標記。這篇文章解釋了它的工作原理、為什麼說話者分離與識別聲音不同,以及如何將通用標籤變成真實姓名。
說話者分離,以淺白方式
手寫 90 分鐘訪談的圖片。將語音轉換為文字後,您要做的下一件事是在每次聲音發生變化時添加屬性:“訪談者:”、“主題:”,來回添加。歸因工作,決定誰在任何給定的時刻說話,正是說話者分離為您所做的。
輸出是對話格式的記錄:
說話者 A [00:00:12]:首先要明白的是,資料只存在一會兒。
說話者 B [00:00:27]:對,大多數人都沒有意識到這一點,直到為時已晚。
說話者A [00:00:34]:沒錯。因此,真正的問題是您在該視窗中執行的操作。
每個話語都與說話者和時間戳相關聯。然後您可以將說話者 A和說話者 B重命名為真名;每個說話者進行一次編輯,並且標籤會在出現的所有地方更新。
另一個選擇是沒有說話者分離的普通逐字稿,是一個連續的文字區塊,您必須在其中重播音訊才能弄清楚誰說了什麼。對於超過幾分鐘且有兩個或更多聲音的任何事情,這都是真正的手動工作,並且是說話者分離過程消除的工作。
開始之前需要什麼
無需配置任何設定,也無需安裝任何內容。說話者分離在錄音本身上運行,因此唯一真正的先決條件是說話者相當不同的音訊:
- **一個錄音,其中包含每個聲音。**說話者分離在單一檔案中進行,因此所有說話者都必須出現在該檔案中。圓桌會議,每個人共享一個房間麥克風;兩個人各自錄製在自己單獨的設備上,保存為兩個單獨的文件,但事實並非如此。首先將這些組合成一個混音。
- **夠清晰的音訊。**它不需要達到錄音室品質。它需要每個人都能在不費力的情況下聽到聲音,並且串音和背景噪音有限。聲音之間的分離越清晰,標籤就越清晰。
- **大致了解有多少人在說話。**您不必提供此資訊,但了解它可以幫助您對結果進行合理性檢查:如果您記錄了三個人,而逐字稿顯示了六個說話者,您就知道該看哪裡。
就是這樣。無需麥克風註冊,無需語音樣本,無需針對每個說話者進行設定。
自動說話者辨識的工作原理
說話者分離分為幾個不同的階段。了解它們可以使輸出更易於閱讀,並且在出現問題時更容易修復。
**特徵提取。**音訊被分成短幀,通常每幀 10 到 40 毫秒,引擎會測量每一幀中的聲學特徵。區分說話者的重要特徵存在於頻域中:音調、共振峰值和頻譜模式,這些特徵往往在一個人的聲音中保持一致,但在不同人之間有所不同。
**分割。**引擎會尋找說話者變化點:這些語音特徵改變的時刻。這是最難的部分。當有人打斷時,更改可能會發生在句子中間,而噪音或重疊的語音可能會隱藏真正的邊界或創造一個錯誤的邊界。
分群。 聽起來像同一個人的片段會被歸在一起。系統事先不知道房間裡有多少人,而是從音訊推算說話者人數。如果您已知人數,有些設定可讓您提供這個數字;否則系統會自行估算,而「把一個人拆成兩個」或「把兩個人合成一個」的錯誤通常就發生在這一步。
標記。 每個群集都會獲得一個標籤,例如 說話者 A、說話者 B、說話者 C,或 說話者 0、說話者 1。這些標籤只是任意的預留名稱,不代表真實身分;它們只是用來在整段錄音中穩定指向同一個聲音。
整個管道作為自動傳遞與轉錄一起運行,因此您無需運行單獨的說話人標記作業。
說話者分離與語音辨識
這兩者經常被混為一談,但它們回答了不同的問題。
說話者分離回答的是:相較於這個檔案中的其他聲音,此刻是誰在說話? 它能區分不同聲音,卻不知道聲音屬於誰。它不需要預先掌握任何資訊,工作完成後也不會保留任何聲紋記錄。
語音辨識(也稱為說話者識別)回答的是:這個人是否與已知參考錄音中的人相同? 它需要已登錄的語音樣本作為比對基準,也是「透過聲音驗證身分」系統背後的技術。
Hushscript 使用說話者分離,不是語音辨識。沒有登記聲音的資料庫,而且您的錄音永遠不會與其他人的錄音進行比較。說話者標籤純粹源自於該檔案內的語音特徵。
這個差異正是說話者分離無法替您說出姓名的原因。它可以有把握地指出『同一個人在這一小時內說了 200 段話』,但無法判斷那個人究竟是誰。這一步需要由您完成,而且每位說話者只要按一下即可。若想進一步了解 Hushscript 如何從頭到尾處理多人錄音,請參閱說話者識別頁面。
一個有效的範例:三人會議
假設您在一個房間中錄製了一個 40 分鐘的專案會議,其中三個人共用一個筆記型電腦麥克風,並儲存為單一麥克風.m4a檔案。您將其放入,轉錄後的輸出如下所示:
說話者 A [00:00:04]:好的,讓我們從發布日期開始。我們在哪裡?
說話者B[00:00:09]:設計完成了。我們在周一交付了最終螢幕。
說話者 C [00:00:14]:工程還需要大約兩週的付款流程。
說話者 A [00:00:21]:兩週後,我們就超越了我們承諾的行銷日期。
說話者 B [00:00:27]:可以我們在沒有新的付款流程的情況下發貨並跟進?
說話者C [00:00:33]:不乾淨。舊流程在新定價上中斷。
三種聲音,分開並標記,每個回合都有時間戳。現在您重新標記:說話者 A變成“Priya”(她主持會議),說話者 B變為“湯姆”,說話者 C變為“Dana”。點擊三下後,每一行都帶有真實姓名,記錄可以貼上到會議記錄中,並且始終具有正確的歸屬。
同樣的形狀適用於兩人訪談、四人播客或雙方電話:引擎將聽到的內容分開,然後你將名字加上。
如何在 Hushscript 中重新標記說話者
標籤是故意通用的;命名它們是一個快速的編輯步驟。到達那裡之前的流程是:拖入檔案,無需帳戶即可呈現 30 秒的帶有說話者標籤的預覽渲染,註冊以轉錄其餘部分,然後打開完成的轉錄。從那裡開始:
- 點擊腳本編輯器中的任意說話者標籤,例如
說話者 B。 - 輸入真實姓名,例如「Tom」。
- 該說話者的每個實例都會立即更新,從第一行到最後一行。
重新命名是全域性的,因此您永遠不會兩次編輯相同標籤。對於兩位說話者的 90 分鐘採訪,完整的重新標記過程只需不到一分鐘,您最終會得到一份可引用的逐字稿,其中每一行都正確歸屬。然後,您可以使用 21 種格式(例如 TXT、SRT、DOCX、PDF 和 JSON)中的任何一種格式匯出它,其中包含烘焙名稱,以及受密碼保護的 .husharchive。
排查常見的說話者分離問題
說話者分離在乾淨的錄音上是可靠的,但隨著音訊變得更加混亂,說話者分離會變得更加困難。常見問題以及解決方法:
**重疊語音。**當兩個人同時說話時,引擎必須將重疊音訊分配給單一說話者,並且可能會錯誤標記交叉或丟棄一些單字。軟體無法修復;音訊確實在同一時刻包含兩個聲音。預防是槓桿:人們輪流進行的記錄比充滿幹擾的記錄乾淨得多。在確實發生重疊的地方,快速閱讀音訊可以捕捉到一些受影響的台詞。
**聲音相似。**兩個音調和口音接近的說話者(例如,兩個年齡相仿的男人或兄弟姐妹)比一對對比者更難區分,因為他們的聲音特徵確實重疊。引擎有時可能會在它們之間交換轉向。掃描逐字稿,找出對於指定的說話者來說讀起來奇怪的行;這些是手動重新分配的。
**一個人分成兩個標籤。**如果某人的音訊在錄製過程中發生變化(他們靠近麥克風,從耳機切換到擴音模式,或連線品質變差),引擎可以把後半段判定為新的聲音並建立一個額外的標籤。將兩個標籤改成相同名稱即可合併,重複的標籤會歸為同一位說話者。
**兩個人合併為一個標籤。**當兩個安靜或遙遠的聲音聽起來太相似以至於引擎無法分開時,就會發生相反的情況。這種情況事後很難修復,因此值得預防:讓麥克風靠近說話者,並避免在大房間內錄音。
**遠場或吵雜的音訊。**會議桌末端的筆記型電腦麥克風、群組聊天期間放在桌上的電話或沉重的房間迴聲都會模糊聲音之間的界線。麥克風放置得更近對每個說話者都有幫助,減少背景噪音(風扇、交通、音樂)可以增強分離度。說話者分離品質密切追蹤音訊品質。
**將通話記錄為兩份單獨的檔案。**如果您的錄音機將通話的每一方保存為自己的單聲道文件,則單獨對任一文件進行說話者分離只會看到一個語音。首先將兩者合併為一個混合錄音,這樣兩個聲音都會出現在一個檔案中,然後將其轉錄。
實際行動的準確性提示
一些習慣可以使說話者分離明顯更好,其中大多數與錄音有關,而不是軟體:
- **讓人們輪流。**串擾是說話者分離錯誤的最大單一來源。經過主持的討論勝過自由混戰。
- **將麥克風拉近。**距離和房間迴聲使聲音模糊在一起。每人擁有近距離麥克風是理想的選擇;桌子中間的共用麥克風勝過角落的麥克風。
- **消除明顯的背景噪音。**音樂、跑步的粉絲或繁忙的咖啡館都會與聲音競爭,使界線變得模糊。
- **將每個聲音放入您轉錄的檔案中。**說話者分離會比較一個錄音中的說話者。如果錄音機產生單獨的參與者曲目,請先將它們混合或合併到一個檔案中,以便說話者分離過程可以聽到整個對話。
這一切都不需要完美。清晰的轉向和合理的麥克風位置可以讓大部分錄音清晰地貼在標籤上,剩下的由剪輯師處理。
為什麼這對訪談和會議很重要
如果不進行說話者分離,多人對話的記錄幾乎無法用於最常見的工作:
- **直接引用。**不知道哪幾行是他們的。
- **摘要歸屬。**會議摘要沒有說明誰說了什麼,只是比沒有摘要更有用。
- **依說話者搜尋。**如果您正在尋找某個人所說的內容,則無法過濾單一無差異的文字區塊。
透過說話者分離,每一個都變得簡單,並且記錄變成文件而不是原始文字。對於將要發表或引用的任何內容,無論是新聞、研究還是播客節目筆記,準確的歸屬都不是可選的,從記錄中獲取而不是從音訊中重建它可以節省時間。對於會議記錄、訪談研究或人力資源記錄等內部工作,標籤的結構同樣有價值:掃描對話比閱讀一整面文字快得多。
有關上下文的完整演練,請參閱如何轉錄訪談,其中涵蓋了新聞和研究的錄音、轉錄和重新標記,以及如何轉錄訪談播客,用於標記一集中的主持人和嘉賓。
每份 Hushscript 逐字稿中的說話者標籤都是免費的
每份 Hushscript 逐字稿中都包含說話者分離,無需額外付費。沒有說話者分離附加功能,沒有單獨的計劃層,並且錄音可以有多少說話者沒有上限。 Hushscript 本身是隨選付費的,無需訂閱。有 30 分鐘免費試用時間,您只需為之後使用的分鐘數付費;有關詳細資訊,請參閱定價頁面。
說話者分離是免費的,因為沒有說話者分離的對話記錄只是半個記錄:可讀的文字,不知道是誰說的。放入錄音,自動取得標籤,點擊即可重新命名,然後匯出結果。有關如何將其組合在一起的更多資訊,請參閱音訊到文字頁面。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: