跳至主要內容

說話者分離:說話者標籤如何運作

作者: 發布: 最後審閱:

說話者分離是按說話者將錄音分成片段的自動過程,回答「誰在何時發言?」在任何人閱讀逐字稿之前。目前 ACL 選集中的說話者分離研究描述了多方對話的相同任務。這就是大段文字和結構化對話之間的區別,也是兩人訪談的筆錄返回為可讀對話而不是一長段的原因。

簡單來說:您上傳一段錄音,說話者分離引擎會找到聲音變化的點,對聽起來像同一個人的片段進行分組,然後返回一份讀起來像腳本的逐字稿:每輪一行,用聲音標記。這篇文章解釋了它的工作原理、為什麼說話者分離與識別聲音不同,以及如何將通用標籤變成真實姓名。

說話者分離,以淺白方式

手寫 90 分鐘訪談的圖片。將語音轉換為文字後,您要做的下一件事是在每次聲音發生變化時添加屬性:“訪談者:”、“主題:”,來回添加。歸因工作,決定誰在任何給定的時刻說話,正是說話者分離為您所做的。

輸出是對話格式的記錄:

說話者 A [00:00:12]:首先要明白的是,資料只存在一會兒。
說話者 B [00:00:27]:對,大多數人都沒有意識到這一點,直到為時已晚。
說話者A [00:00:34]:沒錯。因此,真正的問題是您在該視窗中執行的操作。

每個話語都與說話者和時間戳相關聯。然後您可以將說話者 A說話者 B重命名為真名;每個說話者進行一次編輯,並且標籤會在出現的所有地方更新。

另一個選擇是沒有說話者分離的普通逐字稿,是一個連續的文字區塊,您必須在其中重播音訊才能弄清楚誰說了什麼。對於超過幾分鐘且有兩個或更多聲音的任何事情,這都是真正的手動工作,並且是說話者分離過程消除的工作。

開始之前需要什麼

無需配置任何設定,也無需安裝任何內容。說話者分離在錄音本身上運行,因此唯一真正的先決條件是說話者相當不同的音訊:

就是這樣。無需麥克風註冊,無需語音樣本,無需針對每個說話者進行設定。

自動說話者辨識的工作原理

說話者分離分為幾個不同的階段。了解它們可以使輸出更易於閱讀,並且在出現問題時更容易修復。

**特徵提取。**音訊被分成短幀,通常每幀 10 到 40 毫秒,引擎會測量每一幀中的聲學特徵。區分說話者的重要特徵存在於頻域中:音調、共振峰值和頻譜模式,這些特徵往往在一個人的聲音中保持一致,但在不同人之間有所不同。

**分割。**引擎會尋找說話者變化點:這些語音特徵改變的時刻。這是最難的部分。當有人打斷時,更改可能會發生在句子中間,而噪音或重疊的語音可能會隱藏真正的邊界或創造一個錯誤的邊界。

分群。 聽起來像同一個人的片段會被歸在一起。系統事先不知道房間裡有多少人,而是從音訊推算說話者人數。如果您已知人數,有些設定可讓您提供這個數字;否則系統會自行估算,而「把一個人拆成兩個」或「把兩個人合成一個」的錯誤通常就發生在這一步。

標記。 每個群集都會獲得一個標籤,例如 說話者 A說話者 B說話者 C,或 說話者 0說話者 1。這些標籤只是任意的預留名稱,不代表真實身分;它們只是用來在整段錄音中穩定指向同一個聲音。

整個管道作為自動傳遞與轉錄一起運行,因此您無需運行單獨的說話人標記作業。

說話者分離與語音辨識

這兩者經常被混為一談,但它們回答了不同的問題。

說話者分離回答的是:相較於這個檔案中的其他聲音,此刻是誰在說話? 它能區分不同聲音,卻不知道聲音屬於誰。它不需要預先掌握任何資訊,工作完成後也不會保留任何聲紋記錄。

語音辨識(也稱為說話者識別)回答的是:這個人是否與已知參考錄音中的人相同? 它需要已登錄的語音樣本作為比對基準,也是「透過聲音驗證身分」系統背後的技術。

Hushscript 使用說話者分離,不是語音辨識。沒有登記聲音的資料庫,而且您的錄音永遠不會與其他人的錄音進行比較。說話者標籤純粹源自於該檔案內的語音特徵。

這個差異正是說話者分離無法替您說出姓名的原因。它可以有把握地指出『同一個人在這一小時內說了 200 段話』,但無法判斷那個人究竟是。這一步需要由您完成,而且每位說話者只要按一下即可。若想進一步了解 Hushscript 如何從頭到尾處理多人錄音,請參閱說話者識別頁面

一個有效的範例:三人會議

假設您在一個房間中錄製了一個 40 分鐘的專案會議,其中三個人共用一個筆記型電腦麥克風,並儲存為單一麥克風.m4a檔案。您將其放入,轉錄後的輸出如下所示:

說話者 A [00:00:04]:好的,讓我們從發布日期開始。我們在哪裡?
說話者B[00:00:09]:設計完成了。我們在周一交付了最終螢幕。
說話者 C [00:00:14]:工程還需要大約兩週的付款流程。
說話者 A [00:00:21]:兩週後,我們就超越了我們承諾的行銷日期。
說話者 B [00:00:27]:可以我們在沒有新的付款流程的情況下發貨並跟進?
說話者C [00:00:33]:不乾淨。舊流程在新定價上中斷。

三種聲音,分開並標記,每個回合都有時間戳。現在您重新標記:說話者 A變成“Priya”(她主持會議),說話者 B變為“湯姆”,說話者 C變為“Dana”。點擊三下後,每一行都帶有真實姓名,記錄可以貼上到會議記錄中,並且始終具有正確的歸屬。

同樣的形狀適用於兩人訪談、四人播客或雙方電話:引擎將聽到的內容分開,然後你將名字加上。

如何在 Hushscript 中重新標記說話者

標籤是故意通用的;命名它們是一個快速的編輯步驟。到達那裡之前的流程是:拖入檔案,無需帳戶即可呈現 30 秒的帶有說話者標籤的預覽渲染,註冊以轉錄其餘部分,然後打開完成的轉錄。從那裡開始:

  1. 點擊腳本編輯器中的任意說話者標籤,例如說話者 B
  2. 輸入真實姓名,例如「Tom」。
  3. 該說話者的每個實例都會立即更新,從第一行到最後一行。

重新命名是全域性的,因此您永遠不會兩次編輯相同標籤。對於兩位說話者的 90 分鐘採訪,完整的重新標記過程只需不到一分鐘,您最終會得到一份可引用的逐字稿,其中每一行都正確歸屬。然後,您可以使用 21 種格式(例如 TXT、SRT、DOCX、PDF 和 JSON)中的任何一種格式匯出它,其中包含烘焙名稱,以及受密碼保護的 .husharchive。

排查常見的說話者分離問題

說話者分離在乾淨的錄音上是可靠的,但隨著音訊變得更加混亂,說話者分離會變得更加困難。常見問題以及解決方法:

**重疊語音。**當兩個人同時說話時,引擎必須將重疊音訊分配給單一說話者,並且可能會錯誤標記交叉或丟棄一些單字。軟體無法修復;音訊確實在同一時刻包含兩個聲音。預防是槓桿:人們輪流進行的記錄比充滿幹擾的記錄乾淨得多。在確實發生重疊的地方,快速閱讀音訊可以捕捉到一些受影響的台詞。

**聲音相似。**兩個音調和口音接近的說話者(例如,兩個年齡相仿的男人或兄弟姐妹)比一對對比者更難區分,因為他們的聲音特徵確實重疊。引擎有時可能會在它們之間交換轉向。掃描逐字稿,找出對於指定的說話者來說讀起來奇怪的行;這些是手動重新分配的。

**一個人分成兩個標籤。**如果某人的音訊在錄製過程中發生變化(他們靠近麥克風,從耳機切換到擴音模式,或連線品質變差),引擎可以把後半段判定為新的聲音並建立一個額外的標籤。將兩個標籤改成相同名稱即可合併,重複的標籤會歸為同一位說話者。

**兩個人合併為一個標籤。**當兩個安靜或遙遠的聲音聽起來太相似以至於引擎無法分開時,就會發生相反的情況。這種情況事後很難修復,因此值得預防:讓麥克風靠近說話者,並避免在大房間內錄音。

**遠場或吵雜的音訊。**會議桌末端的筆記型電腦麥克風、群組聊天期間放在桌上的電話或沉重的房間迴聲都會模糊聲音之間的界線。麥克風放置得更近對每個說話者都有幫助,減少背景噪音(風扇、交通、音樂)可以增強分離度。說話者分離品質密切追蹤音訊品質。

**將通話記錄為兩份單獨的檔案。**如果您的錄音機將通話的每一方保存為自己的單聲道文件,則單獨對任一文件進行說話者分離只會看到一個語音。首先將兩者合併為一個混合錄音,這樣兩個聲音都會出現在一個檔案中,然後將其轉錄。

實際行動的準確性提示

一些習慣可以使說話者分離明顯更好,其中大多數與錄音有關,而不是軟體:

這一切都不需要完美。清晰的轉向和合理的麥克風位置可以讓大部分錄音清晰地貼在標籤上,剩下的由剪輯師處理。

為什麼這對訪談和會議很重要

如果不進行說話者分離,多人對話的記錄幾乎無法用於最常見的工作:

透過說話者分離,每一個都變得簡單,並且記錄變成文件而不是原始文字。對於將要發表或引用的任何內容,無論是新聞、研究還是播客節目筆記,準確的歸屬都不是可選的,從記錄中獲取而不是從音訊中重建它可以節省時間。對於會議記錄、訪談研究或人力資源記錄等內部工作,標籤的結構同樣有價值:掃描對話比閱讀一整面文字快得多。

有關上下文的完整演練,請參閱如何轉錄訪談,其中涵蓋了新聞和研究的錄音、轉錄和重新標記,以及如何轉錄訪談播客,用於標記一集中的主持人和嘉賓。

每份 Hushscript 逐字稿中的說話者標籤都是免費的

每份 Hushscript 逐字稿中都包含說話者分離,無需額外付費。沒有說話者分離附加功能,沒有單獨的計劃層,並且錄音可以有多少說話者沒有上限。 Hushscript 本身是隨選付費的,無需訂閱。有 30 分鐘免費試用時間,您只需為之後使用的分鐘數付費;有關詳細資訊,請參閱定價頁面

說話者分離是免費的,因為沒有說話者分離的對話記錄只是半個記錄:可讀的文字,不知道是誰說的。放入錄音,自動取得標籤,點擊即可重新命名,然後匯出結果。有關如何將其組合在一起的更多資訊,請參閱音訊到文字頁面。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

什麼是說話者分離?

說話者分離是將音訊錄音分割成與不同說話者相對應的部分的過程。結果是一份記錄,其中每一行都歸屬於說這句話的說話者(「說話者 A 說這個,說話者 B 說那個」),而不是一個無差別的文字塊。它回答了「誰在何時發言?」的問題。在任何人閱讀逐字稿之前自動進行。

說話者分離與語音辨識相同嗎?

不。說話者分離會一段錄音中的聲音分開,並告訴您同一個人說了這些片段,但它不知道那個人是誰。語音辨識(說話者辨識)將語音與已知的參考樣本進行比較,並為其命名。說話者分離不需要參考,也不需要建立語音檔案;這就是為什麼它會將說話者標記為“說話者 A”和“說話者 B”,而不是按姓名。

說話者分離可以處理多少個說話者?

Hushscript 對說話者數量沒有付費上限,但沒有一個通用數字可以讓說話者分離保持同樣準確。重疊、聽起來相似的聲音、麥克風距離和房間噪音都很重要。乾淨的面板可以比嘈雜的兩人通話更好地分開,因此只要歸屬很重要,請檢查標籤。

為什麼轉錄要將一個人分成兩個說話者?

通常該人的聲音在中途會發生很大的變化:他們靠近或遠離麥克風,從耳機切換到擴音模式,或者線路品質發生了變化。引擎會依照聲音特徵進行分組,因此這些特徵的較大變化可能被判定為新的聲音。在編輯器中合併兩個標籤即可一次修復此問題。

說話者分離可以告訴我誰是說話者的名字嗎?

不能。說話者分離可以區分說話者,但不會透過名稱來識別他們。它給他們貼上「說話者 A」、「說話者 B」等標籤。產生逐字稿後,您可以在編輯器中自行指派真實姓名,每次重新命名都會套用至說話者所說的每一行。

說話者分離是否適用於電話錄音?

可以,當通話雙方都被擷取時。如果錄音是包含兩個聲音的單一混合音軌,則說話者分離會像任何其他雙說話者檔案一樣將它們分開。如果每一方都儲存為自己單獨的單聲道文件,請先將它們組合成一個混音,以便兩個聲音都出現在同一錄音中。

每個 Hushscript 轉錄中是否包含說話者分離?

是的。每個逐字稿都包含說話者標籤,無需額外費用,無需單獨的附加組件,也不需要更高的等級。轉錄後,您可以一鍵將標籤重新命名為真實姓名,新名稱會在整個轉錄中更新。

從 30 分鐘免費額度開始

開始––30 分鐘免費