跳至主要內容

如何將 MP3 轉成文字(免費・含說話者標籤)

作者: 發布: 最後審閱:

將 MP3 轉換為文字是最常見的轉錄工作之一,並且步驟不會隨來源而改變:播客節目、錄製的訪談、講座或手機上的語音備忘錄都經過相同的流程。上傳文件,等待轉錄,以您需要的格式匯出。

改變的是 MP3 本身如何影響結果。大多數指南都會跳過它。 MP3 是一種有損壓縮文件,其保存的位元率設定了語音引擎必須處理的細節數量的上限。本指南介紹了這三個步驟,然後進行了更深入的介紹:帶有真實說話者標記輸出的實例、位元率對準確性的實際含義以及如何修復粗糙的錄音。

您需要什麼

無需安裝任何內容;沒有桌面應用程序,沒有瀏覽器擴充功能。一切都在瀏覽器和帳戶中運行。

除了免費分鐘數之外,轉錄是按需付費的:您僅在需要時購買分鐘數,無需訂閱。費用位於定價頁面

三步驟即可將 MP3 轉換為文字

  1. **上傳檔案。**開啟 /audio-to-text,然後將 MP3 拖曳到放置區或按一下瀏覽。接受最長 10 小時的文件,沒有文件大小限制。登入前,前 30 秒會在瀏覽器中預覽,以便您可以在提交之前看到說話者標記的樣式。
  2. **讓它進行轉錄。**登入並上傳檔案後,語音引擎會對其進行處理並傳回已分離說話者的轉錄內容。處理時間各不相同,並且作業在背景運行,因此您不必保持選項卡開啟。
  3. **匯出。**以 21 種格式中的任一種下載結果。其中涵蓋純 TXT、帶有時間戳記的 SRT、Word DOCX、PDF 以及字幕和編輯器時間軸格式,以及受密碼保護的 .husharchive。每種格式都包含在內,匯出時沒有付費牆,且任何格式都沒有浮水印。

完成的逐字稿將在您的儀表板中開啟。說話者顯示為說話者 A說話者 B等,您可以按一下任何標籤將其重命名為真實姓名,這會更新說話者的每一行內容。

一個有效範例:兩人訪談

假設您有founder-interview.mp3:一段 42 分鐘的錄音,128 kbps,一名訪談者和一位客人,透過電話錄音。上傳後,逐字稿會按說話者輪流分段返回,每個部分都有時間戳:

[00:00:04] 說話者答:感謝您抽出時間。讓我們從頭開始-
           這個想法實際上是從哪裡來的?
[00:00:11] 說話者 B:老實說,它源自於我們自己的一個問題。我們
           淹沒在錄音通話中,沒有一個是可搜尋的。
[00:00:23] 說話者 A:所以你建構了你需要的東西。
[00:00:25] 說話者 B:差不多了。第一個版本是用膠帶固定在一起的。

從那裡開始編輯就很輕鬆了。您將說話者 A重新命名為採訪者,將說話者 B重新命名為來賓一次,並且每行都會更新。您瀏覽引擎猜測的少數專有名詞,例如產品名稱或人的姓氏,然後使用尋找和替換來修復它們,這會一次性修正每個實例。對於像這樣乾淨的 128 kbps 採訪,略讀通常是在轉錄文字被引用之前所需的所有清理工作。

這就是免費標記說話者的轉錄贏得一席之地的地方。除非你回顧並標記誰說了什麼,否則一堵來自採訪的完整大段文字幾乎毫無用處;到達時已經分成幾輪的逐字稿可以立即引用。

位元率對準確度意味著什麼

MP3 是有損格式:編碼會丟棄被認為最難聽的音訊部分,以保持檔案較小。位元率是編碼器每秒花費多少千位元。越低,丟棄的越多。 MDN 目前的 MP3 編解碼器參考記錄了此格式支援的位元率和取樣率,並將其壓縮標識為有損壓縮。

語音辨識很大程度上依賴輔音的高頻細節。 “十五”和“十六”,或“可以”和“不能”之間的區別就在那裡。積極的壓縮正是細節優先的地方。因此,比特率不會均勻地降低逐字稿的品質;它會吃掉語音邊緣最難聽的單字。

實際上:

一些說明可以節省不必要的重新編碼。**可變位元率(VBR)就可以了;與語音的恆定位元率 (CBR)**相比,它沒有準確性損失,因此不要只是為了「修復」它而轉換 VBR 檔案。對於轉錄來說,單聲道和立體聲一樣有效,因為語音不需要兩個通道。如果有的話,請參閱下面有關立體聲雙端的註釋。

MP3 與無損:何時重新錄製

一個自然的問題是,首先將 MP3 轉換為無損格式(如 WAV)是否會有幫助。不會的。一旦音訊被儲存為 128 kbps MP3,遺失的細節就消失了;將相同的音訊包裝在 WAV 容器中只會產生一個更大的文件,且不包含任何額外資訊。如果您是新鮮錄製並且有選擇,無損或高位元率來源是更好的起點(請參閱WAV 到文字指南以了解這種情況),但向上轉換現有 MP3 沒有任何意義。

誠實的決策規則:如果您唯一的副本是合理位元率的 MP3,請按原樣轉錄。如果錄音確實很糟糕(被剪輯、被噪音淹沒或以 32 kbps 保存),並且您可以再次擷取它,那麼重新錄音比任何轉換都更有幫助。當您進行新錄音時,有兩個習慣比比特率更重要:讓麥克風靠近說話的人,如果可以的話,為每個人提供自己的麥克風,因為從源頭乾淨分離才能使單字和說話者標籤都正確顯示。

解決常見問題

大多數粗略的記錄都可以追溯到錄音,而不是工具。以下是如何處理常見的罪魁禍首。

**低音量。**如果波形看起來平坦(非常安靜的錄音),引擎需要處理的訊號較少,並且精確度會下降。首先在任何音訊編輯器中標準化或放大音訊,然後上傳聲音更大的版本。增強音量是針對弱錄音的最高回報修復方法之一。

**背景噪音。**穩定的噪音(空調、道路嗡嗡聲)處理得相當好;與語音重疊的突然噪音(如門聲、咳嗽聲或餐具聲)會導致漏話。如果您可以在上傳之前執行輕微的降噪處理,請執行此操作,但不要過度處理:重度降噪會引入比雜訊更嚴重損害準確性的偽影。

**重口音或專業詞彙。**現代引擎可以很好地處理各種英語口音。可靠的遺漏是引擎沒有理由預期的領域術語,例如藥品名稱、法律引用或利基品牌名稱。計劃在匯出後進行一次瀏覽以擷取這些內容,並依靠查找和替換:如果公司名稱每次都以相同的方式出現錯誤,則一次更正將掃描整個文件。

**非常長的 MP3。**6 小時的錄音本身沒有問題。 10 小時的上限幾乎涵蓋了所有內容,並且沒有文件大小限制,因此無需先將長文件切成碎片。真正降低長文件品質的是整個錄音品質的漂移:說話者偏離麥克風,音量在第一個小時後下降,場地擁擠且變得更加嘈雜。盡可能保持來源穩定;如果你做不到,則預期較粗糙的部分比乾淨的部分需要更多的編輯。時間戳使管理變得容易:您可以直接跳到讀得不好的補丁,而不是重新聽整個內容。

**重疊的說話者。**當兩個人同時說話時,引擎會將單字分配給較大的聲音,這是說話者分離的限制,而不是任何一種工具的限制。沒有上傳端修復;熱鬧的集體錄音的串音部分的預算編輯時間。

保持說話者清晰分離

說話者分離(說話者分離)在每個轉錄中運行,無需額外費用,MP3 級別的一些因素會影響其結果的乾淨程度。如果您想了解其內部工作原理的詳細資訊,請參閱什麼是說話者分離;這裡的實用要點是:

匯出您的逐字稿

正確的格式取決於您對文字的處理方式。下表列出了提供的 21 種格式中人們最常使用的格式;有關完整的權衡,請參閱您實際需要哪種轉錄格式

格式 最適合
TXT 註釋、複製貼上、將文字輸入另一個工具
SRT 影片上的字幕,或按時間戳導航;如果您的來源是MP4 等文件,也是正確選擇的
VTT 網路字幕和瀏覽器原生視訊播放器
CSV 電子表格審核和輕量級資料移交
Markdown 發布註解、README 樣式檔案和可編輯草稿
JSON 程式設計處理和自訂工具
DOCX 與 Word 中的編輯或註釋者共享
PDF 只讀共享和存檔

每次匯出都包含說話者標籤和時間戳,其中任何一個都沒有浮水印。

時間戳與編輯

編輯器顯示每個話語及其開始時間、說話者標籤和文字。按一下任一行可依文字播放該音訊片段。這對於檢查棘手的段落非常方便,而無需手動擦除整個文件。

SRT 匯出中的時間戳位於話語層級:每個說話者回合一個條目,而不是每個單字。對於帶有時間戳的字幕、導航和引用來說,這是正確的粒度。如果您需要在程式碼中處理字級結構,請匯出 JSON:每個條目都會為您提供說話者標籤、開始和結束時間(以毫秒為單位)以及該回合的文字。


上傳、轉錄、匯出:這就是整個工作,具體到 MP3 的詳細資訊決定結果的乾淨程度。 MP3-to-text 頁面具有完整的功能概述,如果您在另一個容器中處理錄音,音訊-to-text 頁面會以相同的方式涵蓋每種格式。做一整場表演? 播客轉錄指南逐步將轉錄內容轉換為節目註釋,如果您的檔案是 WAV 而不是 MP3,則WAV 到文字指南包含處理大型無損檔案的註釋。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

我可以上傳的最大 MP3 檔案大小是多少?

每個檔案最多 10 小時,沒有檔案大小限制。每個文件都從您的預付分鐘中提取;服務安全和主動工作保障也適用。

MP3 位元率會影響轉錄準確性嗎?

低於約 64 kbps 會影響轉錄準確性。非常低位元率的壓縮會模糊語音辨識所依賴的輔音,因此語音邊緣的單字會遺失。在 128 kbps 或以上,您已經過了位元率的關鍵點,更高的位元率並不會使轉錄效果更好。

我可以從純音訊 MP3 中取得 SRT 字幕檔嗎?

可以。 Hushscript 從任何來源匯出 SRT、TXT、DOCX 和 JSON。即使輸入是沒有附加影片的音訊,SRT 也會帶有每個話語的時間戳,因此您可以稍後將其直接放入影片中。

我需要信用卡才能啟動嗎?

不需要。刷卡是獲得 30 分鐘免費時間的最快途徑。持有 1 美元即可驗證它,然後立即釋放,並且永遠不會收取費用。如果您想使用您所在國家/地區可用的其他付款方式,您的 30 分鐘將隨第一分鐘套餐一起到達。

轉錄後我的 MP3 會怎麼樣?

轉錄完成後,它會從伺服器中刪除。不保留任何內容用於儲存或模型訓練。您也可以一鍵從儀表板中刪除逐字稿本身。

MP3 上的說話者分離有多準確?

當人們輪流且錄音相當乾淨時,說話者標籤最可靠。兩人面試通常會乾淨利落地分開;人們互相交談的嘈雜群組通話之後需要更多的手動編輯。

可變位元率 (VBR) MP3 可以工作嗎?

可以。 VBR 沒問題。與語音的恆定位元率 (CBR) 相比,它沒有準確性劣勢。單聲道和立體聲都可以使用;上傳前無需重新編碼。

它可以轉錄非英語的 MP3 嗎?

可以。自動偵測大約 99 種語言。乾淨的單一語言錄音轉錄效果最好;對於任何引擎來說,句子中間的大量代碼轉換都比較困難。

從 30 分鐘免費額度開始

開始––30 分鐘免費