如何將 MP3 轉成文字(免費・含說話者標籤)
作者: Hushscript 發布: 最後審閱:
將 MP3 轉換為文字是最常見的轉錄工作之一,並且步驟不會隨來源而改變:播客節目、錄製的訪談、講座或手機上的語音備忘錄都經過相同的流程。上傳文件,等待轉錄,以您需要的格式匯出。
改變的是 MP3 本身如何影響結果。大多數指南都會跳過它。 MP3 是一種有損壓縮文件,其保存的位元率設定了語音引擎必須處理的細節數量的上限。本指南介紹了這三個步驟,然後進行了更深入的介紹:帶有真實說話者標記輸出的實例、位元率對準確性的實際含義以及如何修復粗糙的錄音。
您需要什麼
- **MP3 檔案。**將載入任何位元率。就準確性而言,64 kbps 是實際下限,而 128 kbps 則輕鬆超過了數字重要的點(更多內容見下文)。
- **Hushscript 帳號。**您有 30 分鐘的免費試用時間。解鎖它們的最快方法是添加一張卡:持有 1 美元即可驗證該卡,然後立即釋放且無需付費。如果您不想使用銀行卡,也可以選擇其他付款方式,第一次購買後 30 分鐘即可完成。無論哪種方式都不需要卡片。
無需安裝任何內容;沒有桌面應用程序,沒有瀏覽器擴充功能。一切都在瀏覽器和帳戶中運行。
除了免費分鐘數之外,轉錄是按需付費的:您僅在需要時購買分鐘數,無需訂閱。費用位於定價頁面。
三步驟即可將 MP3 轉換為文字
- **上傳檔案。**開啟 /audio-to-text,然後將 MP3 拖曳到放置區或按一下瀏覽。接受最長 10 小時的文件,沒有文件大小限制。登入前,前 30 秒會在瀏覽器中預覽,以便您可以在提交之前看到說話者標記的樣式。
- **讓它進行轉錄。**登入並上傳檔案後,語音引擎會對其進行處理並傳回已分離說話者的轉錄內容。處理時間各不相同,並且作業在背景運行,因此您不必保持選項卡開啟。
- **匯出。**以 21 種格式中的任一種下載結果。其中涵蓋純 TXT、帶有時間戳記的 SRT、Word DOCX、PDF 以及字幕和編輯器時間軸格式,以及受密碼保護的 .husharchive。每種格式都包含在內,匯出時沒有付費牆,且任何格式都沒有浮水印。
完成的逐字稿將在您的儀表板中開啟。說話者顯示為說話者 A、說話者 B等,您可以按一下任何標籤將其重命名為真實姓名,這會更新說話者的每一行內容。
一個有效範例:兩人訪談
假設您有founder-interview.mp3:一段 42 分鐘的錄音,128 kbps,一名訪談者和一位客人,透過電話錄音。上傳後,逐字稿會按說話者輪流分段返回,每個部分都有時間戳:
[00:00:04] 說話者答:感謝您抽出時間。讓我們從頭開始-
這個想法實際上是從哪裡來的?
[00:00:11] 說話者 B:老實說,它源自於我們自己的一個問題。我們
淹沒在錄音通話中,沒有一個是可搜尋的。
[00:00:23] 說話者 A:所以你建構了你需要的東西。
[00:00:25] 說話者 B:差不多了。第一個版本是用膠帶固定在一起的。
從那裡開始編輯就很輕鬆了。您將說話者 A重新命名為採訪者,將說話者 B重新命名為來賓一次,並且每行都會更新。您瀏覽引擎猜測的少數專有名詞,例如產品名稱或人的姓氏,然後使用尋找和替換來修復它們,這會一次性修正每個實例。對於像這樣乾淨的 128 kbps 採訪,略讀通常是在轉錄文字被引用之前所需的所有清理工作。
這就是免費標記說話者的轉錄贏得一席之地的地方。除非你回顧並標記誰說了什麼,否則一堵來自採訪的完整大段文字幾乎毫無用處;到達時已經分成幾輪的逐字稿可以立即引用。
位元率對準確度意味著什麼
MP3 是有損格式:編碼會丟棄被認為最難聽的音訊部分,以保持檔案較小。位元率是編碼器每秒花費多少千位元。越低,丟棄的越多。 MDN 目前的 MP3 編解碼器參考記錄了此格式支援的位元率和取樣率,並將其壓縮標識為有損壓縮。
語音辨識很大程度上依賴輔音的高頻細節。 “十五”和“十六”,或“可以”和“不能”之間的區別就在那裡。積極的壓縮正是細節優先的地方。因此,比特率不會均勻地降低逐字稿的品質;它會吃掉語音邊緣最難聽的單字。
實際上:
- **32 kbps 以下:**即使對於人耳來說也明顯壓縮,引擎也會以同樣的方式做出反應。單字錯誤不斷攀升。對於您關心轉錄的任何內容,請避免這種情況。
- 64 kbps:可靠語音到文字的現實底線。適合清晰、近距離麥克風的聲音。
- **128 kbps 以上:**足夠舒適地進行轉錄。走得更高不會改善逐字稿。引擎擁有在此之前可以使用的所有詳細資訊。
一些說明可以節省不必要的重新編碼。**可變位元率(VBR)就可以了;與語音的恆定位元率 (CBR)**相比,它沒有準確性損失,因此不要只是為了「修復」它而轉換 VBR 檔案。對於轉錄來說,單聲道和立體聲一樣有效,因為語音不需要兩個通道。如果有的話,請參閱下面有關立體聲雙端的註釋。
MP3 與無損:何時重新錄製
一個自然的問題是,首先將 MP3 轉換為無損格式(如 WAV)是否會有幫助。不會的。一旦音訊被儲存為 128 kbps MP3,遺失的細節就消失了;將相同的音訊包裝在 WAV 容器中只會產生一個更大的文件,且不包含任何額外資訊。如果您是新鮮錄製並且有選擇,無損或高位元率來源是更好的起點(請參閱WAV 到文字指南以了解這種情況),但向上轉換現有 MP3 沒有任何意義。
誠實的決策規則:如果您唯一的副本是合理位元率的 MP3,請按原樣轉錄。如果錄音確實很糟糕(被剪輯、被噪音淹沒或以 32 kbps 保存),並且您可以再次擷取它,那麼重新錄音比任何轉換都更有幫助。當您進行新錄音時,有兩個習慣比比特率更重要:讓麥克風靠近說話的人,如果可以的話,為每個人提供自己的麥克風,因為從源頭乾淨分離才能使單字和說話者標籤都正確顯示。
解決常見問題
大多數粗略的記錄都可以追溯到錄音,而不是工具。以下是如何處理常見的罪魁禍首。
**低音量。**如果波形看起來平坦(非常安靜的錄音),引擎需要處理的訊號較少,並且精確度會下降。首先在任何音訊編輯器中標準化或放大音訊,然後上傳聲音更大的版本。增強音量是針對弱錄音的最高回報修復方法之一。
**背景噪音。**穩定的噪音(空調、道路嗡嗡聲)處理得相當好;與語音重疊的突然噪音(如門聲、咳嗽聲或餐具聲)會導致漏話。如果您可以在上傳之前執行輕微的降噪處理,請執行此操作,但不要過度處理:重度降噪會引入比雜訊更嚴重損害準確性的偽影。
**重口音或專業詞彙。**現代引擎可以很好地處理各種英語口音。可靠的遺漏是引擎沒有理由預期的領域術語,例如藥品名稱、法律引用或利基品牌名稱。計劃在匯出後進行一次瀏覽以擷取這些內容,並依靠查找和替換:如果公司名稱每次都以相同的方式出現錯誤,則一次更正將掃描整個文件。
**非常長的 MP3。**6 小時的錄音本身沒有問題。 10 小時的上限幾乎涵蓋了所有內容,並且沒有文件大小限制,因此無需先將長文件切成碎片。真正降低長文件品質的是整個錄音品質的漂移:說話者偏離麥克風,音量在第一個小時後下降,場地擁擠且變得更加嘈雜。盡可能保持來源穩定;如果你做不到,則預期較粗糙的部分比乾淨的部分需要更多的編輯。時間戳使管理變得容易:您可以直接跳到讀得不好的補丁,而不是重新聽整個內容。
**重疊的說話者。**當兩個人同時說話時,引擎會將單字分配給較大的聲音,這是說話者分離的限制,而不是任何一種工具的限制。沒有上傳端修復;熱鬧的集體錄音的串音部分的預算編輯時間。
保持說話者清晰分離
說話者分離(說話者分離)在每個轉錄中運行,無需額外費用,MP3 級別的一些因素會影響其結果的乾淨程度。如果您想了解其內部工作原理的詳細資訊,請參閱什麼是說話者分離;這裡的實用要點是:
- **雙單聲道立體聲。**一些播客和通話設定將每個說話者錄製在單獨的立體聲通道上。與直覺相反,在上傳之前將其混合到單一單聲道軌道往往會有所幫助:引擎聽到一個混合對話而不是兩個獨立的流。大多數編輯器都會匯出單聲道「混音」。
- **快速來回。**非常短的交流(不到兩秒的回合)偶爾會合併成一個標籤的話語。它很少會影響可讀性,如果特定報價需要,您可以手動分割轉彎。
- **乾淨的轉彎最有幫助。**說話者之間的交接越乾淨(幹擾越少,串擾越少),標籤就越可靠。無需配置任何內容;它純粹是錄音的屬性。
匯出您的逐字稿
正確的格式取決於您對文字的處理方式。下表列出了提供的 21 種格式中人們最常使用的格式;有關完整的權衡,請參閱您實際需要哪種轉錄格式:
| 格式 | 最適合 |
|---|---|
| TXT | 註釋、複製貼上、將文字輸入另一個工具 |
| SRT | 影片上的字幕,或按時間戳導航;如果您的來源是MP4 等文件,也是正確選擇的 |
| VTT | 網路字幕和瀏覽器原生視訊播放器 |
| CSV | 電子表格審核和輕量級資料移交 |
| Markdown | 發布註解、README 樣式檔案和可編輯草稿 |
| JSON | 程式設計處理和自訂工具 |
| DOCX | 與 Word 中的編輯或註釋者共享 |
| 只讀共享和存檔 |
每次匯出都包含說話者標籤和時間戳,其中任何一個都沒有浮水印。
時間戳與編輯
編輯器顯示每個話語及其開始時間、說話者標籤和文字。按一下任一行可依文字播放該音訊片段。這對於檢查棘手的段落非常方便,而無需手動擦除整個文件。
SRT 匯出中的時間戳位於話語層級:每個說話者回合一個條目,而不是每個單字。對於帶有時間戳的字幕、導航和引用來說,這是正確的粒度。如果您需要在程式碼中處理字級結構,請匯出 JSON:每個條目都會為您提供說話者標籤、開始和結束時間(以毫秒為單位)以及該回合的文字。
上傳、轉錄、匯出:這就是整個工作,具體到 MP3 的詳細資訊決定結果的乾淨程度。 MP3-to-text 頁面具有完整的功能概述,如果您在另一個容器中處理錄音,音訊-to-text 頁面會以相同的方式涵蓋每種格式。做一整場表演? 播客轉錄指南逐步將轉錄內容轉換為節目註釋,如果您的檔案是 WAV 而不是 MP3,則WAV 到文字指南包含處理大型無損檔案的註釋。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: