部落格
如何轉錄錄音:方法與步驟
作者: Hushscript 發布: 最後審閱:
錄音只有轉成文字才真正有用。會議、電話、語音備忘、單一來賓的訪談——無論來源是什麼,問題都一樣:您需要能搜尋、能引用,並能交給不在現場的人閱讀的文字。本指南涵蓋一般長度的錄音,從幾分鐘到幾小時不等,從挑選方法一路講到完成匯出。若錄音超過 2 小時,請參閱如何轉錄長錄音;若要一次處理多個檔案,請參閱轉錄一個錄音資料夾。
人工、自動,還是混合
從音訊到文字有三種做法,而大多數人會依錄音的情況,交替使用不只一種。
人工轉錄指的是自己聽並逐字打出每一個字。它讓您擁有完全的控制權,也沒有第三方介入,但速度很慢:仔細聽打一小時清晰的音訊,把播放、重打和校對都算進去,輕易就要花上好幾個小時。它適合短片段、您的自動工具處理不好的語言,或是真的不能讓內容離開您手上的資料。
自動語音辨識能在幾分鐘內完成同樣的工作,而不是幾小時。模型會聆聽波形,預測最可能的文字,並傳回已加上標點與說話者標籤的草稿。這份草稿並不完美,但對大多數日常錄音來說,已經接近到只需輕鬆瀏覽一遍,就能抓出剩下的問題。
混合轉錄是自動草稿加上您自己的審閱。大多數持續進行的轉錄工作最後都會落在這裡:模型處理大部分的打字工作,您負責處理姓名、專業術語,以及任何它聽錯的地方。它的成本只是人工作業的一小部分,而成果又比未經審閱的自動草稿乾淨。
哪一種適合,取決於逐字稿之後要做什麼,而不是錄音的長度。文章要用的引述,無論用哪種方法,都需要對照音訊確認措辭是否精確。給自己看的粗略會議筆記,通常完全不需要審閱。
真正決定準確度的因素
轉錄準確度最大的單一因素是錄音本身,而不是讀取它的軟體。近距離收音、清晰、一次只有一個人說話的音訊,幾乎任何自動系統都能產出乾淨的草稿。在房間對角錄的、透過品質不佳的電話線傳來的,或是三個人同時搶話的錄音,無論用哪個工具讀取,都會產生錯誤。W3C 建立準確逐字稿的指南從無障礙的角度提出了同樣的論點:逐字稿是音訊的替代品,它的準確度必須能夠自成一體,不取決於現場的人覺得原始錄音有多好聽。
在上傳之前,有幾件您能掌控的事,比事後的任何設定都更重要:
- 靠近說話者收音,而不是隔著整個房間。
- 避免用兩支麥克風對著同一段對話收音;這只會讓房間噪音加倍,而不會增加訊號。
- 如果檔案格式讓您選擇,比起較小的檔案,請優先選擇較高的位元率。壓縮造成的雜訊在語音模型聽來,就像雜訊之於人耳一樣。
近期關於自動語音辨識的研究,包括一份2024 年深度學習方法用於 ASR 的調查,追蹤了乾淨音訊上的準確度已經進步到什麼程度,以及它在特定口音、領域或噪音特性上,仍有多依賴訓練資料。沒有任何系統能同等地讀懂每一段錄音,因此在信任重要事項的結果之前,先用您自己的音訊測試一次,仍然是比較安全的習慣。
逐步轉錄一段錄音
- **上傳檔案。**把錄音拖到音訊轉文字頁面。常見的音訊與影片格式都可直接接受;如果是影片,音訊會在任何內容上傳之前先在您的瀏覽器中被提取出來。
- **檢查預覽。**開頭幾分鐘會在您登入之前就轉錄完成,並附上說話者標籤,讓您判斷音訊是否夠乾淨、分離是否合理。
- **登入並讓它運作。**完整檔案會上傳,作業會自動完成;您不需要一直開著分頁等待。
- **重新命名說話者。**像說話者 A 這樣的通用標籤,只要編輯一次就能變成真實姓名,並套用到整份逐字稿。
- **對照音訊確認重要內容。**瀏覽姓名、數字與專業術語,這些正是模型最可能猜錯的地方。
- **匯出。**選擇下一步需要的格式,而不是隨便先載入的那一種。
說話者標籤,當不只一個人在說話時
只要錄音裡有一個以上的聲音,就需要先做說話者分離,逐字稿才真正可讀;一大片沒有說話者分段的文字,用處幾乎不比音訊本身高多少。說話者辨識會依聲音把對話分開,並讓您把通用標籤重新命名一次,這項變更就會套用到該說話者在逐字稿中出現的每一處。當每個人的聲音夠有辨識度、又不會一直打斷彼此時,效果最好;兩個聲音相似又互相搶話的情況,至今仍是所有系統都會出錯的難題,不只是自動系統。
依下一步用途挑選匯出格式
正確的匯出格式取決於文字接下來要用在哪裡,而不是哪一種看起來最完整:
- 純文字,用於貼到其他文件,或餵給摘要工具。
- SRT 或 VTT,如果您在為影片加字幕,需要播放器能讀取的時間戳記。
- DOCX,用於分享給想要留言或編輯的人。
- JSON,如果您要把連同說話者與時間資料一起的逐字稿,匯入您自己的工具流程。
從同一份作業匯出不只一種格式不會多花任何費用,所以沒有必要事先猜哪一種才是唯一正確的格式,您可以直接拿走實際會用到的兩三種。
隱私,如果這段錄音不該被保留
不是每一段錄音都該進永久的封存。一通機密電話、一場敏感的訪談、一份轉錄完就該消失的臨時備忘——這些都需要跟日常工作不一樣的設定。私人轉錄會完全跳過儲存到您帳戶這一步。結果會以受密碼保護的下載檔傳回,若您一直沒有開啟就會過期,而不是無限期留在您的紀錄裡。
對於任何您拿不準的內容,比較安全的預設做法是使用隱私模式。您隨時可以選擇保留下一份逐字稿;但您無法回頭把這一份補救成沒有儲存過。
一般錄音的花費
費用是依音訊的分鐘數計算,與檔案、格式或說話者人數無關。一通 45 分鐘的電話和一段 45 分鐘的語音備忘,轉錄費用是一樣的。以 $5.99 的 5 小時(300 分鐘)套餐來算,一段 45 分鐘的錄音大約會從這筆餘額中扣除 45 分鐘,只占套餐的一小部分,剩下的留給下一段錄音使用。無論您使用與否,都不會有任何訂閱在背後運作;套餐如何往上擴展,請參閱即用即付轉錄。
把單一段錄音轉成文字,其實是比看起來更小的決定:依逐字稿最終要撐起什麼用途,選擇人工、自動或混合方式,如果您能掌控錄音本身,就餵給模型乾淨的音訊,再對照真正重要的部分檢查結果。至於本指南沒有深入處理的長度或大量檔案情況,如何轉錄長錄音與轉錄一個錄音資料夾有更詳細的說明。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: