跳至主要內容

部落格

如何轉錄錄音:方法與步驟

作者: 發布: 最後審閱:

錄音只有轉成文字才真正有用。會議、電話、語音備忘、單一來賓的訪談——無論來源是什麼,問題都一樣:您需要能搜尋、能引用,並能交給不在現場的人閱讀的文字。本指南涵蓋一般長度的錄音,從幾分鐘到幾小時不等,從挑選方法一路講到完成匯出。若錄音超過 2 小時,請參閱如何轉錄長錄音;若要一次處理多個檔案,請參閱轉錄一個錄音資料夾

人工、自動,還是混合

從音訊到文字有三種做法,而大多數人會依錄音的情況,交替使用不只一種。

人工轉錄指的是自己聽並逐字打出每一個字。它讓您擁有完全的控制權,也沒有第三方介入,但速度很慢:仔細聽打一小時清晰的音訊,把播放、重打和校對都算進去,輕易就要花上好幾個小時。它適合短片段、您的自動工具處理不好的語言,或是真的不能讓內容離開您手上的資料。

自動語音辨識能在幾分鐘內完成同樣的工作,而不是幾小時。模型會聆聽波形,預測最可能的文字,並傳回已加上標點與說話者標籤的草稿。這份草稿並不完美,但對大多數日常錄音來說,已經接近到只需輕鬆瀏覽一遍,就能抓出剩下的問題。

混合轉錄是自動草稿加上您自己的審閱。大多數持續進行的轉錄工作最後都會落在這裡:模型處理大部分的打字工作,您負責處理姓名、專業術語,以及任何它聽錯的地方。它的成本只是人工作業的一小部分,而成果又比未經審閱的自動草稿乾淨。

哪一種適合,取決於逐字稿之後要做什麼,而不是錄音的長度。文章要用的引述,無論用哪種方法,都需要對照音訊確認措辭是否精確。給自己看的粗略會議筆記,通常完全不需要審閱。

真正決定準確度的因素

轉錄準確度最大的單一因素是錄音本身,而不是讀取它的軟體。近距離收音、清晰、一次只有一個人說話的音訊,幾乎任何自動系統都能產出乾淨的草稿。在房間對角錄的、透過品質不佳的電話線傳來的,或是三個人同時搶話的錄音,無論用哪個工具讀取,都會產生錯誤。W3C 建立準確逐字稿的指南從無障礙的角度提出了同樣的論點:逐字稿是音訊的替代品,它的準確度必須能夠自成一體,不取決於現場的人覺得原始錄音有多好聽。

在上傳之前,有幾件您能掌控的事,比事後的任何設定都更重要:

近期關於自動語音辨識的研究,包括一份2024 年深度學習方法用於 ASR 的調查,追蹤了乾淨音訊上的準確度已經進步到什麼程度,以及它在特定口音、領域或噪音特性上,仍有多依賴訓練資料。沒有任何系統能同等地讀懂每一段錄音,因此在信任重要事項的結果之前,先用您自己的音訊測試一次,仍然是比較安全的習慣。

逐步轉錄一段錄音

  1. **上傳檔案。**把錄音拖到音訊轉文字頁面。常見的音訊與影片格式都可直接接受;如果是影片,音訊會在任何內容上傳之前先在您的瀏覽器中被提取出來。
  2. **檢查預覽。**開頭幾分鐘會在您登入之前就轉錄完成,並附上說話者標籤,讓您判斷音訊是否夠乾淨、分離是否合理。
  3. **登入並讓它運作。**完整檔案會上傳,作業會自動完成;您不需要一直開著分頁等待。
  4. **重新命名說話者。**像說話者 A 這樣的通用標籤,只要編輯一次就能變成真實姓名,並套用到整份逐字稿。
  5. **對照音訊確認重要內容。**瀏覽姓名、數字與專業術語,這些正是模型最可能猜錯的地方。
  6. **匯出。**選擇下一步需要的格式,而不是隨便先載入的那一種。

說話者標籤,當不只一個人在說話時

只要錄音裡有一個以上的聲音,就需要先做說話者分離,逐字稿才真正可讀;一大片沒有說話者分段的文字,用處幾乎不比音訊本身高多少。說話者辨識會依聲音把對話分開,並讓您把通用標籤重新命名一次,這項變更就會套用到該說話者在逐字稿中出現的每一處。當每個人的聲音夠有辨識度、又不會一直打斷彼此時,效果最好;兩個聲音相似又互相搶話的情況,至今仍是所有系統都會出錯的難題,不只是自動系統。

依下一步用途挑選匯出格式

正確的匯出格式取決於文字接下來要用在哪裡,而不是哪一種看起來最完整:

從同一份作業匯出不只一種格式不會多花任何費用,所以沒有必要事先猜哪一種才是唯一正確的格式,您可以直接拿走實際會用到的兩三種。

隱私,如果這段錄音不該被保留

不是每一段錄音都該進永久的封存。一通機密電話、一場敏感的訪談、一份轉錄完就該消失的臨時備忘——這些都需要跟日常工作不一樣的設定。私人轉錄會完全跳過儲存到您帳戶這一步。結果會以受密碼保護的下載檔傳回,若您一直沒有開啟就會過期,而不是無限期留在您的紀錄裡。

對於任何您拿不準的內容,比較安全的預設做法是使用隱私模式。您隨時可以選擇保留下一份逐字稿;但您無法回頭把這一份補救成沒有儲存過。

一般錄音的花費

費用是依音訊的分鐘數計算,與檔案、格式或說話者人數無關。一通 45 分鐘的電話和一段 45 分鐘的語音備忘,轉錄費用是一樣的。以 $5.99 的 5 小時(300 分鐘)套餐來算,一段 45 分鐘的錄音大約會從這筆餘額中扣除 45 分鐘,只占套餐的一小部分,剩下的留給下一段錄音使用。無論您使用與否,都不會有任何訂閱在背後運作;套餐如何往上擴展,請參閱即用即付轉錄


把單一段錄音轉成文字,其實是比看起來更小的決定:依逐字稿最終要撐起什麼用途,選擇人工、自動或混合方式,如果您能掌控錄音本身,就餵給模型乾淨的音訊,再對照真正重要的部分檢查結果。至於本指南沒有深入處理的長度或大量檔案情況,如何轉錄長錄音轉錄一個錄音資料夾有更詳細的說明。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

我應該手動轉錄錄音,還是使用自動語音辨識?

幾乎所有情況都適合自動轉錄:它在幾分鐘內就能傳回草稿,而不是手動作業每小時音訊要花上的好幾個小時。只有在處理短片段、您的自動工具處理不好的語言,或是真的不能讓內容離開您手上的資料時,才保留手動輸入。

使用自動逐字稿之前,我需要先審閱嗎?

作為內部筆記,通常不需要。作為引述、法律紀錄,或任何您要發布的內容,就需要。請對照音訊閱讀草稿,特別檢查姓名、數字與專業術語,因為這些正是模型最可能猜錯的地方。

當錄音中有一個以上的聲音時,說話者標籤是如何運作的?

逐字稿會依聲音分割,並附上像是說話者 A、說話者 B 這樣的通用標籤。只要重新命名一次標籤,就會套用到該說話者在逐字稿中出現的每一處。當每個人的聲音夠有辨識度、又不會一直打斷彼此時,準確度最好。

錄音轉錄完成後會發生什麼事?

這取決於您選擇的模式。預設模式會將逐字稿保留在您的帳戶中,方便您日後回來查看。隱私模式則完全跳過帳戶儲存:結果會以受密碼保護的下載檔傳回,若您一直沒有開啟,就會過期。

轉錄一段錄音要花多少錢?

費用是依音訊的分鐘數計算,與檔案格式或說話者人數無關。一段 45 分鐘的錄音會從您的預付餘額中扣除 45 分鐘,無論這筆餘額來自小套餐還是大套餐,背後也沒有任何訂閱在運作。

我可以上傳哪些檔案類型?

常見的音訊與影片格式都可直接接受,包括 MP3、WAV、M4A、FLAC 和 MP4。如果您上傳的是影片,音訊會在傳送任何內容之前先在您的瀏覽器中提取,因此原始影片檔案永遠不會被上傳。

從 30 分鐘免費額度開始

$1 暫授權用於確認您的卡片,並會立即釋放——絕不收費,您的 30 分鐘免費時數也會立刻到帳。

開始––30 分鐘免費