部落格
音檔轉文字:準確度、成本與工作流程
作者: Hushscript 發布: 最後審閱:
音訊轉文字能不能產出一份堪用的文件,關鍵在於三件事:錄音本身有多乾淨、語音辨識處理得多好,以及成果在您能放心使用前需要多少校對。做對這三件事,錄音幾分鐘內就能變成可搜尋、可引用的文字,而不是一項編輯工程。
法務團隊轉錄證詞,研究人員轉錄訪談,記者轉錄對話,而他們遇到的是同一道難題:唯有錄音變成可搜尋、可引用的文字,才算真正派上用場。要走到這一步,靠的不只是按下一個按鈕而已。
音訊如何轉為文字
現代語音辨識運行的是以 Transformer 為基礎的神經網路,訓練資料涵蓋跨語言、跨聲學環境的數百萬小時語音。不論您使用哪一家服務,您的檔案大致都會經過相同的幾個階段:
- 前處理:正規化音量、降低噪音,並將語音切分為片段
- 聲學建模:將聲波對應到候選的音素與詞彙
- 語言建模:從上下文挑出最可能的詞序
- 後處理:加上標點、大小寫、時間戳記與說話者標籤
最弱的那個環節,決定了最終逐字稿的品質上限。一篇 2025 年的語音辨識架構綜述回顧了端到端模型如何取代舊式的模組化流程,以及為什麼它們在口音、噪音與各種錄音條件下表現更穩定。想用白話了解同一套機制,可參閱語音轉文字的運作原理。
準確度由什麼決定
錄音本身比模型更重要。清晰的說話聲、一支像樣的麥克風,加上安靜的房間,產出的草稿幾乎可以直接發布;用筆電內建麥克風、隔著桌子錄下的視訊會議,產出的則是一堆功課。除了音訊品質之外,還有幾個因素會左右結果:
- 口音與方言:模型訓練時較少接觸過的類型
- 交疊發言:說話者彼此搶著開口
- 專業詞彙:藥名、案號引用、產品術語
- 說話速度:只有異常快的語速才會明顯拖累準確度
廣告上標榜的準確度數字,不要照單全收。拿您自己的錄音轉錄五分鐘的樣本,數一數錯誤數量,再除以總字數。這個數字會告訴您,校對整份錄音要花多少工夫,也能看出問題出在服務本身,還是麥克風。
全自動、人工,還是混合模式
全自動轉錄又快又便宜:好幾個小時的音訊,幾分鐘內就能變成文字。在乾淨的錄音上,這樣的草稿已經足夠用來做會議記錄、搜尋和內部參考,不需要任何人再動手修改。
人工轉錄買到的是判斷力。遇到困難音訊,或是一個字打錯就可能惹上法律責任的內容,仔細聆聽的真人仍然是標準做法。代價是成本更高,耗時以天計,而不是幾分鐘。
混合模式是大多數正式工作最後採用的做法:機器出草稿,人工再校對一輪。打字的工作交給機器,判斷交給您,而校對花的時間,只是從零開始打字的一小部分。
| 做法 | 速度 | 成本 | 適合 |
|---|---|---|---|
| 全自動 | 幾分鐘 | 低 | 乾淨音訊、筆記、搜尋、草稿 |
| 純人工 | 幾天 | 高 | 法律記錄、關鍵內容 |
| 混合模式 | 幾小時 | 低,外加您的時間 | 任何要發布或要據以行動的內容 |
語言與說話者
上傳前先選好語言,這件麻煩事現在大多已經不存在了:現代平台會從音訊最初幾秒就自動偵測所使用的語言。Hushscript 涵蓋大約 99 種口語語言,並採自動偵測,準確度最高的則是包含英語、西班牙語、法語、德語、日語與中文在內的一組旗艦語言。
說話者辨識,是一整片文字牆和一段可以清楚追蹤的對話之間的差別。說話者分離技術會自動偵測聲音切換,為每位說話者一致地加上標籤,並讓您一次重新命名,套用到全文。Hushscript 在每份逐字稿都免費提供說話者標籤,且不限聲音數量;背後的運作原理,可參閱說話者分離的工作原理。
人名與專業詞彙
通用模型最容易出錯的,恰恰是最重要的那些詞:人名、品牌、藥品名稱、產品術語。一份把「Kubernetes」寫成「communities」的草稿,即使其他每個字都拼對了,這句話的意思也已經整個跑掉。
有兩種方法有效。關於結合大型語言模型校正的命名實體辨識的研究顯示,對初版草稿跑一輪語言模型校正,能大幅減少實體詞的錯誤。另一種方法,是事先告訴轉錄引擎接下來會出現什麼:Hushscript 讓您先儲存一份人名、縮寫和常見術語的詞典,在轉錄前套用,也能為單一工作加上一次性關鍵詞。設定方式請參閱教轉錄引擎認識您的詞彙。
長篇錄音
早期系統把音訊切成一段段獨立處理,結果丟失了脈絡:術語前後不一致,標點忽有忽無,同一個聲音還會被貼上兩種不同標籤。較新的做法會在整段錄音中保持上下文,反映出來就是術語一致、句子斷點更準確,說話者標籤也更穩定。
實際的做法是:能整份錄音當一個檔案處理,就不要拆開。Hushscript 接受最長 10 小時的上傳,沒有固定的檔案大小上限,所以一整天的聽證會或四小時的座談會,都能維持連續的時間戳記,不會在第二段又從零開始。詳細內容請參閱如何轉錄長篇錄音。
把文字送到它該去的地方
逐字稿本身很少是最終成品。剪輯師需要定時字幕,研究人員想要文件,開發者想要結構化資料,內容團隊則想要純文字。匯出格式夠不夠多,決定了交付是一次下載,還是一項轉檔工程:
- 純文字(TXT、Markdown):用於書寫與貼上
- 字幕(SRT、VTT、ASS、TTML):用於加字幕;SRT 與 VTT 的選擇說明怎麼挑
- 文件(DOCX、PDF、RTF):用於分享與存檔
- 資料(JSON、CSV、XLSX):用於分析與資料流程
- 剪輯時間軸(FCPXML、EDL):用於影片製作
Hushscript 可匯出 21 種格式,外加一個受密碼保護的封存檔;當逐字稿含有翻譯時,還能依語言分別匯出。
處理過程中的隱私
比起人們上傳的大多數檔案,錄音更常帶有機密內容:客戶通話、病患問診、尚未公開的計畫。在把錄音交給某項服務之前,真正重要的問題是:音訊會被送去哪裡、會被保存多久,以及誰有權限讀取:
- 加密:傳輸中與靜態儲存時都加密
- 保留期限由您自行決定,並有明確的刪除方式
- 處理地點,以及適用的法律
- 逐字稿產生後,音訊會如何處理
Hushscript 的做法是:只上傳處理過的音訊,逐字稿儲存完成後,用於轉錄的副本就會被刪除;儲存的逐字稿內容一律靜態加密;保留期限由您自行決定(一直保留到您刪除為止,或是 7、30、90、365 天後自動刪除);歐盟地區的音訊則在歐盟境內處理。對於完全不該被儲存的錄音,隱私模式會產出一個受密碼保護的 .husharchive,不會有任何內容存進帳戶;運作方式請參閱隱私模式說明。
事前準備音訊
花五分鐘做準備,能省下好幾個小時的剪輯工夫。錄音前:把麥克風擺在說話者附近,挑一個安靜的房間,並使用真正的麥克風,而不是筆電內建的那種。錄音後:剪掉開場的閒聊和冗長的靜音,並把同一段對話留在同一個檔案裡,不要拆開。
如果檔案需要先轉換格式、剪輯,或做音量正規化,免費瀏覽器工具可以直接在您的瀏覽器裡本機處理,處理敏感錄音不必再交給另一台伺服器。
該花多少錢
轉錄的定價方式大致有三種:按分鐘計費的人工費率、附額度的月訂閱制,以及預付或按需付費的分鐘數。哪一種划算,取決於您的用量和頻率,所以請以一整年來算,而不是只看一個月。訂閱制在您完全沒錄音的月份照樣收費,而額度制則會在您錄最多的那個月拖累您。
偶爾使用、用量不固定的情況,最適合預付制。Hushscript 銷售預付分鐘套餐,不綁訂閱:新帳號享有 30 分鐘免費額度,分鐘數效期為 365 天,任何一次完成的轉錄或新購買,都會重設這個效期。也要留意其他地方藏著的額外費用:有些服務會針對說話者標籤、匯出或儲存空間另外收費。在這裡,說話者標籤和每一種匯出格式都已經包含在內。
從草稿到成品文件
機器的輸出結果是一份草稿。它需要多少校對,取決於這份文字最終要用到哪裡:
- 修正聽錯的人名和術語;讀起來很合理的錯誤,才是真正危險的那種
- 決定文字要多逐字:清稿逐字稿與完整逐字稿談的正是這個取捨
- 補回結構:段落、標題,以及讀者需要的時間戳記
- 核對數字、日期,以及任何會被拿來當依據行動的內容
直接在轉錄工具裡編輯,勝過匯出到文書處理軟體,因為您能針對任何有疑慮的句子,直接播放背後的音訊。Hushscript 提供一份可編輯的文件,支援說話者重新命名、尋找取代、復原與還原。它的 Insights 功能會加上摘要、待辦事項、決議、金句、章節,以及一份完整改寫過的清稿逐字稿;每份逐字稿的第一次生成免費,之後重新生成則需要花費分鐘數。
不同領域,要求不同
法律。 證詞與聽證會需要逐字文字、說話者歸屬與時間戳記,逐字稿往往會成為正式記錄的一部分。機器草稿有幫助;但跳過校對沒有。
醫療。 臨床對話的成敗,繫於藥名和術語是否正確。Hushscript 的醫療模式針對臨床詞彙做了調校,計費分鐘數會在錄音時長之外,額外加收 100%。
研究。 訪談與焦點團體需要保留說話方式,並記錄清楚的研究方法。完整逐字稿再加上仔細校對,是常見的標準做法。
商業。 會議與通話需要的是速度、可搜尋性,以及不會在清淡月份多收費的價格。乾淨的自動化草稿通常就夠用了。
媒體。 Podcast 與影片需要逐字稿來做搜尋和無障礙,還需要從同一份文字剪出字幕。定時匯出格式會把時間資訊一併帶過去。
貫穿所有情境的模式是:準確度要在錄音階段就先買到,打字的工作交給機器,把注意力留給校對,再用下一步真正接受的格式匯出。Hushscript 涵蓋這整條鏈路:涵蓋大約 99 種語言的說話者標籤轉錄、預付分鐘制而非訂閱,以及您可以自行驗證、而不必單憑信任的隱私選擇。把一段錄音拖到音檔轉文字頁面,在您建立任何東西之前,前 5 分鐘就會先帶著說話者標籤回傳給您。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: