部落格
Podcast 轉錄全流程:從頭到尾
作者: Hushscript 發布: 最後審閱:
轉錄一集 Podcast 並非單一決定,而是一連串決定的組合:草稿要多準確、由誰來校對、說話者怎麼命名、文字最後要輸出成什麼格式,以及您願意每週重複多少次這套流程。流程一旦理順,一集的逐字稿只要花上幾分鐘;流程一旦出錯,每一集都會變成一場沒人排定的編輯工作。
Podcast 製作者為什麼要轉錄節目
搜尋引擎索引的是文字,不是音訊。逐字稿能讓聽眾靠主題、來賓姓名,或是一句只記得一半的話找到您的節目,而當您的舊集數多到沒人會逐一翻找時,這一點會變得更重要。
無障礙是另一半的原因。聽障與重聽聽眾需要文字,非母語聽眾、身處吵雜環境的人,以及閱讀速度比您說話還快的人也都需要。Section 508 對字幕與逐字稿的指引把逐字稿視為純音訊內容的對等替代方案,並且要求人工校對自動草稿,而不是直接丟出機器產出的原始結果。
乾淨的逐字稿也是一份原始素材:
- 用一段講太久的內容寫成部落格文章
- 用逐字措辭做成社群貼文金句
- 電子報摘要
- 節目筆記與章節標記
- 為讀某語言比聽某語言更順的聽眾提供翻譯
它也是一份存檔。兩年後,您還能在自己的節目裡搜尋當初引用的數字、想重溫的故事,或是那句只記得一半的來賓發言。

語音辨識做得到的事,以及做不到的事
自動語音辨識已經好到可以拿來當發布底稿,但還沒好到能不經校對就直接發布。一項針對 11 家服務商、衡量自動語音辨識解決方案準確度的研究發現,準確度在不同廠商之間差異很大,串流情境下更會進一步下降,這提醒我們機器轉錄並不是單一固定的品質水準。
品質主要取決於錄音本身,而不是工具。乾淨、幾乎沒有交疊發言的音訊,效果會勝過有環境雜音的現場活動錄音。單人主持讀起來會比四方辯論更順。日常對話轉錄起來,也會比滿是藥名、案例引用或產品術語的一小時內容更乾淨。
| 影響草稿的因素 | 影響程度 | 您可以怎麼處理 |
|---|---|---|
| 音訊品質 | 影響很大 | 找安靜的地方,用真正的麥克風錄音 |
| 互相搶話 | 影響很大 | 事先約定輪流發言,上傳前剪掉最嚴重的交疊段落 |
| 口音與方言 | 影響中等 | 選擇多語言模型能力強的服務 |
| 專業詞彙 | 影響中等 | 開始轉錄前,先把人名與術語加進詞典 |
| 說話速度 | 影響輕微 | 正常語速沒問題,只有語速極快才會影響準確度 |
口音和口語瑕疵的處理,是通用模型最快掉分的兩個地方。如果您的節目常有國際來賓,請預留校對時間,不要假設草稿已經很乾淨。Hushscript 讓您先儲存一份人名、品牌和常見術語的詞典,並在轉錄前套用,這是您能買到最划算的準確度提升方式。
說話者標籤,以及容易出錯的地方
說話者分離會自動區分不同聲音,兩人訪談幾乎每次都能分得準確。但當兩位來賓聲音相似、大家一起大笑,或是一段長時間停頓讓同一個聲音看起來像兩個人時,就容易出錯。
標籤回傳時是通用名稱,只要重新命名一次,同一個標籤就會全文更新,所以兩人對談大約一分鐘就能命名完成,四人小組則要多花幾分鐘。Hushscript 在每一份逐字稿都免費提供說話者標籤,不按人頭收費,也沒有聲音數量上限。想了解背後機制,請參閱說話者分離的工作原理。
選擇處理方式
**人工轉錄。**您自己或聘請的聽打員逐字打出全部內容。速度最慢、成本最高,但處理困難音訊時最可靠。在一個字打錯就會出大問題的法律和醫療記錄上,這筆成本值得,但在 Podcast 上幾乎用不到。
**混合模式。**機器出草稿,人工做校對。幾乎每個節目最後都該落在這裡。機器負責打字,您負責判斷:修正同音字、補回被漏掉的否定詞、更正來賓公司名稱,並決定要留多少贅字。
**純自動化。**上傳、下載、發布。用來做內部參考或粗略的節目索引沒問題。但拿來公開發布就有風險,因為留下來的錯誤,往往是那種乍看之下很合理的錯誤。
大多數節目最後會混用後兩種做法:主打宣傳的集數做完整校對,其餘存檔裡的集數則保留未經校對的逐字稿。
按次付費,還是訂閱
訂閱制費用可預期,但就算某個月沒有發布新集數也照樣收費。按需付費只在您實際轉錄時才收費,適合季節性節目、不固定的發布節奏,或是夏天暫停更新的情況。
算成本時請以每集為單位,而不是每月。如果您每週發布,訂閱制可能比較划算。如果您是想到才發布,預付分鐘套餐能讓您先買好額度,不綁任何方案。分鐘數效期為 365 天,任何一次完成的轉錄或新購買都會重設這個效期。
建立工作流程
從頭到尾的核心流程:
- 錄製並整理乾淨的音訊:剪掉開場閒聊和長時間靜音,匯出 MP3、M4A 或 WAV,或讓影片的音軌自動被擷取出來。
- 上傳檔案,讓語音辨識產生草稿,說話者會自動分開標記。
- 對照音訊校對草稿,修正同音字、被漏掉的否定詞,以及被打亂的專有名詞。
- 決定要用清稿逐字稿還是完整逐字稿,並依接下來的用途排版文字:節目筆記、獨立的逐字稿頁面,或是定時字幕。
- 確認來賓的期待與錄音相關的任何權利,然後發布。
上傳之前
從乾淨的音訊開始。剪掉冗長的靜音、講到一半重來的開頭,以及訪談真正開始前的閒聊。音訊越少,要讀的文字就越少,之後要刪的無關段落也越少。
匯出 MP3、M4A 或 WAV。影片也可以,Hushscript 會在您的瀏覽器中擷取音軌,所以影片檔案本身不會上傳,但如果您手邊已經有音訊匯出檔,直接交出去會更快。多軌錄音請先混音成一軌,除非您特意想讓每一軌分開轉錄。
每次都用同一套方式命名檔案:
- 錄音日期,讓資料夾能按時間順序排列
- 集數編號
- 來賓姓名或主題
- 如果有多個版本,加上版本標記
舉例來說:2026-06-18-e047-jordan-chen-final.mp3。在您只有四集的時候,這看起來無關緊要;但等到累積了兩百集,這就是找得到和找不到的差別。
校對草稿
一邊播放音訊一邊讀逐字稿。看起來就有問題的錯誤是好處理的那種。真正危險的錯誤讀起來完全通順,卻表達了跟原意相反的意思:同音字、被漏掉的否定詞,以及被打錯的專有名詞,就是最後會被發布出去的那三種錯誤。
錯誤通常會集中出現,所以請仔細讀錯誤聚集的地方,其餘部分可以略讀。開場白和結尾通常帶有人名、頭銜和口說的網址。技術性段落則帶有術語和數字。交疊發言和笑聲產生的亂碼,通常直接刪掉會比修補更好。
順便檢查標籤。確認正確的聲音被分開了,把通用標籤換成真實姓名,並把任何因長時間停頓被拆成兩個的說話者合併回去。
接著決定文字要多逐字。清稿逐字稿與完整逐字稿談的正是這個取捨:完整逐字稿保留每一個「嗯」和講到一半重來的句子,清稿逐字稿則會把它們拿掉並整理文法。大多數 Podcast 都想要後者。您的聽眾不需要每一個口頭習慣,您的來賓也會默默感謝您。
為讀者排版
一整片純文字雖然可以搜尋,卻讀不下去。給它一點結構:
- 在話題轉換處或固定間隔加上時間戳記
- 在每一輪發言前面用粗體標出說話者姓名
- 在對話真正轉折的地方加上段落分隔
- 為節目中不同的段落加上標題
接著依照發布目的做排版。節目筆記需要標題和項目符號。獨立的逐字稿頁面需要簡短導言,加上一個播放器連結。字幕則需要 SRT 或 VTT 這類定時格式。
版權、來賓與您發布的內容
逐字稿是錄音的衍生內容,因此適用於錄音的限制,通常也會延伸適用到逐字稿上。如果某一集使用了授權音樂、片段或第三方音訊,請先確認授權範圍,再發布它的文字內容。
請在發布同意書裡就談好來賓的期待,而不是事後才談。有些來賓合理地希望在發布前看過逐字稿,尤其是以官方身分發言,或談到敏感主題時更是如此。事先談好,會比頁面上線後再來協商快得多。
而且已發布的逐字稿是永久、公開,而且可以被引用的,這是音訊做不到的。如果某一集談到尚未發表的研究、客戶細節,或是您還沒公布的數字,請在上線前先審閱,將該段落遮蔽,或者乾脆不公開那一集的逐字稿。
多語言節目
請先用原始語言轉錄。這樣您會有一份準確的來源文件,而不是從一份不穩定的草稿翻譯,讓錯誤在每個分支裡不斷放大。Hushscript 支援自動偵測,涵蓋大約 99 種口語語言,您額外新增的每個翻譯目標語言,都會再花費錄音時長 25% 的費用,疊加在轉錄費用之上。
如果您的節目會混雜語言切換,或主持人本身是雙語者,請先確認您使用的服務怎麼處理節目中途的語言轉換。有些服務能自動偵測;有些則要求音訊送達前先依語言切好段。
經得起考驗的翻譯流程:
- 轉錄原始語言,並確實校對
- 翻譯成目標語言
- 請母語人士審閱每份翻譯的語氣與慣用語
- 把翻譯與原始逐字稿一起發布

不該公開的節目
不是每一段錄音都適合放進永久存檔。個人故事、客戶案例分享,以及不公開發言的段落,處理方式都應該跟每週例行訪談不一樣。
私密模式就是為了這種情況而設計的。語音辨識仍然照常執行,但不會有任何內容存進您的帳戶:結果會是一個受密碼保護的 .husharchive,供您下載,如果您一直不下載,它就會過期。在一般路徑中,逐字稿一旦儲存完成,轉錄用的音訊副本就會被移除,儲存的逐字稿內容會靜態加密,而您可以選擇讓逐字稿一直保留到您自行刪除,或是在 7、30、90 或 365 天後自動刪除。
匯出格式
逐字稿之後能拿來做什麼,取決於一開始匯出的是什麼格式。純文字格式最通用,但會遺失文字以外的一切資訊。定時格式保留了時間資訊。結構化格式則保留了全部的元資料。
| 格式 | 適合用途 | 是否保留元資料 |
|---|---|---|
| TXT | 存檔、貼上純文字 | 否 |
| DOCX、PDF | 分享給不會打開資料檔案的人 | 部分 |
| SRT、VTT | 字幕與副標題 | 時間資訊 |
| JSON、XML | 餵給其他工具使用 | 全部 |
| HTML | 把逐字稿發布成網頁 | 結構與樣式 |
Hushscript 匯出 21 種格式,外加一個受密碼保護的存檔,所以選格式只是一次下載,而不是一項轉檔工程。如果您要發布節目的剪輯影片版本,如何為影片添加字幕完整說明了定時格式的整套流程。
如果您把逐字稿餵給摘要工具,輸入內容的品質比摘要工具本身更重要。錯誤會一路傳遞下去:逐字稿裡打錯的名字,會變成後續每一份摘要、金句卡片和電子報裡同樣打錯的名字。
準確度要到什麼程度才夠
對於已發布的 Podcast 逐字稿,偶爾出現的錯字還撐得過去,因為上下文能幫讀者帶過去。但人們會據以行動的內容,像是醫療、法律或財務相關內容,就需要更嚴謹的校對,而且校對者必須熟悉相關詞彙,才能抓出那種乍看合理的替換錯誤。
與其用猜的,不如實際量測。隨機抽出五分鐘,數一數字數,再數一數錯誤數,兩者相除。這個數字會告訴您,這次校對值得花一小時還是十分鐘,也會告訴您問題出在轉錄服務,還是麥克風。
這才是重點:準確度是在錄音階段就決定好的。沒有任何轉錄服務能還原一開始就沒被清楚錄下來的字,而在更安靜的房間裡用更好的麥克風,對逐字稿品質的幫助,會遠勝過換一家轉錄服務商。
這樣做值得嗎
與其假設,不如實際追蹤。觀察逐字稿頁面的瀏覽量,確認節目是否針對談論的主題有搜尋排名,也問問聽眾當初是怎麼找到您的。逐字稿帶來的流量通常成長得很慢,但就算某一集早已跌出排行榜,它還是會持續帶來流量。
該衡量的重點:
- 撰寫節目筆記和社群貼文省下的時間
- 從搜尋引擎導入逐字稿頁面的流量
- 無障礙性,以及因此增加的聽眾
- 一份自己舊集數、可搜尋的存檔
- 從文字而不是音訊出發的二次利用
轉錄的成本是您每個月都會看到的一筆帳。它帶來的好處則分散又姍姍來遲,這正是它容易被低估的原因。
真正能撐過每週例行發布的流程,往往是最無趣的那種:乾淨的音訊進來,機器出草稿,做一次專注的校對,再轉成文字最終要去的地方適用的格式。Hushscript 負責處理中間這一段:每份逐字稿都免費附上說話者標籤、涵蓋大約 99 種語言、單次上傳最多可達 10 小時,並採用預付分鐘制而非訂閱。把一集節目拖到 Podcast 逐字稿 頁面,在您建立任何東西之前,前 5 分鐘就會先帶著說話者標籤回傳給您。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: