跳至主要內容

部落格

Podcast 轉錄全流程:從頭到尾

作者: 發布: 最後審閱:

轉錄一集 Podcast 並非單一決定,而是一連串決定的組合:草稿要多準確、由誰來校對、說話者怎麼命名、文字最後要輸出成什麼格式,以及您願意每週重複多少次這套流程。流程一旦理順,一集的逐字稿只要花上幾分鐘;流程一旦出錯,每一集都會變成一場沒人排定的編輯工作。

Podcast 製作者為什麼要轉錄節目

搜尋引擎索引的是文字,不是音訊。逐字稿能讓聽眾靠主題、來賓姓名,或是一句只記得一半的話找到您的節目,而當您的舊集數多到沒人會逐一翻找時,這一點會變得更重要。

無障礙是另一半的原因。聽障與重聽聽眾需要文字,非母語聽眾、身處吵雜環境的人,以及閱讀速度比您說話還快的人也都需要。Section 508 對字幕與逐字稿的指引把逐字稿視為純音訊內容的對等替代方案,並且要求人工校對自動草稿,而不是直接丟出機器產出的原始結果。

乾淨的逐字稿也是一份原始素材:

它也是一份存檔。兩年後,您還能在自己的節目裡搜尋當初引用的數字、想重溫的故事,或是那句只記得一半的來賓發言。

搜尋、無障礙與二次利用,全都源自同一份 Podcast 逐字稿

語音辨識做得到的事,以及做不到的事

自動語音辨識已經好到可以拿來當發布底稿,但還沒好到能不經校對就直接發布。一項針對 11 家服務商、衡量自動語音辨識解決方案準確度的研究發現,準確度在不同廠商之間差異很大,串流情境下更會進一步下降,這提醒我們機器轉錄並不是單一固定的品質水準。

品質主要取決於錄音本身,而不是工具。乾淨、幾乎沒有交疊發言的音訊,效果會勝過有環境雜音的現場活動錄音。單人主持讀起來會比四方辯論更順。日常對話轉錄起來,也會比滿是藥名、案例引用或產品術語的一小時內容更乾淨。

影響草稿的因素 影響程度 您可以怎麼處理
音訊品質 影響很大 找安靜的地方,用真正的麥克風錄音
互相搶話 影響很大 事先約定輪流發言,上傳前剪掉最嚴重的交疊段落
口音與方言 影響中等 選擇多語言模型能力強的服務
專業詞彙 影響中等 開始轉錄前,先把人名與術語加進詞典
說話速度 影響輕微 正常語速沒問題,只有語速極快才會影響準確度

口音和口語瑕疵的處理,是通用模型最快掉分的兩個地方。如果您的節目常有國際來賓,請預留校對時間,不要假設草稿已經很乾淨。Hushscript 讓您先儲存一份人名、品牌和常見術語的詞典,並在轉錄前套用,這是您能買到最划算的準確度提升方式。

說話者標籤,以及容易出錯的地方

說話者分離會自動區分不同聲音,兩人訪談幾乎每次都能分得準確。但當兩位來賓聲音相似、大家一起大笑,或是一段長時間停頓讓同一個聲音看起來像兩個人時,就容易出錯。

標籤回傳時是通用名稱,只要重新命名一次,同一個標籤就會全文更新,所以兩人對談大約一分鐘就能命名完成,四人小組則要多花幾分鐘。Hushscript 在每一份逐字稿都免費提供說話者標籤,不按人頭收費,也沒有聲音數量上限。想了解背後機制,請參閱說話者分離的工作原理

選擇處理方式

**人工轉錄。**您自己或聘請的聽打員逐字打出全部內容。速度最慢、成本最高,但處理困難音訊時最可靠。在一個字打錯就會出大問題的法律和醫療記錄上,這筆成本值得,但在 Podcast 上幾乎用不到。

**混合模式。**機器出草稿,人工做校對。幾乎每個節目最後都該落在這裡。機器負責打字,您負責判斷:修正同音字、補回被漏掉的否定詞、更正來賓公司名稱,並決定要留多少贅字。

**純自動化。**上傳、下載、發布。用來做內部參考或粗略的節目索引沒問題。但拿來公開發布就有風險,因為留下來的錯誤,往往是那種乍看之下很合理的錯誤。

大多數節目最後會混用後兩種做法:主打宣傳的集數做完整校對,其餘存檔裡的集數則保留未經校對的逐字稿。

按次付費,還是訂閱

訂閱制費用可預期,但就算某個月沒有發布新集數也照樣收費。按需付費只在您實際轉錄時才收費,適合季節性節目、不固定的發布節奏,或是夏天暫停更新的情況。

算成本時請以每集為單位,而不是每月。如果您每週發布,訂閱制可能比較划算。如果您是想到才發布,預付分鐘套餐能讓您先買好額度,不綁任何方案。分鐘數效期為 365 天,任何一次完成的轉錄或新購買都會重設這個效期。

建立工作流程

從頭到尾的核心流程:

  1. 錄製並整理乾淨的音訊:剪掉開場閒聊和長時間靜音,匯出 MP3、M4A 或 WAV,或讓影片的音軌自動被擷取出來。
  2. 上傳檔案,讓語音辨識產生草稿,說話者會自動分開標記。
  3. 對照音訊校對草稿,修正同音字、被漏掉的否定詞,以及被打亂的專有名詞。
  4. 決定要用清稿逐字稿還是完整逐字稿,並依接下來的用途排版文字:節目筆記、獨立的逐字稿頁面,或是定時字幕。
  5. 確認來賓的期待與錄音相關的任何權利,然後發布。

上傳之前

從乾淨的音訊開始。剪掉冗長的靜音、講到一半重來的開頭,以及訪談真正開始前的閒聊。音訊越少,要讀的文字就越少,之後要刪的無關段落也越少。

匯出 MP3、M4A 或 WAV。影片也可以,Hushscript 會在您的瀏覽器中擷取音軌,所以影片檔案本身不會上傳,但如果您手邊已經有音訊匯出檔,直接交出去會更快。多軌錄音請先混音成一軌,除非您特意想讓每一軌分開轉錄。

每次都用同一套方式命名檔案:

  1. 錄音日期,讓資料夾能按時間順序排列
  2. 集數編號
  3. 來賓姓名或主題
  4. 如果有多個版本,加上版本標記

舉例來說:2026-06-18-e047-jordan-chen-final.mp3。在您只有四集的時候,這看起來無關緊要;但等到累積了兩百集,這就是找得到和找不到的差別。

校對草稿

一邊播放音訊一邊讀逐字稿。看起來就有問題的錯誤是好處理的那種。真正危險的錯誤讀起來完全通順,卻表達了跟原意相反的意思:同音字、被漏掉的否定詞,以及被打錯的專有名詞,就是最後會被發布出去的那三種錯誤。

錯誤通常會集中出現,所以請仔細讀錯誤聚集的地方,其餘部分可以略讀。開場白和結尾通常帶有人名、頭銜和口說的網址。技術性段落則帶有術語和數字。交疊發言和笑聲產生的亂碼,通常直接刪掉會比修補更好。

順便檢查標籤。確認正確的聲音被分開了,把通用標籤換成真實姓名,並把任何因長時間停頓被拆成兩個的說話者合併回去。

接著決定文字要多逐字。清稿逐字稿與完整逐字稿談的正是這個取捨:完整逐字稿保留每一個「嗯」和講到一半重來的句子,清稿逐字稿則會把它們拿掉並整理文法。大多數 Podcast 都想要後者。您的聽眾不需要每一個口頭習慣,您的來賓也會默默感謝您。

為讀者排版

一整片純文字雖然可以搜尋,卻讀不下去。給它一點結構:

接著依照發布目的做排版。節目筆記需要標題和項目符號。獨立的逐字稿頁面需要簡短導言,加上一個播放器連結。字幕則需要 SRT 或 VTT 這類定時格式。

版權、來賓與您發布的內容

逐字稿是錄音的衍生內容,因此適用於錄音的限制,通常也會延伸適用到逐字稿上。如果某一集使用了授權音樂、片段或第三方音訊,請先確認授權範圍,再發布它的文字內容。

請在發布同意書裡就談好來賓的期待,而不是事後才談。有些來賓合理地希望在發布前看過逐字稿,尤其是以官方身分發言,或談到敏感主題時更是如此。事先談好,會比頁面上線後再來協商快得多。

而且已發布的逐字稿是永久、公開,而且可以被引用的,這是音訊做不到的。如果某一集談到尚未發表的研究、客戶細節,或是您還沒公布的數字,請在上線前先審閱,將該段落遮蔽,或者乾脆不公開那一集的逐字稿。

多語言節目

請先用原始語言轉錄。這樣您會有一份準確的來源文件,而不是從一份不穩定的草稿翻譯,讓錯誤在每個分支裡不斷放大。Hushscript 支援自動偵測,涵蓋大約 99 種口語語言,您額外新增的每個翻譯目標語言,都會再花費錄音時長 25% 的費用,疊加在轉錄費用之上。

如果您的節目會混雜語言切換,或主持人本身是雙語者,請先確認您使用的服務怎麼處理節目中途的語言轉換。有些服務能自動偵測;有些則要求音訊送達前先依語言切好段。

經得起考驗的翻譯流程:

  1. 轉錄原始語言,並確實校對
  2. 翻譯成目標語言
  3. 請母語人士審閱每份翻譯的語氣與慣用語
  4. 把翻譯與原始逐字稿一起發布

一份錄音先轉錄,再分支出多份翻譯後的逐字稿

不該公開的節目

不是每一段錄音都適合放進永久存檔。個人故事、客戶案例分享,以及不公開發言的段落,處理方式都應該跟每週例行訪談不一樣。

私密模式就是為了這種情況而設計的。語音辨識仍然照常執行,但不會有任何內容存進您的帳戶:結果會是一個受密碼保護的 .husharchive,供您下載,如果您一直不下載,它就會過期。在一般路徑中,逐字稿一旦儲存完成,轉錄用的音訊副本就會被移除,儲存的逐字稿內容會靜態加密,而您可以選擇讓逐字稿一直保留到您自行刪除,或是在 7、30、90 或 365 天後自動刪除。

匯出格式

逐字稿之後能拿來做什麼,取決於一開始匯出的是什麼格式。純文字格式最通用,但會遺失文字以外的一切資訊。定時格式保留了時間資訊。結構化格式則保留了全部的元資料。

格式 適合用途 是否保留元資料
TXT 存檔、貼上純文字
DOCX、PDF 分享給不會打開資料檔案的人 部分
SRT、VTT 字幕與副標題 時間資訊
JSON、XML 餵給其他工具使用 全部
HTML 把逐字稿發布成網頁 結構與樣式

Hushscript 匯出 21 種格式,外加一個受密碼保護的存檔,所以選格式只是一次下載,而不是一項轉檔工程。如果您要發布節目的剪輯影片版本,如何為影片添加字幕完整說明了定時格式的整套流程。

如果您把逐字稿餵給摘要工具,輸入內容的品質比摘要工具本身更重要。錯誤會一路傳遞下去:逐字稿裡打錯的名字,會變成後續每一份摘要、金句卡片和電子報裡同樣打錯的名字。

準確度要到什麼程度才夠

對於已發布的 Podcast 逐字稿,偶爾出現的錯字還撐得過去,因為上下文能幫讀者帶過去。但人們會據以行動的內容,像是醫療、法律或財務相關內容,就需要更嚴謹的校對,而且校對者必須熟悉相關詞彙,才能抓出那種乍看合理的替換錯誤。

與其用猜的,不如實際量測。隨機抽出五分鐘,數一數字數,再數一數錯誤數,兩者相除。這個數字會告訴您,這次校對值得花一小時還是十分鐘,也會告訴您問題出在轉錄服務,還是麥克風。

這才是重點:準確度是在錄音階段就決定好的。沒有任何轉錄服務能還原一開始就沒被清楚錄下來的字,而在更安靜的房間裡用更好的麥克風,對逐字稿品質的幫助,會遠勝過換一家轉錄服務商。

這樣做值得嗎

與其假設,不如實際追蹤。觀察逐字稿頁面的瀏覽量,確認節目是否針對談論的主題有搜尋排名,也問問聽眾當初是怎麼找到您的。逐字稿帶來的流量通常成長得很慢,但就算某一集早已跌出排行榜,它還是會持續帶來流量。

該衡量的重點:

轉錄的成本是您每個月都會看到的一筆帳。它帶來的好處則分散又姍姍來遲,這正是它容易被低估的原因。

真正能撐過每週例行發布的流程,往往是最無趣的那種:乾淨的音訊進來,機器出草稿,做一次專注的校對,再轉成文字最終要去的地方適用的格式。Hushscript 負責處理中間這一段:每份逐字稿都免費附上說話者標籤、涵蓋大約 99 種語言、單次上傳最多可達 10 小時,並採用預付分鐘制而非訂閱。把一集節目拖到 Podcast 逐字稿 頁面,在您建立任何東西之前,前 5 分鐘就會先帶著說話者標籤回傳給您。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

轉錄一集節目實際上要花多少時間?

轉錄工作在背景執行,時間只占節目長度的一小部分。真正花時間的是校對這一關。乾淨的雙麥克風訪談,抓節目長度四分之一左右的時間,一邊聽音訊一邊校正人名、同音字和交疊發言就差不多了。四個聲音以上、錄音又雜亂的節目則會花更久。

我需要帳號才能看看它怎麼處理我的節目嗎?

預覽不需要帳號。把一集節目拖到 Hushscript 首頁或 Podcast 逐字稿頁面,前 5 分鐘就會帶著說話者標籤回傳給您,讓您用自己的音訊判斷分離效果和文字品質。要轉錄完整節目才需要帳號。

它最多能分離幾位說話者?

聲音數量沒有上限,任何逐字稿的說話者標籤也都不額外收費。當每個人的聲音夠有辨識度、又沒有一直互相搶話時,準確度會最好。讓每位參與者各自錄在獨立軌道上,是最乾淨的輸入方式。

Podcast 逐字稿要花多少錢?

Hushscript 採預付分鐘制,沒有訂閱,一集 60 分鐘的節目就會扣掉餘額中的 60 分鐘。新帳號享有 30 分鐘免費額度,可透過 1 美元的信用卡驗證領取(該筆授權會立即釋放,從不收費),或是在您第一次購買時直接取得。分鐘數效期為 365 天,任何一次完成的轉錄或新的購買都會重設這個效期。

我可以直接轉錄影片錄影,不用先匯出音訊嗎?

可以。Hushscript 會在您的瀏覽器中擷取音軌,因此影片檔案本身永遠不會上傳。這樣一來,您的網路連線就不必上傳動輒好幾 GB 的檔案,畫面也留在您的裝置上。如果您已經有音訊匯出檔,直接用它更快。

開場音樂或背景配樂會不會搞亂逐字稿?

段落之間的音樂通常會被跳過,或是原封不動地留在轉錄結果之外,人聲底下一小段配樂通常也不會出問題。真正可能拖累準確度的,是持續講話底下一直播放的背景配樂。錄音時人聲保持乾淨,之後在剪輯軟體裡再加音樂,逐字稿會最乾淨。

一次最多可以上傳多長的節目?

每次上傳最多 10 小時,沒有固定的檔案大小上限。四小時的座談或一場現場錄音都能整份當成一個檔案處理,說話者標籤全程一致,時間戳記也連續累計,不會在下集重新從零開始。

如果有一集完全不該存檔怎麼辦?

使用私密模式。語音辨識仍然照常執行,但不會有任何內容存進您的帳戶:結果會變成一個受密碼保護的 .husharchive 讓您下載,如果您一直不下載,它就會過期失效。這條路徑上無法使用翻譯、醫療模式和 Insights。

從 30 分鐘免費額度開始

$1 暫授權用於確認您的卡片,並會立即釋放——絕不收費,您的 30 分鐘免費時數也會立刻到帳。

開始––30 分鐘免費