如何轉錄長錄音(2 小時以上)
作者: Hushscript 發布: 最後審閱:
長時間的記錄使每個限制都可見:最長持續時間、瀏覽器準備、上傳可靠性、分鐘餘額和佇列保護。如果您需要將 3 小時的面試、半天的研討會或董事會會議轉換為文字,請在上傳之前而不是在工作失敗之後檢查這些邊界。
Hushscript 的上傳時間每次最多 10 小時,沒有檔案大小限制- 大檔案會在您的瀏覽器中準備好。沒有基於計劃的每日津貼; 40 小時滾動至 24 小時的高安全上限和主動工作保障措施為服務提供保障。長文件並不是這裡的特例。它與兩分鐘剪輯的工作流程相同,只需自行完成即可。
開始之前需要什麼
您需要三樣東西,而且您可能已經具備了這三樣東西。
- 錄音本身,採用任何常見的音訊或視訊格式:MP3、M4A、WAV、FLAC、AAC、 MP4、MOV、MKV 等。無需先轉換它;只需將文件放入即可。
- **現代瀏覽器。**前 30 秒在瀏覽器中準備為緊湊的預覽剪輯,並發送以進行預覽轉錄;在您登入之前,不會上傳完整文件。對於視訊文件,瀏覽器也會準備音訊,而不發送來源視訊。
- **您的餘額中有足夠的分鐘來覆蓋持續時間。**這是值得預先檢查的數字。 2.5 小時的訪談相當於 150 分鐘,因此 5 小時(300 分鐘)的分鐘包仍綽綽有餘。新帳戶有30分鐘免費試用全流程;請參閱定價頁面以了解每包的費用。
關於免費分鐘的簡要說明,因為長時間的錄音會很快消耗掉:您一次可以獲得 30 分鐘的免費時間。解鎖它們的最快方法是添加一張卡(持有 1 美元即可驗證並立即釋放,無需付費),並且分鐘數會立即生效。如果您想使用您所在國家/地區可用的其他付款方式,則在您首次購買時將有 30 分鐘的時間。不需要卡;這只是最快的路線。在將完整包提交到一個三小時的文件之前,三十分鐘足以轉錄一個短片段並判斷準確性。
長時間上傳之前要驗證什麼
四項檢查可以防止大多數意外:
- **每個檔案的持續時間。**Hushscript 接受最長 10 小時的錄音。較長的源需要自然分割。
- **瀏覽器和設備容量。**沒有產品檔案大小限制,但瀏覽器仍需要讀取和準備本機來源。非常大的檔案需要足夠的記憶體、儲存空間和裝置上的上傳時間。
- **分鐘餘額。**按照音訊時長計費。 150 分鐘的錄製在任何更改計費持續時間的選項之前都會花費 150 個基本分鐘。
- **服務保障。**沒有基於計劃的每日津貼,但 40 小時滾動 24 小時安全上限和活動工作保障仍然適用。大批量文件可以排隊,而不是一次啟動每個文件。
在上傳之前確認這些邊界。 Hushscript 在這裡說明了它們,以便可以從來源持續時間開始規劃長作業,而不是透過反覆試驗來發現。
一步步轉錄長錄音
無需開啟長錄音模式。該過程與短片相同;它只是在後台運行時間更長。
- **打開轉換器並拖入檔案。**前往音訊轉文字並將錄音拖曳到上傳區域,或按一下瀏覽。接受任何常見的音訊或視訊格式。如果是影片,此時會在您的瀏覽器中提取音訊,因此繁重的影片文件永遠不會離開您的機器。
- **檢查 30 秒預覽。**在您註冊之前,Hushscript 會在您的瀏覽器中準備一個短片,發送該剪輯進行轉錄,並向您顯示帶有說話者標籤的輸出。在此階段,完整錄音仍保留在本地。閱讀預覽,確認說話者是否合理分割且單字正確,您就會知道音訊是否足夠乾淨以適合完整運行。
- **登入以轉錄其餘部分。**如果預覽看起來正確,請註冊並上傳完整文件。這就是您的分鐘餘額很重要的地方:150 分鐘的文件花費 150 分鐘。確保您擁有的包涵蓋了持續時間。
- **讓作業自行完成。**處理時間因文件長度和服務負載而異,但作業在無人值守的情況下運行。您不必讓選項卡保持焦點;完成後回來。
- **重新標記說話者。**文字到達時帶有通用標籤,如
說話者 A和說話者 B。在編輯器中,將說話者 A重新命名為真實姓名一次,文件中的所有位置都會更新,這樣三小時的採訪就可以從頭到尾閱讀正確的姓名。 - **以您需要的格式匯出。**以 21 種格式中的任一種(TXT、SRT、DOCX、PDF 以及其中的字幕和編輯器時間軸格式)下載,並帶有受密碼保護的 .husharchive,任何格式都沒有水印其中。 SRT 是處理長文件的最佳選擇,因為它的時間戳讓您可以直接跳到任何時刻,而無需滾動。
結果位於您的儀表板中,其中包含說話者標籤、時間戳和完整的匯出選單,並且它會保留在那裡供您返回。
一個有效範例:2.5 小時的錄音訪談
以下是真實檔案形狀的外觀。假設您將一段長達 2 小時 30 分鐘的訪談錄製為一個 MP3:兩個人,一個安靜,一個大聲,透過視訊通話錄製。
您將 MP3 放在上傳區域。 30 秒的預覽顯示在開場樣本中兩個說話者已經分開。您登入; 150 分鐘的文件上傳並開始作業。完成後,結果是一份連續的文件,其時間戳從00:00:00到02:30:00不間斷地運行。
原始輸出如下所示:
[00:00:04] 說話者答:感謝您抽出時間。我們可以從專案是如何開始的開始嗎?
[00:00:11] 說話者 B:當然可以。所以這真的是從 2023 年初開始的,當時...
您只需將 說話者 A 重新命名為訪談者、將 說話者 B 重新命名為受訪者一次,所有相關行就會一併更新。接著匯出兩種格式:將 TXT 貼入摘要工具以製作初步摘要;使用 SRT,則能在撰寫直接引文時點選時間戳記,準確回聽原話。總成本為 150 分鐘:上傳一次,不必切割、不會截斷,也不需要重試。
在長時間的會話中標記說話者
對 3 小時的錄音進行說話者分離確實比對 10 分鐘的剪輯更難:聲音漂移、停頓拉長、背景噪音來來去去。 Hushscript 會立即在整個記錄上運行標籤,因此標籤端對端保持一致,但錄音本身可能會有所幫助或損害。
在錄製時:
- 如果您的工具可以捕捉每個參與者的單獨軌道,請使用它。例如,Zoom 的本地錄音可以根據設定產生混合軌道或每通道音訊;混合立體聲軌道通常最適合上傳。
- 錄製實體房間是一個困難的情況。定向麥克風或簡單地將說話者放置得更遠,可以消除串擾,從而使兩個聲音讀成一個聲音。
音訊品質:
- 44.1 kHz / 16 位元 WAV,或 128 kbps 以上的高位元率 MP3,對語音引擎已綽綽有餘。96 kHz 不會提高準確度,只會讓長錄音的檔案更大。
- 如果錄音安靜或不均勻,在上傳之前在音訊編輯器中規範化音量通常比任何設定更改都更能提高準確性。
一旦文字返回,用真實姓名重新標記說話者 A是一次性編輯,會傳播到整個文件。若要更深入了解標籤本身的工作原理,請參閱說話者辨識。
分割文件,還是整個上傳?
幾乎每個人的簡短答案:**整個上傳。**將長錄音分成幾個部分是應該避免的事情,而不是要做的事情,只有兩種情況可以這樣做必要。
當錄音時間為 10 小時或以下時,上傳為一個文件,其中涵蓋了絕大多數採訪、講座、會議和小組討論 - 沒有文件大小上限可供解決。一個文件意味著一組連續的時間戳記和一組一致的說話者標籤。拆分會破壞兩者:每個部分都會從零重新啟動時鐘,而同一個人可以在第二部分中獲得與第一部分不同的標籤,使您需要手動縫合和重新映射。
語音系統仍可能在內部分割長音訊。最近的IWSLT 2026 長篇語音處理的研究比較了幾種分段策略,發現選擇會影響穩健性。這是引擎層級的問題,而不是手動剪切來源的理由:保留一次上傳可以保留連續的面向使用者的記錄,同時處理管道處理其自己的內部邊界。
只有在錄製確實超過 10 小時時才分割,例如多天的會議錄製。在這種情況下,請中斷自然沉默(會話中斷)而不是句子中間,並記下偏移量,以便之後可以重新編號時間戳。如果您在上傳之前剪切 MP3,請優先選擇恆定位元速率 (CBR) 而不是可變位元速率 (VBR),因為 VBR 可能會在某些編輯器中引入同步漂移。
多 GB 影片檔案不是問題。由於 Hushscript 在上傳之前會在您的瀏覽器中提取音訊,因此源影片的大小不是上傳大小,並且源文件的大小沒有上限 - 只要您的瀏覽器和設備可以準備好,只會傳輸小得多的音訊流。
長音訊準確度的最佳設定
影響準確度的最大因素是語音清晰度,而不是取樣率或檔案格式。特別是對於長時間的會話:
- 在錄音端使用壓縮器(硬體或軟體音訊壓縮器,而不是檔案壓縮)來平衡大聲的訪談者和安靜的受訪者之間的差距。這在三個小時內比在十分鐘內更重要,在十分鐘內,電平的一個漂移可能會導致整個交換失敗。
- FLAC 是無損且被接受的,但它在準確性方面無法擊敗好的 MP3。它唯一真正的用途是消除疑慮:如果您想確定音訊品質不是瓶頸,FLAC 可以以更大的檔案為代價來解決這個問題。
- 上傳前避免重度降噪。 過度降噪可能削弱子音,反而降低準確度。輕度正規化有幫助,強力清理則沒有。
對常見的長檔案問題進行故障排除
**錄音後半部的準確性下降。**這幾乎總是在長時間會話後期音訊電平下降或房間噪音上升,而不是長度限制。檢查錯誤聚集的時間戳周圍的原始記錄;如果電平下降,則標準化並重新運行,並在稍後片段上使用 30 秒預覽進行確認,然後再次花費幾分鐘。
**兩個人不斷合併為一個說話者。**重疊語音和串擾是常見原因。事後並沒有完美的解決方案,但聲音之間有更多分離的錄音(每個通道的音軌,或麥克風距離更遠)下次會更加清晰地分離。在您現在的逐字稿中,您可以在編輯器中手動修正偶爾出現的錯誤標籤。
**大檔案上傳速度較慢。**上傳速度取決於您的連接,而不是工具。對於多 GB 的影片,請記住首先在本地提取音訊,因此實際上傳的文件比磁碟上的文件小得多。如果您的連線訊號較弱,則可以使用有線連接或直接讓它運作。
**整個錄音過程中的背景噪音。**穩定的噪音(空調、交通、房間嗡嗡聲)會降低整個文件的準確性。輕音量歸一化通常比去噪更有幫助,而去雜訊往往會損害語音。如果某個片段受到嚴重影響,時間戳仍然可以讓您找到它並回聽。
**逐字稿看起來提前結束了。**在 Hushscript 上,逐字稿涵蓋了整個文件;沒有無聲的截斷。如果文字看起來很短,請根據錄音的實際長度檢查最終時間戳記。長時間的沉默或音樂只會產生幾個單詞,這些單詞可能會被讀作“缺失”,但事實並非如此。
匯出長文字:哪一種格式
對於一個多小時的會議,您選擇的格式會改變文字的可用性。
- TXT是最容易攜帶的,也是輸入到 LLM 的正確輸入。總結或分析長對話。
- SRT帶有話語級時間戳,因此您可以跳到任何時刻而無需滾動。如果您轉錄的目的是尋找特定時刻,那麼這就是格式。
- DOCX將說話者標籤和時間戳保存在與 Word 相容的檔案中,最適合與需要評論的人共享轉錄。
- JSON為您提供原始結構(說話者、開始、結束、文字),以便透過管道傳輸到另一個檔案
每個匯出都包含在每個方案中,沒有浮水印,也無需單獨支付解鎖字幕的費用。
對於按分鐘計費的長時間錄製,即用即付轉錄避免了重複的每月計劃。您按轉錄時間付費,並具有較高的滾動安全上限和針對異常繁重批次的活動作業控制。兩個最常見的長錄音工作都有自己的演練:如何轉錄播客涵蓋多嘉賓劇集和節目筆記,如何轉錄講座涵蓋課堂音訊怪癖,例如混響和來自房間另一端的觀眾問題。如果您的材料是一堆單獨的文件而不是一個長錄音,那麼轉錄一個錄音資料夾涵蓋了將它們批量運行。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: