跳至主要內容

如何將 WAV 檔案轉換為文字(免費試用)

作者: 發布: 最後審閱:

WAV 檔案是未壓縮的音訊,這使其成為準確轉錄的有力起點。權衡是大小:WAV 檔案很大,但沒有檔案大小限制––即使是非常大的檔案也只是為您準備好的。本指南涵蓋了整個工作:將 WAV 文件轉換為文字、獲取乾淨的說話者標籤、處理大文件以及以您實際需要的格式匯出逐字稿。

WAV 出現在品質重要的任何地方:現場錄音機保存到 SD 卡、從 DAW 混音和匯出音訊、Windows 錄音機輸出以及廣播採訪設備。逐字稿身的工作方式與任何其他格式相同:上傳、轉錄、匯出。首先值得了解的是為什麼無損音訊有幫助,以及如何保持檔案大小易於管理。

為什麼 WAV 的準確度很高

WAV 是未壓縮的容器。與 MP3 或 M4A 不同,它沒有有損壓縮步驟,因此引擎接收的音訊與錄製的音訊相同,沒有添加和丟棄任何編碼偽影。

實際上,這在兩種情況下最重要:

對於乾淨的錄音室錄音或精心設定的採訪,來自同一來源的 128 kbps MP3 可提供幾乎相同的準確性。 WAV 的優勢是真實的,但除非條件困難,否則是有限的。因此,「我應該以 WAV 格式錄製以獲得更好的轉錄結果」的誠實答案是:它有一點幫助,而且錄製環境越差,幫助越大。

引擎實際使用的內容

語音模型主要在 16 kHz 單聲道音訊上進行訓練。當您上傳 48 kHz 立體聲 WAV 時,引擎會先進行下取樣並混合為單聲道,然後再執行其他操作。語音的有用範圍大致位於 300 Hz 到 8 kHz(電話頻帶)之間。乾淨利落地捕捉該範圍是最重要的,任何 16 kHz 或以上的像樣麥克風都已經做到了。

實際結果:同一語音的 48 kHz WAV 和 16 kHz WAV 會產生相同的轉錄內容。高取樣率不會有什麼壞處,但對文字也沒有幫助。他們只是使文件更大。如果您控制錄音設定並希望在不放棄任何內容的情況下實現最小上傳,那麼 16 kHz 單聲道是最低選擇。

您需要什麼

轉錄按音訊持續時間計費,而不是檔案大小。 44.1 kHz、16 位元的一小時 WAV 大小約為 600 MB,但成本與一小時 MP3 相同。免費時間足以在您提交完整批次之前轉錄一個簡短的樣本並檢查您自己的錄音的準確性。

只需三個步驟即可將 WAV 檔案轉換為文字

  1. **開啟轉換器並登入。**前往 /audio-to-text 並登入。新帳戶付款後即可獲得 30 分鐘免費時間添加了方法,足以測試端到端的錄音。
  2. **上傳WAV檔案。**將其拖曳到上傳區域或按一下瀏覽。大多數文件都遵循直接路徑。更大的文件會直接在您的瀏覽器中暫存和準備,具體取決於設備容量;僅當文件無法按原樣上傳時,才會使用本地 16 kHz 單聲道 FLAC 轉換。
  3. **下載逐字稿。**處理完成後,逐字稿會出現在儀表板中,並已套用說話者標籤和時間戳記。以 21 種格式中的任一種匯出,包括 TXT、SRT、VTT、DOCX 和 PDF,或作為受密碼保護的 .husharchive。

說話者標籤顯示為說話者 A說話者 B等。按一下標籤可將其重新命名。一旦您將“說話者 A”設為真名,該說話者的每一行都會更新。

一個有效的範例:現場錄音訪談

假設您用手持式現場錄音機錄製了一段 40 分鐘的採訪,兩個人,保存為 44.1 kHz / 16 位立體聲 WAV,名為field-interview.wav。該檔案大約有 400 MB。以下是工作的實際過程。

該檔案是正常大小,因此無需轉換任何內容;您按原樣上傳。由於房間裡有一些空調嗡嗡聲,您首先在音訊編輯器中運行 80 Hz 的高通濾波器並重新匯出;消除了引擎會讀取為噪音的低隆隆聲,並且重新匯出到 WAV 可以保持音訊無損。您上傳清理後的文件。

處理完成後,傳回的逐字稿會分為說話者 A(您)和說話者 B(您的主題),每輪都有時間戳記。您重新命名兩個說話者,瀏覽一次引擎猜測的專有名詞,例如公司名稱或地點,然後透過尋找和替換修復重複的錯誤。然後匯出:DOCX 用於可讀的採訪,如果您還需要與視訊剪輯對齊的時間戳,則匯出 SRT。

此模式(輕度預處理、上傳、重新標記、略讀、匯出)適用於幾乎所有訪談或會議 WAV。對於更長或更大的文件,唯一改變的是您是否先壓縮它。

處理大型 WAV 檔案

44.1 kHz / 16 位元立體聲 WAV 每分鐘運行約 10 MB。兩個小時的會話大約為 1.2 GB,長時間的多軌匯出可能會更大。有兩件事值得規劃。

**沒有檔案大小限制可供規劃。**您通常不需要手動縮小較大的 WAV – Hushscript 可以直接在瀏覽器中階段和準備非常大的文件,僅當文件無法遵循直接上傳路徑時才使用本地 16 kHz 單聲道 FLAC 回退。如果您的裝置無法輕鬆準備來源,可以使用瀏覽器內的免費WAV 到 MP3 轉換器或音訊編輯器先製作較小的檔案。

上傳時間。在 10 Mbps 連線上傳 1 GB WAV 大約需要十五分鐘。在慢速連結上,上傳前進行壓縮可以顯著縮短等待時間。如果您不需要逐位無損,壓縮音訊工具會以較小的、通常聽不見的品質成本進一步縮小文件,這對於語音來說很少是問題。

**攜帶單聲道內容的立體聲。**大量錄音保存為立體聲,但實際上在兩個通道上包含相同的音訊:左右聲道複製一個麥克風。將其轉換為單聲道 WAV 或 FLAC 可以將檔案大小減半,而不會損失準確性,因為引擎無論如何都會混合為單聲道。這是應用時最簡單的尺寸勝利。

對困難錄音進行預處理

在上傳邊界檔案之前,在音訊編輯器中進行兩次快速編輯會得到回報:

這兩個步驟都不需要乾淨的錄音。它們是針對需要幫助的錄音的有針對性的修復,並且在任何編輯後重新匯出為 WAV 都可以保持音訊無損。

WAV 與 MP3 進行轉錄:無損真的有幫助嗎?

這是大多數 WAV 決策背後的問題,所以這裡是純版本。

對於準確性,無損有一點幫助,而且有更多幫助源頭越差。在乾淨的錄音中,WAV 和優質 128 kbps MP3 之間的差異很難在轉錄中察覺。在安靜或吵雜的錄音中,WAV 的額外保真度為引擎提供了更多的支援。不管怎樣,格式很少是你和可用的逐字稿之間的障礙。錄音品質為。

對於工作流程,MP3 在大小和上傳速度方面勝出,而 WAV 作為您在編輯之間保留的工作母帶勝出。常見的中間路徑:將編輯後的母帶保留為 WAV 或 FLAC,如果需要透過慢速連接上傳,請傳送高位元速率 MP3。您在逐字稿中幾乎不會丟失任何內容,並節省大量上傳時間。 MP3 到文字指南完整地涵蓋了該路徑。

簡短版本:如果品質很重要,請以 WAV 格式錄製和存檔,但當 100 MB 的檔案也能轉錄時,不必上傳 1 GB 檔案。

WAV 的準確度提示

說話者標籤和時間戳

每個 WAV 轉錄內容都包含自動說話者分離,這是每項工作的免費福利,而不是付費等級或按說話者追加銷售。兩人錄音(例如訪談者和拍攝對象)或錄製到立體聲軌道的兩側通話,會清晰地呈現出來。對於任何說話者分離引擎來說,較大的團體錄音(會議桌旁有四個或更多人)都比較困難,因此需要對嘈雜的房間錄音進行一些標籤清理。

SRT 匯出對於來自影片製作的 WAV 檔案特別有用。如果您單獨錄製音訊(在後期同步的吊桿麥克風或 lav 音軌),SRT 時間戳可讓您將逐字稿重新排列到圖片,而無需手動擦除音訊。

匯出選項

格式 註解
TXT 帶有說話者標籤的純逐字稿,沒有時間戳。適合搜尋、引用和輸入其他工具。
SRT 每句的時間戳記。可在 VLC、影片編輯器和字幕工具中開啟的標準字幕和字幕格式。
VTT 適用於 HTML5 視訊和發布工作流程的 Web 字幕格式。
CSV 支援電子表格匯出,包括說話者、計時和文字欄位。
Markdown 用於註釋、文件和發布的可編輯純文字結構。
JSON 用於自訂處理管道的結構化輸出(每個話語{ speaker, start, end, text })。
DOCX 與 Word 相容,在可讀佈局中包含說話者標籤和時間戳,以便共用或註解。
PDF 用於共享或存檔的固定佈局轉錄。

任何格式都沒有浮水印,並且每個轉錄都包含匯出內容。更高層後面沒有東西。


如果您的 WAV 是邊緣錄製且準確性是首要考慮因素,則MP3 到文字指南涵蓋了同樣適用於此處的標準化和其他預處理步驟。如果您希望將其轉換為 MP3 並轉錄,免費轉換器將在您的瀏覽器中運行,而無需上傳檔案。要在一個地方獲取可接受的格式和功能的完整列表,音訊轉文字頁面擁有一切。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

我需要在上傳之前壓縮 WAV 檔案嗎?

通常不需要。大多數 WAV 檔案直接按原樣上傳,沒有檔案大小限制。對於特別大的文件,Hushscript 會在您的瀏覽器中本地暫存並準備一個緊湊的 16 kHz 單聲道 FLAC,因此您無需手動壓縮任何內容。

WAV 轉錄比 MP3 更準確嗎?

稍微準確一點。 WAV 沒有有損壓縮,但來自同一來源的 128 kbps 或更高的 MP3 在實踐中給出了幾乎相同的結果。 WAV 的邊緣主要在來源錄音品質已經較低時出現,例如安靜的房間或廉價的麥克風。

支援哪些取樣率?

從 8 kHz 到 48 kHz 的任何標準速率。語音在 16 kHz 以上沒有精度增益,因為引擎工作在語音訊段,而不是超音波範圍。相同音訊的 48 kHz 和 16 kHz WAV 會產生相同的逐字稿。

我可以在 WAV 檔案上取得說話者標籤嗎?

可以。無論格式如何,說話人分離都會在每個記錄上運行,無需額外費用。兩人的訪談結果完全不同;您只需點擊一下即可將說話者 A 和說話者 B 重新命名為真實姓名。

如果我的 WAV 檔案非常安靜怎麼辦?

安靜的音訊為引擎帶來的訊號較少,從而降低了準確性。如果波形檢視器中的峰值未達到大約 -12 dBFS 以上,請在上傳之前在音訊編輯器中對檔案進行標準化。

單聲道或立體聲對於 WAV 檔案重要嗎?

為了準確起見,沒有。引擎在內部混合為單聲道。但是,如果兩個頻道都包含相同的內容,則匯出單聲道檔案可將大小減半,而不會造成品質損失,從而加快上傳速度。

免費分鐘數後的費用是多少?

您只需為轉錄的分鐘數付費,無需訂閱。按音訊持續時間計費,而不是按檔案大小計費,因此較大的 WAV 與相同長度的小型 MP3 的費用相同。請參閱定價頁面,以了解目前每分鐘的費率。

從 30 分鐘免費額度開始

開始––30 分鐘免費