跳至主要內容

如何在不上傳影片的情況下將 MP4 轉成文字

作者: 發布: 最後審閱:

即使語音辨識只需要其音軌,上傳優先的視訊工作流程也可能會傳送整個 MP4。根據解析度、編解碼器和位元率,長錄音可能會達到數千兆位元組。 Hushscript 避免了這種傳輸:瀏覽器首先準備音訊,來源視訊保留在您的裝置上。

Hushscript 採取不同的路徑。您的瀏覽器會在上傳開始之前從影片中提取音訊,因此原始 MP4 會保留在您的裝置上。僅轉錄音訊,並在轉錄完成後將其刪除。本指南將介紹整個過程:步驟、錄製的網路研討會的實例、如何提取 SRT 字幕、以相同方式工作的其他視訊格式以及出現問題時該怎麼做。

為什麼您的影片不應該上傳

影片軌道與轉錄無關。語音引擎只需要音訊。上傳圖片純粹是浪費:網路時間、伺服器儲存和您不需要的隱私足跡。

瀏覽器內提取的工作原理,以淺白方式

MP4 是一個容器。它內部有不同的串流:視訊(圖片)、音訊(聲音)和一些元資料––MDN 的視訊處理指南中解釋了這種結構。轉錄僅需要音訊流。

Hushscript 在頁面上執行一個小型瀏覽器原生媒體工具包。當您放下 MP4 時,該工具包會在本地打開容器,複製音訊串流,然後將該音訊上傳,而頁面不會將視訊傳送到任何地方。這項工作發生在視訊播放的同一位置:您自己的電腦上。

因此實際結果是:

這對於會議、錄製的訪談、法律證詞以及鏡頭本身敏感的任何內容都很重要。當您使用數 GB 檔案進行慢速連接時,這一點也很重要:首先提取音訊可以將半小時的上傳時間縮短為幾分鐘。

您需要什麼

三樣東西,無需安裝:

您不需要單獨的音訊擷取器、轉換器或任何視訊軟體。拖放 MP4 就是整個輸入。

三步驟轉換 MP4

  1. **將 MP4 拖曳到 /MP4-to-text 頁面。**您的瀏覽器會提取音軌並僅上傳音訊,因此視訊本身會保留在您的裝置上。前 30 秒將作為說話者標記的預覽返回,無需帳戶。
  2. **註冊以轉錄其餘部分。**輸入您的電子郵件地址以建立帳戶。新來的?一旦您驗證付款方式,我們將提供前 30 分鐘的服務,無論是 1 美元的卡持有(授權,然後立即釋放,從未收費),還是您的第一分鐘套餐(如果您以其他方式付款)。不需要卡。轉錄按音訊時長計費,而不是按檔案大小計費。
  3. **匯出轉錄。**準備好後,以 21 種格式中的任一種下載(字幕為 TXT、SRT 和 VTT,文件為 DOCX 和 PDF,資料為 JSON 和 CSV 等)以及受密碼保護的 .husharchive。免費包含說話者標籤。

在交付逐字稿時,音訊會自動刪除。無需記住任何清理步驟。

「以音訊時長計費」是什麼意思

一小時 1080p 的 MP4 可能為 6 GB。從其中提取的音訊(通常為 128-256 kbps 的 AAC)約為 60-120 MB。這就是上傳的內容,分鐘費用是基於一小時的音訊,而不是 6 GB 檔案。

結果:您可以從現場錄音機轉錄一個兩小時的 4K 紀錄片,並支付與小型 MP3 相同的分鐘費用,因為兩者都攜帶相同數量的音訊。解析度、比特率和檔案大小與您的收費完全無關。

一個有效範例:錄製的網路研討會

假設您與兩位示範者一起舉辦了一場 52 分鐘的網路研討會,並將其錄製到一個 MP4 中:q3-product-webinar.mp4,大約 3.4 GB,1080p。您希望為重述電子郵件提供乾淨的逐字稿,並在重播中附加字幕。

實際效果如下:

  1. 您開啟 /MP4-to-text 並拖曳q3-product-webinar.mp4。該頁面在本地提取音訊,因此 3.4 GB 影片變成大約 70 MB 音訊。僅上傳 70 MB 的內容。
  2. 前 30 秒會被標記回來,因此您可以在轉錄完整的 52 分鐘之前對音訊品質進行健全檢查。
  3. 完整逐字稿準備就緒後,內容會依發言段落切分,並標記為 說話者 A說話者 B。您可以點選 說話者 A 並輸入「Priya」,再點選 說話者 B 並輸入「Marcus」;所有相同標籤都會一次更新。
  4. 您匯出 TXT 作為重述電子郵件,並匯出 SRT 作為重播字幕軌道。網路研討會的原始 MP4 從未離開過您的筆記型電腦,音訊已從伺服器中刪除。

第一次使用時最讓人意外的是步驟 1:原以為要上傳數 GB 的影片,其實根本不需要。畫面留在您的裝置上,只有語音內容會送出。

多人影片的說話者標籤

每個逐字稿都包含自動說話者分離,無需額外付費。對於訪談、小組討論或會議錄音,每個說話者都被標記為說話者 A說話者 B等,您可以透過點擊標籤並鍵入來在編輯器中將其重命名為真實姓名。

說話者分離在清晰分離的情況下效果最佳。安靜房間中的相機音訊或記錄每個參與者軌蹟的視訊通話,可以讓引擎發揮最大作用。對於任何說話者分離引擎來說,在擁擠的房間裡人們互相交談都會變得更加困難。請參閱下面的故障排除部分以取得協助。

從影片中取得字幕 (SRT/VTT)

如果您轉錄影片的原因是字幕,請將轉錄內容匯出為 SRT。每個話語都帶有開始和結束時間戳,格式為 SRT 規範:

1
00:00:04,210 --> 00:00:07,880
說話者 A:感謝您今天加入我們。

2
00:00:08,100 --> 00:00:12,340
說話者 B:很高興來到這裡。

將 SRT 旁加載到桌面播放器中(VLC、QuickTime 和大多數編輯器都接受),或將其作為字幕軌道上傳到平台上那個支援一個。 Hushscript SRT 匯出保留說話者標籤,這對於多人影片非常有用。某些字幕格式會刪除名稱; SRT 保留了它們。

對於使用 WebVTT (.vtt) 的網絡播放器,與 SRT 的區別很小:WEBVTT標題行和時間戳中的.而不是,。您可以使用 /tools/SRT-to-VTT 中的免費工具在瀏覽器中將 SRT 轉換為 VTT;轉換在頁面本地運行。

兩個同級指南比這裡的空間更深入:如何從影片建立 SRT 字幕介紹了編輯提示時間和行長度,如何向影片添加字幕介紹了附加錄 SRT 或將其刻錄到其中。將字幕永久刻錄到圖片中是一個單獨的項目編碼步驟。擁有 SRT 後,HandBrake 等免費工具即可處理多工器。

其他視訊格式(MOV、WebM、MKV)

相同的瀏覽器提取過程不僅適用於 MP4:

這些容器攜帶常用的音訊編解碼器(AAC、MP3、Opus、FLAC),提取步驟將它們分解,就像處理 MP4 一樣。實際上,手機、相機或螢幕錄影機上錄製的任何內容都可以。只需將其放入即可。

您也可以直接提供 MP3、WAV、M4A 等純音訊檔案。由於沒有要剝離的視訊串流,因此將跳過提取步驟並按原樣上傳檔案。如果您只需要音訊檔案本身而不是逐字稿,將 MP4 轉換為 MP3 是一項單獨的工作,也完全在瀏覽器中運作。 視訊到文字頁面涵蓋了任何視訊格式的完整工作流程,包括具有不常見音訊編解碼器的視訊格式。

故障排除

常見 MP4 檔案通常不需要手動準備。如果失敗或產生的文字較弱,請先檢查這些原因。

**來源視訊非常大。**該應用程式沒有檔案大小限制 - 只要錄製時間在 10 小時之內,它就可以直接在瀏覽器中準備非常大的視訊的音訊(您的瀏覽器仍然需要足夠的本地容量來完成這項工作)。如果提取在一個巨大的 4K 檔案上停止,請關閉其他標籤並重試,或先提取音訊。免費的提取音訊工具可以在瀏覽器中執行此操作,並產生一個可以直接上傳的較小檔案。

**沒有音軌,或沒有語音。**無聲螢幕錄製或純音樂片段沒有任何內容可供引擎轉錄,因此您將獲得一個空結果。透過調高音量播放來確認影片確實有語音。如果是螢幕錄製,請檢查錄音機是否設定為擷取系統或麥克風音訊;許多預設為僅視訊。

**不受支援或模糊的音訊編解碼器。**瀏覽器內提取器處理常見編解碼器(AAC、MP3、Opus、FLAC)。使用不尋常或專有音訊編解碼器的容器可能無法乾淨地解復用,並且不會提取音訊。解決方法是先將視訊的音訊重新混合或重新編碼為標準編解碼器;大多數轉換器可以輸出標準 MP4 或普通音訊檔案。如果您遇到無法通過的格式,請發送電子郵件至support@hushscript.com,我們將考慮添加它。

多位說話者,分離結果混亂。 說話者分離需要聲音彼此可辨。語音重疊、在大房間中只使用一支遠距麥克風,或背景噪音過重,都會模糊說話者之間的界線。逐字稿本身仍可保持準確,只是說話者標籤的精準度會較低。若您能控制錄音方式,為每位參與者保留獨立音軌(多數視訊通話工具皆可匯出),或把麥克風移近每位說話者,都能得到最清楚的分離結果。無論採用哪種方式,匯出前都可以在編輯器中修正標錯說話者的行。

**轉錄內容有一致的拼字錯誤。**總是以相同錯誤方式轉錄的重複出現的專有名詞或行話是一次性修復:匯出文字中的單個查找和替換即可更正每個實例。這比重新運行任何內容都要快。

匯出格式一覽

格式 您得到的內容
TXT 純文字、說話者標籤、無時間戳
SRT 帶時間戳記的字幕,可側載到任何視訊播放器中
VTT HTML5 影片播放器的網頁字幕
CSV 適合電子表格的行,包含說話者和計時
Markdown 用於註釋和發布的說話者標記文字
JSON 結構化資料:每次話語的{ speaker, start, end, text }
DOCX Word 或 Google 文件的說話者標記逐字稿
PDF 用於共享或存檔的固定版式逐字稿

每個方案均包含所有匯出格式,包括 30 分鐘免費時間,且沒有浮水印。


適用於任何涉及隱私的影片無論是會議、訪談或證詞,這一點都很重要:你的影片永遠不會上傳。你可以自己驗證一下。在拖入檔案之前開啟瀏覽器的網路標籤並查看發送的內容;您會看到音訊增強,而圖像保持不變。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

MP4 視訊檔案是否上傳到伺服器?

否。在任何內容離開您的裝置之前,您的瀏覽器會從影片中提取音軌。僅發送音訊進行轉錄。原始 MP4 保留在您的機器上。您可以在瀏覽器的網路標籤中自行確認:您將看到上傳的小音訊,而不是數 GB 的影片。

我可以使用的最大影片大小是多少?

沒有檔案大小限制 - 無論來源影片有多大,都可以接受長達 10 小時的錄製內容。因為只有音訊上傳,所以長影片發送的資料通常遠少於磁碟上的大小。

轉錄 MP4 要多少錢?

在使用 1 美元的卡檢查後,您將獲得 30 分鐘的免費時間(保留已授權,然後立即釋放,無需付費),或者如果您以其他方式付款,則可在首次購買時獲得 30 分鐘免費時間。之後,它是即用即付,根據音訊的持續時間計費,而不是視訊的檔案大小。請參閱定價頁面以了解套餐費用。

我可以從 MP4 取得 SRT 字幕嗎?

可以。轉錄後,匯出為SRT。 SRT 檔案在每次說話時都包含開始和結束時間戳,可以側載到大多數影片播放器中或作為字幕軌道上傳。它會保留說話者標籤,而其他一些字幕格式則會刪除這些標籤。

還有哪些影片格式也能以同樣的方式運作?

MOV、WebM、MKV 以及大多數帶有標準音訊編解碼器(AAC、MP3、Opus、FLAC)的容器格式。瀏覽器內擷取步驟處瞭解復用,因此此方法與 MP4 相同。

我的影片沒有語音音訊。我還能轉錄嗎?

不可以。轉錄是根據語音進行的,因此沒有音軌或無聲螢幕錄製的影片沒有任何可轉錄的內容。如果有背景音樂但沒有語音,結果將是空的或噪音,因為引擎只回傳單字。

轉錄後音訊是否被刪除?

是。當您的逐字稿準備好時,提取的音訊就會從伺服器中刪除,並且語音引擎不會保留任何內容。逐字稿本身是靜態加密的,因此即使儲存洩漏也會暴露不可讀的密文,而不是您的文字。

從 30 分鐘免費額度開始

開始––30 分鐘免費