Chuyển đến nội dung chính

Cách chuyển đổi tệp WAV thành văn bản (Dùng thử miễn phí)

Tác giả: Ngày đăng: Rà soát lần cuối:

Tệp WAV là âm thanh không nén, điều này khiến đây là điểm khởi đầu vững chắc để có bản chép lời chính xác. Sự đánh đổi là kích thước: các tệp WAV có kích thước lớn, mặc dù không có giới hạn kích thước tệp nào được áp dụng – ngay cả một tệp rất lớn cũng được sắp xếp và chuẩn bị đơn giản cho bạn. Hướng dẫn này bao gồm toàn bộ công việc: chuyển tệp WAV thành văn bản, lấy nhãn người nói rõ ràng, xử lý các tệp lớn và xuất bản ghi theo định dạng bạn thực sự cần.

WAV xuất hiện ở bất kỳ nơi nào có vấn đề về chất lượng: máy ghi hiện trường lưu vào thẻ SD, âm thanh được trộn và xuất từ ​​DAW, đầu ra của Windows Voice Recorder và thiết bị phỏng vấn phát sóng. Bản thân phiên âm hoạt động giống như bất kỳ định dạng nào khác: tải lên, phiên âm, xuất. Điều cần biết đầu tiên là tại sao âm thanh lossless lại hữu ích và cách duy trì kích thước tệp có thể quản lý được.

Tại sao WAV lại mang lại độ chính xác tốt

WAV là một vùng chứa không nén. Không giống như MP3 hoặc M4A, không có bước nén làm suy hao nên âm thanh mà công cụ nhận được giống hệt với những gì đã được ghi, không có thành phần mã hóa nào được thêm vào và loại bỏ.

Trong thực tế, điều này quan trọng nhất trong hai trường hợp:

Đối với một bản ghi âm trong phòng thu rõ ràng hoặc một cuộc phỏng vấn được dàn dựng tốt, MP3 128 kbps từ cùng một nguồn sẽ mang lại độ chính xác gần như giống hệt nhau. Lợi thế của WAV là có thật nhưng khiêm tốn trừ khi điều kiện khó khăn. Vì vậy, câu trả lời trung thực cho “tôi có nên ghi ở định dạng WAV để có bản chép lời tốt hơn” là: nó giúp ích một chút và càng giúp ích nhiều hơn khi môi trường ghi âm của bạn tệ hơn.

Những gì công cụ thực sự sử dụng

Mô hình giọng nói được đào tạo chủ yếu trên âm thanh đơn âm 16 kHz. Khi bạn tải lên WAV âm thanh nổi 48 kHz, hệ thống sẽ lấy mẫu xuống và trộn thành đơn âm trước khi thực hiện bất kỳ điều gì khác. Phạm vi hữu ích cho lời nói nằm trong khoảng từ 300 Hz đến 8 kHz, dải tần điện thoại. Ghi lại rõ ràng phạm vi đó là điều quan trọng và bất kỳ micrô tốt nào ở tần số 16 kHz trở lên đều có thể làm được điều đó.

Kết quả thực tế: WAV 48 kHz và WAV 16 kHz của cùng một giọng nói sẽ tạo ra cùng một bản ghi. Tỷ lệ mẫu cao không gây hại nhưng cũng không giúp ích gì cho từ ngữ. Họ chỉ làm cho tập tin lớn hơn. Nếu bạn kiểm soát cài đặt ghi âm và muốn tải lên nhỏ nhất mà không bỏ sót bất cứ điều gì thì mono 16 kHz là phù hợp.

Những gì bạn cần

Bản chép lời được tính phí theo thời lượng âm thanh chứ không phải kích thước tệp. WAV dài một giờ ở tần số 44,1 kHz và 16 bit có dung lượng khoảng 600 MB nhưng có giá tương đương với MP3 dài một giờ. Số phút miễn phí đủ để chép lại một mẫu ngắn và kiểm tra độ chính xác của bản ghi của chính bạn trước khi bạn chuyển sang một lô đầy đủ.

Chuyển đổi tệp WAV thành văn bản theo ba bước

  1. Mở trình chuyển đổi và đăng nhập. Đi tới /audio-to-text và đăng nhập. Tài khoản mới sẽ nhận được 30 phút miễn phí sau khi thêm phương thức thanh toán. đủ để kiểm tra toàn bộ bản ghi.
  2. Tải tệp WAV lên. Kéo tệp đó vào vùng tải lên hoặc nhấp để duyệt. Hầu hết các tập tin đều đi theo đường dẫn trực tiếp. Thay vào đó, một tệp lớn hơn sẽ được sắp xếp và chuẩn bị ngay trong trình duyệt của bạn, tùy thuộc vào dung lượng thiết bị; chuyển đổi FLAC mono 16 kHz cục bộ chỉ được sử dụng khi tệp không thể tải lên nguyên trạng.
  3. Tải bản ghi xuống. Khi quá trình xử lý hoàn tất, bản ghi sẽ xuất hiện trên trang tổng quan của bạn với nhãn người nói và dấu thời gian đã được áp dụng. Xuất nó ở bất kỳ định dạng nào trong số 21 định dạng, bao gồm TXT, SRT, VTT, DOCX và PDF hoặc dưới dạng .husharchive được bảo vệ bằng mật khẩu.

Nhãn người nói xuất hiện dưới dạng Người nói A,Người nói B, v.v. Bấm vào một nhãn để đổi tên nó. Sau khi bạn đặt “Người nói A” thành tên thật, mỗi dòng của người nói đó sẽ cập nhật.

Một ví dụ hoạt động: một cuộc phỏng vấn được ghi âm tại hiện trường

Giả sử bạn đã ghi âm một cuộc phỏng vấn dài 40 phút trên một máy ghi âm hiện trường cầm tay, hai người, được lưu dưới dạng WAV âm thanh nổi 44,1 kHz / 16-bit có tên là field-interview.wav. Tệp đó có dung lượng khoảng 400 MB. Đây là cách công việc thực sự diễn ra.

Tệp có kích thước bình thường nên không cần phải chuyển đổi bất cứ thứ gì; bạn tải nó lên như cũ. Vì căn phòng có tiếng ồn của điều hòa không khí nên trước tiên bạn chạy bộ lọc thông cao ở tần số 80 Hz trong trình chỉnh sửa âm thanh của mình và xuất lại; giúp loại bỏ tiếng ồn thấp mà hệ thống thường đọc là tiếng ồn và việc xuất lại sang WAV giúp âm thanh không bị mất. Bạn tải lên tệp đã được làm sạch.

Khi quá trình xử lý hoàn tất, bản ghi sẽ được chia thành Người nói A (bạn) và Người nói B (chủ đề của bạn), với dấu thời gian ở mỗi lượt. Bạn đổi tên hai người nói, lướt qua một lần để tìm danh từ riêng mà công cụ đoán được, chẳng hạn như tên công ty hoặc địa điểm, sau đó sửa các lỗi lặp lại bằng tính năng tìm và thay thế. Sau đó, bạn xuất: DOCX cho cuộc phỏng vấn có thể đọc được và SRT nếu bạn cũng cần dấu thời gian xếp hàng cho một đoạn cắt video.

Mẫu đó (xử lý trước nhẹ nhàng, tải lên, gắn nhãn lại, đọc lướt, xuất) áp dụng cho hầu hết mọi cuộc phỏng vấn hoặc cuộc họp WAV. Điều duy nhất thay đổi với tệp dài hơn hoặc lớn hơn nhiều là liệu bạn có nén tệp đó trước hay không.

Xử lý các tệp WAV lớn

WAV âm thanh nổi 44,1 kHz / 16 bit chạy khoảng 10 MB mỗi phút. Phiên kéo dài hai giờ có dung lượng khoảng 1,2 GB và bản xuất nhiều bản nhạc dài có thể lớn hơn. Có hai điều đáng để lập kế hoạch.

Không có giới hạn kích thước tệp để lập kế hoạch. Thông thường, bạn không cần phải thu nhỏ một WAV lớn hơn bằng tay – Hushscript sẽ xử lý và chuẩn bị ngay cả một tệp rất lớn ngay trong trình duyệt, chỉ sử dụng dự phòng FLAC mono 16 kHz cục bộ khi tệp không thể đi theo đường dẫn tải lên trực tiếp. Nếu thiết bị của bạn không thể chuẩn bị nguồn một cách thoải mái, bộ chuyển đổi WAV sang MP3 miễn phí trong trình duyệt hoặc trình chỉnh sửa âm thanh trước tiên có thể tạo một tệp nhỏ hơn.

Thời gian tải lên. WAV 1 GB trên kết nối 10 Mbps chỉ mất khoảng mười lăm phút để tải lên. Trên một liên kết chậm, việc nén trước khi tải lên sẽ cắt giảm thời gian chờ đợi đáng kể. Nếu bạn không cần không mất dữ liệu từng bit, công cụ nén âm thanh sẽ thu nhỏ tệp hơn nữa với chi phí chất lượng nhỏ, thường không nghe được. Điều này hiếm khi xảy ra đối với lời nói.

Âm thanh nổi mang nội dung đơn âm. Rất nhiều bản ghi được lưu dưới dạng âm thanh nổi nhưng thực tế chứa cùng một âm thanh trên cả hai kênh: một micrô được nhân đôi ở bên trái và bên phải. Việc chuyển đổi nó thành WAV đơn âm hoặc FLAC sẽ giảm một nửa kích thước tệp mà không làm giảm độ chính xác vì dù sao thì công cụ cũng trộn thành đơn âm. Đây là giải pháp có kích thước dễ dàng nhất khi áp dụng.

Xử lý trước các bản ghi khó

Hai chỉnh sửa nhanh trong trình chỉnh sửa âm thanh sẽ mang lại hiệu quả trước khi bạn tải tệp ranh giới lên:

Không cần thực hiện bước nào để có bản ghi rõ ràng. Chúng là các bản sửa lỗi được nhắm mục tiêu cho các bản ghi cần trợ giúp và việc xuất lại sang WAV sau khi chỉnh sửa sẽ giúp âm thanh không bị mất.

WAV so với MP3 để chép lời: lossless có thực sự hữu ích không?

Đây là câu hỏi đằng sau hầu hết các quyết định về WAV, vì vậy đây là phiên bản đơn giản.

Để có độ chính xác, lossless sẽ giúp ích một chút và càng giúp nhiều thì nguồn càng tệ. Khi ghi âm rõ ràng, khó có thể phát hiện sự khác biệt giữa WAV và MP3 128 kbps tốt trong bản ghi. Khi ghi âm yên tĩnh hoặc ồn ào, độ trung thực cao hơn của WAV giúp hệ thống hoạt động hiệu quả hơn một chút. Dù bằng cách nào, định dạng hiếm khi là thứ đứng giữa bạn và bản ghi có thể sử dụng được. Chất lượng ghi âm là.

Đối với quy trình làm việc, MP3 chiếm ưu thế về kích thước và tốc độ tải lên, còn WAV chiếm ưu thế với tư cách là bản chính hoạt động mà bạn giữ giữa các lần chỉnh sửa. Con đường trung gian chung: giữ bản gốc đã chỉnh sửa của bạn ở dạng WAV hoặc FLAC và nếu bạn cần tải lên qua kết nối chậm, hãy gửi MP3 tốc độ bit cao. Bạn hầu như không mất gì trong bản ghi và tiết kiệm rất nhiều thời gian tải lên. Hướng dẫn chuyển MP3 thành văn bản bao gồm đầy đủ đường dẫn đó.

Phiên bản ngắn: ghi và lưu trữ ở định dạng WAV nếu chất lượng quan trọng nhưng không cảm thấy bắt buộc phải tải lên tệp 1 GB khi tệp 100 MB cũng được phiên âm.

Mẹo về độ chính xác cho WAV

Nhãn người nói và dấu thời gian

Mỗi bản ghi WAV đều bao gồm tính năng tách người nói tự động, lợi ích miễn phí cho mọi công việc, không phải cấp trả phí hay bán thêm cho mỗi người nói. Bản ghi âm của hai người, chẳng hạn như người phỏng vấn và chủ đề hoặc cuộc gọi hai bên được ghi vào một bản nhạc âm thanh nổi, sẽ được phân tách rõ ràng. Việc ghi nhóm lớn hơn (bốn người trở lên quanh bàn hội nghị) khó hơn đối với bất kỳ công cụ phân tách người nói nào, vì vậy, bạn nên thực hiện một số thao tác dọn dẹp nhãn trên bản ghi trong phòng ồn ào.

Tính năng xuất SRT đặc biệt hữu ích cho các tệp WAV được tạo ra từ quá trình sản xuất video. Nếu bạn đã ghi âm thanh riêng biệt (microphone hoặc bản nhạc lav được đồng bộ hóa trong bài đăng), thì dấu thời gian SRT cho phép bạn sắp xếp lại bản ghi thành hình ảnh mà không cần phải lọc âm thanh bằng tay.

Tùy chọn xuất

Định dạng Ghi chú
TXT Bản ghi đơn giản có nhãn người nói, không có dấu thời gian. Phù hợp cho việc tìm kiếm, trích dẫn và cung cấp thông tin cho một công cụ khác.
SRT Dấu thời gian trên mỗi câu nói. Định dạng phụ đề và chú thích tiêu chuẩn mở trong VLC, trình chỉnh sửa video và công cụ phụ đề.
VTT Định dạng phụ đề web cho quy trình xuất bản và video HTML5.
CSV Xuất thân thiện với bảng tính với các trường người nói, thời gian và văn bản.
Markdown Cấu trúc văn bản thuần tuý có thể chỉnh sửa dành cho ghi chú, tài liệu và xuất bản.
JSON Đầu ra có cấu trúc ({ speaker, start, end, text } mỗi phát âm) cho quy trình xử lý tùy chỉnh.
DOCX Tương thích với từ, có nhãn người nói và dấu thời gian trong bố cục có thể đọc được để chia sẻ hoặc chú thích.
PDF Bản ghi có bố cục cố định để chia sẻ hoặc lưu trữ.

Không có hình mờ trên bất kỳ định dạng nào và các bản xuất đều được bao gồm mỗi biên bản. Không có gì bị kiểm soát phía sau cấp cao hơn.


Nếu WAV của bạn là bản ghi gần ranh giới và độ chính xác là ưu tiên hàng đầu thì Hướng dẫn chuyển MP3 thành văn bản bao gồm quá trình chuẩn hóa và các bước xử lý trước khác được áp dụng tương tự ở đây. Nếu bạn muốn chuyển nó sang MP3 và chép lại, trình chuyển đổi miễn phí sẽ chạy trong trình duyệt của bạn mà không cần tải tệp lên. Và để có danh sách đầy đủ các định dạng và tính năng được chấp nhận ở cùng một nơi, trang chuyển âm thanh thành văn bản có mọi thứ.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Tôi có cần nén tệp WAV của mình trước khi tải lên không?

Thường là không. Hầu hết các tệp WAV được tải lên trực tiếp, không có giới hạn kích thước tệp. Đối với một tệp đặc biệt lớn, Hushscript sẽ xử lý và chuẩn bị cục bộ FLAC mono 16 kHz nhỏ gọn trong trình duyệt của bạn, do đó, bạn không bao giờ phải nén bất cứ thứ gì bằng tay.

WAV có chính xác hơn MP3 để chép lời không?

Một chút. WAV không có tính năng nén bị mất, nhưng MP3 128 kbps hoặc cao hơn từ cùng một nguồn cho kết quả gần giống nhau trong thực tế. Lợi thế của WAV thể hiện chủ yếu khi bản ghi nguồn vốn đã có chất lượng thấp, chẳng hạn như phòng yên tĩnh hoặc micrô giá rẻ.

Tốc độ mẫu nào được hỗ trợ?

Bất kỳ tốc độ tiêu chuẩn nào từ 8 kHz đến 48 kHz. Không có mức tăng độ chính xác trên 16 kHz đối với giọng nói vì hệ thống hoạt động trong dải giọng nói chứ không phải dải siêu âm. WAV 48 kHz và 16 kHz của cùng một âm thanh sẽ tạo ra cùng một bản ghi.

Tôi có thể lấy nhãn người nói trên tệp WAV không?

Có. Tính năng tách người nói chạy trên mọi bản ghi bất kể định dạng mà không mất thêm phí. Một cuộc phỏng vấn dành cho hai người được thực hiện một cách rõ ràng; bạn có thể đổi tên Người nói A và Người nói B thành tên thật chỉ bằng một cú nhấp chuột.

Điều gì sẽ xảy ra nếu tệp WAV của tôi rất yên tĩnh?

Âm thanh yên tĩnh tạo cho hệ thống ít tín hiệu hơn, điều này làm giảm độ chính xác. Nếu mức đỉnh không đạt trên khoảng -12 dBFS trong trình xem dạng sóng, hãy chuẩn hóa tệp trong trình chỉnh sửa âm thanh trước khi tải lên.

Đơn âm hay âm thanh nổi có quan trọng đối với tệp WAV không?

Để đảm bảo độ chính xác thì không. Hệ thống trộn thành mono bên trong. Nhưng nếu cả hai kênh đều có cùng một nội dung thì việc xuất tệp đơn âm sẽ giảm một nửa kích thước mà không làm giảm chất lượng, điều này giúp tăng tốc độ tải lên.

Chi phí là bao nhiêu sau số phút miễn phí?

Bạn chỉ trả tiền cho số phút bạn ghi âm mà không cần đăng ký. Việc thanh toán được tính theo thời lượng âm thanh chứ không phải kích thước tệp, do đó, một WAV lớn có giá tương đương với một MP3 nhỏ có cùng độ dài. Xem trang định giá để biết mức giá mỗi phút hiện tại.

Bắt đầu với 30 phút miễn phí

Bắt đầu – 30 phút miễn phí