Chuyển đến nội dung chính

Cách chuyển MP3 thành văn bản (miễn phí, có nhãn người nói)

Tác giả: Ngày đăng: Rà soát lần cuối:

Chuyển đổi MP3 thành văn bản là một trong những công việc chép lời phổ biến nhất hiện có và các bước không thay đổi theo nguồn: một tập podcast, một cuộc phỏng vấn được ghi âm, một bài giảng hoặc một bản ghi nhớ giọng nói từ điện thoại của bạn đều trải qua cùng một quy trình. Tải tệp lên, đợi bản ghi, xuất nó ở định dạng bạn cần.

Điều thay đổi là bản thân MP3 ảnh hưởng đến kết quả như thế nào. Hầu hết các hướng dẫn đều bỏ qua nó. MP3 là một tệp nén, bị mất dữ liệu và tốc độ bit được lưu ở mức giới hạn về mức độ chi tiết mà công cụ giọng nói phải làm việc. Hướng dẫn này bao gồm 3 bước, sau đó đi sâu hơn: một ví dụ hoạt động với đầu ra được gắn nhãn người nói thực, tốc độ bit thực sự có ý nghĩa như thế nào đối với độ chính xác và cách khắc phục các bản ghi âm bị thô.

Những thứ bạn cần

Không cần cài đặt gì cả; không có ứng dụng dành cho máy tính để bàn, không có phần mở rộng trình duyệt. Mọi thứ đều chạy trong trình duyệt và tài khoản.

Ngoài số phút miễn phí, bản ghi được trả theo mức sử dụng: bạn chỉ mua số phút khi cần mà không cần đăng ký. Chi phí có trên trang định giá.

Chuyển đổi MP3 thành văn bản theo ba bước

  1. Tải tệp của bạn lên. Mở /audio-to-text, sau đó kéo MP3 vào vùng thả hoặc nhấp để duyệt. Chấp nhận các tệp có độ dài tối đa 10 giờ và không có giới hạn kích thước tệp. Bản xem trước 30 giây đầu tiên ngay trong trình duyệt trước khi bạn đăng nhập, do đó, bạn có thể xem kiểu được gắn nhãn của người nói trước khi xác nhận.
  2. Hãy để nó chép lời. Sau khi bạn đã đăng nhập và tải tệp lên, công cụ phát âm sẽ xử lý tệp đó và trả về bản chép lời với những người nói đã được tách riêng. Thời gian xử lý khác nhau và công việc chạy ở chế độ nền nên bạn không cần phải mở tab.
  3. Xuất. Tải xuống kết quả ở bất kỳ định dạng nào trong số 21 định dạng. Điều đó bao gồm TXT đơn giản, SRT được đánh dấu thời gian, Word DOCX, PDF cũng như các định dạng phụ đề và dòng thời gian của trình chỉnh sửa, cùng với .husharchive được bảo vệ bằng mật khẩu. Mọi định dạng đều được bao gồm, không có tường phí khi xuất và không có hình mờ trên bất kỳ định dạng nào.

Bản ghi hoàn chỉnh sẽ mở ra trong trang tổng quan của bạn. Các diễn giả xuất hiện dưới dạng Người nói A,Người nói B, v.v., và bạn có thể nhấp vào bất kỳ nhãn nào để đổi tên thành tên thật, cập nhật mọi dòng mà người nói có.

Một ví dụ hoạt động: một cuộc phỏng vấn hai người

Giả sử bạn có founder-interview.mp3: một đoạn ghi âm dài 42 phút, 128 kbps, một người phỏng vấn và một khách, được ghi lại qua một cuộc gọi. Sau khi bạn tải lên, bản ghi sẽ quay lại được phân đoạn theo lượt của người nói, với dấu thời gian trên mỗi lượt:

<00:00:04] Người nói A: Cảm ơn bạn đã dành thời gian. Hãy bắt đầu lại từ đầu –
           ý tưởng thực sự đến từ đâu?
<00:00:11] Người nói B: Thành thật mà nói, nó xuất phát từ một vấn đề mà chúng tôi gặp phải. Chúng tôi
           đắm chìm trong các cuộc gọi được ghi âm và không có cuộc gọi nào có thể tìm kiếm được.
<00:00:23] Người nói A: Vậy là bạn đã xây dựng được thứ bạn cần.
[00:00:25] Người nói B: Khá nhiều. Phiên bản đầu tiên được giữ lại bằng băng.

Từ đó việc chỉnh sửa trở nên nhẹ nhàng. Bạn đổi tên Người nói A thành người phỏng vấn và Người nói B thành khách một lần, mỗi dòng đều cập nhật. Bạn lướt qua một số danh từ riêng mà công cụ đoán được, chẳng hạn như tên sản phẩm hoặc họ của một người, rồi sửa chúng bằng tính năng tìm và thay thế, tính năng này sẽ sửa mọi trường hợp trong một lần. Đối với một cuộc phỏng vấn 128 kbps rõ ràng như thế này, phần đọc lướt thường là tất cả những gì cần thiết để dọn dẹp trước khi bản ghi có thể trích dẫn.

Đây là nơi bản ghi âm gắn nhãn người nói miễn phí có được vị trí của nó. Một bức tường văn bản liền mạch từ một cuộc phỏng vấn gần như vô dụng cho đến khi bạn xem lại và đánh dấu xem ai đã nói gì; một bản chép lời đến đã được chia thành nhiều lượt là thứ bạn có thể trích dẫn ngay lập tức.

Tốc độ bit có ý nghĩa gì đối với độ chính xác

MP3 là định dạng bị mất dữ liệu: mã hóa sẽ loại bỏ các phần âm thanh được đánh giá là ít nghe được nhất để giữ cho tệp có kích thước nhỏ. Tốc độ bit là số kilobit mỗi giây mà bộ mã hóa sử dụng để thực hiện việc đó. Càng thấp thì càng loại bỏ. Tham chiếu codec MP3 hiện tại của MDN ghi lại tốc độ bit và tốc độ mẫu được hỗ trợ của định dạng này, đồng thời xác định khả năng nén của nó là bị mất dữ liệu.

Tính năng nhận dạng giọng nói chủ yếu dựa vào chi tiết tần số cao trong phụ âm. Sự khác biệt giữa “mười lăm” và “mười sáu” hay “có thể” và “không thể” nằm ở đó. Nén mạnh mẽ chính xác là nơi mà chi tiết đó được ưu tiên hàng đầu. Vì vậy, tốc độ bit không làm giảm chất lượng bản ghi một cách đồng đều; nó ăn những từ khó nghe nhất ở rìa của lời nói.

Trong thực tế:

Một số giải thích rõ ràng giúp tiết kiệm việc mã hóa lại không cần thiết. Tốc độ bit thay đổi (VBR) là ổn; nó không bị phạt về độ chính xác đối với ** tốc độ bit không đổi (CBR)** đối với lời nói, vì vậy đừng chuyển đổi tệp VBR chỉ để “sửa” nó. Và ** mono hoạt động tốt như âm thanh nổi** để chép lời vì giọng nói không cần hai kênh. Nếu có bất cứ điều gì, hãy xem ghi chú về đầu cuối kép âm thanh nổi bên dưới.

MP3 so với lossless: khi nào cần ghi lại thay thế

Một câu hỏi tự nhiên là liệu việc chuyển đổi MP3 của bạn sang định dạng lossless như WAV trước tiên có giúp ích hay không. Nó sẽ không. Khi âm thanh đã được lưu dưới dạng MP3 128 kbps, chi tiết bị thiếu sẽ biến mất; việc gói cùng âm thanh đó vào vùng chứa WAV chỉ tạo ra một tệp lớn hơn mà không mang thêm thông tin nào. Nếu bạn đang ghi âm mới và có quyền lựa chọn thì nguồn không mất dữ liệu hoặc tốc độ bit cao là điểm khởi đầu tốt hơn (xem hướng dẫn chuyển WAV sang văn bản cho trường hợp đó), nhưng việc chuyển đổi MP3 hiện có trở lên cũng không có tác dụng gì.

Quy tắc quyết định trung thực: nếu bản sao duy nhất của bạn là MP3 có tốc độ bit hợp lý, hãy chép lại nguyên bản. Nếu bản ghi thực sự tệ (bị cắt, bị nhiễu hoặc được lưu ở tốc độ 32 kbps) và bạn có thể ghi lại thì việc ghi lại sẽ giúp ích nhiều hơn bất kỳ chuyển đổi nào. Khi bạn ghi âm mới, hai thói quen quan trọng hơn tốc độ bit: đặt micrô ở gần người đang nói và đưa micrô riêng cho mỗi người nếu có thể, vì sự tách biệt rõ ràng tại nguồn là điều khiến cả từ và nhãn người nói đều phát ra chính xác.

Khắc phục các sự cố thường gặp

Hầu hết các bản ghi thô đều truy ngược lại bản ghi âm chứ không phải công cụ. Sau đây là những việc cần làm đối với những thủ phạm thông thường.

Âm lượng thấp. Nếu dạng sóng có vẻ phẳng (bản ghi rất yên tĩnh), thì hệ thống có ít tín hiệu hơn để làm việc và độ chính xác bị giảm. Trước tiên, hãy chuẩn hóa hoặc khuếch đại âm thanh trong bất kỳ trình chỉnh sửa âm thanh nào, sau đó tải lên phiên bản to hơn. Mức tăng cường là một trong những cách khắc phục mang lại lợi nhuận cao nhất cho bản ghi yếu.

Tiếng ồn xung quanh. Tiếng ồn ổn định (máy điều hòa không khí, tiếng ồn trên đường) được xử lý khá tốt; Tiếng ồn đột ngột lấn át lời nói, như tiếng cửa, tiếng ho hoặc dao kéo, là nguyên nhân khiến lời nói bị ngắt quãng. Nếu bạn có thể chạy quy trình giảm nhiễu nhẹ trước khi tải lên, hãy thực hiện nhưng đừng xử lý quá mức: quá trình khử nhiễu quá mức sẽ gây ra hiện tượng làm ảnh hưởng đến độ chính xác nhiều hơn là nhiễu.

Giọng nặng hoặc từ vựng chuyên môn. Công cụ hiện đại xử lý tốt nhiều loại giọng tiếng Anh. Những lỗi đáng tin cậy là các thuật ngữ tên miền mà công cụ không có lý do gì để mong đợi, như tên thuốc, trích dẫn pháp lý hoặc tên thương hiệu thích hợp. Lập kế hoạch đọc lướt sau khi xuất để nắm bắt những thông tin này và dựa vào tìm và thay thế: nếu tên công ty lần nào cũng sai theo cùng một cách, thì một lần sửa sẽ quét toàn bộ tệp.

Các bản MP3 rất dài. Bản ghi âm kéo dài 6 giờ không có vấn đề gì. Giới hạn 10 giờ bao gồm hầu hết mọi thứ và không có giới hạn về kích thước tệp, vì vậy trước tiên không cần phải cắt một tệp dài thành nhiều mảnh. Điều thực sự làm giảm chất lượng của một tập tin dài là chất lượng ghi âm của nó bị lệch: người nói rời xa micrô, mức độ chùng xuống sau giờ đầu tiên, địa điểm chật kín và trở nên ồn ào hơn. Nơi nào có thể, hãy giữ nguồn ổn định; ở những nơi bạn không thể, hãy mong đợi những đoạn thô hơn sẽ cần chỉnh sửa nhiều hơn những đoạn rõ ràng. Dấu thời gian giúp bạn dễ dàng quản lý việc này: bạn có thể chuyển thẳng đến phần đọc kém thay vì nghe lại toàn bộ nội dung.

những người nói chồng chéo. Khi hai người nói chuyện cùng một lúc, công cụ sẽ gán các từ cho giọng nói to hơn, hạn chế về khả năng tách người nói nói chung chứ không phải của bất kỳ một công cụ nào. Không có cách khắc phục phía tải lên; dành thời gian chỉnh sửa cho các phần trao đổi chéo trong một bản ghi âm sôi động của nhóm.

Việc tách những người nói rõ ràng

Tính năng tách người nói (phân tách người nói) chạy trên mọi bản ghi mà không mất thêm phí và một số yếu tố ở cấp độ MP3 sẽ ảnh hưởng đến mức độ rõ ràng của bản ghi. Nếu bạn muốn biết chi tiết về cách thức hoạt động của nó, hãy xem phân tách người nói là gì; những điểm thực tế ở đây:

Xuất bản ghi của bạn

Định dạng phù hợp tùy thuộc vào việc bạn đang làm với văn bản. Bảng bên dưới liệt kê những định dạng mà mọi người tiếp cận nhiều nhất, trong số 21 định dạng được cung cấp; để có được sự cân bằng hoàn toàn, hãy xem định dạng bản ghi nào bạn thực sự cần:

Định dạng Tốt nhất cho
TXT Ghi chú, sao chép-dán, đưa văn bản vào một công cụ khác
SRT Phụ đề trên video hoặc điều hướng theo dấu thời gian; cũng là lựa chọn phù hợp nếu nguồn của bạn là tệp video như MP4
VTT Phụ đề web và trình phát video gốc trên trình duyệt
CSV Xem xét bảng tính và chuyển giao dữ liệu nhẹ
Markdown Xuất bản ghi chú, tệp kiểu README và bản nháp có thể chỉnh sửa
JSON Xử lý theo chương trình và công cụ tùy chỉnh
DOCX Chia sẻ với người chỉnh sửa hoặc người chú thích làm việc trong Word
PDF Chia sẻ và lưu trữ chỉ đọc

Mỗi lần xuất đều bao gồm nhãn người nói và dấu thời gian, không có hình mờ trên bất kỳ nhãn nào trong số đó.

Dấu thời gian và chỉnh sửa

Trình chỉnh sửa hiển thị từng câu nói cùng với thời gian bắt đầu, nhãn người nói và văn bản. Nhấp vào bất kỳ dòng nào để phát lại đoạn âm thanh đó trên văn bản. Điều đó rất hữu ích để kiểm tra một đoạn văn phức tạp mà không cần phải duyệt toàn bộ tệp bằng tay.

Dấu thời gian trong quá trình xuất SRT nằm ở cấp độ phát âm: một mục nhập cho mỗi lượt phát biểu, không phải cho mỗi từ. Để tạo chú thích, điều hướng và trích dẫn bằng dấu thời gian, đó là mức độ chi tiết phù hợp. Nếu bạn cần cấu trúc cấp độ từ để xử lý bằng mã, hãy xuất JSON: mỗi mục nhập sẽ cung cấp cho bạn nhãn người nói, thời gian bắt đầu và kết thúc tính bằng mili giây cũng như văn bản cho lượt đó.


Tải lên, chép lời, xuất: đó là toàn bộ công việc, với các chi tiết dành riêng cho MP3 quyết định mức độ rõ ràng của kết quả. trang chuyển MP3 sang văn bản có tổng quan đầy đủ về tính năng và nếu bạn đang làm việc với bản ghi trong một vùng chứa khác thì trang chuyển âm thanh sang văn bản sẽ bao gồm mọi định dạng theo cùng một cách. Thực hiện toàn bộ chương trình? Hướng dẫn chép lời podcast hướng dẫn cách chuyển bản ghi thành ghi chú tập và nếu tệp của bạn là WAV chứ không phải MP3 thì Hướng dẫn chuyển WAV sang văn bản có ghi chú về cách xử lý các tệp không mất dữ liệu lớn.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Kích thước tệp MP3 tối đa tôi có thể tải lên là bao nhiêu?

Tối đa 10 giờ cho mỗi tệp mà không có giới hạn kích thước tệp. Mỗi tập tin lấy từ số phút trả trước của bạn; Các biện pháp bảo vệ an toàn dịch vụ và công việc đang hoạt động cũng được áp dụng.

Tốc độ bit MP3 có ảnh hưởng đến độ chính xác của bản ghi không?

Tốc độ này có thể thấp hơn khoảng 64 kbps. Việc nén ở tốc độ bit rất thấp sẽ làm mờ các phụ âm mà tính năng nhận dạng giọng nói dựa vào, do đó các từ ở rìa lời nói sẽ bị mất. Ở tốc độ 128 kbps trở lên, bạn đã vượt qua ngưỡng mà tốc độ bit đóng vai trò quan trọng và con số cao hơn sẽ không làm cho bản ghi tốt hơn.

Tôi có thể lấy tệp phụ đề SRT từ MP3 chỉ có âm thanh không?

Có. Hushscript xuất SRT, TXT, DOCX và JSON từ bất kỳ nguồn nào. SRT mang dấu thời gian cho mỗi lần phát âm ngay cả khi đầu vào là âm thanh không có video đính kèm, vì vậy bạn có thể thả thẳng vào video sau.

Tôi có cần thẻ tín dụng để bắt đầu không?

Không. Thẻ chỉ là con đường nhanh nhất để có 30 phút miễn phí. Việc giữ $1 sẽ xác thực nó, sau đó giải phóng ngay lập tức và không bao giờ bị tính phí. Nếu bạn muốn sử dụng một phương thức thanh toán khác có sẵn ở quốc gia của mình thì 30 phút của bạn sẽ đến với gói phút đầu tiên.

Điều gì xảy ra với MP3 của tôi sau khi được chép lời?

Nó sẽ bị xóa khỏi máy chủ ngay khi bản chép lời sẵn sàng. Không có gì được giữ lại để lưu trữ hoặc đào tạo mô hình. Bạn cũng có thể xóa bản ghi âm khỏi trang tổng quan của mình chỉ bằng một cú nhấp chuột.

Việc phân tách người nói trên MP3 chính xác đến mức nào?

Nhãn người nói đáng tin cậy nhất khi mọi người thay phiên nhau và bản ghi âm khá rõ ràng. Một cuộc phỏng vấn hai người thường tách biệt rõ ràng; một cuộc gọi nhóm ồn ào với những người đang nói chuyện với nhau cần phải chỉnh sửa thủ công nhiều hơn sau đó.

MP3 có tốc độ bit thay đổi (VBR) có hoạt động không?

Có. VBR ổn. Nó không có nhược điểm về độ chính xác so với tốc độ bit không đổi (CBR) cho giọng nói. Mono và stereo đều hoạt động tốt; bạn không cần phải mã hóa lại bất cứ thứ gì trước khi tải lên.

Nó có thể chép lại một bản MP3 không phải bằng tiếng Anh không?

Có. Ngôn ngữ được phát hiện tự động trên khoảng 99 ngôn ngữ. Một bản ghi âm đơn ngôn ngữ rõ ràng sẽ được phiên âm tốt nhất; Việc chuyển đổi mã nặng ở giữa câu khó hơn đối với bất kỳ công cụ nào.

Bắt đầu với 30 phút miễn phí

Bắt đầu – 30 phút miễn phí