Cách chuyển MP3 thành văn bản (miễn phí, có nhãn người nói)
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
Chuyển đổi MP3 thành văn bản là một trong những công việc chép lời phổ biến nhất hiện có và các bước không thay đổi theo nguồn: một tập podcast, một cuộc phỏng vấn được ghi âm, một bài giảng hoặc một bản ghi nhớ giọng nói từ điện thoại của bạn đều trải qua cùng một quy trình. Tải tệp lên, đợi bản ghi, xuất nó ở định dạng bạn cần.
Điều thay đổi là bản thân MP3 ảnh hưởng đến kết quả như thế nào. Hầu hết các hướng dẫn đều bỏ qua nó. MP3 là một tệp nén, bị mất dữ liệu và tốc độ bit được lưu ở mức giới hạn về mức độ chi tiết mà công cụ giọng nói phải làm việc. Hướng dẫn này bao gồm 3 bước, sau đó đi sâu hơn: một ví dụ hoạt động với đầu ra được gắn nhãn người nói thực, tốc độ bit thực sự có ý nghĩa như thế nào đối với độ chính xác và cách khắc phục các bản ghi âm bị thô.
Những thứ bạn cần
- Tệp MP3. Mọi tốc độ bit đều sẽ tải. Để chính xác, 64 kbps là mức sàn thực tế và 128 kbps là vượt quá mức mà con số quan trọng (xem thêm ở bên dưới).
- Tài khoản Hushscript. Bạn có 30 phút dùng thử miễn phí. Cách nhanh nhất để mở khóa chúng là thêm thẻ: khoản giữ 1 USD sẽ xác thực thẻ, sau đó giải phóng ngay lập tức và không bao giờ bị tính phí. Nếu bạn không muốn sử dụng thẻ, một phương thức thanh toán thay thế cũng sẽ hoạt động và bạn sẽ có 30 phút cho lần mua hàng đầu tiên. Dù thế nào đi nữa cũng không cần thẻ.
Không cần cài đặt gì cả; không có ứng dụng dành cho máy tính để bàn, không có phần mở rộng trình duyệt. Mọi thứ đều chạy trong trình duyệt và tài khoản.
Ngoài số phút miễn phí, bản ghi được trả theo mức sử dụng: bạn chỉ mua số phút khi cần mà không cần đăng ký. Chi phí có trên trang định giá.
Chuyển đổi MP3 thành văn bản theo ba bước
- Tải tệp của bạn lên. Mở /audio-to-text, sau đó kéo MP3 vào vùng thả hoặc nhấp để duyệt. Chấp nhận các tệp có độ dài tối đa 10 giờ và không có giới hạn kích thước tệp. Bản xem trước 30 giây đầu tiên ngay trong trình duyệt trước khi bạn đăng nhập, do đó, bạn có thể xem kiểu được gắn nhãn của người nói trước khi xác nhận.
- Hãy để nó chép lời. Sau khi bạn đã đăng nhập và tải tệp lên, công cụ phát âm sẽ xử lý tệp đó và trả về bản chép lời với những người nói đã được tách riêng. Thời gian xử lý khác nhau và công việc chạy ở chế độ nền nên bạn không cần phải mở tab.
- Xuất. Tải xuống kết quả ở bất kỳ định dạng nào trong số 21 định dạng. Điều đó bao gồm TXT đơn giản, SRT được đánh dấu thời gian, Word DOCX, PDF cũng như các định dạng phụ đề và dòng thời gian của trình chỉnh sửa, cùng với .husharchive được bảo vệ bằng mật khẩu. Mọi định dạng đều được bao gồm, không có tường phí khi xuất và không có hình mờ trên bất kỳ định dạng nào.
Bản ghi hoàn chỉnh sẽ mở ra trong trang tổng quan của bạn. Các diễn giả xuất hiện dưới dạng Người nói A,Người nói B, v.v., và bạn có thể nhấp vào bất kỳ nhãn nào để đổi tên thành tên thật, cập nhật mọi dòng mà người nói có.
Một ví dụ hoạt động: một cuộc phỏng vấn hai người
Giả sử bạn có founder-interview.mp3: một đoạn ghi âm dài 42 phút, 128 kbps, một người phỏng vấn và một khách, được ghi lại qua một cuộc gọi. Sau khi bạn tải lên, bản ghi sẽ quay lại được phân đoạn theo lượt của người nói, với dấu thời gian trên mỗi lượt:
<00:00:04] Người nói A: Cảm ơn bạn đã dành thời gian. Hãy bắt đầu lại từ đầu –
ý tưởng thực sự đến từ đâu?
<00:00:11] Người nói B: Thành thật mà nói, nó xuất phát từ một vấn đề mà chúng tôi gặp phải. Chúng tôi
đắm chìm trong các cuộc gọi được ghi âm và không có cuộc gọi nào có thể tìm kiếm được.
<00:00:23] Người nói A: Vậy là bạn đã xây dựng được thứ bạn cần.
[00:00:25] Người nói B: Khá nhiều. Phiên bản đầu tiên được giữ lại bằng băng.
Từ đó việc chỉnh sửa trở nên nhẹ nhàng. Bạn đổi tên Người nói A thành người phỏng vấn và Người nói B thành khách một lần, mỗi dòng đều cập nhật. Bạn lướt qua một số danh từ riêng mà công cụ đoán được, chẳng hạn như tên sản phẩm hoặc họ của một người, rồi sửa chúng bằng tính năng tìm và thay thế, tính năng này sẽ sửa mọi trường hợp trong một lần. Đối với một cuộc phỏng vấn 128 kbps rõ ràng như thế này, phần đọc lướt thường là tất cả những gì cần thiết để dọn dẹp trước khi bản ghi có thể trích dẫn.
Đây là nơi bản ghi âm gắn nhãn người nói miễn phí có được vị trí của nó. Một bức tường văn bản liền mạch từ một cuộc phỏng vấn gần như vô dụng cho đến khi bạn xem lại và đánh dấu xem ai đã nói gì; một bản chép lời đến đã được chia thành nhiều lượt là thứ bạn có thể trích dẫn ngay lập tức.
Tốc độ bit có ý nghĩa gì đối với độ chính xác
MP3 là định dạng bị mất dữ liệu: mã hóa sẽ loại bỏ các phần âm thanh được đánh giá là ít nghe được nhất để giữ cho tệp có kích thước nhỏ. Tốc độ bit là số kilobit mỗi giây mà bộ mã hóa sử dụng để thực hiện việc đó. Càng thấp thì càng loại bỏ. Tham chiếu codec MP3 hiện tại của MDN ghi lại tốc độ bit và tốc độ mẫu được hỗ trợ của định dạng này, đồng thời xác định khả năng nén của nó là bị mất dữ liệu.
Tính năng nhận dạng giọng nói chủ yếu dựa vào chi tiết tần số cao trong phụ âm. Sự khác biệt giữa “mười lăm” và “mười sáu” hay “có thể” và “không thể” nằm ở đó. Nén mạnh mẽ chính xác là nơi mà chi tiết đó được ưu tiên hàng đầu. Vì vậy, tốc độ bit không làm giảm chất lượng bản ghi một cách đồng đều; nó ăn những từ khó nghe nhất ở rìa của lời nói.
Trong thực tế:
- 32 kbps trở xuống: bị nén đáng kể ngay cả với tai người và hệ thống cũng phản ứng theo cách tương tự. Lỗi từ leo thang. Hãy tránh điều này đối với bất kỳ nội dung nào bạn quan tâm đến việc chép lời.
- 64 kbps: nền tảng thực tế để chuyển giọng nói thành văn bản đáng tin cậy. Tốt cho giọng nói rõ ràng, gần mic.
- 128 kbps trở lên: đủ thoải mái để chép lời. Lên cao hơn sẽ không cải thiện bản chép lời. Công cụ có tất cả các chi tiết mà nó có thể sử dụng tốt trước đó.
Một số giải thích rõ ràng giúp tiết kiệm việc mã hóa lại không cần thiết. Tốc độ bit thay đổi (VBR) là ổn; nó không bị phạt về độ chính xác đối với ** tốc độ bit không đổi (CBR)** đối với lời nói, vì vậy đừng chuyển đổi tệp VBR chỉ để “sửa” nó. Và ** mono hoạt động tốt như âm thanh nổi** để chép lời vì giọng nói không cần hai kênh. Nếu có bất cứ điều gì, hãy xem ghi chú về đầu cuối kép âm thanh nổi bên dưới.
MP3 so với lossless: khi nào cần ghi lại thay thế
Một câu hỏi tự nhiên là liệu việc chuyển đổi MP3 của bạn sang định dạng lossless như WAV trước tiên có giúp ích hay không. Nó sẽ không. Khi âm thanh đã được lưu dưới dạng MP3 128 kbps, chi tiết bị thiếu sẽ biến mất; việc gói cùng âm thanh đó vào vùng chứa WAV chỉ tạo ra một tệp lớn hơn mà không mang thêm thông tin nào. Nếu bạn đang ghi âm mới và có quyền lựa chọn thì nguồn không mất dữ liệu hoặc tốc độ bit cao là điểm khởi đầu tốt hơn (xem hướng dẫn chuyển WAV sang văn bản cho trường hợp đó), nhưng việc chuyển đổi MP3 hiện có trở lên cũng không có tác dụng gì.
Quy tắc quyết định trung thực: nếu bản sao duy nhất của bạn là MP3 có tốc độ bit hợp lý, hãy chép lại nguyên bản. Nếu bản ghi thực sự tệ (bị cắt, bị nhiễu hoặc được lưu ở tốc độ 32 kbps) và bạn có thể ghi lại thì việc ghi lại sẽ giúp ích nhiều hơn bất kỳ chuyển đổi nào. Khi bạn ghi âm mới, hai thói quen quan trọng hơn tốc độ bit: đặt micrô ở gần người đang nói và đưa micrô riêng cho mỗi người nếu có thể, vì sự tách biệt rõ ràng tại nguồn là điều khiến cả từ và nhãn người nói đều phát ra chính xác.
Khắc phục các sự cố thường gặp
Hầu hết các bản ghi thô đều truy ngược lại bản ghi âm chứ không phải công cụ. Sau đây là những việc cần làm đối với những thủ phạm thông thường.
Âm lượng thấp. Nếu dạng sóng có vẻ phẳng (bản ghi rất yên tĩnh), thì hệ thống có ít tín hiệu hơn để làm việc và độ chính xác bị giảm. Trước tiên, hãy chuẩn hóa hoặc khuếch đại âm thanh trong bất kỳ trình chỉnh sửa âm thanh nào, sau đó tải lên phiên bản to hơn. Mức tăng cường là một trong những cách khắc phục mang lại lợi nhuận cao nhất cho bản ghi yếu.
Tiếng ồn xung quanh. Tiếng ồn ổn định (máy điều hòa không khí, tiếng ồn trên đường) được xử lý khá tốt; Tiếng ồn đột ngột lấn át lời nói, như tiếng cửa, tiếng ho hoặc dao kéo, là nguyên nhân khiến lời nói bị ngắt quãng. Nếu bạn có thể chạy quy trình giảm nhiễu nhẹ trước khi tải lên, hãy thực hiện nhưng đừng xử lý quá mức: quá trình khử nhiễu quá mức sẽ gây ra hiện tượng làm ảnh hưởng đến độ chính xác nhiều hơn là nhiễu.
Giọng nặng hoặc từ vựng chuyên môn. Công cụ hiện đại xử lý tốt nhiều loại giọng tiếng Anh. Những lỗi đáng tin cậy là các thuật ngữ tên miền mà công cụ không có lý do gì để mong đợi, như tên thuốc, trích dẫn pháp lý hoặc tên thương hiệu thích hợp. Lập kế hoạch đọc lướt sau khi xuất để nắm bắt những thông tin này và dựa vào tìm và thay thế: nếu tên công ty lần nào cũng sai theo cùng một cách, thì một lần sửa sẽ quét toàn bộ tệp.
Các bản MP3 rất dài. Bản ghi âm kéo dài 6 giờ không có vấn đề gì. Giới hạn 10 giờ bao gồm hầu hết mọi thứ và không có giới hạn về kích thước tệp, vì vậy trước tiên không cần phải cắt một tệp dài thành nhiều mảnh. Điều thực sự làm giảm chất lượng của một tập tin dài là chất lượng ghi âm của nó bị lệch: người nói rời xa micrô, mức độ chùng xuống sau giờ đầu tiên, địa điểm chật kín và trở nên ồn ào hơn. Nơi nào có thể, hãy giữ nguồn ổn định; ở những nơi bạn không thể, hãy mong đợi những đoạn thô hơn sẽ cần chỉnh sửa nhiều hơn những đoạn rõ ràng. Dấu thời gian giúp bạn dễ dàng quản lý việc này: bạn có thể chuyển thẳng đến phần đọc kém thay vì nghe lại toàn bộ nội dung.
những người nói chồng chéo. Khi hai người nói chuyện cùng một lúc, công cụ sẽ gán các từ cho giọng nói to hơn, hạn chế về khả năng tách người nói nói chung chứ không phải của bất kỳ một công cụ nào. Không có cách khắc phục phía tải lên; dành thời gian chỉnh sửa cho các phần trao đổi chéo trong một bản ghi âm sôi động của nhóm.
Việc tách những người nói rõ ràng
Tính năng tách người nói (phân tách người nói) chạy trên mọi bản ghi mà không mất thêm phí và một số yếu tố ở cấp độ MP3 sẽ ảnh hưởng đến mức độ rõ ràng của bản ghi. Nếu bạn muốn biết chi tiết về cách thức hoạt động của nó, hãy xem phân tách người nói là gì; những điểm thực tế ở đây:
- Bộ kết thúc âm thanh nổi kép. Một số thiết lập podcast và cuộc gọi ghi lại từng người nói trên một kênh âm thanh nổi riêng biệt. Ngược lại, việc trộn thành một bản nhạc đơn âm trước khi tải lên có xu hướng hữu ích: công cụ nghe thấy một cuộc trò chuyện hỗn hợp thay vì hai luồng riêng biệt. Hầu hết các biên tập viên đều xuất một “sự trộn lẫn” đơn âm.
- Quay qua lại nhanh chóng. Những trao đổi rất ngắn (các lượt dưới hai giây) đôi khi có thể hợp nhất thành một cách phát âm được gắn nhãn. Điều này hiếm khi ảnh hưởng đến khả năng đọc và bạn có thể chia lượt bằng tay nếu một câu trích dẫn cụ thể cần.
- Các lượt rõ ràng sẽ hữu ích nhất. Việc chuyển tiếp giữa các diễn giả càng rõ ràng (ít gián đoạn hơn, ít nhiễu xuyên âm) thì nhãn càng đáng tin cậy. Không có gì để cấu hình; nó hoàn toàn là thuộc tính của bản ghi.
Xuất bản ghi của bạn
Định dạng phù hợp tùy thuộc vào việc bạn đang làm với văn bản. Bảng bên dưới liệt kê những định dạng mà mọi người tiếp cận nhiều nhất, trong số 21 định dạng được cung cấp; để có được sự cân bằng hoàn toàn, hãy xem định dạng bản ghi nào bạn thực sự cần:
| Định dạng | Tốt nhất cho |
|---|---|
| TXT | Ghi chú, sao chép-dán, đưa văn bản vào một công cụ khác |
| SRT | Phụ đề trên video hoặc điều hướng theo dấu thời gian; cũng là lựa chọn phù hợp nếu nguồn của bạn là tệp video như MP4 |
| VTT | Phụ đề web và trình phát video gốc trên trình duyệt |
| CSV | Xem xét bảng tính và chuyển giao dữ liệu nhẹ |
| Markdown | Xuất bản ghi chú, tệp kiểu README và bản nháp có thể chỉnh sửa |
| JSON | Xử lý theo chương trình và công cụ tùy chỉnh |
| DOCX | Chia sẻ với người chỉnh sửa hoặc người chú thích làm việc trong Word |
| Chia sẻ và lưu trữ chỉ đọc |
Mỗi lần xuất đều bao gồm nhãn người nói và dấu thời gian, không có hình mờ trên bất kỳ nhãn nào trong số đó.
Dấu thời gian và chỉnh sửa
Trình chỉnh sửa hiển thị từng câu nói cùng với thời gian bắt đầu, nhãn người nói và văn bản. Nhấp vào bất kỳ dòng nào để phát lại đoạn âm thanh đó trên văn bản. Điều đó rất hữu ích để kiểm tra một đoạn văn phức tạp mà không cần phải duyệt toàn bộ tệp bằng tay.
Dấu thời gian trong quá trình xuất SRT nằm ở cấp độ phát âm: một mục nhập cho mỗi lượt phát biểu, không phải cho mỗi từ. Để tạo chú thích, điều hướng và trích dẫn bằng dấu thời gian, đó là mức độ chi tiết phù hợp. Nếu bạn cần cấu trúc cấp độ từ để xử lý bằng mã, hãy xuất JSON: mỗi mục nhập sẽ cung cấp cho bạn nhãn người nói, thời gian bắt đầu và kết thúc tính bằng mili giây cũng như văn bản cho lượt đó.
Tải lên, chép lời, xuất: đó là toàn bộ công việc, với các chi tiết dành riêng cho MP3 quyết định mức độ rõ ràng của kết quả. trang chuyển MP3 sang văn bản có tổng quan đầy đủ về tính năng và nếu bạn đang làm việc với bản ghi trong một vùng chứa khác thì trang chuyển âm thanh sang văn bản sẽ bao gồm mọi định dạng theo cùng một cách. Thực hiện toàn bộ chương trình? Hướng dẫn chép lời podcast hướng dẫn cách chuyển bản ghi thành ghi chú tập và nếu tệp của bạn là WAV chứ không phải MP3 thì Hướng dẫn chuyển WAV sang văn bản có ghi chú về cách xử lý các tệp không mất dữ liệu lớn.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: