Cách phiên âm mọi tệp âm thanh thành văn bản
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
Một tệp MP3 từ trình chỉnh sửa podcast, M4A từ iPhone của bạn, một WAV từ máy ghi hiện trường, một CAF ít người biết đến từ ứng dụng ghi âm giọng nói: để chép lại bất kỳ tệp nào trong số chúng, bạn cũng làm tương tự. Thả tập tin, lấy bản ghi với những người nói đã được tách sẵn, xuất nó ở định dạng bạn cần. Vùng chứa âm thanh đi vào không thay đổi các bước.
Những gì định dạng ảnh hưởng sâu hơn một chút: kích thước của tệp, mức độ ghi chép rõ ràng và những việc cần làm trong trường hợp hiếm hoi tệp không tải được. Hướng dẫn này đề cập đến những định dạng âm thanh nào hoạt động, một phương pháp xử lý tất cả các định dạng đó, cách chọn định dạng tốt nhất khi bạn có lựa chọn và cách khắc phục những tệp không đạt chất lượng.
Những thứ bạn cần
- Tệp âm thanh (hoặc video). Bất kỳ định dạng phổ biến nào dưới đây. Không cần cài đặt gì: không có ứng dụng dành cho máy tính để bàn, không có tiện ích mở rộng. Mọi thứ đều chạy trong trình duyệt và tài khoản của bạn.
- Tài khoản Hushscript để có bản ghi đầy đủ. Bạn có 30 phút dùng thử miễn phí. Cách nhanh nhất để mở khóa chúng là thêm thẻ: khoản giữ 1 USD sẽ xác thực thẻ, sau đó giải phóng ngay lập tức và không bao giờ bị tính phí. Nếu bạn không muốn sử dụng thẻ thì một phương thức thanh toán thay thế cũng có tác dụng và bạn sẽ có 30 phút cho lần mua hàng đầu tiên.
Bản xem trước 30 giây không cần có tài khoản. Bạn có thể thả một tệp và xem kiểu được gắn nhãn của người nói trước khi đăng ký, đây là cách trung thực để kiểm tra xem đầu ra có phù hợp hay không trước khi bạn thực hiện bất kỳ điều gì. Ngoài số phút miễn phí, phiên âm còn được trả tiền theo mức sử dụng: bạn chỉ mua số phút khi cần mà không cần đăng ký. Chi phí nằm trên trang định giá.
Các định dạng âm thanh nào hoạt động
Hushscript hỗ trợ tất cả các định dạng âm thanh tiêu chuẩn. Đây là nơi xuất phát của mỗi tên, để bạn có thể nhận ra những gì mình có:
Tên không chỉ là quy ước về tên tệp. Đăng ký loại phương tiện IANA hiện tại ghi lại các loại được tiêu chuẩn hóa như audio/aac,audio/mp4,audio/mpeg,audio/ogg và audio/opus, đó là lý do tại sao vùng chứa và mã hóa âm thanh bên trong nó là những câu hỏi riêng biệt.
| Định dạng | Nguồn chung |
|---|---|
| MP3 | Podcast, bản ghi âm điện thoại, xuất từ hầu hết các ứng dụng ghi âm |
| M4A / AAC | iPhone Voice Bản ghi nhớ, ghi chú giọng nói WhatsApp, bản xuất của Apple |
| WAV | Bản ghi kỹ thuật số, bản xuất DAW, bản ghi âm Windows Voice Recorder |
| FLAC | Bản ghi lưu trữ, bản xuất DAW, trích xuất không mất dữ liệu |
| OGG | Ghi chú giọng nói của Android, công cụ ghi nguồn mở |
| AIFF / CAF | Âm thanh trên Mac và iOS, GarageBand |
Các tệp video hoạt động theo cách tương tự. Thả MP4, MOV, WebM hoặc MKV và bản âm thanh được trích xuất trong trình duyệt của bạn trước khi tải lên bất kỳ nội dung nào, do đó, bản thân video sẽ không bao giờ rời khỏi thiết bị của bạn; chỉ âm thanh mới đến được máy chủ.
Danh sách trên không phải là hàng rào. Lời hứa đơn giản hơn bảng định dạng được hỗ trợ: chỉ cần thả tệp của bạn và nó sẽ được chuyển đổi và phiên âm. Nếu bạn có thứ gì đó thực sự bất thường (tệp AMR từ Nokia cũ,.3gp từ Android cách đây hàng chục năm, clip RealAudio), hãy thử tải nó lên. Trình duyệt có thể đọc hầu hết các vùng chứa tiêu chuẩn và nếu không thể, bạn có hai cách dự phòng: chuyển đổi nó sang MP3 hoặc WAV bằng các công cụ miễn phí trong trình duyệt tại /tools và tải nó lên hoặc gửi email tới support@hushscript.com và chúng tôi sẽ thêm định dạng. Bạn không cần phải tìm hiểu trước xem tệp của mình có đủ điều kiện hay không.
Chép lại tệp âm thanh theo ba bước
Quy trình đều giống nhau cho dù bạn bắt đầu bằng định dạng nào. Bước đầu tiên xảy ra trước khi bạn có tài khoản.
- Thả tệp của bạn để xem trước. Đi tới /audio-to-text và kéo tệp vào vùng thả hoặc nhấp để duyệt. 30 giây đầu tiên được chép lại ngay trong trình duyệt, được gắn nhãn cho người nói mà không cần có tài khoản. Đây là bước kiểm tra của bạn để đảm bảo đầu ra đọc theo cách bạn muốn trước khi bạn đăng ký bất kỳ nội dung nào.
- Đăng ký để chép lại phần còn lại. Nhập email của bạn để tạo tài khoản. 30 phút miễn phí của bạn sẽ được mở khóa khi bạn thêm và xác thực thẻ (khoản giữ $1 được mô tả ở trên) hoặc với lần mua hàng đầu tiên nếu bạn thanh toán theo cách khác. Tải lên tập tin đầy đủ từ đây. Một bản ghi có thể chạy tối đa 10 giờ mà không có giới hạn về kích thước tệp – ngay cả một tệp rất lớn cũng được chuẩn bị ngay trong trình duyệt. Các biện pháp bảo vệ an toàn dịch vụ và công việc đang hoạt động cũng được áp dụng.
- Nhận và xuất bản ghi. Công cụ giọng nói xử lý tệp và trả về bản ghi có những người nói đã được tách riêng. Đổi tên người nói nếu bạn thích, sau đó tải xuống ở bất kỳ định dạng nào trong số 21 định dạng (TXT, SRT, DOCX và PDF trong số đó, cùng với các định dạng phụ đề và dòng thời gian của trình chỉnh sửa) hoặc .husharchive được bảo vệ bằng mật khẩu. Bao gồm mọi nội dung xuất: không có tường phí, không có hình mờ.
Quá trình xử lý chạy ở chế độ nền và điều chỉnh theo độ dài của âm thanh (khoảng vài phút mỗi giờ ghi), do đó bạn không cần phải mở tab trong khi kết thúc một tệp dài.
Một ví dụ hoạt động: một bản ghi, hai định dạng
Giả sử bạn đã ghi lại một cuộc trò chuyện dài 38 phút và máy ghi âm của bạn đã lưu nó hai lần: một meeting.wav ở chất lượng đầy đủ và một meeting.m4a điện thoại của bạn được tạo cùng lúc. Cả hai đều trải qua ba bước giống nhau và bản ghi được trả về được phân đoạn theo lượt của người nói, với dấu thời gian trên mỗi bước:
[00:00:06] Người nói A: Trước khi chúng ta bắt đầu, mọi người có nhận được số liệu tôi gửi qua không?
[00:00:10] Người nói B: Sáng nay đã nhận được. Số Q3 là số tôi muốn
đào sâu vào.
[00:00:17] Người nói A: Đúng rồi, vậy ra đó là dòng đã di chuyển. Để tôi kéo nó lên.
<00:00:21] Người nói C: Trong khi bạn làm vậy – sau đó chúng ta có thể quay lại tuyển dụng không?
Hai tệp này về cơ bản tạo ra cùng một bản ghi. WAV là một tệp tải lên lớn hơn nhiều và M4A là một tệp nhỏ, nhưng các từ và nhãn người nói có cùng một cách, bởi vì cả hai đều mang cùng một lời nói cơ bản. Từ đây việc chỉnh sửa trở nên dễ dàng: bạn bấm vào Người nói A một lần để đổi tên, và mỗi dòng người nói đều có cập nhật; bạn lướt qua một số danh từ riêng mà công cụ đoán (họ, tên sản phẩm) và sửa chúng bằng tính năng tìm và thay thế, tính năng này sẽ sửa mọi trường hợp trong một lần chuyển.
Đó là kết quả thực tế của một phương pháp cho mọi định dạng. Bạn không giữ một công cụ khác hoặc một danh sách kiểm tra tinh thần khác cho WAV so với M4A so với MP3. Bất kể máy ghi âm, điện thoại của bạn hay sản phẩm xuất khẩu của người khác đưa cho bạn, nó đều đi qua cùng một khu vực thả và xuất ra dưới dạng cùng một loại bản ghi.
Chọn định dạng tốt nhất để có độ chính xác
Hầu hết các trường hợp bạn không được chọn. Bạn chép lại tập tin bạn được cung cấp, và điều đó ổn thôi. Tuy nhiên, nếu bạn kiểm soát cách ghi hoặc xuất âm thanh, thì một số lựa chọn sẽ đặt ra giới hạn về mức độ rõ ràng của kết quả.
Chất lượng ghi âm được đặt lên hàng đầu, với biên độ rộng. MP3 128 kbps từ micrô đóng tốt sẽ luôn đánh bại WAV không mất dữ liệu được ghi khắp phòng bằng micrô tích hợp của máy tính xách tay. Trước khi nghĩ đến định dạng, hãy nghĩ đến việc đặt micro lại gần người đang nói. Vùng chứa cách đó một giây.
Tránh MP3 có tốc độ bit quá thấp. MP3 bị mất dữ liệu: quá trình mã hóa sẽ loại bỏ các phần âm thanh để giữ cho tệp có kích thước nhỏ và tốc độ bit càng thấp thì tốc độ bit càng thấp. Nhận dạng giọng nói dựa vào chi tiết tần số cao trong các phụ âm, nơi có khoảng cách giữa “mười lăm” và “mười sáu” hoặc “có thể” và “không thể”. Nén mạnh mẽ sẽ ăn chính xác chi tiết đó trước tiên. Dưới khoảng 64 kbps, lỗi từ tăng lên. Ở tốc độ 128 kbps trở lên, bạn đã vượt qua điểm mà con số quan trọng; tốc độ bit cao hơn sẽ không làm cho bản ghi tốt hơn.
Lossless xóa định dạng dưới dạng biến. WAV, FLAC và AIFF cung cấp âm thanh không nén cho công cụ. Để ghi âm rõ ràng, độ chính xác đạt được so với MP3 tốt là không đáng kể, nhưng nó hoàn toàn loại bỏ khả năng nén. Hướng dẫn âm thanh kỹ thuật số của MDN giải thích sự đánh đổi cơ bản: lossless bảo toàn chi tiết ở kích thước lớn hơn, trong khi mã hóa lossy có thể thu nhỏ âm thanh hơn nữa bằng cách loại bỏ thông tin. Đó là bối cảnh hữu ích khi bản ghi rất quý giá và sau này bạn không muốn băn khoăn liệu định dạng này có khiến bạn tốn kém hay không.
Mono vẫn ổn; bạn không cần âm thanh nổi. Công cụ này sẽ kết hợp âm thanh nổi thành âm thanh đơn âm bên trong cho giọng nói, do đó, tệp đơn âm cũng có thể phiên âm và tải lên nhanh hơn khi kết nối chậm. Một sắc thái: nếu thiết lập của bạn ghi âm từng người trên một kênh âm thanh nổi riêng biệt (“đầu kép”), thì việc trộn kênh đó thành một bản nhạc đơn âm duy nhất trước khi tải lên có xu hướng giúp ích cho nhãn của người nói vì công cụ sẽ nghe thấy một cuộc trò chuyện kết hợp chứ không phải hai luồng riêng biệt.
Tốc độ mẫu trên 16 kHz không giúp ích gì cho lời nói. Mọi âm thanh từ 16 kHz đến 48 kHz đều hoạt động và WAV 48 kHz từ trình chỉnh sửa video phiên âm giống như tệp đơn âm 16 kHz từ ứng dụng điện thoại, có cùng giọng nói cơ bản. Mô hình được đào tạo về giọng nói chứ không phải âm nhạc nên không đạt được độ chính xác khi tốc độ cao hơn.
Không mất dữ liệu so với mất dữ liệu và khi chuyển đổi sẽ giúp
Một câu hỏi phổ biến: liệu việc chuyển đổi MP3 của bạn sang WAV trước tiên có cải thiện độ chính xác không? Nó sẽ không. Khi âm thanh đã được lưu dưới dạng MP3 128 kbps, chi tiết bị loại bỏ sẽ biến mất hoàn toàn. Việc gói cùng âm thanh đó vào WAV chỉ tạo ra một tệp lớn hơn mà không có thêm thông tin. Việc chuyển đổi lên trên chỉ giúp giải quyết một định dạng không tải được chứ không bao giờ giúp tăng độ chính xác.
Chuyển đổi xuống là trường hợp thực sự hữu ích. WAV dài nhiều giờ có thể là một tệp rất lớn; mã hóa lại nó thành MP3 128 kbps trước khi tải lên sẽ thu nhỏ nó một cách đáng kể mà không mất đi độ chính xác đáng kể, giúp tăng tốc độ tải lên trên một liên kết chậm. bộ chuyển đổi trong trình duyệt miễn phí thực hiện việc này mà âm thanh không bao giờ rời khỏi thiết bị của bạn. Quy tắc trung thực: nếu tệp của bạn đã tải và không có tốc độ bit nhỏ, hãy sao chép nguyên trạng. Chỉ chuyển đổi để giải quyết vấn đề thực sự, chẳng hạn như một tệp không mở được hoặc một tệp quá lớn để tải lên một cách thoải mái.
Nhãn người nói, được bao gồm miễn phí
Mỗi bản ghi Hushscript đều đi kèm tính năng tách người nói tự động (phân tách người nói) mà không mất thêm phí. Công cụ chọn ra các giọng nói riêng biệt và gắn nhãn cho chúng là Người nói A,Người nói B, v.v., và bạn đổi tên chúng thành tên thật trong trình chỉnh sửa chỉ bằng một cú nhấp chuột cho mỗi người nói. Theo mặc định, tính năng này được bật bất kể định dạng nguồn, không có cấp độ nhãn người nói riêng biệt.
Mức độ rõ ràng của các nhãn tùy thuộc vào bản ghi chứ không phải loại tệp:
- Các lượt phân biệt giúp ích nhiều nhất. Khi mọi người thay phiên nhau và không nói chuyện với nhau thì các nhãn này đáng tin cậy. Cuộc phỏng vấn giữa hai người thường được phân tách rõ ràng.
- Sự chồng chéo là trường hợp khó xảy ra. Khi hai giọng nói cùng xuất hiện, công cụ sẽ gán các từ đó cho giọng nói to hơn. Đó là hạn chế của việc tách người nói nói chung chứ không phải của một công cụ nào cả. Dành một chút thời gian chỉnh sửa cho nhiễu xuyên âm trong cuộc gọi nhóm sôi động.
- Giọng nói giống nhau có thể bị mờ. Hai người có âm vực rất giống nhau (chẳng hạn như anh chị em cùng giới) sẽ thách thức bất kỳ công cụ quay số nào. Tỷ lệ tín hiệu trên nhiễu hợp lý giúp phân tách xuyên suốt.
Đối với hầu hết các cuộc phỏng vấn, podcast và cuộc họp, các nhãn sẽ có thể sử dụng được chỉ sau một vài lần gán lại. Nếu bạn muốn biết thông tin chi tiết về cách thức hoạt động của quá trình phân tách người nói một cách chi tiết, hãy xem xác định phân tách người nói là gì hoặc trang nhận dạng người nói để biết thông tin tổng quan về tính năng.
Sửa các tệp có lỗi thô
Hầu hết các bản ghi thô đều truy ngược lại bản ghi âm chứ không phải định dạng hay công cụ. Thủ phạm thông thường và những việc cần làm với chúng:
Tệp không tải. Hiếm gặp nhưng xảy ra với vùng chứa bất thường hoặc bị hỏng. Trước tiên, hãy dùng thử trình chuyển đổi trong trình duyệt miễn phí để gói lại dưới dạng MP3 hoặc WAV, công cụ này sẽ sửa hầu hết các tệp cứng đầu. Nếu vẫn không được, hãy gửi email tới support@hushscript.com. Việc bổ sung hỗ trợ định dạng là điều chúng tôi thực hiện.
Âm lượng thấp. Nếu quá trình ghi rất yên tĩnh, hệ thống sẽ có ít tín hiệu hơn để làm việc và độ chính xác bị giảm. Chuẩn hóa hoặc khuếch đại âm thanh trong bất kỳ trình chỉnh sửa nào trước khi tải lên. Tăng mức độ của bản ghi yếu là một trong những cách khắc phục mang lại lợi nhuận cao nhất.
Tiếng ồn xung quanh. Tiếng ồn ổn định (máy điều hòa không khí, tiếng ồn trên đường) được xử lý khá tốt. Tiếng động đột ngột lấn át lời nói (tiếng cửa, tiếng ho, dao kéo) là nguyên nhân làm rớt lời. Việc giảm tiếng ồn nhẹ trước khi tải lên có thể hữu ích nhưng đừng lạm dụng: việc khử nhiễu quá nhiều sẽ tạo ra các thành phần tạo tác làm ảnh hưởng đến độ chính xác nhiều hơn là tiếng ồn.
Trọng âm nặng hoặc từ vựng chuyên môn. Công cụ hiện đại xử lý tốt nhiều loại giọng. Những lỗi đáng tin cậy là những thuật ngữ tên miền mà công cụ không có lý do gì để mong đợi: tên thuốc, trích dẫn pháp lý, tên thương hiệu thích hợp. Lập kế hoạch lướt qua một lần sau khi xuất khẩu và dựa vào việc tìm và thay thế; nếu một tên nào đó luôn xuất hiện sai theo cùng một cách thì một lần chỉnh sửa sẽ quét toàn bộ tệp.
Các tệp rất lớn hoặc rất dài. Giới hạn 10 giờ bao gồm hầu hết mọi thứ và không có giới hạn kích thước tệp nào cả nên không cần phải cắt một bản ghi dài thành nhiều phần. Nếu một tệp lossless có dung lượng lớn quá lớn để chuẩn bị trong trình duyệt, trước tiên hãy mã hóa lại nó thành MP3 128 kbps (không mất phí chính xác thực sự) để tăng tốc độ. Để biết thông tin chi tiết về phiên dài hơn, hướng dẫn ghi dài sẽ đi sâu hơn.
Điều gì xảy ra với tệp của bạn
Âm thanh sẽ bị xóa khỏi máy chủ ngay khi bản ghi sẵn sàng. Không có bộ nhớ trên đám mây, không được sử dụng cho việc đào tạo mô hình và không có thời gian lưu giữ. Nếu bạn bỏ tệp video thì chỉ âm thanh được trích xuất mới đến được máy chủ (video vẫn còn trên thiết bị của bạn) và bạn có thể xóa bản ghi đó khỏi trang tổng quan chỉ bằng một cú nhấp chuột bất cứ khi nào bạn muốn.
Xuất bản ghi của bạn
Sau khi chép lời, hãy chọn định dạng phù hợp với những gì bạn đang làm với văn bản. Nếu bạn không chắc chắn định dạng bản ghi nào mình thực sự cần, hãy bắt đầu với những lựa chọn phổ biến bên dưới:
| Định dạng | Những gì được bao gồm | Tốt nhất cho |
|---|---|---|
| TXT | Nhãn người nói, văn bản thuần túy | Ghi chú, tìm kiếm, cung cấp vào công cụ khác |
| SRT | Dấu thời gian mỗi lần phát âm, nhãn người nói | Phụ đề video, điều hướng một đoạn dài ghi theo thời gian |
| VTT | Dấu thời gian chú thích web, nhãn người nói | Trình phát video HTML5 và xuất bản trên web |
| CSV | Các hàng có trường người nói, thời gian và trường văn bản | Xem xét bảng tính và chuyển giao dữ liệu nhẹ |
| Markdown | Bản ghi được gắn nhãn bởi người nói trong Markdown | Ghi chú, tài liệu, quy trình xuất bản và trang web tĩnh |
| DOCX | Được định dạng cho Word hoặc Google Tài liệu | Chỉnh sửa, chia sẻ, chú thích |
| JSON | { speaker, start, end, text } mỗi mục | Quy trình và công cụ tùy chỉnh |
| Bản ghi có bố cục cố định có thể đọc được | Chia sẻ và lưu trữ chỉ đọc |
Mỗi lần xuất đều mang theo nhãn người nói, không có hình mờ trên bất kỳ nhãn nào và tất cả các định dạng xuất đều được bao gồm trong mọi gói, trong đó có 30 phút miễn phí. Dấu thời gian trong SRT nằm ở cấp độ phát âm (một mục nhập cho mỗi lượt người nói), đây là mức độ chi tiết phù hợp cho chú thích và trích dẫn; nếu bạn cần cấu trúc cấp độ từ để xử lý mã, JSON sẽ cung cấp cho bạn thời gian bắt đầu và kết thúc tính bằng mili giây cho mỗi lượt.
Ngôn ngữ
Hushscript phiên âm khoảng 99 ngôn ngữ, được phát hiện tự động chứ không phải do thiết lập thủ công. Độ chính xác cao nhất ở 18, bao gồm bốn biến thể tiếng Anh (Toàn cầu, Anh, Úc, Mỹ), tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Quan Thoại, tiếng Hindi và tiếng Ả Rập. Danh sách đầy đủ có trên trang ngôn ngữ.
Nếu bạn đang quyết định giữa bản chép lời cùng ngôn ngữ và bản chép lời đã dịch, hướng dẫn về “dịch âm thanh thành văn bản” sẽ giải thích sự khác biệt.
Đó là toàn bộ công việc (thả, chép lời, xuất) và nó đọc cùng một định dạng bất kể bạn đã bắt đầu với. Đối với các ghi chú có định dạng cụ thể, hướng dẫn anh chị em đề cập đến các trường hợp phổ biến nhất: MP3, WAV và M4A / Apple Voice Memo. trang chuyển âm thanh thành văn bản có thông tin tổng quan đầy đủ về tính năng và mọi định dạng đều có cùng một cách như nhau: chỉ cần thả tệp của bạn.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: