Chuyển đến nội dung chính

Chuyển giọng nói thành văn bản: nguyên lý và cách thực hiện

Tác giả: Ngày đăng: Rà soát lần cuối:

Chuyển giọng nói thành văn bản là phần mềm biến âm thanh nói thành chữ viết. Thuật ngữ này bao gồm hai công việc khác nhau có vẻ giống nhau nhưng hoạt động khác nhau: đọc chính tả trực tiếp, nơi bạn nói và văn bản xuất hiện khi bạn di chuyển, và phiên âm, nơi bạn chuyển bản ghi âm và nhận lại bản ghi hoàn chỉnh. Ý tưởng cốt lõi là giống nhau ở cả hai. Quy trình làm việc, độ chính xác và những gì bạn có thể làm với kết quả đều không như vậy.

Hướng dẫn này giải thích thực tế lời nói thành văn bản là gì, bằng ngôn ngữ dễ hiểu, cách công cụ chuyển từ âm thanh sang từ và hai chế độ khác nhau như thế nào. Sau đó, nó sẽ chuyển đổi bản ghi thành văn bản trên Hushscript, với một ví dụ hoạt động, các vấn đề khiến mọi người bối rối và một câu hỏi thường gặp ngắn ở cuối.

Lời nói thành văn bản thực sự là gì

Ở dạng đơn giản nhất, tính năng nhận dạng giọng nói tự động (ASR) sử dụng một làn sóng âm thanh và tạo ra một chuỗi các từ. Micrô ghi lại giọng nói dưới dạng dạng sóng liên tục, một đường lắc lư biểu thị áp suất không khí thay đổi theo thời gian. Dạng sóng đó mang theo mọi thứ: lời nói, giọng nói của người nói, căn phòng, tiếng vo ve của máy điều hòa. Nhiệm vụ của công cụ này là lấy các từ ra khỏi tổ hợp đó và viết chúng ra.

Để thực hiện việc đó, công cụ sẽ chia âm thanh thành các lát nhỏ, thường là 10 đến 30 mili giây mỗi lát và đo âm thanh trong mỗi lát. Những phép đo đó cung cấp cho một mô hình đã được đào tạo để ánh xạ các mẫu âm thanh lên các đơn vị giọng nói của ngôn ngữ, sau đó đến các từ, rồi đến toàn bộ cụm từ. Bạn không thấy bất kỳ điều này. Bạn thấy một bản ghi âm được đưa vào và một bản ghi âm xuất hiện. Nhưng biết đại khái những gì diễn ra bên trong sẽ giải thích được tại sao một số bản ghi được chép lại rõ ràng còn những bản ghi khác thì chép lại thô.

Có hai lớp kiến ​​thức phối hợp với nhau. Một là âm học: âm thanh của một ngôn ngữ là gì và chúng có xu hướng được phát âm như thế nào qua các giọng và giọng khác nhau. Cái còn lại là ngôn ngữ: chuỗi từ nào là hợp lý. Lớp ngôn ngữ là lý do tại sao một hệ thống tốt viết “xe của họ bị hỏng” chứ không phải “có xe bị hỏng”, mặc dù cả hai âm thanh giống hệt nhau. Nó đang sử dụng ngữ cảnh để chọn cách đánh vần mà con người sẽ làm.

Tính năng nhận dạng giọng nói cũ hơn dựa vào các quy tắc viết tay và các tập huấn luyện nhỏ, và nó rất mong manh. Các công cụ hiện đại là các mô hình AI lớn được đào tạo dựa trên hàng nghìn giờ giọng nói được ghi âm từ nhiều diễn giả, giọng điệu và điều kiện ghi âm. Bề rộng đó là toàn bộ lý do khiến các bản ghi âm ngày nay có thể sử dụng được. Với lời nói rõ ràng trong một bản ghi âm tốt, các mô hình hiện tại đạt độ chính xác từ khoảng 90 đến 97 phần trăm. Một vài phần trăm còn lại là nơi việc khắc phục sự cố sau này trong hướng dẫn này phát huy tác dụng.

Lời nói được ghi lại và lời nói trực tiếp

Sự phân chia quan trọng nhất trong thực tế là liệu âm thanh đang được xử lý trực tiếp hay sau khi xử lý.

Tính năng đọc chính tả trực tiếp chạy trong thời gian thực. Bạn nói vào điện thoại, trợ lý giọng nói hoặc tính năng nhập liệu bằng giọng nói trong trình xử lý văn bản và các từ xuất hiện gần như nhanh như bạn nói. Để theo kịp, công cụ phải cam kết với từng từ với rất ít câu để dựa vào. Đó là một hạn chế khó khăn và đó là lý do tại sao việc đọc chính tả đôi khi đoán được một từ, sau đó lặng lẽ viết lại nó khi có vài từ tiếp theo. Đọc chính tả trực tiếp là công cụ phù hợp khi mục đích là ghi lại lời nói của chính bạn khi bạn di chuyển: ghi chú mà không cần dùng tay, soạn email bằng giọng nói, điều khiển thiết bị.

Tính năng chép lời hoạt động trên một bản ghi hoàn chỉnh. Bạn cung cấp cho công cụ một tệp âm thanh hoặc video đã hoàn thành, nó xử lý toàn bộ nội dung và đổi lại bạn nhận được bản ghi đầy đủ. Vì không có gì xảy ra trong thời gian thực nên công cụ có thể đọc trước và xem toàn bộ câu trước khi quyết định bất kỳ từ nào, điều này giúp nâng cao độ chính xác. Nó cũng có thể thực hiện những công việc mà tính năng đọc chính tả trực tiếp không thể thực hiện được. Nó có thể tách những người nói, phân bổ từng dòng cho người nói và có thể đính kèm dấu thời gian để bạn có thể chuyển từ dòng văn bản thẳng đến thời điểm đó trong âm thanh.

Nếu bạn đang xử lý một cuộc họp, một cuộc phỏng vấn, một bài giảng, một tập podcast hoặc một cuộc gọi điện thoại mà bạn đã ghi âm thì bạn đang thực hiện phiên âm từ một tệp đã lưu chứ không phải viết chính tả trực tiếp. Cả hai đều bị nhầm lẫn vì cả hai đều được tiếp thị là “lời nói thành văn bản”, nhưng bản ghi âm bạn có có hình dạng sai đối với công cụ đọc chính tả và hình dạng phù hợp đối với máy ghi âm. Hushscript được xây dựng để ghi âm. Không có chế độ đọc chính tả trực tiếp và trọng tâm đó là có chủ ý: làm việc từ toàn bộ tệp cho phép nó đọc trước để đảm bảo độ chính xác và gắn nhãn người nói trong cùng một lượt.

Cách chuyển giọng nói đã ghi thành văn bản

Đây là quy trình thực tế trên Hushscript, theo thứ tự bạn đáp ứng. Bạn cần bản ghi dưới dạng tệp trên thiết bị của mình, tệp âm thanh hoặc video ở bất kỳ định dạng phổ biến nào và địa chỉ email để đăng ký. Đó là toàn bộ danh sách. Không có gì để cài đặt.

  1. Thả tệp và xem bản xem trước. Mở trang chuyển âm thanh thành văn bản và thả tệp của bạn vào đó. Hushscript chép lại ngay 30 giây đầu tiên và hiển thị cho bạn kết quả với những người nói đã được tách riêng. Không cần tài khoản cho bước này. Có bản xem trước để bạn có thể đánh giá độ chính xác của bản ghi của chính mình trước khi thực hiện bất kỳ điều gì.
  2. Đăng ký để chép lại phần còn lại. Nếu bản xem trước có vẻ ổn, hãy đăng ký bằng email của bạn. Việc sao chép toàn bộ tệp được kiểm soát nên đây là bước cần đến tài khoản. Tài khoản mới có 30 phút miễn phí để dùng thử dịch vụ đúng cách.
  3. Tải tệp đầy đủ lên. Sau khi bạn đăng nhập, hãy tải toàn bộ bản ghi lên. Nếu là video thì âm thanh sẽ được trích xuất trong trình duyệt của bạn trước tiên và chỉ âm thanh được gửi, do đó, video sẽ vẫn ở trên thiết bị của bạn.
  4. Đọc, gắn nhãn lại và xuất. Bản ghi sẽ quay lại với mỗi lượt được gán cho một người nói (Người nói A, Người nói B, v.v.) và được gắn dấu thời gian. Nhấp vào bất kỳ nhãn người nói nào để đổi tên nhãn đó và tên mới sẽ cập nhật ở mọi nơi mà người đó nói. Khi nó đọc theo cách bạn muốn, hãy xuất sang TXT cho văn bản thuần túy, SRT hoặc VTT cho phụ đề, CSV hoặc JSON cho dữ liệu có cấu trúc, Markdown để xuất bản ghi chú, DOCX để chỉnh sửa hoặc PDF để chia sẻ.

Ba mươi phút là đủ để chép lại một cuộc phỏng vấn ngắn, một đoạn bài giảng dài 10 phút hoặc đoạn đầu tiên của bản ghi dài hơn nếu bạn muốn kiểm tra độ chính xác trước khi đi sâu hơn. Số phút miễn phí sẽ được mở khóa ngay lập tức khi kiểm tra thẻ nhanh: khoản giữ $1 được phép kiểm tra thẻ, sau đó được hủy bỏ ngay lập tức và không bao giờ bị tính phí. Hãy sử dụng một phương thức thanh toán khác và chúng sẽ đến với lần mua hàng đầu tiên của bạn. Không cần thẻ; nó chỉ là con đường nhanh nhất để nhận được tiền thưởng. Sau số phút miễn phí, bạn chỉ trả tiền cho số phút bạn ghi âm mà không cần đăng ký. trang giá có mức giá hiện tại.

Một ví dụ hoạt động

Giả sử bạn đã ghi lại cuộc phỏng vấn khách hàng dài 38 phút trên điện thoại của mình. Nó được lưu dưới dạng M4A, hai giọng nói, thỉnh thoảng là tiếng tách cà phê, được ghi lại trong phòng họp bình thường.

Bạn thả M4A trên trang chuyển âm thanh thành văn bản. Bản xem trước 30 giây xuất hiện dưới dạng một cuộc trò chuyện ngắn:

Người nói A 00:00 Cảm ơn bạn đã dành thời gian. Bạn có thể bắt đầu bằng việc kể cho tôi
                    điều gì khiến bạn tìm kiếm một công cụ như thế này lần đầu tiên không?
Người nói B 00:11 Chắc chắn rồi. Chúng tôi đang chìm trong đống vé hỗ trợ và hệ thống
                    cũ không thể theo kịp nên tôi bắt đầu tìm kiếm xung quanh.

Đó là bản xem trước chưa chỉnh sửa. Hai giọng nói được tách ra, mỗi dòng được đánh dấu thời gian và từ ngữ rõ ràng. Bạn đăng ký, tải lên tệp đầy đủ dài 38 phút và vài phút sau, bản ghi hoàn chỉnh đã sẵn sàng ở dạng tương tự. Người nói A là bạn và Người nói B là người được phỏng vấn của bạn, vì vậy bạn nhấp vào nhãn “Người nói A”, nhập tên của bạn và nhấp vào “Người nói B” để nhập tên của họ. Cả hai đều đổi tên toàn bộ tài liệu chỉ trong một lần. Bạn xuất sang DOCX, mở nó trong trình xử lý văn bản của mình, sửa hai hoặc ba vị trí mà tên sản phẩm được đánh vần theo phiên âm và bạn có bản ghi cuộc phỏng vấn hoàn chỉnh. 38 phút đã vượt quá số dư của bạn, đó là lý do tại sao 30 phút miễn phí này rất hữu ích cho công việc thực tế đầu tiên thay vì chỉ là một clip thử nghiệm.

Các vấn đề thường gặp và cách khắc phục

Phần lớn các bản ghi đáng thất vọng đều liên quan đến bản ghi chứ không phải hệ thống. Đây là những vấn đề thường gặp nhất và những việc cần làm đối với từng vấn đề.

Bản ghi yên lặng hoặc lầy lội. Nếu giọng nói yếu ớt hoặc căn phòng có âm thanh bùng nổ thì hệ thống sẽ hoạt động kém hơn và độ chính xác giảm xuống. Micrô đặt gần người nói, mic cài áo hoặc tai nghe cách miệng từ 10 đến 20 cm sẽ tạo ra sự khác biệt lớn hơn bất kỳ cách cài đặt nào. Một căn phòng rộng, trống trải thêm tiếng vang làm mờ đi ranh giới giữa các âm thanh; không gian nhỏ hơn hoặc nội thất mềm mại sẽ ghi lại tốt hơn. Thực tế là bạn không thể khắc phục vấn đề này, vì vậy, bạn nên làm ngay trước khi đạt kỷ lục vào lần tới.

Hai người nói chuyện cùng một lúc. Khi các giọng nói trùng nhau, cả từ ngữ và ai nói gì đều trở nên khó khăn hơn vì hai bộ âm thanh cạnh tranh nhau trong cùng một đoạn âm thanh. Không có bản sửa lỗi phần mềm sạch nào cho sự chồng chéo chính hãng. Trong bản ghi mà bạn điều khiển, việc để lại nhịp giữa các lượt sẽ có tác dụng sau này. Trong một trường hợp, bạn không thể làm lại, hãy mong đợi một vài dòng gạch chéo xung quanh những điểm gián đoạn và sắp xếp chúng bằng tay.

Một thuật ngữ chuyên môn bị sai. Các mô hình có mục đích chung biết rõ ngôn ngữ hàng ngày nhưng không nhất thiết phải nhìn thấy biệt ngữ trong ngành của bạn, họ khác thường hoặc tên sản phẩm. Chúng có xu hướng được phiên âm theo cách chúng phát âm hơn là cách chúng được đánh vần. Việc tìm và thay thế trong DOCX đã xuất sẽ xóa một thuật ngữ định kỳ trong vài giây, đó là một lý do khiến DOCX là bản xuất dễ sửa nhất.

Tệp sẽ không tải. Hầu hết các tệp âm thanh và video tiêu chuẩn đều hoạt động. Nếu một người từ chối, đó thường là một chiếc hộp đựng không bình thường hoặc rất cũ. Việc chuyển đổi nó sang MP3 hoặc WAV đơn giản bằng công cụ trong trình duyệt miễn phí, chạy trên thiết bị của bạn và không tải lên gì, hầu như luôn giải quyết được vấn đề. Nếu một định dạng vẫn không được chấp nhận, hãy gửi email tới support@hushscript.com và nhóm sẽ thêm định dạng đó.

Một người nói sẽ được chia thành hai. Đôi khi, cùng một người được gắn nhãn là hai người nói, thường là do giọng nói của họ đã thay đổi giữa chừng: họ di chuyển đến gần micrô hơn, chuyển từ tai nghe sang loa ngoài hoặc chất lượng đường truyền đã thay đổi. Công cụ nhóm theo cách phát ra giọng nói, do đó, một người mới có thể đọc được một sự thay đổi lớn. Việc hợp nhất hai nhãn trong trình chỉnh sửa sẽ khắc phục vấn đề này trong một bước. Cơ chế của việc này có trong hướng dẫn về cách hoạt động của tính năng phân tách người nói.

Độ chính xác và trọng âm

Mức độ phù hợp của trọng âm tùy thuộc vào kiểu máy và ngôn ngữ. Đối với tiếng Anh, các mô hình được đào tạo trên các bộ dữ liệu rộng có thể xử lý tốt tiếng Anh Mỹ, Anh, Úc và Ấn Độ và Hushscript cung cấp bốn giọng tiếng Anh riêng biệt. Phương ngữ địa phương nặng hoặc giọng ít đặc trưng hơn sẽ cần chỉnh sửa nhiều hơn, nhưng bạn vẫn đang chỉnh sửa bản nháp thay vì nhập từ không có gì.

Một số thói quen sẽ nâng cao độ chính xác của mọi bản ghi, bất kể giọng điệu. Ghi âm bằng micrô gần. Hãy để mỗi người hoàn thành trước khi người tiếp theo bắt đầu. Tránh các phòng có tiếng vang lớn. Tốc độ nói vừa phải sẽ phiên âm tốt hơn so với việc chạy nước rút 200 từ một phút. Và tốc độ bit hợp lý là vấn đề quan trọng: MP3 128 kbps là ổn, trong khi âm thanh tin nhắn thoại được nén nhiều ở băng thông hẹp sẽ mất chi tiết mà hệ thống cần. Để tìm hiểu đầy đủ hơn về các định dạng và đặc điểm riêng của từng định dạng, hãy xem cách phiên âm bất kỳ tệp âm thanh nào.

Hushscript tự động phát hiện ngôn ngữ và phiên âm khoảng 99 ngôn ngữ, với độ chính xác cao nhất ở 18 ngôn ngữ trong số đó. Bản ghi âm bằng một ngôn ngữ sẽ được ghi lại một cách rõ ràng nhất; chuyển đổi ngôn ngữ ở giữa câu là điều khó khăn đối với bất kỳ công cụ nào.

Nhãn người nói, trong cùng một bước

Việc tách những người nói, chính thức được gọi là phân tách người nói, diễn ra cùng lúc với tính năng nhận dạng giọng nói chứ không phải là công việc thứ hai mà bạn phải trả thêm tiền. Bạn nhận được các từ và ghi công cùng nhau, miễn phí trên mỗi bản ghi. Đối với một cuộc phỏng vấn hai người hoặc một cuộc họp nhỏ, sự tách biệt đó thường chính xác và tiết kiệm công việc tẻ nhạt khi gắn thẻ từng dòng bằng tay. Không có giới hạn về số lượng người nói mà một tệp có thể chứa, tuy nhiên độ chính xác sẽ cao nhất khi các giọng nói khác biệt, không trùng lặp và không phát ra âm thanh giống nhau. Việc gắn nhãn diễn giả đi kèm với mỗi bản ghi mà không mất thêm phí là loại chi tiết trung thực theo mặc định mà toàn bộ phương pháp này được xây dựng dựa trên: phần hữu ích được đưa vào chứ không bị giữ lại ở cấp cao hơn.

Sự khác biệt rõ ràng cần lưu ý là đây. Nếu bạn muốn ghi lại giọng nói khi bạn nói, nhập liệu bằng giọng nói hoặc đọc chính tả, hãy sử dụng công cụ trực tiếp được tích hợp trong thiết bị hoặc trình xử lý văn bản của bạn. Nếu bạn đã có bản ghi âm cần thiết dưới dạng văn bản thì việc chép lại bản ghi đó từ trang chuyển âm thanh thành văn bản sẽ nhanh hơn, chính xác hơn và cung cấp cho bạn nhãn người nói cũng như đầu ra có thể xuất chỉ trong một bước.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Lời nói thành văn bản là gì?

Lời nói thành văn bản, còn được gọi là nhận dạng giọng nói tự động hoặc ASR, là phần mềm chuyển âm thanh nói thành từ viết. Nó lắng nghe âm thanh của lời nói, tìm ra những từ được nói và tạo ra bản ghi văn bản. Các phiên bản hiện đại chạy trên mô hình AI được đào tạo trên hàng nghìn giờ giọng nói được ghi âm, đó là lý do tại sao chúng xử lý trọng âm và tiếng ồn xung quanh tốt hơn nhiều so với các công cụ đọc chính tả cách đây một thập kỷ.

Sự khác biệt giữa đọc chính tả trực tiếp và chép lại bản ghi âm là gì?

Tính năng đọc chính tả trực tiếp biến lời nói thành văn bản trong thời gian thực khi bạn nói, giống như cách nhập giọng nói trong điện thoại hoặc trình xử lý văn bản. Việc sao chép bản ghi sẽ hoạt động trên tệp âm thanh hoặc video đã lưu sau khi thực hiện. Các bản ghi âm thường chính xác hơn vì công cụ có thể nhìn thấy toàn bộ câu trước khi chuyển thành từ và có thể gắn nhãn ai đã nói khi nào. Hushscript xử lý các bản ghi chứ không phải đọc chính tả trực tiếp.

Giọng nói tự động chuyển thành văn bản có độ chính xác như thế nào?

Để có giọng nói rõ ràng trong phòng yên tĩnh, các mô hình AI hiện tại đạt độ chính xác từ khoảng 90 đến 97% trên các ngôn ngữ được hỗ trợ tốt. Độ chính xác giảm khi có tiếng ồn xung quanh nặng, hai người đang nói chuyện với nhau, giọng mạnh mà người mẫu chưa nghe nhiều hoặc từ vựng chuyên môn như tên thuốc hoặc tiếng Latinh hợp pháp. Việc dọn dẹp bản ghi mang lại độ chính xác cao hơn bất kỳ cài đặt đơn lẻ nào.

Tính năng chuyển giọng nói thành văn bản có hoạt động với dấu trọng âm không?

Có và tốt hơn nhiều so với các hệ thống cũ. Các mô hình được đào tạo trên các bộ dữ liệu lớn, đa dạng xử lý tiếng Anh Mỹ, Anh, Úc và Ấn Độ một cách thoải mái và Hushscript cung cấp bốn giọng Anh riêng biệt. Sau đó, một phương ngữ địa phương mạnh hoặc giọng ít đặc trưng hơn sẽ cần chỉnh sửa nhiều hơn một chút, nhưng bản chép lời vẫn là bản nháp đầu tiên có thể sử dụng được chứ không phải là thứ bạn nhập lại từ đầu.

Làm cách nào để chuyển đổi giọng nói đã ghi thành văn bản trên Hushscript?

Thả tệp âm thanh hoặc video của bạn trên trang chuyển âm thanh thành văn bản và bản xem trước có gắn nhãn người nói dài 30 giây sẽ xuất hiện mà không cần tài khoản. Đăng ký bằng email của bạn để chép lại phần còn lại, sau đó tải tệp đầy đủ lên. Bản ghi hoàn chỉnh sẽ có nhãn người nói và dấu thời gian, đồng thời bạn có thể đổi tên người nói và xuất ở 21 định dạng, từ TXT, SRT và DOCX sang PDF hoặc dưới dạng .husharchive được bảo vệ bằng mật khẩu.

Bài phát biểu thành văn bản có miễn phí không?

Hushscript không miễn phí vì AI đằng sau nó phải tốn tiền thật để chạy nên nó sẽ trả tiền theo mức sử dụng mà không cần đăng ký. Bạn có 30 phút miễn phí để dùng thử. Chúng mở khóa ngay lập tức khi bạn xác thực thẻ có khoản giữ $1 được phát hành ngay lập tức và không bao giờ bị tính phí hoặc với lần mua hàng đầu tiên của bạn nếu bạn thanh toán theo cách khác. Bản xem trước 30 giây và các công cụ trong trình duyệt hoàn toàn miễn phí mà không cần có tài khoản.

Hushscript có thể phiên âm những ngôn ngữ nào?

Hushscript tự động phát hiện ngôn ngữ và phiên âm khoảng 99 ngôn ngữ, với độ chính xác cao nhất ở 18 ngôn ngữ trong số đó, bao gồm tiếng Anh toàn cầu, tiếng Anh, tiếng Úc và tiếng Anh Mỹ, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Quan Thoại, tiếng Hindi và tiếng Ả Rập. Trang Ngôn ngữ liệt kê mọi ngôn ngữ. Bản ghi âm ở một ngôn ngữ sẽ được phiên âm tốt nhất.

Bắt đầu với 30 phút miễn phí

Bắt đầu – 30 phút miễn phí