Chuyển đến nội dung chính

Phân tách người nói: nhãn người nói hoạt động thế nào

Tác giả: Ngày đăng: Rà soát lần cuối:

phân tách người nói của người nói là quá trình tự động chia bản ghi thành các phân đoạn theo người nói, trả lời “ai đã nói khi nào?” trước khi bất kỳ con người nào đọc bản ghi. Nghiên cứu phân tách người nói trong Tuyển tập ACL hiện tại mô tả nhiệm vụ tương tự đối với các cuộc trò chuyện nhiều bên. Đó là sự khác biệt giữa một bức tường chữ và một cuộc trò chuyện có cấu trúc và đó là lý do tại sao bản ghi lại cuộc phỏng vấn hai người trở lại dưới dạng một đoạn hội thoại có thể đọc được thay vì một đoạn văn dài.

Nói một cách dễ hiểu: bạn tải lên một bản ghi âm, công cụ phân tách người nói sẽ tìm những điểm mà giọng nói thay đổi, nhóm các phân đoạn nghe giống của cùng một người và gửi lại bản ghi có nội dung giống như một tập lệnh: một dòng mỗi lượt, được gắn nhãn bằng giọng nói. Bài đăng này giải thích cách hoạt động của tính năng này, tại sao việc phân tách người nói không giống như nhận dạng giọng nói và cách chuyển các nhãn chung thành tên thật.

tính năng phân tách người nói, bằng ngôn ngữ dễ hiểu

Hình ảnh chép lại một cuộc phỏng vấn dài 90 phút bằng tay. Sau khi chuyển bài phát biểu thành văn bản, việc tiếp theo bạn cần làm là thêm các thuộc tính: “Người phỏng vấn:”, “Chủ đề:”, qua lại, mỗi khi giọng nói thay đổi. Công việc ghi công đó, quyết định ai đang nói vào bất kỳ giây nào, chính là công việc mà tính năng phân tách người nói mang lại cho bạn.

Đầu ra là một bản ghi có định dạng hội thoại:

Người nói A [00:00:12]: Điều đầu tiên cần hiểu là dữ liệu chỉ tồn tại trong một khoảnh khắc.
Người nói B [00:00:27]: Đúng, và đó là phần mà hầu hết mọi người không nhận ra cho đến khi quá muộn.
Người nói A [00:00:34]: Chính xác. Vì vậy, câu hỏi thực sự sẽ trở thành những gì bạn làm trong cửa sổ đó.

Mỗi câu nói được gắn với một người nói và một dấu thời gian. Sau đó bạn có thể đổi tên Người nói ANgười nói B thành tên thật; một chỉnh sửa cho mỗi người nói và nhãn sẽ cập nhật ở mọi nơi nó xuất hiện.

Giải pháp thay thế, một bản ghi đơn giản không có phân tách người nói, là một khối văn bản liên tục trong đó bạn phải phát lại âm thanh để tìm ra ai đã nói gì. Đối với bất cứ điều gì kéo dài vài phút với hai giọng nói trở lên, đó thực sự là công việc thủ công và đó là công việc mà thẻ phân tách người nói sẽ loại bỏ.

Những gì bạn cần trước khi bắt đầu

Không có cài đặt nào để định cấu hình và không có gì để cài đặt. quá trình phân tách người nói diễn ra trên chính bản ghi âm, do đó, điều kiện tiên quyết thực sự duy nhất là âm thanh trong đó những người nói được phân biệt hợp lý:

Vậy là xong. Không đăng ký micrô, không lấy mẫu giọng nói, không thiết lập từng người nói.

Cách nhận dạng người nói tự động hoạt động

việc phân tách người nói chia thành một số giai đoạn riêng biệt. Việc biết rõ các giá trị này giúp đầu ra dễ đọc hơn và dễ sửa hơn khi có lỗi xảy ra.

Trích xuất tính năng. Âm thanh được chia thành các khung hình ngắn, mỗi khung hình thường từ 10 đến 40 mili giây và công cụ đo lường các đặc điểm âm thanh trong mỗi khung hình. Các đặc điểm quan trọng để phân biệt những người nói nằm trong miền tần số: cao độ, hình thức và mẫu quang phổ có xu hướng nhất quán trong giọng nói của một người và khác nhau giữa những người.

Phân đoạn. Công cụ tìm kiếm các điểm thay đổi của người nói: những khoảnh khắc mà các đặc điểm giọng nói đó thay đổi. Đây là phần khó khăn. Một sự thay đổi có thể xảy ra ở giữa câu khi ai đó ngắt lời, đồng thời tiếng ồn hoặc lời nói chồng chéo có thể che giấu ranh giới thực sự hoặc bịa ra một ranh giới sai lầm.

Phân cụm. Các phân đoạn có âm thanh giống nhau sẽ được nhóm lại với nhau. Hệ thống không cho biết có bao nhiêu người trong phòng; nó suy ra số lượng người nói từ âm thanh. Nếu bạn biết trước số lượng, một số thiết lập cho phép bạn cung cấp số lượng đó; nếu không, công cụ sẽ ước tính điều đó, đây là nơi hầu hết các lỗi “chia một người thành hai” và “hợp nhất hai người thành một”.

Gắn nhãn. Mỗi cụm có một nhãn:Người nói A,Người nói B,Người nói C hoặc Người nói 0,Người nói 1. Các nhãn là phần giữ chỗ tùy ý. Không có danh tính đằng sau chúng, chỉ có một bộ xử lý ổn định cho một giọng nói trong toàn bộ bản ghi.

Toàn bộ quy trình chạy như một quá trình tự động chuyển cùng với phiên âm, do đó bạn không phải thực hiện công việc gắn nhãn người nói riêng biệt.

Diarization và nhận dạng giọng nói

Hai công việc này liên tục được kết hợp với nhau nhưng chúng trả lời các câu hỏi khác nhau.

Diarization hỏi: ai đang nói vào lúc này, so với những giọng nói khác trong tệp này? Nó phân tách các giọng nói nhưng không biết họ thuộc về ai. Nó không cần kiến ​​thức trước và không lưu giữ bất kỳ giọng nói nào sau khi công việc hoàn thành.

Nhận dạng giọng nói, còn gọi là nhận dạng người nói, hỏi: đây có phải là người trong bản ghi âm tham chiếu đã biết không? Nó cần một mẫu giọng nói đã đăng ký để so sánh và đó là công nghệ đằng sau hệ thống “xác minh danh tính của bạn bằng giọng nói”.

Hushscript sử dụng tính năng phân tách người nói chứ không phải nhận dạng giọng nói. Không có cơ sở dữ liệu về giọng nói đã đăng ký và bản ghi âm của bạn không bao giờ được so sánh với bất kỳ ai khác. Nhãn của người nói được lấy hoàn toàn từ đặc điểm giọng nói bên trong một tệp đó.

Sự khác biệt này là lý do khiến phân tách người nói không thể nêu tên mọi người cho bạn. Nó có thể tự tin nói “cùng một người đã nói 200 lượt này trong một giờ”, nhưng nó không thể nói ai người đó là. Bước đó là của bạn và mỗi người nói phải thực hiện một cú nhấp chuột. Nếu bạn muốn tìm hiểu sâu hơn về cách Hushscript xử lý các bản ghi âm nhiều người nói từ đầu đến cuối, trang nhận dạng người nói sẽ trình bày việc đó.

Một ví dụ hoạt động: cuộc họp ba người

Giả sử bạn ghi lại một cuộc họp dự án kéo dài 40 phút với ba người trong một phòng, dùng chung một mic máy tính xách tay, được lưu dưới dạng một tệp .m4a. Bạn thả vào, sau khi phiên âm thì kết quả như sau:

Người nói A [00:00:04]: Được rồi, bắt đầu với ngày ra mắt. Chúng ta đang ở đâu?
Người nói B [00:00:09]: Thiết kế đã xong. Chúng tôi đã bàn giao những màn hình cuối cùng vào thứ Hai.
Người nói C [00:00:14]: Kỹ thuật cần khoảng hai tuần nữa cho quá trình thanh toán.
Người nói A [00:00:21]: Hai tuần đã quá thời hạn chúng tôi đã hứa với tiếp thị.
Người nói B [00:00:27]: Chúng tôi có thể giao hàng mà không có luồng thanh toán mới không? và theo dõi?
Người nói C [00:00:33]: Không sạch sẽ. Quy trình cũ bị phá vỡ khi áp dụng mức giá mới.

Ba giọng nói, được tách biệt và gắn nhãn, có dấu thời gian ở mỗi lượt. Bây giờ bạn đổi tên:Người nói A thành “Priya” (cô ấy đang điều hành cuộc họp),Người nói B thành “Tom”,Người nói C thành “Dana”. Sau ba lần nhấp chuột, mỗi dòng đều có tên thật và bản ghi đã sẵn sàng để dán vào ghi chú cuộc họp với phần ghi công chính xác xuyên suốt.

Hình dạng tương tự áp dụng cho cuộc phỏng vấn hai người, podcast bốn người hoặc cuộc gọi điện thoại hai bên: công cụ sẽ phân tách nội dung nó nghe được và bạn đặt tên vào.

Cách gắn nhãn lại người nói trong Hushscript

Các nhãn được đưa đến có mục đích chung chung; đặt tên cho chúng là một bước soạn thảo nhanh chóng. Quy trình trước khi bạn đến đó là: thả tệp của bạn và bản xem trước có gắn nhãn người nói dài 30 giây sẽ hiển thị mà không cần tài khoản, đăng ký để chép lại phần còn lại, sau đó mở bản ghi hoàn chỉnh. Từ đó:

  1. Nhấp vào nhãn người nói bất kỳ trong trình chỉnh sửa bản chép lời, chẳng hạn như Người nói B.
  2. Nhập tên thật, chẳng hạn như “Tom”.
  3. Mọi phiên bản của người nói đó cập nhật cùng một lúc, từ dòng đầu tiên đến dòng cuối cùng.

Việc đổi tên có tính chất chung nên bạn không bao giờ chỉnh sửa cùng một nhãn hai lần. Đối với một cuộc phỏng vấn kéo dài 90 phút với hai diễn giả, quá trình dán nhãn lại đầy đủ chỉ mất chưa đầy một phút và bạn sẽ có được một bản ghi sẵn có trích dẫn ghi chính xác từng dòng. Sau đó, bạn có thể xuất tệp đó, với các tên đã được đặt sẵn, ở bất kỳ định dạng nào trong số 21 định dạng như TXT, SRT, DOCX, PDF và JSON, cùng với .husharchive được bảo vệ bằng mật khẩu.

Xử lý sự cố thường gặp khi phân tách người nói

tính năng phân tách người nói đáng tin cậy đối với các bản ghi sạch và sẽ khó hơn khi âm thanh trở nên lộn xộn hơn. Các vấn đề thường gặp và cách xử lý:

Lời nói chồng chéo. Khi hai người nói chuyện cùng một lúc, công cụ phải gán âm thanh chồng chéo cho một người nói duy nhất và nó có thể gắn nhãn sai cho phần giao nhau hoặc bỏ đi một vài từ. Không có cách khắc phục nào trong phần mềm; âm thanh thực sự chứa hai giọng nói trong cùng một thời điểm. Phòng ngừa chính là đòn bẩy: một bản ghi trong đó mọi người lần lượt nói một cách rõ ràng hơn nhiều so với một bản ghi đầy gián đoạn. Khi xảy ra hiện tượng chồng chéo, việc đọc nhanh âm thanh sẽ phát hiện được một số dòng bị ảnh hưởng.

Giọng nói có âm vực tương tự. Hai người nói có cao độ và giọng gần giống nhau (chẳng hạn như hai người đàn ông cùng độ tuổi hoặc anh chị em ruột) khó tách biệt hơn so với một cặp tương phản vì đặc điểm giọng nói của họ thực sự trùng lặp. Hệ thống đôi khi có thể hoán đổi lượt giữa chúng. Quét bản ghi để tìm những dòng đọc kỳ lạ đối với người được chỉ định; đó là những nhãn cần gán lại bằng tay.

Một người chia thành hai nhãn. Nếu âm thanh của ai đó thay đổi trong khi ghi (họ di chuyển đến gần micrô hơn, chuyển từ tai nghe sang loa ngoài hoặc kết nối bị suy giảm), công cụ có thể đọc nửa sau dưới dạng giọng nói mới và tạo nhãn bổ sung. Hợp nhất cả hai bằng cách dán nhãn lại cho cả hai cùng tên; các bản sao thu gọn thành một người nói.

Hai người hợp nhất thành một nhãn. Điều ngược lại xảy ra khi hai giọng nói nhỏ hoặc xa xôi phát ra quá giống nhau đến mức hệ thống không thể phân tách được. Thực tế là vấn đề khó khắc phục nhất nên bạn cần ngăn chặn: đặt micrô gần người nói hơn và tránh ghi âm từ phòng lớn.

Âm thanh xa hoặc ồn ào. Mic máy tính xách tay ở cuối bàn hội nghị, điện thoại trên bàn trong khi trò chuyện nhóm hoặc tiếng vang trong phòng nặng nề, tất cả đều làm mờ ranh giới giữa các giọng nói. Vị trí đặt mic gần hơn sẽ giúp ích cho mọi người nói và việc giảm tiếng ồn xung quanh (quạt, giao thông, âm nhạc) giúp tăng cường sự tách biệt. Chất lượng ghi âm theo dõi chặt chẽ chất lượng âm thanh.

Cuộc gọi điện thoại được ghi thành hai tệp riêng biệt. Nếu máy ghi âm của bạn lưu mỗi bên cuộc gọi dưới dạng tệp đơn âm riêng thì việc phân tách người nói trên một trong hai tệp sẽ chỉ thấy một giọng nói. Trước tiên, hãy kết hợp cả hai thành một bản ghi hỗn hợp duy nhất để cả hai giọng nói đều xuất hiện trong một tệp, sau đó chép lại.

Các mẹo về độ chính xác thực sự tác động đến kim

Một số thói quen giúp việc phân tách người nói trở nên tốt hơn rõ rệt và hầu hết trong số đó là về bản ghi âm chứ không phải phần mềm:

Không cần phải hoàn hảo. Các lượt quay rõ ràng và vị trí micrô hợp lý giúp hầu hết các bản ghi được loại bỏ nhãn và biên tập viên sẽ xử lý phần còn lại.

Tại sao điều này lại quan trọng đối với các cuộc phỏng vấn và cuộc họp

Nếu không phân tách người nói, bản ghi của cuộc trò chuyện nhiều người gần như không thể sử dụng được cho các công việc phổ biến nhất:

Với tính năng phân tách người nói, mỗi nội dung này đều đơn giản, dễ hiểu. và bản ghi sẽ trở thành một tài liệu chứ không phải là văn bản thô. Đối với bất kỳ nội dung nào sẽ được xuất bản hoặc trích dẫn, cho dù là ghi chú báo chí, nghiên cứu hay chương trình podcast, việc ghi công chính xác không phải là tùy chọn và lấy nó từ bản ghi thay vì xây dựng lại nó từ âm thanh là nơi tiết kiệm thời gian. Đối với công việc nội bộ như ghi chú cuộc họp, nghiên cứu phỏng vấn hoặc hồ sơ nhân sự, cấu trúc được gắn nhãn cũng có giá trị: quét đoạn hội thoại nhanh hơn nhiều so với đọc một bức tường văn bản.

Để có hướng dẫn đầy đủ về ngữ cảnh, hãy xem cách ghi lại một cuộc phỏng vấn, bao gồm việc ghi âm, chép lời và dán nhãn lại cho báo chí và nghiên cứu cũng như cách ghi chép một podcast để ghi nhãn người dẫn chương trình và khách trong một tập.

Nhãn người nói được cung cấp miễn phí trên mọi bản ghi Hushscript

phân tách người nói được đưa vào mỗi bản ghi Hushscript mà không mất thêm phí. Không có tiện ích bổ sung phân tách người nói, không có cấp gói riêng cho nó và không có giới hạn về số lượng người nói mà một bản ghi âm có thể có. Bản thân Hushscript là dịch vụ trả tiền theo mức sử dụng mà không cần đăng ký. Có 30 phút miễn phí để dùng thử và bạn chỉ phải trả tiền cho số phút sử dụng sau đó; hãy xem trang định giá để biết chi tiết.

Việc tách người nói là miễn phí vì bản ghi của cuộc trò chuyện không có nó chỉ là một nửa bản ghi: văn bản có thể đọc được mà không biết ai đã nói. Đưa bản ghi vào, tự động lấy nhãn, đổi tên chúng chỉ bằng một cú nhấp chuột và xuất kết quả. Thông tin thêm về cách tất cả kết hợp với nhau có trên trang âm thanh thành văn bản.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Xác định phân tách người nói là gì?

Xác định phân tách người nói là quá trình phân đoạn bản ghi âm thành các phần tương ứng với những người nói riêng biệt. Kết quả là một bản ghi trong đó mỗi dòng được quy cho người nói ('Người nói A nói thế này, Người nói B nói thế kia') thay vì một khối văn bản không phân biệt. Nó trả lời câu hỏi 'ai nói khi nào?' tự động, trước khi bất kỳ ai đọc bản ghi.

tính năng phân tách người nói có giống như nhận dạng giọng nói không?

Không. tính năng phân tách người nói sẽ phân tách các giọng nói trong một bản ghi âm và cho bạn biết cùng một người đã nói những phân đoạn này nhưng không biết người đó là ai. Nhận dạng giọng nói (nhận dạng người nói) so sánh giọng nói với mẫu tham chiếu đã biết để đặt tên cho giọng nói đó. việc phân tách người nói không cần tham chiếu và không xây dựng hồ sơ giọng nói; đó là lý do tại sao nó gắn nhãn người nói là 'Người nói A' và 'Người nói B' thay vì theo tên.

Có bao nhiêu người nói có thể xử lý việc phân tách người nói?

Hushscript không có giới hạn trả phí về số lượng người nói, nhưng không có con số chung nào mà việc phân tách người nói vẫn chính xác như nhau. Sự chồng chéo, giọng nói có âm thanh tương tự, khoảng cách micrô và tiếng ồn trong phòng đều quan trọng. Một bảng điều khiển sạch có thể phân tách tốt hơn cuộc gọi hai người ồn ào, vì vậy, hãy xem lại nhãn bất cứ khi nào có vấn đề về phân bổ.

Tại sao bản ghi lại chia một người thành hai người nói?

Thường có sự thay đổi lớn về cách người đó phát ra âm thanh giữa chừng: họ di chuyển đến gần hoặc xa hơn micrô, chuyển từ tai nghe sang loa ngoài hoặc chất lượng đường truyền đã thay đổi. Công cụ tập hợp theo đặc điểm giọng nói, do đó, một sự thay đổi lớn trong những đặc điểm đó có thể được coi là một giọng nói mới. Việc hợp nhất hai nhãn trong trình chỉnh sửa sẽ khắc phục vấn đề này chỉ trong một lần.

tính năng phân tách người nói có thể cho tôi biết tên của người nói không?

Không. Diarization phân tách người nói nhưng không xác định họ theo tên. Nó đặt tên cho chúng là 'Người nói A', 'Người nói B', v.v. Bạn tự gán tên thật trong trình chỉnh sửa sau khi bản chép lời được tạo và mỗi lần đổi tên sẽ áp dụng cho mọi dòng mà người nói nói.

tính năng phân tách người nói có hoạt động trên bản ghi âm cuộc gọi điện thoại không?

Có, khi cả hai bên cuộc gọi đều được ghi lại. Nếu bản ghi là một bản nhạc hỗn hợp duy nhất có cả hai giọng, quá trình phân tách người nói sẽ phân tách chúng giống như bất kỳ tệp hai người nói nào khác. Nếu mỗi bên được lưu dưới dạng tệp đơn âm riêng biệt, trước tiên hãy kết hợp chúng thành một bản trộn để cả hai giọng đều có trong cùng một bản ghi.

tính năng phân tách người nói có được bao gồm trong mỗi bản ghi Hushscript không?

Có. Mỗi bản ghi đều bao gồm nhãn người nói mà không mất thêm phí, không có tiện ích bổ sung riêng biệt và không yêu cầu cấp cao hơn cho chúng. Bạn có thể đổi tên nhãn thành tên thật chỉ bằng một cú nhấp chuột sau khi chép lời và tên mới sẽ cập nhật trong toàn bộ bản chép lời.

Bắt đầu với 30 phút miễn phí

Bắt đầu – 30 phút miễn phí