Chuyển M4A hoặc Voice Memo của Apple thành văn bản riêng tư
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
M4A là định dạng mặc định cho Apple Voice Memos và đó là định dạng bạn nhận được khi xuất từ GarageBand, ghi âm bằng QuickTime hoặc lưu ghi chú thoại trong nhiều ứng dụng trên App Store. Nó là bộ chứa MPEG-4 chỉ có âm thanh, thường mang AAC; Hướng dẫn codec hiện tại của MDN xác định AAC là codec âm thanh tiêu chuẩn cho MP4. Chuyển một văn bản thành văn bản rất nhanh chóng. Phần đáng được chú ý hơn là quyền riêng tư, vì nội dung mọi người ghi trên điện thoại có xu hướng mang tính cá nhân hơn nội dung họ nhập.
Hướng dẫn này đề cập đến nguồn gốc của tệp M4A, cách chuyển đổi tệp thành văn bản có nhãn người nói, cách giữ bản ghi nhạy cảm ở chế độ riêng tư và cách xử lý các trường hợp khó xử: cuộc gọi hai chiều, bản ghi nhớ im lặng và giọng nói.
Các tệp M4A đến từ đâu (iPhone và Mac)
M4A là âm thanh MPEG-4, hầu như luôn được mã hóa AAC. Đây là định dạng nội bộ của Apple nên bạn thường xuyên gặp nó trên toàn bộ hệ sinh thái và một số nơi bên ngoài hệ sinh thái:
- Apple Voice Memos lưu mọi bản ghi dưới dạng
.m4a, trên cả iPhone và Mac. - Trình ghi cuộc gọi iPhone, ứng dụng của bên thứ ba ghi lại điện thoại hoặc cuộc gọi FaceTime, thường ghi M4A.
- Bản ghi âm thanh QuickTime trên máy Mac được lưu dưới dạng M4A.
- Ghi chú giọng nói của WhatsApp và Signal xuất dưới dạng OGG hoặc M4A, tùy thuộc vào ứng dụng và nền tảng.
- Các bản xuất của GarageBand là M4A hoặc AAC, là cùng một codec trong một trình bao bọc khác.
Vì vậy, tệp trước mặt bạn có thể là một ghi chú nhanh cho bản thân, một cuộc phỏng vấn, một cuộc gọi được ghi âm hoặc một tin nhắn thoại được chuyển tiếp. Việc chuyển đổi là giống hệt nhau cho tất cả chúng. Những thay đổi nằm ở mức độ cẩn thận mà bạn muốn đối với nội dung, cũng là chủ đề xuyên suốt phần còn lại của hướng dẫn này.
Lấy Bản ghi nhớ giọng nói khỏi iPhone của bạn
Mở ứng dụng Ghi nhớ giọng nói, nhấn vào bản ghi âm bạn muốn, nhấn vào menu ba chấm (…) và chọn Chia sẻ. Từ đó, bạn có thể AirDrop nó tới máy Mac của mình hoặc gửi nó cho chính bạn qua Thư, Tin nhắn hoặc Ghi chú. Các bước đó tuân theo hướng dẫn chia sẻ Ghi nhớ giọng nói hiện tại của Apple. Dù bạn gửi nó như thế nào thì nó vẫn sẽ xuất hiện dưới dạng tệp .m4a.
Trên máy Mac, hãy sử dụng lệnh Chia sẻ của Bản ghi nhớ giọng nói hoặc kéo bản ghi đã xuất vào thư mục mà bạn muốn giữ bản ghi đó. Điều đó tránh việc phụ thuộc vào đường dẫn lưu trữ ứng dụng nội bộ mà Apple có thể thay đổi giữa các bản phát hành.
Những gì bạn cần
Có rất ít thứ cần thiết lập:
- Tệp
.m4a, trên bất kỳ thiết bị nào có trình duyệt. - Một trình duyệt hiện đại. Không cần cài đặt gì trên iPhone hoặc Mac vì quá trình chép lời diễn ra trong trình duyệt và trên đám mây.
- Một tài khoản nhưng chỉ khi bạn sẵn sàng chép lại toàn bộ tệp. Bản xem trước 30 giây không cần tài khoản.
Một lưu ý về chi phí, được viết ngắn gọn: Hushscript không miễn phí vì nó chạy trên AI sao chép hàng đầu có chi phí thực tế mỗi phút. Đây là dịch vụ trả tiền khi bạn sử dụng mà không cần đăng ký và bạn có 30 phút miễn phí để dùng thử. Những phút đó sẽ đến ngay lập tức khi bạn xác thực thẻ có khoản giữ $1 được ủy quyền và sau đó được giải phóng ngay lập tức, không bao giờ bị tính phí. Nếu bạn muốn thanh toán theo cách khác, 30 phút sẽ được cấp một lần sau lần mua hàng đầu tiên của bạn và không cần phải có thẻ. Giá gói chính xác có trên trang định giá.
Chuyển đổi M4A theo ba bước
Quy trình được xây dựng để bạn có thể nghe thấy chất lượng trước khi thực hiện bất kỳ điều gì.
- Thả tệp và xem bản xem trước. Đi tới ghi âm giọng nói để nhắn tin và kéo
.m4acủa bạn vào khu vực tải lên hoặc nhấp để duyệt. Hushscript chép lại 30 giây đầu tiên và hiển thị lại cho bạn nhãn người nói: không có tài khoản, không thanh toán, không có gì để điền. Bản xem trước này là nơi bạn kiểm tra xem âm thanh có đủ rõ ràng không và những người nói có được tách biệt theo cách bạn mong đợi hay không. - Đăng ký để chép lời phần còn lại. Nếu bản xem trước có vẻ ổn, hãy nhập email của bạn để tạo tài khoản. Đây là bước cho phép sao chép đầy đủ và cũng là bước tạo ra 30 phút rảnh rỗi của bạn. Chấp nhận các tệp có thời lượng tối đa 10 giờ và không có giới hạn kích thước tệp.
- Nhận, gắn nhãn lại và xuất bản ghi. Tải toàn bộ tệp lên và để quá trình xử lý. Khi hoàn tất, bản ghi sẽ xuất hiện trong trang tổng quan của bạn với những người nói được đánh dấu. Đổi tên “người nói 1” thành tên thật chỉ bằng một cú nhấp chuột, sau đó xuất ở bất kỳ định dạng nào trong số 21 định dạng (TXT, SRT, DOCX và PDF trong số đó) hoặc dưới dạng .husharchive được bảo vệ bằng mật khẩu.
Ngay khi bản ghi của bạn sẵn sàng, âm thanh sẽ bị xóa khỏi máy chủ. Không có cài đặt nào để giữ lại nó và nó không bao giờ được sử dụng để đào tạo bất cứ thứ gì. Bạn giữ bản ghi; chúng tôi không lưu giữ bản ghi.
Thời gian xử lý là bao lâu
Thời gian xử lý thay đổi tùy theo độ dài của bản ghi nhớ, đặc điểm âm thanh và tải dịch vụ hiện tại. Bạn không cần phải ngồi trên trang trong khi nó chạy: bản chép lời sẽ xuất hiện trên trang tổng quan của bạn và bạn có thể quay lại trang đó khi công việc hoàn tất.
Ngôn ngữ nào hoạt động
Hushscript phiên âm khoảng 99 ngôn ngữ, được phát hiện tự động. Bản ghi nhớ bạn đã ghi bằng tiếng Tây Ban Nha, tiếng Pháp hoặc tiếng Nhật sẽ được chép lại mà không cần bạn cài đặt gì. Không có menu thả xuống ngôn ngữ để có thể sai. Độ chính xác cao nhất ở các ngôn ngữ phổ biến nhất và vẫn ổn định ở phần đuôi dài.
Một ví dụ hoạt động: một cuộc phỏng vấn được ghi lại
Giả sử bạn đã ghi lại một cuộc phỏng vấn dài 25 phút trên iPhone của mình, chỉ có bạn và một người khác, cả hai đều có thể nghe được. Bản ghi nhớ giọng nói đã lưu nó dưới dạng interview-2026-06.m4a. Bạn AirDrop nó vào máy Mac của mình, thả nó vào bản xem trước và 30 giây đầu tiên sẽ được dán nhãn trở lại. Bạn chép lại toàn bộ tập tin, đổi tên người nói khi công việc hoàn thành và xuất TXT có nội dung như sau:
Người nói A 00:00:04 Cảm ơn bạn đã dành thời gian. Chúng ta có thể bắt đầu bằng việc
dự án thực sự bắt đầu như thế nào không?
Người nói B 00:00:11 Chắc chắn rồi. Thành thật mà nói, nó bắt đầu như một thử nghiệm phụ. Chúng tôi
không ngờ nó lại trở thành vấn đề chính.
Người nói A 00:00:19 Và sự thay đổi đó xảy ra khi nào?
Người nói B 00:00:23 Xung quanh nguyên mẫu thứ hai. Đó là khi những người
ngoài nhóm bắt đầu sử dụng nó hàng ngày.
Mỗi lượt đều mang một thẻ người nói và dấu thời gian. Vì vậy, việc trích dẫn chính xác ai đó là vấn đề tìm ra dòng chứ không phải xem đi xem lại qua âm thanh. Thay vào đó, nếu xuất SRT, bạn sẽ nhận được nội dung tương tự được cắt thành các khối phụ đề được định thời gian. Đây là nội dung bạn muốn nếu ghép nối bản ghi với trình phát video hoặc âm thanh.
Giữ các bản ghi nhớ nhạy cảm ở chế độ riêng tư
Bản ghi nhớ giọng nói có xu hướng giữ những thứ bạn sẽ không bao giờ đưa vào email: ghi chú phỏng vấn, quan sát của bác sĩ, vài phút trong cuộc họp kín, một cuộc trò chuyện riêng tư mà bạn muốn ghi nhớ chính xác. Nội dung thường nhạy cảm hơn tài liệu, đó là lý do tại sao cách một công cụ xử lý tệp ở đây quan trọng hơn so với một tập podcast mà bạn sắp xuất bản.
Có hai điều bảo vệ bản ghi bằng Hushscript. Đầu tiên, âm thanh sẽ bị xóa ngay khi bản ghi sẵn sàng, do đó không còn bản sao nào còn sót lại trong bộ lưu trữ. Thứ hai, bản ghi còn lại được mã hóa ở phần còn lại. Nếu kho lưu trữ của chúng tôi bị rò rỉ, nội dung sẽ hiển thị dưới dạng văn bản mã hóa không thể đọc được thay vì lời nói của bạn. Đó là bảo vệ rò rỉ, được nêu rõ ràng. Đó không phải là tuyên bố rằng không ai ở phía chúng tôi có thể đọc được bản ghi, bởi vì khóa được giữ trên máy chủ chứ không phải một mình bạn. Phiên bản trung thực là phiên bản hữu ích: vi phạm sẽ làm lộ văn bản mật mã và bạn có thể tự xóa bất kỳ bản ghi nào chỉ bằng một cú nhấp chuột.
Nếu bạn đang chuyển đổi một tư vấn pháp lý, một ghi chú của bệnh nhân hoặc một cuộc họp bí mật, thì sự kết hợp đó (xóa âm thanh, mã hóa những gì còn lại, cho phép bạn xóa nó) là lý do để chọn một công cụ dựa trên tải lên loại bỏ thay vì công cụ lặng lẽ giữ các tệp của bạn. Giải thích đầy đủ hơn về cách toàn bộ quy trình xử lý âm thanh của bạn có tại âm thanh thành văn bản.
Bản ghi âm cuộc gọi hai mặt
Rất nhiều tệp M4A là các cuộc gọi được ghi âm và cuộc gọi là nơi duy trì khả năng tách người nói. Nếu cả hai bên đều có thể nghe được trong tệp, Hushscript sẽ tự động tách họ ra, ánh xạ Người nói A và Người nói B thành hai giọng nói để bạn có thể đọc ai đã nói gì thay vì gỡ rối một khối đã hợp nhất.
Một số điều quyết định mức độ hoạt động của nó:
- Cả hai bên trong một bản nhạc. Đây là điều mà hầu hết các ứng dụng ghi âm cuộc gọi tạo ra: sự kết hợp âm thanh nổi hoặc đơn âm mang cả hai bên. Tính năng tách người nói hoạt động hoàn hảo trên đó.
- Bản ghi âm một mặt. Một số máy ghi âm cuộc gọi iOS chỉ ghi lại micrô của thiết bị nên chỉ có mặt của bạn có trong tệp. Bản chép lại sẽ chính xác nhưng chỉ có một người nói được gắn nhãn.
- Các điểm khác biệt trong âm thanh cuộc gọi. Các cuộc gọi thường có hiện tượng nén, tiếng ồn xung quanh và giảm âm lượng mà bộ giải mã VoIP áp dụng khi cả hai người nói chuyện cùng một lúc. Độ chính xác thường thấp hơn một chút so với ghi âm trực tiếp, vì vậy hãy lên kế hoạch đọc lướt các danh từ riêng và bất kỳ đoạn nhỏ nào.
Để biết hướng dẫn đầy đủ về ghi âm, lấy sự đồng ý và dọn dẹp cụ thể cho các cuộc gọi, hãy xem cách ghi âm một cuộc gọi điện thoại. Để biết thêm về cách tự tạo thẻ người nói, nhận dạng người nói đi sâu hơn.
Khắc phục sự cố thường gặp
Hầu hết các tệp M4A đều phiên âm mà không gặp bất kỳ rắc rối nào. Khi kết quả không như bạn mong đợi thì nguyên nhân hầu như luôn là một trong số đó và hầu hết đều có thể khắc phục được.
Bản ghi quá yên tĩnh
Bản ghi nhớ được ghi bằng điện thoại trong túi hoặc trên bàn sẽ phát ra âm thanh mờ và âm thanh yếu có nghĩa là nhiều từ được đoán hơn. Cách khắc phục hữu ích nhất là ở nguồn: giữ điện thoại gần hơn với người đang nói vào lần tiếp theo và để điện thoại tránh xa các bề mặt mềm có thể bóp nghẹt điện thoại. Đối với bản ghi mà bạn đã có, phần lớn bản ghi sẽ vẫn đúng; hãy đọc nó dựa vào âm thanh để biết những đoạn yên tĩnh thay vì tin tưởng nó một cách mù quáng.
Giọng mạnh hoặc giọng nói nhanh
Trọng âm được xử lý tốt nhưng trọng âm nặng kết hợp với giọng nói nhanh, chồng chéo là trường hợp khó nhất đối với bất kỳ công cụ phiên âm nào. Mong đợi từ bị tráo đổi thường xuyên hoặc chạy tiếp. Tên và thuật ngữ kỹ thuật là những tổn thất thường gặp nên đó là điều đầu tiên cần hiệu đính.
Hai người đang nói chuyện cùng một lúc
Khi những người nói chồng lên nhau, ranh giới giữa chúng sẽ mờ đi và một vài từ có thể rơi vào thẻ người nói sai. Không có cách khắc phục hoàn hảo cho nhiễu xuyên âm trong bản ghi đã tồn tại. Nếu bạn kiểm soát bản ghi, việc yêu cầu mọi người không nói chuyện với nhau sẽ mang lại nhiều tác dụng hơn cho bản ghi cuối cùng so với bất kỳ cài đặt nào.
Tệp lớn hoặc dài
Bản ghi nhớ dài cũng được, tối đa 10 giờ cho mỗi tệp và không có giới hạn kích thước tệp nhưng tệp lớn sẽ mất nhiều thời gian hơn để xử lý và bạn không cần phải đợi trên trang. Bắt đầu, rời đi và thu thập bản ghi từ trang tổng quan của bạn sau. Nếu một tệp từ chối tải lên, thì đó thường là do kết nối không ổn định chứ không phải do chính tệp đó; việc thử lại trên một mạng ổn định thường sẽ xóa nó.
Một định dạng bất thường của Apple
Nếu bạn có thứ gì đó không phải là M4A đơn giản (tệp CAF, AIFF, âm thanh bên trong MP4), trước tiên bạn không cần phải chuyển đổi nó. Thả nó như cũ. Nếu một định dạng thực sự không được chấp nhận, hãy gửi email tới support@hushscript.com và chúng tôi sẽ thêm định dạng đó.
Hãy xem trước trước hoặc chỉ phiên âm?
Bản xem trước 30 giây là miễn phí và không cần tài khoản. Vì vậy, quy tắc đơn giản là: khi có bất kỳ nghi ngờ nào về chất lượng âm thanh, dù là cuộc gọi được ghi âm, nội dung nào đó được ghi ở khoảng cách xa hay trong phòng ồn ào, hãy xem trước đầu tiên. Trong 30 giây, bạn sẽ biết liệu người nói có tách biệt hay không và liệu các từ có được kết thúc hay không trước khi bạn dành bất kỳ phút nào của mình. Để có một bản ghi nhớ rõ ràng mà bạn ghi gần micrô, bạn có thể chuyển thẳng đến phần đăng ký và chép lại toàn bộ nội dung một cách hợp lý.
Mẹo về độ chính xác
Một số thói quen sẽ nâng cao chất lượng bản ghi hơn bất kỳ cài đặt đơn lẻ nào:
- Ghi âm gần người nói. Khoảng cách là yếu tố lớn nhất. Một chiếc điện thoại ở gần người đang nói chuyện sẽ tạo nên một thiết bị đắt tiền ở khắp phòng.
- Giảm tiếng ồn rõ ràng ngay tại nguồn. Quạt, giao thông và TV ở chế độ nền đều khiến bạn mất lời. Việc ghi lại chúng sẽ giúp ích nhiều hơn bất cứ điều gì bạn có thể làm sau đó.
- Hãy để bản xem trước kiểm tra tệp. Đây là cách kiểm tra độ chính xác rẻ nhất mà bạn có: miễn phí, không cần tài khoản, 30 giây.
- Hãy kiểm tra lại danh từ riêng trước. Tên, địa điểm và biệt ngữ là nơi tập trung lỗi. Hãy lướt qua những nội dung đó trước khi bạn tin tưởng vào phần còn lại.
Kết thúc
M4A là M4A bất kể thứ gì đã tạo ra nó, vì vậy các bước ở đây hoạt động tương tự đối với máy ghi âm Android hoặc ghi chú WhatsApp được chuyển tiếp giống như đối với Bản ghi nhớ giọng nói của Apple. Thả tệp xuống, kiểm tra bản xem trước 30 giây, đăng ký để chép lại phần còn lại và xuất bản ghi có gắn nhãn người nói, trong khi âm thanh bị xóa và bản ghi vẫn được mã hóa khi lưu trữ.
Nếu bạn đang xử lý nhiều bản ghi âm ở các định dạng khác nhau, cách chép lời bất kỳ tệp âm thanh nào sẽ đưa ra danh sách định dạng đầy đủ và phương pháp tốt nhất cho từng định dạng.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: