เสียงพูดเป็นข้อความ: หลักการทำงานและวิธีใช้
ผู้เขียน: Hushscript เผยแพร่: ตรวจสอบล่าสุด:
คำพูดเป็นข้อความคือซอฟต์แวร์ที่เปลี่ยนเสียงพูดเป็นคำพูดที่เขียน คำนี้ครอบคลุมงานสองงานที่ให้ความรู้สึกคล้ายกันแต่ทำงานต่างกัน: การเขียนตามคำบอกสด ซึ่งคุณพูดและข้อความปรากฏขึ้นเมื่อคุณไป และงานถอดเสียง ซึ่งคุณส่งบันทึกเสียงและรับสำเนาเสียงที่เสร็จแล้วกลับมา แนวคิดหลักเหมือนกันในทั้งสองอย่าง ขั้นตอนการทำงาน ความแม่นยำ และสิ่งที่คุณสามารถทำได้กับผลลัพธ์นั้นไม่ได้
คู่มือนี้จะอธิบายว่าจริงๆ แล้วคำพูดเป็นข้อความคืออะไรในภาษาอังกฤษธรรมดา วิธีการเปลี่ยนเสียงเป็นคำ และทั้งสองโหมดแตกต่างกันอย่างไร จากนั้นจะอธิบายเกี่ยวกับการแปลงการบันทึกเป็นข้อความบน Hushscript พร้อมตัวอย่างที่ได้ผล ปัญหาที่ทำให้ผู้คนสับสน และคำถามที่พบบ่อยสั้นๆ ในตอนท้าย
จริงๆ แล้วคำพูดเป็นข้อความคืออะไร
การรู้จำคำพูดอัตโนมัติ (ASR) ที่ง่ายที่สุดใช้คลื่นเสียงและสร้างลำดับของคำ ไมโครโฟนจะบันทึกคำพูดเป็นรูปคลื่นต่อเนื่อง ซึ่งเป็นเส้นโยกเยกซึ่งแสดงถึงความกดอากาศที่เปลี่ยนแปลงไปตามกาลเวลา รูปคลื่นนั้นนำพาทุกสิ่ง: คำพูด, เสียงของผู้พูด, ห้อง, เสียงฮัมของเครื่องปรับอากาศ หน้าที่ของกลไกคือการดึงคำออกจากมิกซ์นั้นแล้วจดบันทึกไว้
ในการทำเช่นนั้น ระบบจะสับเสียงเป็นชิ้นเล็กๆ โดยปกติจะใช้เวลา 10 ถึง 30 มิลลิวินาทีต่อชิ้น และวัดเสียงในทุกๆ ชิ้น การวัดเหล่านั้นป้อนแบบจำลองที่ผ่านการฝึกอบรมซึ่งแมปรูปแบบของเสียงไปยังหน่วยคำพูดของภาษา จากนั้นไปยังคำ จากนั้นทั้งวลี คุณไม่เห็นสิ่งนี้เลย คุณเห็นการบันทึกเข้าไปและมีข้อความถอดเสียงออกมา แต่การรู้คร่าวๆ ว่าเกิดอะไรขึ้นข้างในจะอธิบายได้ว่าเหตุใดการบันทึกบางรายการจึงถอดเสียงได้ชัดเจนและบางรายการกลับหยาบ
ความรู้มีสองชั้นที่ทำงานร่วมกัน ประการหนึ่งคืออะคูสติก: เสียงของภาษาคืออะไร และมีแนวโน้มที่จะออกเสียงอย่างไรตามเสียงและสำเนียงต่างๆ อีกประการหนึ่งคือภาษา: ลำดับคำใดที่น่าเชื่อถือ ชั้นทางภาษาคือสาเหตุที่ระบบที่ดีเขียนว่า “รถของพวกเขาพัง” มากกว่า “รถพัง” แม้ว่าทั้งสองเสียงจะเหมือนกันก็ตาม ใช้บริบทเพื่อเลือกการสะกดที่มนุษย์ต้องการ
การรู้จำคำพูดแบบเก่าอาศัยกฎที่เขียนด้วยลายมือและชุดการฝึกขนาดเล็ก และมันก็เปราะบาง เอ็นจิ้นสมัยใหม่คือโมเดล AI ขนาดใหญ่ที่ได้รับการฝึกอบรมเกี่ยวกับคำพูดที่บันทึกไว้หลายพันชั่วโมงจากผู้พูด สำเนียง และเงื่อนไขในการบันทึกจำนวนมาก ความกว้างนั้นเป็นเหตุผลทั้งหมดที่ทำให้การถอดเสียงของวันนี้สามารถใช้งานได้ ในส่วนของคำพูดที่ชัดเจนในการบันทึกที่เหมาะสม โมเดลปัจจุบันจะมีความแม่นยำของคำประมาณ 90 ถึง 97 เปอร์เซ็นต์ ส่วนที่เหลืออีกสองสามเปอร์เซ็นต์คือจุดที่การแก้ไขปัญหาในภายหลังในคู่มือนี้ยังคงอยู่
คำพูดที่บันทึกไว้เทียบกับการเขียนตามคำบอกสด
ความแตกต่างที่สำคัญที่สุดในทางปฏิบัติคือเสียงจะถูกประมวลผลแบบสดหรือหลังจากเหตุการณ์จริง
การเขียนตามคำบอกสดจะทำงานแบบเรียลไทม์ คุณพูดผ่านโทรศัพท์ ระบบสั่งงานด้วยเสียง หรือคุณสมบัติการพิมพ์ด้วยเสียงในโปรแกรมประมวลผลคำ และคำต่างๆ จะปรากฏขึ้นเกือบจะเร็วเท่ากับที่คุณพูด เพื่อให้ตามทัน กลไกจะต้องผูกมัดกับแต่ละคำโดยแทบไม่ต้องใช้ประโยคเลย นั่นเป็นข้อจำกัดที่ยาก และนี่คือเหตุผลว่าทำไมบางครั้งการป้อนตามคำบอกจึงเดาคำได้ จากนั้นจึงเขียนใหม่อย่างเงียบๆ เมื่อสองสามคำถัดมามาถึง การเขียนตามคำบอกสดเป็นเครื่องมือที่เหมาะสมเมื่อคุณต้องการบันทึกคำพูดของคุณเองในขณะเดินทาง เช่น จดบันทึกแบบแฮนด์ฟรี ร่างอีเมลด้วยเสียง การควบคุมอุปกรณ์
การถอดเสียงใช้ได้กับการบันทึกที่สมบูรณ์ คุณให้ไฟล์เสียงหรือวิดีโอที่เสร็จแล้วแก่ระบบ จากนั้นมันจะประมวลผลทั้งหมด และคุณจะได้รับสำเนาเสียงแบบเต็มเป็นการตอบแทน เนื่องจากไม่มีอะไรเกิดขึ้นแบบเรียลไทม์ เอ็นจิ้นจึงสามารถอ่านล่วงหน้าและดูประโยคทั้งหมดได้ก่อนที่จะตัดสินใจเลือกคำใดคำหนึ่ง ซึ่งช่วยเพิ่มความแม่นยำ นอกจากนี้ยังสามารถทำงานที่การเขียนตามคำบอกสดไม่สามารถทำได้ สามารถแยกผู้พูดโดยถือว่าแต่ละบรรทัดเป็นของใครก็ตามที่พูด และสามารถแนบการประทับเวลาเพื่อให้คุณสามารถข้ามจากบรรทัดข้อความตรงไปยังช่วงเวลานั้นในเสียงได้
หากคุณกำลังเผชิญกับการประชุม การสัมภาษณ์ การบรรยาย ตอนพอดแคสต์ หรือโทรศัพท์ที่คุณบันทึกไว้ คุณกำลังทำการถอดเสียงจากไฟล์ที่บันทึกไว้ ไม่ใช่การเขียนตามคำบอกสด ทั้งสองเกิดความสับสนเนื่องจากทั้งสองมีการวางตลาดเป็น “คำพูดเป็นข้อความ” แต่การบันทึกที่คุณมีอยู่แล้วเป็นรูปแบบที่ไม่ถูกต้องสำหรับเครื่องมือเขียนตามคำบอกและเป็นรูปทรงที่ถูกต้องสำหรับผู้ถอดเสียง Hushscript สร้างขึ้นเพื่อการบันทึก ไม่มีโหมดการเขียนตามคำบอกสดและการมุ่งเน้นนั้นเป็นเรื่องที่ตั้งใจ: การทำงานจากไฟล์เต็มคือสิ่งที่ช่วยให้สามารถอ่านล่วงหน้าเพื่อความแม่นยำและติดป้ายกำกับผู้พูดในรอบเดียวกัน
วิธีแปลงคำพูดที่บันทึกไว้เป็นข้อความ
นี่คือโฟลว์จริงของ Hushscript ตามลำดับที่คุณพบ คุณต้องมีการบันทึกเป็นไฟล์ในอุปกรณ์ของคุณ ไฟล์เสียงหรือวิดีโอในรูปแบบทั่วไป และที่อยู่อีเมลในการสมัคร นั่นคือรายการทั้งหมด ไม่มีสิ่งใดที่จะติดตั้ง
- วางไฟล์และดูตัวอย่าง เปิดหน้าเสียงเป็นข้อความ และวางไฟล์ของคุณลงไป Hushscript ถอดเสียง 30 วินาทีแรกทันทีและแสดงผลลัพธ์โดยแยกผู้พูดออกแล้ว ไม่จำเป็นต้องมีบัญชีสำหรับขั้นตอนนี้ มีการแสดงตัวอย่างเพื่อให้คุณสามารถตัดสินความแม่นยำในการบันทึกของคุณเองก่อนที่จะดำเนินการใดๆ
- ลงทะเบียนเพื่อถอดเสียงส่วนที่เหลือ หากการแสดงตัวอย่างถูกต้อง ให้ลงทะเบียนด้วยอีเมลของคุณ การถอดเสียงไฟล์แบบเต็มมีการควบคุมดูแล ดังนั้นขั้นตอนนี้จึงเป็นขั้นตอนที่บัญชีจะเข้ามา บัญชีใหม่จะได้รับเวลาฟรี 30 นาทีเพื่อลองใช้บริการอย่างถูกต้อง
- อัปโหลดไฟล์แบบเต็ม เมื่อคุณเข้าไปแล้ว ให้อัปโหลดการบันทึกทั้งหมด หากเป็นวิดีโอ เสียงจะถูกแยกออกจากเบราว์เซอร์ของคุณก่อน และส่งเฉพาะเสียงเท่านั้น ดังนั้นวิดีโอจึงยังคงอยู่ในอุปกรณ์ของคุณ
- อ่าน ติดป้ายกำกับใหม่ และส่งออก การถอดเสียงจะกลับมาพร้อมกับแต่ละรอบที่มาจากผู้พูด (ผู้พูด A ผู้พูด B เป็นต้น) และประทับเวลา คลิกป้ายกำกับผู้พูดเพื่อเปลี่ยนชื่อ และชื่อใหม่จะอัปเดตทุกที่ที่บุคคลนั้นพูด เมื่ออ่านตามที่คุณต้องการ ให้ส่งออกเป็น TXT สำหรับข้อความธรรมดา, SRT หรือ VTT สำหรับคำบรรยาย, CSV หรือ JSON สำหรับข้อมูลที่มีโครงสร้าง, Markdown สำหรับการเผยแพร่บันทึกย่อ, DOCX สำหรับการแก้ไข หรือ PDF สำหรับการแชร์
สามสิบนาทีก็เพียงพอแล้วสำหรับการถอดเสียงการสัมภาษณ์สั้น ๆ คลิปการบรรยายความยาว 10 นาที หรือช่วงแรกของการบันทึกที่ยาวขึ้น หากคุณต้องการตรวจสอบความถูกต้องก่อนดำเนินการต่อ นาทีฟรีจะปลดล็อคทันทีจากการตรวจสอบบัตรอย่างรวดเร็ว: การพักเงิน 1 ดอลลาร์ได้รับอนุญาตให้ตรวจสอบบัตร จากนั้นจึงยกขึ้นทันทีและจะไม่มีการเรียกเก็บเงิน ใช้วิธีการชำระเงินอื่นและสินค้าจะมาถึงพร้อมกับการซื้อครั้งแรกของคุณแทน ไม่จำเป็นต้องมีการ์ด มันเป็นเพียงเส้นทางที่เร็วที่สุดในการรับโบนัส หลังจากนาทีที่ฟรี คุณจะจ่ายเฉพาะนาทีที่คุณถอดเสียงเท่านั้น โดยไม่ต้องสมัครสมาชิก หน้าราคามีอัตราปัจจุบัน
ตัวอย่างข้างต้น
สมมติว่าคุณบันทึกการสัมภาษณ์ลูกค้า 38 นาทีบนโทรศัพท์ของคุณ บันทึกเป็น M4A เสียงสองเสียง เสียงแก้วกาแฟกระทบกันเป็นครั้งคราว บันทึกในห้องประชุมปกติ
คุณวาง M4A ลงในหน้าเสียงเป็นข้อความ การแสดงตัวอย่าง 30 วินาทีจะปรากฏเป็นบทสนทนาสั้นๆ:
ผู้พูด A 00:00 ขอบคุณที่สละเวลา คุณช่วยเริ่มด้วยการบอกฉันหน่อยได้ไหม
อะไรทำให้คุณมองหาเครื่องมือประเภทนี้เป็นอันดับแรก
ผู้พูด B 00:11 แน่นอน เรากำลังจมอยู่ในตั๋วสนับสนุนและระบบ
เก่าตามไม่ทัน ฉันจึงเริ่มมองหาไปรอบๆ
นั่นคือตัวอย่างที่ยังไม่ได้แก้ไข เสียงทั้งสองถูกแยกออกจากกัน แต่ละบรรทัดมีการประทับเวลา และถ้อยคำก็สะอาดตา คุณสมัครใช้งาน อัปโหลดไฟล์เต็มความยาว 38 นาที และอีกไม่กี่นาทีต่อมา ทรานสคริปต์ฉบับสมบูรณ์ก็พร้อมในรูปแบบเดียวกัน ผู้พูด A คือคุณ และผู้พูด B คือผู้สัมภาษณ์ของคุณ ดังนั้นคุณจึงคลิกที่ป้ายกำกับ “ผู้พูด A” พิมพ์ชื่อของคุณ และคลิก “ผู้พูด B” เพื่อพิมพ์ชื่อของพวกเขา ทั้งเปลี่ยนชื่อทั้งเอกสารในรอบเดียว คุณส่งออกเป็น DOCX เปิดในโปรแกรมประมวลผลคำ แก้ไขจุดสองหรือสามตำแหน่งที่มีการสะกดชื่อผลิตภัณฑ์ตามหลักสัทศาสตร์ และคุณมีสำเนาบทสัมภาษณ์ที่เสร็จสิ้นแล้ว 38 นาทีนั้นเกินดุลของคุณ ซึ่งเป็นเหตุผลว่าทำไม 30 นาทีฟรีจึงมีประโยชน์สำหรับงานจริงครั้งแรก ไม่ใช่แค่คลิปทดสอบ
ปัญหาที่พบบ่อยและวิธีแก้ไข
การถอดเสียงที่น่าผิดหวังส่วนใหญ่จะย้อนกลับไปที่การบันทึก ไม่ใช่กลไก ปัญหาเหล่านี้เกิดขึ้นบ่อยที่สุดและควรทำอย่างไรในแต่ละปัญหา
การบันทึกเงียบหรือมีโคลน หากเสียงเบาหรือห้องดัง แสดงว่าระบบทำงานได้น้อยลงและความแม่นยำลดลง ไมโครโฟนที่อยู่ใกล้กับผู้พูด ไมโครโฟนแบบติดปกเสื้อ หรือชุดหูฟังในระยะ 10 ถึง 20 เซนติเมตรจากปาก จะสร้างความแตกต่างที่ยิ่งใหญ่กว่าการตั้งค่าใดๆ ห้องเปล่าขนาดใหญ่จะเพิ่มเสียงสะท้อนที่เลอะขอบเขตระหว่างเสียง พื้นที่ขนาดเล็กหรือตกแต่งอย่างนุ่มนวลจะบันทึกได้ดีกว่า คุณไม่สามารถแก้ไขสิ่งนี้ได้หลังจากข้อเท็จจริงแล้ว ดังนั้นจึงควรดำเนินการให้ถูกต้องก่อนที่คุณจะกดบันทึกในครั้งถัดไป
คนสองคนพูดพร้อมกัน เมื่อเสียงทับซ้อนกัน ทั้งถ้อยคำและผู้พูด-อะไรจะยากขึ้น เนื่องจากเสียงสองชุดแข่งขันกันในเสียงชิ้นเดียวกัน ไม่มีการแก้ไขซอฟต์แวร์ใหม่ทั้งหมดสำหรับการทับซ้อนของแท้ ในการบันทึกที่คุณควบคุม การทิ้งจังหวะระหว่างเทิร์นจะได้ผลดีในภายหลัง ในรูปแบบที่คุณไม่สามารถทำซ้ำได้ ให้คาดหวังว่าจะมีการข้ามเส้นสองสามเส้นรอบๆ สิ่งรบกวนและจัดระเบียบด้วยมือ
คำศัพท์เฉพาะทางอาจใช้ผิด โมเดลที่ใช้งานทั่วไปรู้ภาษาที่ใช้ในชีวิตประจำวันได้ดี แต่ไม่จำเป็นต้องเห็นศัพท์เฉพาะทางอุตสาหกรรมของคุณ นามสกุลที่ไม่ธรรมดา หรือชื่อผลิตภัณฑ์ สิ่งเหล่านี้มักจะถูกถอดเสียงโดยวิธีการออกเสียงมากกว่าการสะกดคำ การค้นหาและแทนที่ใน DOCX ที่ส่งออกจะล้างคำที่เกิดซ้ำในไม่กี่วินาที ซึ่งเป็นเหตุผลหนึ่งที่ทำให้ DOCX เป็นการส่งออกที่แก้ไขได้ง่ายที่สุด
ไฟล์จะไม่โหลด ไฟล์เสียงและวิดีโอมาตรฐานส่วนใหญ่ใช้งานได้ หากมีใครปฏิเสธ ก็มักจะเป็นภาชนะที่ผิดปกติหรือเก่ามาก การแปลงเป็น MP3 หรือ WAV ธรรมดาด้วยเครื่องมือในเบราว์เซอร์ฟรี ซึ่งทำงานบนอุปกรณ์ของคุณและไม่ได้อัปโหลดอะไรเลย แทบจะช่วยแก้ปัญหาได้เกือบทุกครั้ง หากรูปแบบยังคงไม่ผ่าน โปรดส่งอีเมลมาที่ support@hushscript.com แล้วทีมงานจะเพิ่มรูปแบบนั้น
ผู้พูดหนึ่งคนจะถูกแบ่งออกเป็นสอง ในบางครั้ง คนคนเดียวกันจะถูกระบุว่าเป็นผู้พูดสองคน โดยปกติแล้วเป็นเพราะเสียงของพวกเขาเปลี่ยนไปในระหว่างทาง: พวกเขาขยับเข้าใกล้ไมโครโฟนมากขึ้น เปลี่ยนจากชุดหูฟังเป็นโหมดลำโพง หรือคุณภาพของสายเปลี่ยนไป ระบบจัดกลุ่มตามลักษณะของเสียง ดังนั้นการเปลี่ยนแปลงครั้งใหญ่จึงอาจถูกมองว่าเป็นคนละคน การรวมป้ายกำกับทั้งสองเข้าด้วยกันในตัวแก้ไขจะแก้ไขได้ในขั้นตอนเดียว รายละเอียดของกลไกนี้อยู่ในคำแนะนำเกี่ยวกับวิธีการทำงานของการแยกแยะเสียงของผู้พูด
ความแม่นยำและสำเนียง
การครอบคลุมสำเนียงขึ้นอยู่กับรุ่นและภาษา สำหรับภาษาอังกฤษ โมเดลที่ได้รับการฝึกบนชุดข้อมูลแบบกว้างรองรับภาษาอังกฤษแบบสหรัฐอเมริกา สหราชอาณาจักร ออสเตรเลีย และอินเดียได้ดี และ Hushscript มีสำเนียงภาษาอังกฤษที่แตกต่างกันสี่แบบ ภาษาถิ่นที่หนักแน่นหรือสำเนียงที่หลากหลายจะต้องมีการแก้ไขเพิ่มเติม แต่คุณยังคงแก้ไขฉบับร่างแทนที่จะพิมพ์จากอะไรเลย
นิสัยบางประการช่วยเพิ่มความแม่นยำในการบันทึก ไม่ว่าจะเป็นสำเนียงใดก็ตาม บันทึกด้วยไมโครโฟนแบบปิด ให้แต่ละคนทำเสร็จก่อนที่จะเริ่มครั้งต่อไป หลีกเลี่ยงห้องที่มีเสียงก้องขนาดใหญ่ อัตราการพูดในระดับปานกลางจะถ่ายทอดได้ดีกว่าการวิ่งเกิน 200 คำต่อนาที และบิตเรตที่สมเหตุสมผลก็มีความสำคัญ: MP3 128 kbps นั้นใช้ได้ ในขณะที่เสียงข้อความเสียงที่ถูกบีบอัดอย่างหนักในย่านความถี่แคบจะสูญเสียรายละเอียดที่ระบบต้องการ หากต้องการทราบข้อมูลเพิ่มเติมเกี่ยวกับรูปแบบและลักษณะเฉพาะของแต่ละรูปแบบ โปรดดูวิธีถอดเสียงไฟล์เสียง
Hushscript ตรวจจับภาษาโดยอัตโนมัติและถอดเสียง ประมาณ 99 ภาษา โดยมีความแม่นยำระดับสูงสุดใน 18 ภาษา การบันทึกที่อยู่ในภาษาเดียวจะถอดเสียงได้อย่างหมดจดที่สุด การเปลี่ยนภาษาระหว่างประโยคเป็นเรื่องยากสำหรับกลไกใดๆ
ป้ายกำกับผู้พูดในการผ่านเดียวกัน
การแยกผู้พูด ซึ่งเรียกอย่างเป็นทางการว่าการแยกเสียงของผู้พูด จะทำงานควบคู่ไปกับการรู้จำเสียงพูด แทนที่จะเป็นงานที่สองที่คุณต้องจ่ายเพิ่ม คุณจะได้คำศัพท์และการระบุแหล่งที่มามารวมกัน โดยไม่เสียค่าใช้จ่ายในทุกบทถอดเสียง สำหรับการสัมภาษณ์สองคนหรือการประชุมขนาดเล็ก การแยกนั้นมักจะถูกต้องและช่วยลดงานที่น่าเบื่อในการแท็กทุกบรรทัดด้วยมือ ไม่มีการกำหนดจำนวนผู้พูดที่สามารถเก็บไฟล์ได้ แม้ว่าความแม่นยำจะสูงสุดเมื่อเสียงมีความแตกต่างกัน ไม่ทับซ้อนกัน และเสียงไม่เหมือนกัน การติดป้ายกำกับผู้พูดนั้นมาพร้อมกับการถอดเสียงทุกครั้งโดยไม่มีค่าใช้จ่ายเพิ่มเติม ถือเป็นรายละเอียดที่ตรงไปตรงมาโดยค่าเริ่มต้นซึ่งแนวทางทั้งหมดนี้สร้างขึ้น: รวมส่วนที่เป็นประโยชน์ไว้ด้วย ไม่ถูกรั้งไว้หลังระดับที่สูงกว่า
ความแตกต่างที่ชัดเจนที่ต้องยึดถือคือสิ่งนี้ หากคุณต้องการบันทึกคำพูดขณะพูด พิมพ์ด้วยเสียงหรือเขียนตามคำบอก ให้เข้าถึงเครื่องมือถ่ายทอดสดที่มีอยู่ในอุปกรณ์หรือโปรแกรมประมวลผลคำของคุณ หากคุณมีไฟล์บันทึกเสียงที่ต้องการเป็นข้อความอยู่แล้ว การถอดเสียงจากหน้าเสียงเป็นข้อความจะรวดเร็ว แม่นยำยิ่งขึ้น และมอบป้ายกำกับผู้พูดและเอาต์พุตที่ส่งออกได้ในขั้นตอนเดียว
แหล่งข้อมูลและมาตรฐานอิสระ
Hushscript อ้างอิงแหล่งข้อมูลอิสระที่ไม่ใช่คู่แข่งเหล่านี้เพื่ออธิบายงานวิจัย มาตรฐาน หรือการทำงานของแพลตฟอร์ม โดยไม่ได้หมายความว่าแหล่งข้อมูลดังกล่าวรับรอง Hushscript
วันที่ตรวจสอบแหล่งข้อมูล: