ข้ามไปยังเนื้อหาหลัก

เสียงพูดเป็นข้อความ: หลักการทำงานและวิธีใช้

ผู้เขียน: เผยแพร่: ตรวจสอบล่าสุด:

คำพูดเป็นข้อความคือซอฟต์แวร์ที่เปลี่ยนเสียงพูดเป็นคำพูดที่เขียน คำนี้ครอบคลุมงานสองงานที่ให้ความรู้สึกคล้ายกันแต่ทำงานต่างกัน: การเขียนตามคำบอกสด ซึ่งคุณพูดและข้อความปรากฏขึ้นเมื่อคุณไป และงานถอดเสียง ซึ่งคุณส่งบันทึกเสียงและรับสำเนาเสียงที่เสร็จแล้วกลับมา แนวคิดหลักเหมือนกันในทั้งสองอย่าง ขั้นตอนการทำงาน ความแม่นยำ และสิ่งที่คุณสามารถทำได้กับผลลัพธ์นั้นไม่ได้

คู่มือนี้จะอธิบายว่าจริงๆ แล้วคำพูดเป็นข้อความคืออะไรในภาษาอังกฤษธรรมดา วิธีการเปลี่ยนเสียงเป็นคำ และทั้งสองโหมดแตกต่างกันอย่างไร จากนั้นจะอธิบายเกี่ยวกับการแปลงการบันทึกเป็นข้อความบน Hushscript พร้อมตัวอย่างที่ได้ผล ปัญหาที่ทำให้ผู้คนสับสน และคำถามที่พบบ่อยสั้นๆ ในตอนท้าย

จริงๆ แล้วคำพูดเป็นข้อความคืออะไร

การรู้จำคำพูดอัตโนมัติ (ASR) ที่ง่ายที่สุดใช้คลื่นเสียงและสร้างลำดับของคำ ไมโครโฟนจะบันทึกคำพูดเป็นรูปคลื่นต่อเนื่อง ซึ่งเป็นเส้นโยกเยกซึ่งแสดงถึงความกดอากาศที่เปลี่ยนแปลงไปตามกาลเวลา รูปคลื่นนั้นนำพาทุกสิ่ง: คำพูด, เสียงของผู้พูด, ห้อง, เสียงฮัมของเครื่องปรับอากาศ หน้าที่ของกลไกคือการดึงคำออกจากมิกซ์นั้นแล้วจดบันทึกไว้

ในการทำเช่นนั้น ระบบจะสับเสียงเป็นชิ้นเล็กๆ โดยปกติจะใช้เวลา 10 ถึง 30 มิลลิวินาทีต่อชิ้น และวัดเสียงในทุกๆ ชิ้น การวัดเหล่านั้นป้อนแบบจำลองที่ผ่านการฝึกอบรมซึ่งแมปรูปแบบของเสียงไปยังหน่วยคำพูดของภาษา จากนั้นไปยังคำ จากนั้นทั้งวลี คุณไม่เห็นสิ่งนี้เลย คุณเห็นการบันทึกเข้าไปและมีข้อความถอดเสียงออกมา แต่การรู้คร่าวๆ ว่าเกิดอะไรขึ้นข้างในจะอธิบายได้ว่าเหตุใดการบันทึกบางรายการจึงถอดเสียงได้ชัดเจนและบางรายการกลับหยาบ

ความรู้มีสองชั้นที่ทำงานร่วมกัน ประการหนึ่งคืออะคูสติก: เสียงของภาษาคืออะไร และมีแนวโน้มที่จะออกเสียงอย่างไรตามเสียงและสำเนียงต่างๆ อีกประการหนึ่งคือภาษา: ลำดับคำใดที่น่าเชื่อถือ ชั้นทางภาษาคือสาเหตุที่ระบบที่ดีเขียนว่า “รถของพวกเขาพัง” มากกว่า “รถพัง” แม้ว่าทั้งสองเสียงจะเหมือนกันก็ตาม ใช้บริบทเพื่อเลือกการสะกดที่มนุษย์ต้องการ

การรู้จำคำพูดแบบเก่าอาศัยกฎที่เขียนด้วยลายมือและชุดการฝึกขนาดเล็ก และมันก็เปราะบาง เอ็นจิ้นสมัยใหม่คือโมเดล AI ขนาดใหญ่ที่ได้รับการฝึกอบรมเกี่ยวกับคำพูดที่บันทึกไว้หลายพันชั่วโมงจากผู้พูด สำเนียง และเงื่อนไขในการบันทึกจำนวนมาก ความกว้างนั้นเป็นเหตุผลทั้งหมดที่ทำให้การถอดเสียงของวันนี้สามารถใช้งานได้ ในส่วนของคำพูดที่ชัดเจนในการบันทึกที่เหมาะสม โมเดลปัจจุบันจะมีความแม่นยำของคำประมาณ 90 ถึง 97 เปอร์เซ็นต์ ส่วนที่เหลืออีกสองสามเปอร์เซ็นต์คือจุดที่การแก้ไขปัญหาในภายหลังในคู่มือนี้ยังคงอยู่

คำพูดที่บันทึกไว้เทียบกับการเขียนตามคำบอกสด

ความแตกต่างที่สำคัญที่สุดในทางปฏิบัติคือเสียงจะถูกประมวลผลแบบสดหรือหลังจากเหตุการณ์จริง

การเขียนตามคำบอกสดจะทำงานแบบเรียลไทม์ คุณพูดผ่านโทรศัพท์ ระบบสั่งงานด้วยเสียง หรือคุณสมบัติการพิมพ์ด้วยเสียงในโปรแกรมประมวลผลคำ และคำต่างๆ จะปรากฏขึ้นเกือบจะเร็วเท่ากับที่คุณพูด เพื่อให้ตามทัน กลไกจะต้องผูกมัดกับแต่ละคำโดยแทบไม่ต้องใช้ประโยคเลย นั่นเป็นข้อจำกัดที่ยาก และนี่คือเหตุผลว่าทำไมบางครั้งการป้อนตามคำบอกจึงเดาคำได้ จากนั้นจึงเขียนใหม่อย่างเงียบๆ เมื่อสองสามคำถัดมามาถึง การเขียนตามคำบอกสดเป็นเครื่องมือที่เหมาะสมเมื่อคุณต้องการบันทึกคำพูดของคุณเองในขณะเดินทาง เช่น จดบันทึกแบบแฮนด์ฟรี ร่างอีเมลด้วยเสียง การควบคุมอุปกรณ์

การถอดเสียงใช้ได้กับการบันทึกที่สมบูรณ์ คุณให้ไฟล์เสียงหรือวิดีโอที่เสร็จแล้วแก่ระบบ จากนั้นมันจะประมวลผลทั้งหมด และคุณจะได้รับสำเนาเสียงแบบเต็มเป็นการตอบแทน เนื่องจากไม่มีอะไรเกิดขึ้นแบบเรียลไทม์ เอ็นจิ้นจึงสามารถอ่านล่วงหน้าและดูประโยคทั้งหมดได้ก่อนที่จะตัดสินใจเลือกคำใดคำหนึ่ง ซึ่งช่วยเพิ่มความแม่นยำ นอกจากนี้ยังสามารถทำงานที่การเขียนตามคำบอกสดไม่สามารถทำได้ สามารถแยกผู้พูดโดยถือว่าแต่ละบรรทัดเป็นของใครก็ตามที่พูด และสามารถแนบการประทับเวลาเพื่อให้คุณสามารถข้ามจากบรรทัดข้อความตรงไปยังช่วงเวลานั้นในเสียงได้

หากคุณกำลังเผชิญกับการประชุม การสัมภาษณ์ การบรรยาย ตอนพอดแคสต์ หรือโทรศัพท์ที่คุณบันทึกไว้ คุณกำลังทำการถอดเสียงจากไฟล์ที่บันทึกไว้ ไม่ใช่การเขียนตามคำบอกสด ทั้งสองเกิดความสับสนเนื่องจากทั้งสองมีการวางตลาดเป็น “คำพูดเป็นข้อความ” แต่การบันทึกที่คุณมีอยู่แล้วเป็นรูปแบบที่ไม่ถูกต้องสำหรับเครื่องมือเขียนตามคำบอกและเป็นรูปทรงที่ถูกต้องสำหรับผู้ถอดเสียง Hushscript สร้างขึ้นเพื่อการบันทึก ไม่มีโหมดการเขียนตามคำบอกสดและการมุ่งเน้นนั้นเป็นเรื่องที่ตั้งใจ: การทำงานจากไฟล์เต็มคือสิ่งที่ช่วยให้สามารถอ่านล่วงหน้าเพื่อความแม่นยำและติดป้ายกำกับผู้พูดในรอบเดียวกัน

วิธีแปลงคำพูดที่บันทึกไว้เป็นข้อความ

นี่คือโฟลว์จริงของ Hushscript ตามลำดับที่คุณพบ คุณต้องมีการบันทึกเป็นไฟล์ในอุปกรณ์ของคุณ ไฟล์เสียงหรือวิดีโอในรูปแบบทั่วไป และที่อยู่อีเมลในการสมัคร นั่นคือรายการทั้งหมด ไม่มีสิ่งใดที่จะติดตั้ง

  1. วางไฟล์และดูตัวอย่าง เปิดหน้าเสียงเป็นข้อความ และวางไฟล์ของคุณลงไป Hushscript ถอดเสียง 30 วินาทีแรกทันทีและแสดงผลลัพธ์โดยแยกผู้พูดออกแล้ว ไม่จำเป็นต้องมีบัญชีสำหรับขั้นตอนนี้ มีการแสดงตัวอย่างเพื่อให้คุณสามารถตัดสินความแม่นยำในการบันทึกของคุณเองก่อนที่จะดำเนินการใดๆ
  2. ลงทะเบียนเพื่อถอดเสียงส่วนที่เหลือ หากการแสดงตัวอย่างถูกต้อง ให้ลงทะเบียนด้วยอีเมลของคุณ การถอดเสียงไฟล์แบบเต็มมีการควบคุมดูแล ดังนั้นขั้นตอนนี้จึงเป็นขั้นตอนที่บัญชีจะเข้ามา บัญชีใหม่จะได้รับเวลาฟรี 30 นาทีเพื่อลองใช้บริการอย่างถูกต้อง
  3. อัปโหลดไฟล์แบบเต็ม เมื่อคุณเข้าไปแล้ว ให้อัปโหลดการบันทึกทั้งหมด หากเป็นวิดีโอ เสียงจะถูกแยกออกจากเบราว์เซอร์ของคุณก่อน และส่งเฉพาะเสียงเท่านั้น ดังนั้นวิดีโอจึงยังคงอยู่ในอุปกรณ์ของคุณ
  4. อ่าน ติดป้ายกำกับใหม่ และส่งออก การถอดเสียงจะกลับมาพร้อมกับแต่ละรอบที่มาจากผู้พูด (ผู้พูด A ผู้พูด B เป็นต้น) และประทับเวลา คลิกป้ายกำกับผู้พูดเพื่อเปลี่ยนชื่อ และชื่อใหม่จะอัปเดตทุกที่ที่บุคคลนั้นพูด เมื่ออ่านตามที่คุณต้องการ ให้ส่งออกเป็น TXT สำหรับข้อความธรรมดา, SRT หรือ VTT สำหรับคำบรรยาย, CSV หรือ JSON สำหรับข้อมูลที่มีโครงสร้าง, Markdown สำหรับการเผยแพร่บันทึกย่อ, DOCX สำหรับการแก้ไข หรือ PDF สำหรับการแชร์

สามสิบนาทีก็เพียงพอแล้วสำหรับการถอดเสียงการสัมภาษณ์สั้น ๆ คลิปการบรรยายความยาว 10 นาที หรือช่วงแรกของการบันทึกที่ยาวขึ้น หากคุณต้องการตรวจสอบความถูกต้องก่อนดำเนินการต่อ นาทีฟรีจะปลดล็อคทันทีจากการตรวจสอบบัตรอย่างรวดเร็ว: การพักเงิน 1 ดอลลาร์ได้รับอนุญาตให้ตรวจสอบบัตร จากนั้นจึงยกขึ้นทันทีและจะไม่มีการเรียกเก็บเงิน ใช้วิธีการชำระเงินอื่นและสินค้าจะมาถึงพร้อมกับการซื้อครั้งแรกของคุณแทน ไม่จำเป็นต้องมีการ์ด มันเป็นเพียงเส้นทางที่เร็วที่สุดในการรับโบนัส หลังจากนาทีที่ฟรี คุณจะจ่ายเฉพาะนาทีที่คุณถอดเสียงเท่านั้น โดยไม่ต้องสมัครสมาชิก หน้าราคามีอัตราปัจจุบัน

ตัวอย่างข้างต้น

สมมติว่าคุณบันทึกการสัมภาษณ์ลูกค้า 38 นาทีบนโทรศัพท์ของคุณ บันทึกเป็น M4A เสียงสองเสียง เสียงแก้วกาแฟกระทบกันเป็นครั้งคราว บันทึกในห้องประชุมปกติ

คุณวาง M4A ลงในหน้าเสียงเป็นข้อความ การแสดงตัวอย่าง 30 วินาทีจะปรากฏเป็นบทสนทนาสั้นๆ:

ผู้พูด A 00:00 ขอบคุณที่สละเวลา คุณช่วยเริ่มด้วยการบอกฉันหน่อยได้ไหม
                    อะไรทำให้คุณมองหาเครื่องมือประเภทนี้เป็นอันดับแรก
ผู้พูด B 00:11 แน่นอน เรากำลังจมอยู่ในตั๋วสนับสนุนและระบบ
                    เก่าตามไม่ทัน ฉันจึงเริ่มมองหาไปรอบๆ

นั่นคือตัวอย่างที่ยังไม่ได้แก้ไข เสียงทั้งสองถูกแยกออกจากกัน แต่ละบรรทัดมีการประทับเวลา และถ้อยคำก็สะอาดตา คุณสมัครใช้งาน อัปโหลดไฟล์เต็มความยาว 38 นาที และอีกไม่กี่นาทีต่อมา ทรานสคริปต์ฉบับสมบูรณ์ก็พร้อมในรูปแบบเดียวกัน ผู้พูด A คือคุณ และผู้พูด B คือผู้สัมภาษณ์ของคุณ ดังนั้นคุณจึงคลิกที่ป้ายกำกับ “ผู้พูด A” พิมพ์ชื่อของคุณ และคลิก “ผู้พูด B” เพื่อพิมพ์ชื่อของพวกเขา ทั้งเปลี่ยนชื่อทั้งเอกสารในรอบเดียว คุณส่งออกเป็น DOCX เปิดในโปรแกรมประมวลผลคำ แก้ไขจุดสองหรือสามตำแหน่งที่มีการสะกดชื่อผลิตภัณฑ์ตามหลักสัทศาสตร์ และคุณมีสำเนาบทสัมภาษณ์ที่เสร็จสิ้นแล้ว 38 นาทีนั้นเกินดุลของคุณ ซึ่งเป็นเหตุผลว่าทำไม 30 นาทีฟรีจึงมีประโยชน์สำหรับงานจริงครั้งแรก ไม่ใช่แค่คลิปทดสอบ

ปัญหาที่พบบ่อยและวิธีแก้ไข

การถอดเสียงที่น่าผิดหวังส่วนใหญ่จะย้อนกลับไปที่การบันทึก ไม่ใช่กลไก ปัญหาเหล่านี้เกิดขึ้นบ่อยที่สุดและควรทำอย่างไรในแต่ละปัญหา

การบันทึกเงียบหรือมีโคลน หากเสียงเบาหรือห้องดัง แสดงว่าระบบทำงานได้น้อยลงและความแม่นยำลดลง ไมโครโฟนที่อยู่ใกล้กับผู้พูด ไมโครโฟนแบบติดปกเสื้อ หรือชุดหูฟังในระยะ 10 ถึง 20 เซนติเมตรจากปาก จะสร้างความแตกต่างที่ยิ่งใหญ่กว่าการตั้งค่าใดๆ ห้องเปล่าขนาดใหญ่จะเพิ่มเสียงสะท้อนที่เลอะขอบเขตระหว่างเสียง พื้นที่ขนาดเล็กหรือตกแต่งอย่างนุ่มนวลจะบันทึกได้ดีกว่า คุณไม่สามารถแก้ไขสิ่งนี้ได้หลังจากข้อเท็จจริงแล้ว ดังนั้นจึงควรดำเนินการให้ถูกต้องก่อนที่คุณจะกดบันทึกในครั้งถัดไป

คนสองคนพูดพร้อมกัน เมื่อเสียงทับซ้อนกัน ทั้งถ้อยคำและผู้พูด-อะไรจะยากขึ้น เนื่องจากเสียงสองชุดแข่งขันกันในเสียงชิ้นเดียวกัน ไม่มีการแก้ไขซอฟต์แวร์ใหม่ทั้งหมดสำหรับการทับซ้อนของแท้ ในการบันทึกที่คุณควบคุม การทิ้งจังหวะระหว่างเทิร์นจะได้ผลดีในภายหลัง ในรูปแบบที่คุณไม่สามารถทำซ้ำได้ ให้คาดหวังว่าจะมีการข้ามเส้นสองสามเส้นรอบๆ สิ่งรบกวนและจัดระเบียบด้วยมือ

คำศัพท์เฉพาะทางอาจใช้ผิด โมเดลที่ใช้งานทั่วไปรู้ภาษาที่ใช้ในชีวิตประจำวันได้ดี แต่ไม่จำเป็นต้องเห็นศัพท์เฉพาะทางอุตสาหกรรมของคุณ นามสกุลที่ไม่ธรรมดา หรือชื่อผลิตภัณฑ์ สิ่งเหล่านี้มักจะถูกถอดเสียงโดยวิธีการออกเสียงมากกว่าการสะกดคำ การค้นหาและแทนที่ใน DOCX ที่ส่งออกจะล้างคำที่เกิดซ้ำในไม่กี่วินาที ซึ่งเป็นเหตุผลหนึ่งที่ทำให้ DOCX เป็นการส่งออกที่แก้ไขได้ง่ายที่สุด

ไฟล์จะไม่โหลด ไฟล์เสียงและวิดีโอมาตรฐานส่วนใหญ่ใช้งานได้ หากมีใครปฏิเสธ ก็มักจะเป็นภาชนะที่ผิดปกติหรือเก่ามาก การแปลงเป็น MP3 หรือ WAV ธรรมดาด้วยเครื่องมือในเบราว์เซอร์ฟรี ซึ่งทำงานบนอุปกรณ์ของคุณและไม่ได้อัปโหลดอะไรเลย แทบจะช่วยแก้ปัญหาได้เกือบทุกครั้ง หากรูปแบบยังคงไม่ผ่าน โปรดส่งอีเมลมาที่ support@hushscript.com แล้วทีมงานจะเพิ่มรูปแบบนั้น

ผู้พูดหนึ่งคนจะถูกแบ่งออกเป็นสอง ในบางครั้ง คนคนเดียวกันจะถูกระบุว่าเป็นผู้พูดสองคน โดยปกติแล้วเป็นเพราะเสียงของพวกเขาเปลี่ยนไปในระหว่างทาง: พวกเขาขยับเข้าใกล้ไมโครโฟนมากขึ้น เปลี่ยนจากชุดหูฟังเป็นโหมดลำโพง หรือคุณภาพของสายเปลี่ยนไป ระบบจัดกลุ่มตามลักษณะของเสียง ดังนั้นการเปลี่ยนแปลงครั้งใหญ่จึงอาจถูกมองว่าเป็นคนละคน การรวมป้ายกำกับทั้งสองเข้าด้วยกันในตัวแก้ไขจะแก้ไขได้ในขั้นตอนเดียว รายละเอียดของกลไกนี้อยู่ในคำแนะนำเกี่ยวกับวิธีการทำงานของการแยกแยะเสียงของผู้พูด

ความแม่นยำและสำเนียง

การครอบคลุมสำเนียงขึ้นอยู่กับรุ่นและภาษา สำหรับภาษาอังกฤษ โมเดลที่ได้รับการฝึกบนชุดข้อมูลแบบกว้างรองรับภาษาอังกฤษแบบสหรัฐอเมริกา สหราชอาณาจักร ออสเตรเลีย และอินเดียได้ดี และ Hushscript มีสำเนียงภาษาอังกฤษที่แตกต่างกันสี่แบบ ภาษาถิ่นที่หนักแน่นหรือสำเนียงที่หลากหลายจะต้องมีการแก้ไขเพิ่มเติม แต่คุณยังคงแก้ไขฉบับร่างแทนที่จะพิมพ์จากอะไรเลย

นิสัยบางประการช่วยเพิ่มความแม่นยำในการบันทึก ไม่ว่าจะเป็นสำเนียงใดก็ตาม บันทึกด้วยไมโครโฟนแบบปิด ให้แต่ละคนทำเสร็จก่อนที่จะเริ่มครั้งต่อไป หลีกเลี่ยงห้องที่มีเสียงก้องขนาดใหญ่ อัตราการพูดในระดับปานกลางจะถ่ายทอดได้ดีกว่าการวิ่งเกิน 200 คำต่อนาที และบิตเรตที่สมเหตุสมผลก็มีความสำคัญ: MP3 128 kbps นั้นใช้ได้ ในขณะที่เสียงข้อความเสียงที่ถูกบีบอัดอย่างหนักในย่านความถี่แคบจะสูญเสียรายละเอียดที่ระบบต้องการ หากต้องการทราบข้อมูลเพิ่มเติมเกี่ยวกับรูปแบบและลักษณะเฉพาะของแต่ละรูปแบบ โปรดดูวิธีถอดเสียงไฟล์เสียง

Hushscript ตรวจจับภาษาโดยอัตโนมัติและถอดเสียง ประมาณ 99 ภาษา โดยมีความแม่นยำระดับสูงสุดใน 18 ภาษา การบันทึกที่อยู่ในภาษาเดียวจะถอดเสียงได้อย่างหมดจดที่สุด การเปลี่ยนภาษาระหว่างประโยคเป็นเรื่องยากสำหรับกลไกใดๆ

ป้ายกำกับผู้พูดในการผ่านเดียวกัน

การแยกผู้พูด ซึ่งเรียกอย่างเป็นทางการว่าการแยกเสียงของผู้พูด จะทำงานควบคู่ไปกับการรู้จำเสียงพูด แทนที่จะเป็นงานที่สองที่คุณต้องจ่ายเพิ่ม คุณจะได้คำศัพท์และการระบุแหล่งที่มามารวมกัน โดยไม่เสียค่าใช้จ่ายในทุกบทถอดเสียง สำหรับการสัมภาษณ์สองคนหรือการประชุมขนาดเล็ก การแยกนั้นมักจะถูกต้องและช่วยลดงานที่น่าเบื่อในการแท็กทุกบรรทัดด้วยมือ ไม่มีการกำหนดจำนวนผู้พูดที่สามารถเก็บไฟล์ได้ แม้ว่าความแม่นยำจะสูงสุดเมื่อเสียงมีความแตกต่างกัน ไม่ทับซ้อนกัน และเสียงไม่เหมือนกัน การติดป้ายกำกับผู้พูดนั้นมาพร้อมกับการถอดเสียงทุกครั้งโดยไม่มีค่าใช้จ่ายเพิ่มเติม ถือเป็นรายละเอียดที่ตรงไปตรงมาโดยค่าเริ่มต้นซึ่งแนวทางทั้งหมดนี้สร้างขึ้น: รวมส่วนที่เป็นประโยชน์ไว้ด้วย ไม่ถูกรั้งไว้หลังระดับที่สูงกว่า

ความแตกต่างที่ชัดเจนที่ต้องยึดถือคือสิ่งนี้ หากคุณต้องการบันทึกคำพูดขณะพูด พิมพ์ด้วยเสียงหรือเขียนตามคำบอก ให้เข้าถึงเครื่องมือถ่ายทอดสดที่มีอยู่ในอุปกรณ์หรือโปรแกรมประมวลผลคำของคุณ หากคุณมีไฟล์บันทึกเสียงที่ต้องการเป็นข้อความอยู่แล้ว การถอดเสียงจากหน้าเสียงเป็นข้อความจะรวดเร็ว แม่นยำยิ่งขึ้น และมอบป้ายกำกับผู้พูดและเอาต์พุตที่ส่งออกได้ในขั้นตอนเดียว

แหล่งข้อมูลและมาตรฐานอิสระ

Hushscript อ้างอิงแหล่งข้อมูลอิสระที่ไม่ใช่คู่แข่งเหล่านี้เพื่ออธิบายงานวิจัย มาตรฐาน หรือการทำงานของแพลตฟอร์ม โดยไม่ได้หมายความว่าแหล่งข้อมูลดังกล่าวรับรอง Hushscript

วันที่ตรวจสอบแหล่งข้อมูล:

คำถามที่พบบ่อย

คำพูดเป็นข้อความคืออะไร

คำพูดเป็นข้อความหรือที่เรียกว่าการรู้จำคำพูดอัตโนมัติหรือ ASR คือซอฟต์แวร์ที่เปลี่ยนเสียงพูดให้เป็นคำพูดที่เขียน โดยจะฟังเสียงคำพูด ตรวจดูว่าคำพูดใดถูกพูด และสร้างสำเนาข้อความ เวอร์ชันใหม่ทำงานบนโมเดล AI ที่ได้รับการฝึกด้วยเสียงที่บันทึกไว้เป็นเวลาหลายพันชั่วโมง ซึ่งเป็นสาเหตุที่ทำให้โมเดลเหล่านี้จัดการสำเนียงและเสียงพื้นหลังได้ดีกว่าเครื่องมือเขียนตามคำบอกเมื่อทศวรรษที่แล้ว

อะไรคือความแตกต่างระหว่างการเขียนตามคำบอกสดและการถอดเสียงการบันทึก

การเขียนตามคำบอกสดเปลี่ยนคำพูดเป็นข้อความแบบเรียลไทม์ในขณะที่คุณพูด เช่นเดียวกับวิธีที่การพิมพ์ด้วยเสียงในโทรศัพท์หรือโปรแกรมประมวลผลคำ การถอดเสียงการบันทึกจะใช้ได้กับไฟล์เสียงหรือวิดีโอที่บันทึกไว้หลังจากนั้น การบันทึกมักจะออกมาแม่นยำกว่าเพราะกลไกสามารถดูประโยคทั้งหมดก่อนที่จะยอมรับคำนั้น และสามารถติดป้ายกำกับว่าใครพูดเมื่อใด Hushscript จัดการการบันทึก ไม่ใช่การเขียนตามคำบอกสด

คำพูดอัตโนมัติเป็นข้อความมีความแม่นยำเพียงใด

เพื่อคำพูดที่ชัดเจนในห้องที่เงียบสงบ โมเดล AI ในปัจจุบันมีความแม่นยำของคำประมาณ 90 ถึง 97 เปอร์เซ็นต์ในภาษาที่รองรับอย่างดี ความแม่นยำลดลงพร้อมกับเสียงรบกวนเบื้องหลังที่หนักหน่วง คนสองคนคุยกัน สำเนียงชัดเจนที่โมเดลไม่เคยได้ยินมากนัก หรือคำศัพท์เฉพาะทาง เช่น ชื่อยาหรือภาษาละตินทางกฎหมาย การล้างข้อมูลการบันทึกให้ความแม่นยำมากกว่าการตั้งค่าใดๆ

คำพูดเป็นข้อความใช้งานได้กับการเน้นเสียงหรือไม่

ใช่ และดีกว่าระบบรุ่นเก่ามาก แบบจำลองที่ได้รับการฝึกบนชุดข้อมูลขนาดใหญ่และหลากหลายรองรับภาษาอังกฤษแบบสหรัฐอเมริกา สหราชอาณาจักร ออสเตรเลีย และอินเดียได้อย่างสะดวกสบาย และ Hushscript มีสำเนียงภาษาอังกฤษที่แตกต่างกันสี่แบบ ภาษาถิ่นที่เข้มแข็งหรือสำเนียงที่ไม่ค่อยมีคนใช้จะต้องได้รับการแก้ไขอีกเล็กน้อยในภายหลัง แต่การถอดเสียงยังคงเป็นฉบับร่างแรกที่ใช้งานได้ แทนที่จะเป็นสิ่งที่คุณพิมพ์ใหม่ตั้งแต่ต้น

ฉันจะแปลงคำพูดที่บันทึกไว้เป็นข้อความใน Hushscript ได้อย่างไร

วางไฟล์เสียงหรือวิดีโอของคุณลงบนหน้าเสียงเป็นข้อความ และการแสดงตัวอย่างที่มีป้ายกำกับผู้พูด 30 วินาทีจะปรากฏขึ้นโดยไม่จำเป็นต้องใช้บัญชี ลงทะเบียนด้วยอีเมลของคุณเพื่อถอดเสียงส่วนที่เหลือ จากนั้นอัปโหลดไฟล์เต็ม บทถอดเสียงที่เสร็จแล้วกลับมาพร้อมป้ายกำกับผู้พูดและการประทับเวลา และคุณสามารถเปลี่ยนชื่อผู้พูดและส่งออกได้ 21 รูปแบบ ตั้งแต่ TXT, SRT และ DOCX เป็น PDF หรือเป็น .husharchive ที่ป้องกันด้วยรหัสผ่าน

คำพูดเป็นข้อความฟรีหรือไม่

Hushscript ไม่ฟรี เพราะ AI ที่อยู่เบื้องหลังต้องใช้เงินจริงในการเรียกใช้ ดังนั้น จ่ายตามการใช้งานโดยไม่ต้องสมัครสมาชิก คุณจะได้รับทดลองใช้ฟรี 30 นาที พวกเขาจะปลดล็อคทันทีเมื่อคุณตรวจสอบบัตรที่มีการระงับ $1 ซึ่งจะถูกปล่อยทันทีและไม่มีการเรียกเก็บเงิน หรือเมื่อคุณซื้อครั้งแรกหากคุณชำระเงินด้วยวิธีอื่น การแสดงตัวอย่าง 30 วินาทีและเครื่องมือในเบราว์เซอร์นั้นฟรีอย่างแท้จริงโดยไม่ต้องมีบัญชี

Hushscript สามารถถอดความภาษาใดบ้าง

ตรวจพบภาษาโดยอัตโนมัติและถอดความได้ประมาณ 99 ภาษา โดยมีความแม่นยำระดับสูงสุดใน 18 ภาษา รวมถึงทั่วโลก อังกฤษ ออสเตรเลีย และอังกฤษแบบสหรัฐอเมริกา สเปน ฝรั่งเศส เยอรมัน ญี่ปุ่น จีนกลาง ฮินดี และอารบิก หน้าภาษาจะแสดงรายการทั้งหมด การบันทึกที่อยู่ในภาษาเดียวจะถอดเสียงได้ดีที่สุด

เริ่มต้นด้วย 30 นาทีฟรี

เริ่มต้น – 30 นาทีฟรี