Konuşmayı metne dönüştürme: Nasıl çalışır?
Yazar: Hushscript Yayınlandı: Son inceleme:
Konuşmayı metne dönüştürme, konuşulan sesi yazılı kelimelere dönüştüren bir yazılımdır. Bu terim, benzer hissettiren ancak farklı çalışan iki farklı işi kapsar: konuştuğunuz ve ilerledikçe metnin göründüğü canlı dikte ve bir kaydı teslim ettiğiniz ve bitmiş bir transkripsiyonun geri alındığı transkripsiyon. Her ikisinde de ana fikir aynı. İş akışı, doğruluk ve sonuçla yapabilecekleriniz önemli değil.
Bu kılavuz, konuşmadan metne dönüştürmenin aslında ne olduğunu, sade bir dille olarak, motorun sesten kelimelere nasıl geçtiğini ve iki modun nasıl farklılaştığını açıklamaktadır. Daha sonra, Hushscript’te bir kaydın metne dönüştürülmesi, üzerinde çalışılmış bir örnek, insanları şaşırtan sorunlar ve sonunda kısa bir SSS ile anlatılıyor.
Metne konuşmanın gerçekte ne olduğu
En basit haliyle, otomatik konuşma tanıma (ASR), bir ses dalgasını alır ve bir kelime dizisi üretir. Mikrofon, konuşmayı sürekli bir dalga biçimi olarak, zamanla değişen hava basıncını temsil eden sallanan bir çizgi olarak yakalar. Bu dalga biçimi her şeyi taşır: sözcükleri, konuşmacının sesini, odayı, klimanın uğultusunu. Motorun görevi, bu karışımdan kelimeleri çekip yazmaktır.
Bunu yapmak için motor, sesi genellikle her biri 10 ila 30 milisaniyelik küçük dilimlere böler ve her dilimdeki sesi ölçer. Bu ölçümler, ses kalıplarını bir dilin konuşma birimlerine, ardından kelimelere ve daha sonra tüm ifadelere haritalayan eğitimli bir modeli besliyor. Bunların hiçbirini görmüyorsunuz. Bir kaydın içeri girdiğini ve bir transkriptin çıktığını görüyorsunuz. Ancak içeride ne olduğunu kabaca bilmek, neden bazı kayıtların temiz bir şekilde yazıya geçirildiğini ve diğerlerinin kaba bir şekilde geri döndüğünü açıklıyor.
Birlikte çalışan iki bilgi katmanı vardır. Bunlardan biri akustiktir: Bir dildeki seslerin neler olduğu ve bunların farklı ses ve aksanlarda nasıl telaffuz edilme eğiliminde olduğu. Diğeri ise dilseldir: Hangi kelime dizilerinin makul olduğu. Dilsel katman, iyi bir motorun “araba bozuldu” yerine “arabaları bozuldu” yazmasının nedenidir, her ne kadar ikisi de kulağa aynı gelse de. Bir insanın yapacağı yazımı seçmek için bağlamı kullanmaktır.
Daha eski konuşma tanıma, elle yazılmış kurallara ve küçük eğitim setlerine dayanıyordu ve kırılgandı. Modern motorlar, birçok konuşmacıdan, aksandan ve kayıt koşullarından binlerce saatlik kayıtlı konuşmayla eğitilmiş büyük yapay zeka modelleridir. Bugünkü transkriptlerin kullanılabilir olmasının tek nedeni bu genişliktir. İyi bir kayıtta net konuşma durumunda, mevcut modeller yüzde 90 ila 97 civarında kelime doğruluğuna ulaşıyor. Geriye kalan yüzde birkaçlık kısım, bu kılavuzun ilerleyen kısımlarında sorun gidermenin geçimini sağladığı yerdir.
Kayıtlı konuşma ve canlı dikte
Uygulamada en önemli ayrım, sesin canlı olarak mı yoksa sonradan mı işlendiğidir.
Canlı dikte, gerçek zamanlı olarak çalışır. Bir telefona, sesli asistana veya bir kelime işlemcinin sesle yazma özelliğine konuştuğunuzda kelimeler neredeyse söylediğiniz kadar hızlı görünür. Buna ayak uydurmak için, motorun her kelimeye bağlı kalması ve cümlenin çok azına dayanması gerekiyor. Bu zor bir kısıtlamadır ve diktenin bazen bir kelimeyi tahmin etmesinin ve sonraki birkaç kelime geldiğinde onu sessizce yeniden yazmasının nedeni budur. Canlı dikte, hareket halindeyken kendi konuşmanızı yakalamak olduğunda doğru araçtır: eller serbest olarak not almak, sesle e-posta taslağı hazırlamak, bir cihazı kontrol etmek.
Transkripsiyon tam bir kayıt üzerinde çalışır. Motora bitmiş bir ses veya video dosyası verirsiniz, o da her şeyi işler ve karşılığında tam bir transkript alırsınız. Hiçbir şeyin gerçek zamanlı olarak gerçekleşmesi gerekmediğinden, motor herhangi bir kelimeye karar vermeden önce cümlenin tamamını okuyabilir ve görebilir; bu da doğruluğu artırır. Ayrıca canlı diktenin yapamadığı işleri de yapabilir. Her satırı söyleyen kişiyle ilişkilendirerek konuşmacıları ayırabilir ve zaman damgaları ekleyerek bir metin satırından doğrudan sesteki o ana atlayabilirsiniz.
Bir toplantı, röportaj, ders, podcast bölümü veya kaydettiğiniz bir telefon görüşmesiyle uğraşıyorsanız, canlı dikte değil, kaydedilmiş bir dosyadan transkripsiyon yapıyorsunuz demektir. Her ikisi de “konuşmayı metne dönüştürme” olarak pazarlandığı için ikisinin kafası karışıyor, ancak zaten sahip olduğunuz kayıt, bir dikte aracı için yanlış şekil ve bir transkripsiyon cihazı için doğru şekildir. Hushscript kayıtlar için tasarlandı. Canlı dikte modu yoktur ve bu odaklanma kasıtlıdır: Tam dosyadan çalışmak, doğruluk için ileriyi okumasını ve konuşmacıları aynı geçişte etiketlemesini sağlar.
Kayıtlı konuşma nasıl metne dönüştürülür
Burada Hushscript’teki gerçek akış, karşıladığınız sıraya göre verilmiştir. Kaydolmak için cihazınızda bir dosya olarak kayda, herhangi bir ortak formatta bir ses veya video dosyasına ve bir e-posta adresine ihtiyacınız vardır. Bütün liste bu. Yüklenecek bir şey yok.
- Dosyayı bırakın ve önizlemeyi izleyin.sesten metne dönüştürme sayfasını açın ve dosyanızı bu sayfaya bırakın. Hushscript, ilk 30 saniyeyi hemen yazıya döker ve sonucu, konuşmacılar zaten ayrılmış durumdayken gösterir. Bu adım için herhangi bir hesaba gerek yoktur. Önizleme oradadır, böylece herhangi bir işlem yapmadan önce kendi kaydınızın doğruluğunu değerlendirebilirsiniz.
- Geri kalanını yazıya dökmek için kaydolun. Önizleme doğru görünüyorsa e-postanızla kaydolun. Dosyanın tamamının transkripsiyonu sınırlıdır, bu nedenle hesap bu adımda devreye girer. Yeni hesaplara, hizmeti düzgün şekilde denemeleri için 30 ücretsiz dakika verilir.
- Dosyanın tamamını yükleyin. İçeri girdikten sonra kaydın tamamını yükleyin. Bir videoysa, önce ses tarayıcınızda çıkarılır ve yalnızca ses gönderilir, böylece videonun kendisi cihazınızda kalır.
- Oku, yeniden etiketle ve dışa aktar. Konuşma metni, her konuşmanın bir konuşmacıya (Konuşmacı A, Konuşmacı B vb.) atfedildiği ve zaman damgasının eklendiği şekilde geri gelir. Yeniden adlandırmak için herhangi bir konuşmacı etiketine tıkladığınızda yeni ad, o kişinin konuştuğu her yerde güncellenir. İstediğiniz şekilde okunduğunda, düz metin için TXT’ye, altyazılar için SRT veya VTT’ye, yapılandırılmış veriler için CSV veya JSON’a, notları yayınlamak için Markdown’a, düzenleme için DOCX’e veya paylaşım için PDF’ye aktarın.
Kısa bir röportajı, 10 dakikalık bir ders klibini veya daha ileri gitmeden önce doğruluğunu kontrol etmek istiyorsanız daha uzun bir kaydın ilk kısmını yazıya dökmek için otuz dakika yeterlidir. Ücretsiz dakikaların kilidi, hızlı bir kart kontrolünden anında açılır: Kartın kontrol edilmesi için 1 dolarlık bloke yetkisi verilir, ardından hemen kaldırılır ve asla ücret alınmaz. Başka bir ödeme yöntemi kullanın; bunun yerine ilk satın alma işleminizle birlikte gelirler. Kart gerekli değildir; Bu sadece bonusa giden en hızlı yoldur. Ücretsiz dakikalardan sonra abonelik gerekmeden yalnızca yazıya döktüğünüz dakikalar için ödeme yaparsınız. fiyatlandırma sayfasında güncel fiyatlar bulunmaktadır.
Çalışılmış bir örnek
Telefonunuza 38 dakikalık bir müşteri görüşmesini kaydettiğinizi varsayalım. Bir M4A olarak kaydedildi, iki ses, ara sıra bir kahve fincanının takırtısı, normal bir toplantı odasında kaydedildi.
M4A’yı sesten metne dönüştürme sayfasına bırakırsınız. 30 saniyelik ön izleme kısa bir sohbet olarak karşımıza çıkıyor:
Konuşmacı A 00:00 Zaman ayırdığınız için teşekkür ederiz. Bana anlatarak başlayabilir misin
Böyle bir aracı aramanıza ilk ne sebep oldu?
Konuşmacı B 00:11 Elbette. Destek bildirimleri arasında boğuluyorduk ve eski
sistem buna ayak uyduramıyordu, ben de etrafa bakmaya başladım.
Bu düzenlenmemiş önizlemedir. İki ses bölünmüş, her satıra zaman damgası yerleştirilmiş ve ifadeler net. Kaydolursunuz, 38 dakikalık dosyanın tamamını yüklersiniz ve birkaç dakika sonra tam transkript aynı şekilde hazır olur. Konuşmacı A sizsiniz, Konuşmacı B ise görüştüğünüz kişidir, yani “Konuşmacı A” etiketine tıklayıp adınızı yazın ve “Konuşmacı B”ye tıklayarak kendi adını yazın. Her ikisi de tek geçişte belgenin tamamını yeniden adlandırır. DOCX’e aktarırsınız, onu kelime işlemcinizde açarsınız, bir ürün adının fonetik olarak yazıldığı iki veya üç yeri düzeltirsiniz ve bitmiş bir röportaj transkriptiniz olur. 38 dakika bakiyenizden çıktı; bu nedenle ücretsiz 30 dakika, yalnızca bir test klibi yerine ilk gerçek iş için kullanışlıdır.
Genel sorunlar ve bunların nasıl düzeltileceği
Hayal kırıklığı yaratan transkriptlerin çoğu motora değil kayda dayanmaktadır. Bunlar en çok ortaya çıkan sorunlar ve her biri hakkında ne yapılması gerektiğidir.
Kayıt sessiz veya çamurlu. Sesler zayıfsa veya oda gürültülü geliyorsa, motorun çalışacak işi azalır ve doğruluk düşer. konuşmacıya yakın bir mikrofon, yaka mikrofonu veya ağzın 10 ila 20 santimetre yakınında bir kulaklık, herhangi bir ayardan daha büyük bir fark yaratır. Büyük, çıplak bir oda, sesler arasındaki sınırları aşındıran yankıyı ekler; daha küçük veya yumuşak döşenmiş bir alan daha iyi kayıt yapar. Olay gerçekleştikten sonra bunu düzeltemezsiniz, bu nedenle bir dahaki sefere kayda basmadan önce hemen harekete geçmeye değer.
İki kişi aynı anda konuşur. Sesler örtüştüğünde hem ifadeler hem de kimin ne söylediğini anlamak zorlaşır çünkü iki ses grubu aynı ses diliminde rekabet eder. Gerçek örtüşme için temiz bir yazılım düzeltmesi yoktur. Kontrol ettiğiniz bir kayıtta, dönüşler arasında bir ritim bırakmak daha sonra karşılığını verir. Yineleyemeyeceğiniz bir modelde, kesintilerin etrafında birkaç çapraz çizgi olmasını bekleyin ve bunları elle düzenleyin.
Uzman bir terim yanlış çıkıyor. Genel amaçlı modeller günlük dili iyi bilir ancak sektörünüzün jargonunu, sıra dışı bir soyadını veya ürün adını mutlaka görmemiştir. Bunlar, nasıl yazıldığından ziyade seslerine göre yazıya geçirilme eğilimindedir. Dışa aktarılan DOCX’teki bul ve değiştir işlemi, yinelenen bir terimi saniyeler içinde temizler; bu, DOCX’in düzeltilmesi en kolay dışa aktarma yöntemi olmasının nedenlerinden biridir.
Dosya yüklenmez. Çoğu standart ses ve video dosyası çalışır. Eğer biri reddederse, bu genellikle alışılmadık veya çok eski bir konteynerdir. Cihazınızda çalışan ve hiçbir şey yüklemeyen ücretsiz tarayıcı içi araçları kullanarak onu düz bir MP3 veya WAV’a dönüştürmek neredeyse her zaman sorunu çözer. Bir format yine de geçmezse support@hushscript.com adresine e-posta gönderin; ekip bunu ekleyecektir.
Bir konuşmacı ikiye ayrılır. Bazen aynı kişi iki konuşmacı olarak etiketlenir, bunun nedeni normalde sesin yarı yolda değişmesidir: mikrofona yaklaşmış, kulaklıktan hoparlöre geçmiş veya hat kalitesi değişmiştir. Motor, sesleri duyuluşlarına göre gruplandırır, böylece büyük bir değişiklik yeni bir kişi olarak okunabilir. Düzenleyicide iki etiketi birleştirmek sorunu tek adımda düzeltir. Bunun mekanizması konuşmacı ayrıştırmanın nasıl çalıştığına ilişkin kılavuzda yer almaktadır.
Doğruluk ve aksanlar
Vurgu kapsamı modele ve dile bağlıdır. İngilizce için, geniş veri kümeleri üzerinde eğitilen modeller ABD, Birleşik Krallık, Avustralya ve Hint İngilizcesini iyi bir şekilde kullanır ve Hushscript dört farklı İngilizce aksanı sunar. Ağır bir bölgesel lehçe veya daha az temsil edilen bir aksan çeşidi, daha fazla düzeltmeye ihtiyaç duyacaktır, ancak yine de sıfırdan yazmak yerine taslağı düzenliyorsunuz.
Aksan ne olursa olsun, birkaç alışkanlık her kayıtta doğruluğu artırır. Yakın bir mikrofonla kaydedin. Bir sonraki başlamadan önce herkesin bitirmesine izin verin. Büyük yankı uyandıran odalardan kaçının. Orta düzeyde bir konuşma hızı, dakikada 200 kelimeyi aşan bir sürat koşusundan daha iyi bir şekilde yazıya aktarılır. Makul bir bit hızı da önemlidir: 128 kbps MP3 iyidir, dar bantta yoğun şekilde sıkıştırılmış sesli mesaj sesi ise motorun ihtiyaç duyduğu ayrıntıları kaybeder. Biçimler ve her birinin tuhaflıkları hakkında daha ayrıntılı bilgi edinmek için herhangi bir ses dosyasının nasıl metne dönüştürüleceği konusuna bakın.
Hushscript, dili otomatik olarak algılar ve yaklaşık 99 dilde, bunların 18’inde üst düzey doğrulukla metne dönüştürür. Tek dilde kalan bir kayıt en temiz şekilde yazıya aktarılır; cümlenin ortasında dil değiştirmek her motor için zordur.
Aynı geçişte konuşmacı etiketleri
Resmi olarak konuşmacı ayrıştırma olarak adlandırılan konuşmacıları ayırma, fazladan ödeme yaptığınız ikinci bir iş olmaktan ziyade konuşma tanımayla birlikte çalışır. Her transkriptte kelimeleri ve atıfları bir arada ücretsiz olarak alırsınız. İki kişilik bir görüşme veya küçük bir toplantı için bu ayırma genellikle doğrudur ve her satırı elle etiketlemek gibi sıkıcı bir işten kurtarır. Bir dosyanın kaç konuşmacı tutabileceğine dair bir sınır yoktur; ancak doğruluk, sesler farklı olduğunda, üst üste gelmediğinde ve aynı ses vermediğinde en yüksek düzeydedir. Konuşmacı etiketlemenin hiçbir ekstra ücret ödemeden her transkriptle birlikte gelmesi, tüm yaklaşımın üzerine inşa edildiği, varsayılan olarak dürüst bir ayrıntıdır: yararlı kısım dahil edilir, daha yüksek bir seviyenin arkasında tutulmaz.
Tutunmanız gereken açık ayrım şudur. Konuşurken konuşmayı yakalamak, sesle yazmak veya dikte etmek istiyorsanız cihazınızda veya kelime işlemcinizde yerleşik olarak bulunan canlı araca ulaşın. Metin olarak ihtiyacınız olan bir kaydınız zaten varsa, bunu sesten metne sayfasından metne dönüştürmek daha hızlı, daha doğru olur ve konuşmacı etiketlerini ve dışa aktarılabilir çıktıyı tek adımda size sunar.
Bağımsız kaynaklar ve standartlar
Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.
Kaynakların incelenme tarihi: