Her türlü ses dosyasını metne dönüştürme
Yazar: Hushscript Yayınlandı: Son inceleme:
Bir podcast düzenleyicisinden bir MP3, iPhone’unuzdan bir M4A, bir alan kaydediciden bir WAV, bir ses kayıt cihazı uygulamasından belirsiz bir CAF: bunlardan herhangi birini metne dönüştürmek için aynı şeyi yaparsınız. Dosyayı bırakın, konuşmacıların zaten ayrılmış olduğu bir transkript alın, ihtiyacınız olan formatta dışa aktarın. Sesin geldiği kapsayıcı, adımları değiştirmez.
Biçimin etkilediği şey biraz daha aşağıdadır: dosyanın ne kadar büyük olduğu, ne kadar temiz bir şekilde yazıya döküldüğü ve bir dosyanın yüklenmediği nadir durumlarda ne yapılması gerektiği. Bu kılavuz, hangi ses formatlarının işe yaradığını, bunların tümünü idare eden tek yöntemi, seçeneğiniz olduğunda en iyi formatı nasıl seçeceğinizi ve zor çıkan dosyaları nasıl düzelteceğinizi kapsar.
İhtiyacınız olan şey
- Bir ses (veya video) dosyası. Aşağıdaki yaygın formatlardan herhangi biri. Yüklenecek hiçbir şey yok: masaüstü uygulaması yok, uzantı yok. Her şey tarayıcıda ve hesabınızda çalışır.
- Tam metin için bir Hushscript hesabı. Denemek için 30 ücretsiz dakikanız vardır. Bunların kilidini açmanın en hızlı yolu bir kart eklemektir: 1$’lık bloke işlemi onu doğrular, ardından hemen serbest bırakılır ve hiçbir zaman ücret alınmaz. Kart kullanmamayı tercih ederseniz alternatif bir ödeme yöntemi de işe yarar ve ilk satın alma işleminizde 30 dakika kazanırsınız.
30 saniyelik önizleme için hesaba gerek yoktur. Kaydolmadan önce bir dosyayı bırakabilir ve konuşmacı etiketli stili görebilirsiniz; bu, herhangi bir işlem yapmadan önce çıktının uygunluğunu kontrol etmenin dürüst yoludur. Ücretsiz dakikaların ötesinde, transkripsiyon kullandıkça öde şeklindedir: dakikaları yalnızca ihtiyacınız olduğunda satın alırsınız, abonelik gerektirmez. Maliyetler fiyatlandırma sayfasında yer almaktadır.
Hangi ses formatları çalışır
Hushscript tüm standart ses formatlarını alır. Her birinin genellikle nereden geldiğini burada bulabilirsiniz, böylece nelere sahip olduğunuzu anlayabilirsiniz:
Adlar yalnızca dosya adı kuralları değildir. Mevcut IANA Medya Türleri kaydı,audio/aac,audio/mp4,audio/mpeg,audio/ogg ve audio/opus gibi standartlaştırılmış türleri kaydeder; bu nedenle kapsayıcı ve içindeki ses kodlaması ayrıdır. sorular.
| Biçim | Ortak kaynak |
|---|---|
| MP3 | Podcast’ler, telefon kayıtları, çoğu kayıttan dışa aktarma uygulamalar |
| M4A / AAC | iPhone Sesli Notları, WhatsApp sesli notları, Apple dışa aktarmaları |
| WAV | Dijital kayıt cihazları, DAW dışa aktarmaları, Windows Ses Kaydedici |
| FLAC | Arşiv kayıtları, DAW dışa aktarımları, kayıpsız rip’ler |
| OGG | Android sesli notları, açık kaynaklı kayıt araçları |
| AIFF / CAF | Mac ve iOS ses, GarageBand |
Video dosyaları aynı şekilde çalışır. Bir MP4, MOV, WebM veya MKV bırakın; herhangi bir şey yüklenmeden önce ses parçası tarayıcınıza çıkarılır, böylece videonun kendisi cihazınızdan asla ayrılmaz; sunucuya yalnızca ses ulaşır.
Yukarıdaki liste bir çit değildir. Vaat, desteklenen formatlar tablosundan daha basittir: dosyanızı bırakın, dönüştürülür ve kopyalanır. Gerçekten alışılmadık bir şeye sahipseniz (eski bir Nokia’dan bir AMR dosyası, on yıllık bir Android’den bir .3gp, bir RealAudio klibi), yine de onu yüklemeyi deneyin. Tarayıcı standart kapsayıcıların çoğunu okuyabilir ve okuyamıyorsa iki alternatifiniz vardır: /tools adresindeki ücretsiz tarayıcı içi araçları kullanarak MP3 veya WAV’a dönüştürün ve bunu yükleyin veya support@hushscript.com adresine e-posta gönderin; biz de biçimi ekleyelim. Dosyanızın uygun olup olmadığını önceden anlamanıza gerek yok.
Bir ses dosyasını üç adımda metne dönüştürün
Hangi formatla başlarsanız başlayın akış aynıdır. İlk adım, henüz bir hesabınız olmadan önce gerçekleştirilir.
- Önizlemek için dosyanızı bırakın./audio-to-text adresine gidin ve dosyayı bırakma bölgesine sürükleyin veya göz atmak için tıklayın. İlk 30 saniye, herhangi bir hesaba ihtiyaç duymadan, konuşmacı etiketli olarak doğrudan tarayıcıda yazıya aktarılır. Bu, herhangi bir şeye kaydolmadan önce çıktının istediğiniz gibi okunup okunmadığını kontrol etmenizdir.
- Geri kalanını metne dönüştürmek için kaydolun. Hesap oluşturmak için e-posta adresinizi girin. Bir kart ekleyip doğruladığınızda (yukarıda açıklanan 1 ABD doları bloke) veya başka bir şekilde ödeme yaparsanız ilk satın alma işleminizde 30 ücretsiz dakikanızın kilidini açarsınız. Dosyanın tamamı buradan yüklenir. Bir kayıt, dosya boyutu sınırı olmadan 10 saate kadar sürebilir; çok büyük bir dosya bile doğrudan tarayıcıda hazırlanır. Hizmet güvenliği ve aktif iş korumaları da geçerlidir.
- Transkript’i alın ve dışa aktarın. Konuşma motoru dosyayı işler ve konuşmacıların zaten ayrılmış olduğu bir transkript döndürür. İsterseniz konuşmacıları yeniden adlandırın ve ardından onu 21 formattan herhangi birinde (aralarında TXT, SRT, DOCX ve PDF’nin yanı sıra altyazı ve editör-zaman çizelgesi formatları) veya şifre korumalı bir .husharchive olarak indirin. Her dışa aktarma dahildir: ödeme duvarı yok, filigran yok.
İşleme arka planda çalışır ve sesin uzunluğuna göre ölçeklenir (kabaca kayıt saati başına birkaç dakika), böylece uzun bir dosya tamamlanırken sekmeyi açık tutmak zorunda kalmazsınız.
Çalışılmış bir örnek: bir kayıt, iki format
38 dakikalık bir görüşmeyi kaydettiğinizi ve kayıt cihazınızın bunu iki kez kaydettiğini varsayalım: tam kalitede bir meeting.wav ve telefonunuzun aynı anda oluşturduğu bir meeting.m4a. Her ikisi de aynı üç adımdan geçer ve konuşma metni, her birinde bir zaman damgasıyla birlikte, konuşmacının sırasına göre bölümlere ayrılmış olarak geri gelir:
[00:00:06] Konuşmacı A: Başlamadan önce, gönderdiğim rakamları herkes aldı mı?
[00:00:10] Konuşmacı B: Bu sabah aldım. 3. Çeyrek numarası
araştırmak istediğim numara.
[00:00:17] Konuşmacı C: Evet, yani değişen satır bu. Konuyu açayım.
[00:00:21] Konuşmacı C: Siz hazırken – işe alıma sonra geri dönebilir miyiz?
İki dosya aslında aynı transkripti oluşturuyor. WAV çok daha büyük bir yüklemedir ve M4A ise küçüktür, ancak sözcükler ve konuşmacı etiketleri aynı şekilde yerleşir çünkü her ikisi de aynı temel konuşmayı taşır. Buradan düzenleme kolaydır:Konuşmacı A’yı yeniden adlandırmak için bir kez tıklarsınız ve konuşmacıyın her satırında güncellemeler olur; Motorun tahmin ettiği bir avuç özel isme (soyadı, ürün adı) göz atarsınız ve bunları, her örneği tek geçişte düzelten bul ve değiştir yöntemiyle düzeltirsiniz.
Bu, her format için tek bir yöntemin pratik sonucudur. WAV, M4A ve MP3 için farklı bir araç veya farklı bir zihinsel kontrol listesi tutmuyorsunuz. Kayıt cihazınız, telefonunuz veya bir başkasının dışa aktardığı dosya ne olursa olsun, aynı bırakma bölgesinden geçer ve aynı türde transkript olarak çıkar.
Doğruluk için en iyi formatı seçme
Çoğu zaman seçim yapamazsınız. Size verilen dosyayı yazıya dökersiniz ve bunda bir sorun yoktur. Ancak sesin nasıl kaydedildiğini veya dışa aktarıldığını kontrol ederseniz, birkaç seçenek sonucun ne kadar temiz olabileceğine ilişkin tavanı belirler.
Kayıt kalitesi büyük bir farkla önce gelir. İyi bir yakın mikrofondan gelen 128 kbps MP3, odanın diğer ucunda dizüstü bilgisayarın yerleşik mikrofonuyla kaydedilen kayıpsız bir WAV’ı her zaman yenecektir. Formatı düşünmeden önce mikrofonu konuşan kişiye yaklaştırmayı düşünün. Kapsayıcı çok uzak bir an.
Çok düşük bit hızına sahip MP3’ten kaçının. MP3 kayıplıdır: Kodlama, dosyayı küçük tutmak için sesin bazı kısımlarını atar ve bit hızı ne kadar düşükse, o kadar çok çöpe gider. Konuşma tanıma, “on beş” ile “on altı” veya “can” ile “can’t” arasındaki boşluğun bulunduğu ünsüz harflerdeki yüksek frekanslı ayrıntıya dayanır. Agresif sıkıştırma ilk önce tam olarak bu ayrıntıyı yer. Yaklaşık 64 kbps’nin altında kelime hataları artıyor. 128 kbps ve üzerinde sayının önemli olduğu noktayı çoktan geçmişsinizdir; Daha yüksek bir bit hızı, metni daha iyi hale getirmez.
Kayıpsız, formatı değişken olarak kaldırır. WAV, FLAC ve AIFF, motora sıkıştırılmamış ses verir. Temiz bir kayıt için, iyi bir MP3’e göre doğruluk kazancı marjinaldir, ancak sıkıştırmayı tamamen ortadan kaldırır. MDN’nin dijital ses kılavuzu temeldeki ödünleşimi açıklıyor: Kayıpsız, ayrıntıları daha büyük boyutta korurken, kayıplı kodlama, bilgileri atarak sesi daha da küçültebilir. Kaydın değerli olduğu ve daha sonra formatın size bir maliyeti olup olmadığını merak etmek istemediğiniz durumlarda bu yararlı bir bağlamdır.
Mono iyidir; stereoya ihtiyacınız yoktur. Motor, konuşma için dahili olarak stereoyu monoya karıştırır, böylece mono dosya da aynı şekilde metne dönüştürülür ve yavaş bir bağlantıda daha hızlı yüklenir. Tek nüans: Kurulumunuz her kişiyi ayrı bir stereo kanala (“çift sonlandırıcı”) kaydettiyse, yüklemeden önce bunu tek bir mono kanala karıştırmak konuşmacı etiketlerine yardımcı olabilir çünkü motor iki ayrı akış yerine karma bir konuşmayı duyar.
16 kHz’in üzerindeki örnekleme hızı konuşma için hiçbir şey satın almaz. 16 kHz’den 48 kHz’e kadar olan her şey çalışır ve Bir video düzenleyiciden gelen 48 kHz WAV, aynı temel konuşma göz önüne alındığında, bir telefon uygulamasından gelen 16 kHz mono dosyanın aynısını kopyalar. Model müziğe değil sese göre eğitilmiştir, bu nedenle daha yüksek bir orandan doğruluk kazanımı olmaz.
Kayıpsız ve kayıplı ve dönüştürme sırasında yardımcı olur
Yaygın bir soru: MP3’ünüzü WAV’a dönüştürmek öncelikle doğruluğu artırır mı? Olmayacak. Ses 128 kbps MP3 olarak kaydedildiğinde, atılan ayrıntılar tamamen kaybolur. Aynı sesi bir WAV’a sarmak, hiçbir ekstra bilgi içermeyen daha büyük bir dosya oluşturur. Yukarıya doğru dönüştürmek yalnızca yüklenmeyen bir format için geçici çözüm olarak yardımcı olur, hiçbir zaman doğruluğu artırmaz.
Aşağıya dönüştürmek gerçekten yararlı bir durumdur. Çok saatlik bir WAV çok büyük bir dosya olabilir; Yüklemeden önce onu 128 kbps MP3 olarak yeniden kodlamak, anlamlı bir doğruluk maliyeti olmadan onu önemli ölçüde küçültür, bu da yavaş bir bağlantıda yüklemeyi hızlandırır. Ücretsiz tarayıcı içi dönüştürücü bunu ses cihazınızdan hiç çıkmadan yapar. Dürüst kural: Dosyanız zaten yükleniyorsa ve küçük bit hızında değilse, onu olduğu gibi yazıya dökün. Yalnızca açılmayan veya rahatça yüklenemeyecek kadar büyük bir dosya gibi gerçek bir sorunu çözmek için dönüştürün.
Konuşmacı etiketleri, ücretsiz dahildir
Her Hushscript transkripti, hiçbir ekstra ücret ödemeden otomatik konuşmacı ayırma (ayrıştırma) özelliğiyle birlikte gelir. Motor, farklı sesleri seçip bunları Konuşmacı A,Konuşmacı B vb. olarak etiketler ve siz de bunları editörde, konuşmacı başına tek bir tıklamayla gerçek adlarla yeniden adlandırırsınız. Kaynak biçiminden bağımsız olarak, ayrı bir konuşmacı etiketi katmanı olmadan varsayılan olarak açıktır.
Etiketlerin ne kadar temiz çıkacağı dosya türüne değil kayda bağlıdır:
- Farklı sıralar en çok yardımcı olur. İnsanlar sırayla birbirleriyle konuşmadıklarında, etiketler güvenilirdir. İki kişilik bir görüşme genellikle net bir şekilde ayrılır.
- Çakışma zor bir durumdur. İki ses aynı anda geldiğinde, motor kelimeleri daha yüksek sese sahip olana atar. Bu, herhangi bir aracın değil, genel olarak konuşmacı ayrımının sınırlamasıdır. Canlı bir grup görüşmesinde çapraz konuşma için düzenlemeye biraz zaman ayırın.
- Benzer sesler bulanıklaşabilir. Benzer kayıtlara sahip iki kişi (örneğin aynı cinsiyetten kardeşler) herhangi bir ayrıştırma motoruna meydan okuyacaktır. Makul bir sinyal-gürültü oranı, ayırmanın tamamına yardımcı olur.
Röportajların, podcast’lerin ve toplantıların çoğu için etiketler en fazla birkaç yeniden atamayla kullanılabilir hale gelir. ayrıştırmanın genel olarak nasıl çalıştığına ilişkin ayrıntılı bilgi istiyorsanız konuşmacı ayrıştırmanın ne olduğuna veya özelliklere genel bakış için konuşmacı tanımlama sayfasına bakın.
Kötü görünen dosyaları düzeltme
Kaba metinlerin çoğu kayıttan kaynaklanır, kayıttan değil format veya araç. Olağan suçlular ve bunlar hakkında ne yapılması gerektiği:
Yüklenmeyen bir dosya. Nadirdir, ancak olağandışı veya bozuk bir kapsayıcıda meydana gelir. Çoğu inatçı dosyayı düzelten, önce MP3 veya WAV olarak yeniden sarmak için ücretsiz tarayıcı içi dönüştürücüyü deneyin. Hala devam etmiyorsa support@hushscript.com adresine e-posta gönderin. Format desteği eklemek yaptığımız bir şeydir.
Düşük ses seviyesi. Kayıt çok sessizse, motorun çalışacak sinyali azalır ve doğruluk düşer. Yüklemeden önce herhangi bir düzenleyicide sesi normalleştirin veya güçlendirin. Zayıf bir kaydın düzeyini artırmak, en yüksek getiri sağlayan çözümlerden biridir.
Arka plan gürültüsü. Sabit gürültü (klima, yol uğultusu) oldukça iyi bir şekilde giderilir. Konuşmayı engelleyen ani gürültü (bir kapı, bir öksürük, çatal bıçak takımı) kelimeleri düşüren şeydir. Yüklemeden önce hafif bir gürültü azaltma geçişi yardımcı olabilir, ancak aşırıya kaçmayın: Ağır gürültü giderme, doğruluğu gürültüden daha fazla olumsuz etkileyen kusurlar ekler.
Ağır aksanlar veya uzmanlık gerektiren sözcükler. Modern motorlar, çok çeşitli aksanları iyi bir şekilde işler. Güvenilir atlatmalar, motorun beklemesi için hiçbir neden olmayan alan terimleridir: ilaç adları, yasal alıntılar, niş marka adları. Dışa aktarma sonrasında tek bir gözden geçirme planlayın ve bul ve değiştir yöntemine güvenin; bir ad her seferinde aynı şekilde yanlışsa, bir düzeltme tüm dosyayı tarar.
Çok büyük veya çok uzun dosyalar. 10 saatlik tavan neredeyse her şeyi kapsar ve bunun üzerinde bir dosya boyutu sınırı yoktur, dolayısıyla uzun bir kaydı parçalara ayırmaya gerek yoktur. Kayıpsız bir dosya tarayıcıda hazırlanmak için çok büyükse, işleri hızlandırmak için önce onu 128 kbps MP3 olarak yeniden kodlayın (gerçek doğruluk maliyeti yok). Daha uzun oturumla ilgili ayrıntılar için uzun kayıt kılavuzu daha ayrıntılıdır.
Dosyanıza ne olur?
Transkript hazır olduğu anda ses sunucudan silinir. Bulut depolama alanı yok, model eğitiminin faydası yok ve saklama süresi yok. Bir video dosyasını düşürdüyseniz yalnızca çıkarılan ses sunucuya ulaştı (video cihazınızda kaldı) ve istediğiniz zaman tek tıklamayla transkriptin kendisini kontrol panelinizden silebilirsiniz.
Transkriptinizi dışa aktarma
Transkripsiyondan sonra, metinle yaptığınız işe uygun formatı seçin. Hangi transkript formatına ihtiyacınız olduğundan emin değilseniz, aşağıdaki genel seçimlerle başlayın:
| Biçim | Neler dahil | En iyi |
|---|---|---|
| TXT | konuşmacı etiketleri, düz metin | Notlar, arama, başka bir araca besleme |
| SRT | Söz başına zaman damgaları, konuşmacı etiketleri | Video altyazıları, uzun bir kayıtta zamana göre gezinme |
| VTT | Web altyazı zaman damgaları, konuşmacı etiketleri | HTML5 video oynatıcılar ve web yayınlama |
| CSV | konuşmacı, zamanlama ve metin alanları içeren satırlar | E-tablo incelemesi ve hafif veri aktarımı |
| Markdown | Markdown’da konuşmacı etiketli transkript | Notlar, belgeler, yayınlama iş akışları ve statik siteler |
| DOCX | Word veya Google Dokümanlar için biçimlendirilmiş | Düzenleme, paylaşma, açıklama ekleme |
| JSON | { speaker, start, end, text } öğe başına | Ardışık düzen ve özel araçlar |
| Okunabilir sabit yerleşimli transkript | Salt okunur paylaşım ve arşivleme |
Her dışa aktarma, hiçbirinde filigran olmaksızın konuşmacı etiketleri taşır ve tüm dışa aktarma biçimleri, aralarında 30 ücretsiz dakikanın da bulunduğu her planla birlikte gelir. SRT’deki zaman damgaları, altyazı ve alıntı yapmak için doğru ayrıntı düzeyi olan, ifade düzeyinde (konuşmacı sırası başına bir giriş) bulunur; Kodda işlemek için kelime düzeyinde bir yapıya ihtiyacınız varsa, JSON size her dönüş için milisaniye cinsinden başlangıç ve bitiş zamanını verir.
Diller
Hushscript yaklaşık 99 dili metne dönüştürür, otomatik olarak algılanır, elle ayarlanmaz. Doğruluk, dört İngilizce çeşidi (Global, İngiliz, Avustralya, ABD), İspanyolca, Fransızca, Almanca, Japonca, Mandarin, Hintçe ve Arapça dahil olmak üzere 18’de en güçlüsüdür. Listenin tamamı diller sayfasındadır.
Aynı dilde bir transkript ile çevrilmiş bir transkript arasında karar veriyorsanız, “sesi metne çevirme” kılavuzu farkı açıklar.
İşin tamamı bu kadar (bırak, kopyala, dışa aktar) ve başladığınız format ne olursa olsun aynı şekilde okunur. Biçime özel notlar için kardeş kılavuzlar en yaygın durumları kapsar: MP3, WAV ve M4A / Apple Voice Memo. sesten metne dönüştürme sayfası tüm özelliklere genel bir bakış sunar ve her format oraya aynı şekilde ulaşır: dosyanızı bırakmanız yeterlidir.
Bağımsız kaynaklar ve standartlar
Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.
Kaynakların incelenme tarihi: