Konuşmacı ayrıştırma: Etiketler nasıl oluşturulur?
Yazar: Hushscript Yayınlandı: Son inceleme:
konuşmacı ayrıştırma, bir kaydı “kim ne zaman konuştu?” sorusunu yanıtlayarak konuşmacıya göre bölümlere ayıran otomatik bir işlemdir. Herhangi bir insan metni okumadan önce. Mevcut ACL Antolojisindeki konuşmacı ayrıştırma araştırması, çok taraflı görüşmeler için aynı görevi açıklamaktadır. Bu, kelimelerden oluşan bir duvar ile yapılandırılmış bir konuşma arasındaki farktır ve iki kişilik bir röportajın transkriptinin uzun bir paragraf yerine okunabilir bir diyalog olarak geri dönmesinin nedeni budur.
Basit bir ifadeyle: bir kayıt yüklersiniz, ayrıştırma motoru sesin değiştiği noktaları bulur, aynı kişiye benzeyen bölümleri gruplandırır ve bir komut dosyası gibi okunan bir metni size geri verir: her turda bir satır, sesle etiketlenmiş. Bu gönderide bunun nasıl çalıştığı, ayrıştırmanın neden bir sesi tanımakla aynı şey olmadığı ve genel etiketlerin gerçek adlara nasıl dönüştürüleceği açıklanmaktadır.
konuşmacı ayrıştırma tutma, sade bir dille
90 dakikalık bir röportajın elle yazıya döküldüğü resim. Konuşmayı metne dönüştürdükten sonra yapacağınız bir sonraki şey, ses her değiştiğinde ileri geri atıfları eklemektir: “Görüşmeci:”, “Konu:”. Belirli bir anda kimin konuştuğuna karar veren bu ilişkilendirme çalışması, ayrıştırmanın sizin için yaptığının tam olarak aynısıdır.
Çıktı, diyalog biçiminde bir transkripsiyondur:
Konuşmacı A [00:00:12]: Anlaşılması gereken ilk şey, verilerin yalnızca bir an için var olduğudur.
Konuşmacı B [00:00:27]: Evet, çoğu insanın çok geç olana kadar farkına varmadığı kısım da bu.
Konuşmacı A [00:00:34]: Kesinlikle. Yani asıl soru o pencerede ne yaptığınızdır.
Her ifade bir konuşmacıya ve bir zaman damgasına bağlıdır. Daha sonra Konuşmacı A ve Konuşmacı B’yi gerçek adlarla yeniden adlandırabilirsiniz; Konuşmacı başına bir düzenleme yapılır ve etiket göründüğü her yerde güncellenir.
Günlük içermeyen düz bir transkript olan alternatif, kimin ne söylediğini anlamak için sesi tekrar çalmanız gereken sürekli bir metin bloğudur. İki veya daha fazla sesin olduğu, birkaç dakikayı geçen herhangi bir şey için, bu gerçek bir manuel çalışmadır ve ayrıştırma geçişinin kaldırdığı çalışmadır.
Başlamadan önce ihtiyacınız olan şey
Yapılacak ayar veya yüklenecek hiçbir şey yoktur. ayrıştırma, kaydın kendisi üzerinde çalışır, bu nedenle tek gerçek ön koşul, konuşmacıların oldukça farklı olduğu sestir:
- Her sesin içinde bulunduğu tek bir kayıt. ayrıştırma tek bir dosyada çalışır, bu nedenle tüm konuşmacıların bu dosyada bulunması gerekir. Herkesin bir oda mikrofonunu paylaştığı bir yuvarlak masa çalışması; iki kişi her birini kendi ayrı cihazına kaydedip, iki ayrı dosya olarak kaydetmez. Öncelikle bunları tek bir mikste birleştirin.
- Yeterince net ses. Stüdyo kalitesinde olması gerekmez. Sınırlı çapraz konuşma ve arka plan gürültüsüyle, her kişinin zorlanmadan duyulabilmesi gerekir. Sesler arasındaki ayrım ne kadar net olursa, etiketler de o kadar temiz olur.
- Kaç kişinin konuştuğuna dair kabaca bir fikir. Bunu sağlamanıza gerek yoktur, ancak bunu bilmek sonucun doğruluğunu kontrol etmenize yardımcı olur: Üç kişiyi kaydettiyseniz ve transkripsiyonda altı konuşmacı görünüyorsa nereye bakmanız gerektiğini bilirsiniz.
İşte bu kadar. Mikrofon kaydı yok, ses örneği yok, konuşmacı başına kurulum yok.
Otomatik konuşmacı tanımlama nasıl çalışır?
ayrıştırma birkaç farklı aşamaya ayrılır. Bunları bilmek, çıktının okunmasını ve bir sorun olduğunda düzeltilmesini kolaylaştırır.
Özellik çıkarma. Ses, her biri genellikle 10 ila 40 milisaniye olan kısa karelere bölünür ve motor, her karedeki akustik özellikleri ölçer. Konuşmacıları birbirinden ayırmak için önemli olan özellikler frekans alanında bulunur: bir kişinin sesinde tutarlı kalma ve insanlar arasında farklılık gösterme eğiliminde olan perde, formantlar ve spektral modeller.
Segmentasyon. Motor, konuşmacı değişim noktalarını, yani ses özelliklerinin değiştiği anları arar. Bu işin zor kısmı. Birisi sözünü kestiğinde değişiklik cümlenin ortasında gerçekleşebilir ve gürültü ya da örtüşen konuşma gerçek bir sınırı gizleyebilir ya da yanlış bir sınır icat edebilir.
Kümeleme. Aynı sese benzeyen bölümler birlikte gruplandırılır. Motora odada kaç kişi olduğu söylenmiyor; konuşmacı sayısını sesten çıkarır. Sayımı önceden biliyorsanız bazı kurulumlar bunu sağlamanıza izin verir; değilse, motor bunu tahmin eder ve “bir kişiyi ikiye bölme” ve “iki kişiyi birde birleştirme” hatalarının çoğu buradan kaynaklanır.
Etiketleme. Her küme bir etiket alır:Konuşmacı A,Konuşmacı B,Konuşmacı C veya Konuşmacı 0,Konuşmacı 1. Etiketler keyfi yer tutuculardır. Bunların arkasında bir kimlik yoktur, yalnızca tüm kayıt boyunca tek bir ses için sabit bir tutamaç vardır.
Tüm ardışık düzen, transkripsiyonun yanı sıra otomatik bir geçiş olarak çalışır, bu nedenle ayrı bir konuşmacı etiketleme işi yürütmezsiniz.
ayrıştırma ve ses tanıma
Bu ikisi sürekli olarak birleştirilir, ancak yanıtları farklı olur sorular.
ayrıştırma şunu sorar: bu dosyadaki diğer seslere göre şu anda kim konuşuyor? Sesleri ayırır ancak kime ait oldukları hakkında hiçbir fikri yoktur. Hiçbir ön bilgiye ihtiyaç duymaz ve iş bittikten sonra herhangi bir ses kaydı tutmaz.
Konuşmacı tanımlama olarak da adlandırılan ses tanıma şunu sorar: bu, bilinen bir referans kaydındaki kişiyle aynı mı? Karşılaştırma yapmak için kayıtlı bir ses örneğine ihtiyacı vardır ve bu, “kimliğinizi sesle doğrulama” sistemlerinin arkasındaki teknolojidir.
Hushscript şunu kullanır: ayrıştırma, ses tanıma değil. Kayıtlı seslerden oluşan bir veri tabanı yoktur ve kaydınız hiçbir zaman başkalarınınkiyle karşılaştırılmaz. Konuşmacı etiketleri yalnızca o tek dosyanın içindeki ses özelliklerinden türetilir.
Günlüğün sizin adınıza kişileri adlandıramamasının nedeni bu ayrımdır. Kendinden emin bir şekilde “aynı kişinin saatteki bu 200 dönüşü konuştuğunu” söyleyebilir, ancak bu kişinin kim olduğunu söyleyemez. Bu adım size aittir ve konuşmacı başına bir tıklama gerekir. Hushscript’in çok konuşmacılı kayıtları uçtan uca nasıl yönettiğine daha derinlemesine bakmak istiyorsanız konuşmacı tanımlama sayfasında bu konuyu ele alıyoruz.
Çalışılmış bir örnek: üç kişilik bir toplantı
Diyelim ki bir odada üç kişiyle, tek bir dizüstü bilgisayar mikrofonunu paylaşarak 40 dakikalık bir proje toplantısı kaydettiniz ve şu şekilde kaydettiniz: tek bir .m4a dosyası. Bırakıyorsunuz ve transkripsiyondan sonra çıktı şu şekilde oluyor:
Konuşmacı A [00:00:04]: Peki lansman tarihiyle başlayalım. Neredeyiz?
Konuşmacı B [00:00:09]: Tasarım tamamlandı. Son ekranları Pazartesi günü teslim ettik.
Konuşmacı C [00:00:14]: Mühendisliğin ödeme akışı için yaklaşık iki haftaya daha ihtiyacı var.
Konuşmacı A [00:00:21]: İki hafta, pazarlamaya söz verdiğimiz tarihin ötesine geçiyor.
Konuşmacı B [00:00:27]: Yeni ödeme akışı ve takip olmadan gönderim yapabilir miyiz?
Konuşmacı C [00:00:33]: Temiz değil. Yeni fiyatlandırmada eski akış bozuluyor.
Her fırsatta zaman damgalarıyla birlikte ayrılmış ve etiketlenmiş üç ses. Şimdi yeniden etiketleyin:Konuşmacı A“Priya” olur (toplantıyı yönetiyor),Konuşmacı B“Tom” olur,Konuşmacı C“Dana” olur. Üç tıklamanın ardından her satır gerçek bir ad taşır ve konuşma metni, baştan sona doğru ilişkilendirmeyle toplantı notlarına yapıştırılmaya hazır hale gelir.
Aynı şekil iki kişilik bir röportaj, dört kişilik bir podcast veya iki taraflı bir telefon görüşmesi için de geçerlidir: motor duyduğunu ayırır ve siz adları yazarsınız.
Hushscript’te konuşmacıları yeniden etiketleme
Etiketler bilerek genelleştirilmiş olarak geliyor; bunlara ad vermek hızlı bir düzenleme adımıdır. Oraya varmadan önceki akış şu şekildedir: dosyanızı bırakın ve herhangi bir hesaba ihtiyaç duymadan 30 saniyelik konuşmacı etiketli bir önizleme oluşturulur, geri kalanını yazıya geçirmek için kaydolun ve ardından bitmiş transkripti açın. Buradan:
- Transkript düzenleyicide
Konuşmacı Bgibi herhangi bir konuşmacı etiketini tıklayın. - “Tom” gibi gerçek adı yazın.
- Bu konuşmacının her örneği, ilk satırdan son satıra kadar aynı anda güncellenir.
Yeniden adlandırma genel olduğundan, aynı etiketi asla iki kez düzenlemezsiniz. İki konuşmacıyla yapılan 90 dakikalık bir röportaj için, tam bir yeniden etiketleme geçişi bir dakikadan az sürer ve sonunda her satırı doğru bir şekilde belirten alıntıya hazır bir transkript elde edersiniz. Daha sonra bunu, yerleşik adlarla birlikte TXT, SRT, DOCX, PDF ve JSON gibi 21 formatın yanı sıra şifre korumalı bir .husharchive biçiminde dışa aktarabilirsiniz.
Genel ayrıştırma sorunlarını giderme
ayrıştırma, temiz kayıtlarda güvenilirdir ve ses karmaşıklaştıkça zorlaşır. Yaygın sorunlar ve bunlar hakkında ne yapılması gerektiği:
Çakışan konuşma. İki kişi aynı anda konuştuğunda, motorun tek bir konuşmacıya örtüşen ses ataması gerekir ve geçişin yanlış etiketlenmesine veya birkaç kelimenin atlanmasına neden olabilir. Yazılımda düzeltme yoktur; ses gerçekten aynı anda iki ses içeriyor. Önleme kaldıraçtır: İnsanların sırayla günlük tuttuğu bir kayıt, kesintilerle dolu bir kayıttan çok daha temiz bir şekilde günlük tutar. Çakışmaların meydana geldiği durumlarda, sese karşı yapılan hızlı bir okuma, etkilenen bir avuç satırı yakalar.
Benzer seslere sahip sesler. Yakın ses perdesi ve aksanı olan iki konuşmacıyı (örneğin, benzer yaştaki iki erkek veya kardeş) birbirinden ayırmak zıt bir çiftten daha zordur çünkü ses özellikleri gerçekten örtüşmektedir. Motor bazen aralarında bir dönüş değiştirebilir. Atanan konuşmacı için tuhaf okunan satırlar için transkripti tarayın; elle yeniden atananlar bunlardır.
Bir kişi iki etikete ayrılır. Birinin sesi kaydın ortasında değişirse (mikrofona yaklaşırsa, kulaklıktan hoparlöre geçerse veya bağlantı bozulursa), motor ikinci yarıyı yeni bir ses olarak okuyabilir ve fazladan bir etiket oluşturabilir. Her ikisini de aynı adla yeniden etiketleyerek ikisini birleştirin; kopyalar tek bir konuşmacıda toplanır.
İki kişi tek bir etikette birleştirildi. İki sessiz veya uzak ses, motorun ayrılamayacağı kadar birbirine benzediğinde bunun tersi olur. Bunu onarmak en zor olanıdır, bu yüzden önlemeye değer: mikrofonu konuşmacılara yaklaştırın ve büyük bir odanın diğer ucundan kayıt yapmaktan kaçının.
Uzak alan veya gürültülü ses. Konferans masasının sonundaki bir dizüstü bilgisayar mikrofonu, grup sohbeti sırasında masanın üzerinde bir telefon veya ağır bir oda, sesler arasındaki sınırları bulanıklaştırır. Mikrofonun daha yakın yerleştirilmesi her konuşmacıya yardımcı olur ve arka plan gürültüsünün (fanlar, trafik, müzik) azaltılması ayrımı keskinleştirir. Günlüğe kaydetme kalitesi ses kalitesini yakından takip eder.
Telefon çağrıları iki ayrı dosya olarak kaydedilir. Kaydediciniz bir çağrının her iki tarafını da kendi mono dosyası olarak kaydettiyse, her iki dosyada da ayrıştırma yalnızca tek bir ses görür. Öncelikle ikisini tek bir karışık kayıtta birleştirin, böylece her iki ses de tek bir dosyada mevcut olsun, sonra bunu yazıya dökün.
İbreyi gerçekten hareket ettiren doğruluk ipuçları
Birkaç alışkanlık, ayrıştırmayı fark edilir derecede daha iyi hale getirir ve bunların çoğu yazılımla değil kayıtla ilgilidir:
- Kullanıcıların sırayla konuşmasına izin verin. Çapraz konuşma ayrıştırma hatalarının en büyük kaynağıdır. Denetlenen bir tartışma, herkese açık bir tartışmadan üstündür.
- Mikrofonu yaklaştırın. Uzaklık ve oda yankısı, sesleri birbirine karıştırır. Kişi başına yakın bir mikrofon idealdir; masanın ortasındaki ortak mikrofon, köşedeki mikrofona üstün gelir.
- Arka plandaki bariz gürültüyü kesin. Müzik, koşan bir vantilatör veya kalabalık bir kafe, hepsi seslerle rekabet eder ve sınırları bulanıklaştırır.
- Her sesi metne dönüştürdüğünüz dosyaya koyun. ayrıştırma, konuşmacıları tek bir kayıtta karşılaştırır. Kaydedici ayrı katılımcı parçaları oluşturduysa, ayrıştırma geçişinin tüm konuşmayı duyabilmesi için önce bunları karıştırın veya tek bir dosyada birleştirin.
Bunların hiçbirinin mükemmel olması gerekmez. Net dönüşler ve makul bir mikrofon konumu, kayıtların çoğunun temiz plak şirketlerine yapılmasını sağlar ve editör gerisini halleder.
Röportajlar ve toplantılar neden önemlidir?
ayrıştırma olmadan, çok kişili bir görüşmenin metni, en yaygın işleri için neredeyse kullanılamaz hale gelir:
- Doğrudan alıntılar. Siz Hangi satırların kendisine ait olduğunu bilmiyorsanız birinden alıntı yapamazsınız.
- Özet ilişkilendirme. Kimin ne söylediğini söylemeyen bir toplantı özeti, özet olmamasından biraz daha faydalıdır.
- Konuşmacıya göre arama. Bir kişinin söylediği bir şeyi arıyorsanız, tek bir farklılaşmamış bloku filtreleyemezsiniz. metin.
ayrıştırmayla bunların her biri basittir ve transkript ham metin yerine belge haline gelir. İster gazetecilik, ister araştırma, ister podcast programı notları olsun, yayınlanacak veya alıntı yapılacak herhangi bir şey için, doğru atıf yapmak isteğe bağlı değildir ve bunu sesten yeniden oluşturmak yerine transkriptten almak, zamandan tasarruf edilen yerdir. Toplantı notları, röportaj araştırması veya İK kayıtları gibi dahili çalışmalar için etiketli yapı da aynı derecede değerlidir: bir diyaloğu taramak, bir metin duvarını okumaktan çok daha hızlıdır.
Bağlamda tam bir açıklama için gazetecilik ve araştırma için kayıt, transkripsiyon ve yeniden etiketlemeyi kapsayan bir röportajın nasıl yazıya geçirileceği ve nasıl yapıldığına bakın bir bölüm boyunca sunucuları ve konukları etiketlemek için bir podcast’i metne dönüştürmek.
Konuşmacı etiketleri her Hushscript transkriptinde ücretsizdir
konuşmacı ayrıştırma, her Hushscript transkriptinde hiçbir ekstra ücret ödemeden bulunur. ayrıştırma eklentisi yoktur, bunun için ayrı bir plan katmanı yoktur ve bir kaydın kaç konuşmacıya sahip olabileceğine ilişkin bir sınır yoktur. Hushscript’in kendisi abonelik gerektirmeden kullandıkça öde yöntemidir. Denemek için 30 ücretsiz dakikanız var ve yalnızca bundan sonra kullandığınız dakikalar için ödeme yaparsınız; ayrıntılar için fiyatlandırma sayfasına bakın.
Konuşmacı ayrımı ücretsiz olarak sunulur, çünkü o olmadan bir konuşmanın transkripti yalnızca transkriptin yarısı kadar kalır: kimin söylediği hakkında hiçbir fikri olmayan okunabilir metin. Bir kaydı bırakın, etiketleri otomatik olarak alın, tek tıklamayla yeniden adlandırın ve sonucu dışa aktarın. Tüm bunların birbirine nasıl uyduğuyla ilgili daha fazla bilgiyi sesten metne sayfasında bulabilirsiniz.
Bağımsız kaynaklar ve standartlar
Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.
Kaynakların incelenme tarihi: