Ana içeriğe geç

Konuşmacı ayrıştırma: Etiketler nasıl oluşturulur?

Yazar: Yayınlandı: Son inceleme:

konuşmacı ayrıştırma, bir kaydı “kim ne zaman konuştu?” sorusunu yanıtlayarak konuşmacıya göre bölümlere ayıran otomatik bir işlemdir. Herhangi bir insan metni okumadan önce. Mevcut ACL Antolojisindeki konuşmacı ayrıştırma araştırması, çok taraflı görüşmeler için aynı görevi açıklamaktadır. Bu, kelimelerden oluşan bir duvar ile yapılandırılmış bir konuşma arasındaki farktır ve iki kişilik bir röportajın transkriptinin uzun bir paragraf yerine okunabilir bir diyalog olarak geri dönmesinin nedeni budur.

Basit bir ifadeyle: bir kayıt yüklersiniz, ayrıştırma motoru sesin değiştiği noktaları bulur, aynı kişiye benzeyen bölümleri gruplandırır ve bir komut dosyası gibi okunan bir metni size geri verir: her turda bir satır, sesle etiketlenmiş. Bu gönderide bunun nasıl çalıştığı, ayrıştırmanın neden bir sesi tanımakla aynı şey olmadığı ve genel etiketlerin gerçek adlara nasıl dönüştürüleceği açıklanmaktadır.

konuşmacı ayrıştırma tutma, sade bir dille

90 dakikalık bir röportajın elle yazıya döküldüğü resim. Konuşmayı metne dönüştürdükten sonra yapacağınız bir sonraki şey, ses her değiştiğinde ileri geri atıfları eklemektir: “Görüşmeci:”, “Konu:”. Belirli bir anda kimin konuştuğuna karar veren bu ilişkilendirme çalışması, ayrıştırmanın sizin için yaptığının tam olarak aynısıdır.

Çıktı, diyalog biçiminde bir transkripsiyondur:

Konuşmacı A [00:00:12]: Anlaşılması gereken ilk şey, verilerin yalnızca bir an için var olduğudur.
Konuşmacı B [00:00:27]: Evet, çoğu insanın çok geç olana kadar farkına varmadığı kısım da bu.
Konuşmacı A [00:00:34]: Kesinlikle. Yani asıl soru o pencerede ne yaptığınızdır.

Her ifade bir konuşmacıya ve bir zaman damgasına bağlıdır. Daha sonra Konuşmacı A ve Konuşmacı B’yi gerçek adlarla yeniden adlandırabilirsiniz; Konuşmacı başına bir düzenleme yapılır ve etiket göründüğü her yerde güncellenir.

Günlük içermeyen düz bir transkript olan alternatif, kimin ne söylediğini anlamak için sesi tekrar çalmanız gereken sürekli bir metin bloğudur. İki veya daha fazla sesin olduğu, birkaç dakikayı geçen herhangi bir şey için, bu gerçek bir manuel çalışmadır ve ayrıştırma geçişinin kaldırdığı çalışmadır.

Başlamadan önce ihtiyacınız olan şey

Yapılacak ayar veya yüklenecek hiçbir şey yoktur. ayrıştırma, kaydın kendisi üzerinde çalışır, bu nedenle tek gerçek ön koşul, konuşmacıların oldukça farklı olduğu sestir:

İşte bu kadar. Mikrofon kaydı yok, ses örneği yok, konuşmacı başına kurulum yok.

Otomatik konuşmacı tanımlama nasıl çalışır?

ayrıştırma birkaç farklı aşamaya ayrılır. Bunları bilmek, çıktının okunmasını ve bir sorun olduğunda düzeltilmesini kolaylaştırır.

Özellik çıkarma. Ses, her biri genellikle 10 ila 40 milisaniye olan kısa karelere bölünür ve motor, her karedeki akustik özellikleri ölçer. Konuşmacıları birbirinden ayırmak için önemli olan özellikler frekans alanında bulunur: bir kişinin sesinde tutarlı kalma ve insanlar arasında farklılık gösterme eğiliminde olan perde, formantlar ve spektral modeller.

Segmentasyon. Motor, konuşmacı değişim noktalarını, yani ses özelliklerinin değiştiği anları arar. Bu işin zor kısmı. Birisi sözünü kestiğinde değişiklik cümlenin ortasında gerçekleşebilir ve gürültü ya da örtüşen konuşma gerçek bir sınırı gizleyebilir ya da yanlış bir sınır icat edebilir.

Kümeleme. Aynı sese benzeyen bölümler birlikte gruplandırılır. Motora odada kaç kişi olduğu söylenmiyor; konuşmacı sayısını sesten çıkarır. Sayımı önceden biliyorsanız bazı kurulumlar bunu sağlamanıza izin verir; değilse, motor bunu tahmin eder ve “bir kişiyi ikiye bölme” ve “iki kişiyi birde birleştirme” hatalarının çoğu buradan kaynaklanır.

Etiketleme. Her küme bir etiket alır:Konuşmacı A,Konuşmacı B,Konuşmacı C veya Konuşmacı 0,Konuşmacı 1. Etiketler keyfi yer tutuculardır. Bunların arkasında bir kimlik yoktur, yalnızca tüm kayıt boyunca tek bir ses için sabit bir tutamaç vardır.

Tüm ardışık düzen, transkripsiyonun yanı sıra otomatik bir geçiş olarak çalışır, bu nedenle ayrı bir konuşmacı etiketleme işi yürütmezsiniz.

ayrıştırma ve ses tanıma

Bu ikisi sürekli olarak birleştirilir, ancak yanıtları farklı olur sorular.

ayrıştırma şunu sorar: bu dosyadaki diğer seslere göre şu anda kim konuşuyor? Sesleri ayırır ancak kime ait oldukları hakkında hiçbir fikri yoktur. Hiçbir ön bilgiye ihtiyaç duymaz ve iş bittikten sonra herhangi bir ses kaydı tutmaz.

Konuşmacı tanımlama olarak da adlandırılan ses tanıma şunu sorar: bu, bilinen bir referans kaydındaki kişiyle aynı mı? Karşılaştırma yapmak için kayıtlı bir ses örneğine ihtiyacı vardır ve bu, “kimliğinizi sesle doğrulama” sistemlerinin arkasındaki teknolojidir.

Hushscript şunu kullanır: ayrıştırma, ses tanıma değil. Kayıtlı seslerden oluşan bir veri tabanı yoktur ve kaydınız hiçbir zaman başkalarınınkiyle karşılaştırılmaz. Konuşmacı etiketleri yalnızca o tek dosyanın içindeki ses özelliklerinden türetilir.

Günlüğün sizin adınıza kişileri adlandıramamasının nedeni bu ayrımdır. Kendinden emin bir şekilde “aynı kişinin saatteki bu 200 dönüşü konuştuğunu” söyleyebilir, ancak bu kişinin kim olduğunu söyleyemez. Bu adım size aittir ve konuşmacı başına bir tıklama gerekir. Hushscript’in çok konuşmacılı kayıtları uçtan uca nasıl yönettiğine daha derinlemesine bakmak istiyorsanız konuşmacı tanımlama sayfasında bu konuyu ele alıyoruz.

Çalışılmış bir örnek: üç kişilik bir toplantı

Diyelim ki bir odada üç kişiyle, tek bir dizüstü bilgisayar mikrofonunu paylaşarak 40 dakikalık bir proje toplantısı kaydettiniz ve şu şekilde kaydettiniz: tek bir .m4a dosyası. Bırakıyorsunuz ve transkripsiyondan sonra çıktı şu şekilde oluyor:

Konuşmacı A [00:00:04]: Peki lansman tarihiyle başlayalım. Neredeyiz?
Konuşmacı B [00:00:09]: Tasarım tamamlandı. Son ekranları Pazartesi günü teslim ettik.
Konuşmacı C [00:00:14]: Mühendisliğin ödeme akışı için yaklaşık iki haftaya daha ihtiyacı var.
Konuşmacı A [00:00:21]: İki hafta, pazarlamaya söz verdiğimiz tarihin ötesine geçiyor.
Konuşmacı B [00:00:27]: Yeni ödeme akışı ve takip olmadan gönderim yapabilir miyiz?
Konuşmacı C [00:00:33]: Temiz değil. Yeni fiyatlandırmada eski akış bozuluyor.

Her fırsatta zaman damgalarıyla birlikte ayrılmış ve etiketlenmiş üç ses. Şimdi yeniden etiketleyin:Konuşmacı A“Priya” olur (toplantıyı yönetiyor),Konuşmacı B“Tom” olur,Konuşmacı C“Dana” olur. Üç tıklamanın ardından her satır gerçek bir ad taşır ve konuşma metni, baştan sona doğru ilişkilendirmeyle toplantı notlarına yapıştırılmaya hazır hale gelir.

Aynı şekil iki kişilik bir röportaj, dört kişilik bir podcast veya iki taraflı bir telefon görüşmesi için de geçerlidir: motor duyduğunu ayırır ve siz adları yazarsınız.

Hushscript’te konuşmacıları yeniden etiketleme

Etiketler bilerek genelleştirilmiş olarak geliyor; bunlara ad vermek hızlı bir düzenleme adımıdır. Oraya varmadan önceki akış şu şekildedir: dosyanızı bırakın ve herhangi bir hesaba ihtiyaç duymadan 30 saniyelik konuşmacı etiketli bir önizleme oluşturulur, geri kalanını yazıya geçirmek için kaydolun ve ardından bitmiş transkripti açın. Buradan:

  1. Transkript düzenleyicide Konuşmacı B gibi herhangi bir konuşmacı etiketini tıklayın.
  2. “Tom” gibi gerçek adı yazın.
  3. Bu konuşmacının her örneği, ilk satırdan son satıra kadar aynı anda güncellenir.

Yeniden adlandırma genel olduğundan, aynı etiketi asla iki kez düzenlemezsiniz. İki konuşmacıyla yapılan 90 dakikalık bir röportaj için, tam bir yeniden etiketleme geçişi bir dakikadan az sürer ve sonunda her satırı doğru bir şekilde belirten alıntıya hazır bir transkript elde edersiniz. Daha sonra bunu, yerleşik adlarla birlikte TXT, SRT, DOCX, PDF ve JSON gibi 21 formatın yanı sıra şifre korumalı bir .husharchive biçiminde dışa aktarabilirsiniz.

Genel ayrıştırma sorunlarını giderme

ayrıştırma, temiz kayıtlarda güvenilirdir ve ses karmaşıklaştıkça zorlaşır. Yaygın sorunlar ve bunlar hakkında ne yapılması gerektiği:

Çakışan konuşma. İki kişi aynı anda konuştuğunda, motorun tek bir konuşmacıya örtüşen ses ataması gerekir ve geçişin yanlış etiketlenmesine veya birkaç kelimenin atlanmasına neden olabilir. Yazılımda düzeltme yoktur; ses gerçekten aynı anda iki ses içeriyor. Önleme kaldıraçtır: İnsanların sırayla günlük tuttuğu bir kayıt, kesintilerle dolu bir kayıttan çok daha temiz bir şekilde günlük tutar. Çakışmaların meydana geldiği durumlarda, sese karşı yapılan hızlı bir okuma, etkilenen bir avuç satırı yakalar.

Benzer seslere sahip sesler. Yakın ses perdesi ve aksanı olan iki konuşmacıyı (örneğin, benzer yaştaki iki erkek veya kardeş) birbirinden ayırmak zıt bir çiftten daha zordur çünkü ses özellikleri gerçekten örtüşmektedir. Motor bazen aralarında bir dönüş değiştirebilir. Atanan konuşmacı için tuhaf okunan satırlar için transkripti tarayın; elle yeniden atananlar bunlardır.

Bir kişi iki etikete ayrılır. Birinin sesi kaydın ortasında değişirse (mikrofona yaklaşırsa, kulaklıktan hoparlöre geçerse veya bağlantı bozulursa), motor ikinci yarıyı yeni bir ses olarak okuyabilir ve fazladan bir etiket oluşturabilir. Her ikisini de aynı adla yeniden etiketleyerek ikisini birleştirin; kopyalar tek bir konuşmacıda toplanır.

İki kişi tek bir etikette birleştirildi. İki sessiz veya uzak ses, motorun ayrılamayacağı kadar birbirine benzediğinde bunun tersi olur. Bunu onarmak en zor olanıdır, bu yüzden önlemeye değer: mikrofonu konuşmacılara yaklaştırın ve büyük bir odanın diğer ucundan kayıt yapmaktan kaçının.

Uzak alan veya gürültülü ses. Konferans masasının sonundaki bir dizüstü bilgisayar mikrofonu, grup sohbeti sırasında masanın üzerinde bir telefon veya ağır bir oda, sesler arasındaki sınırları bulanıklaştırır. Mikrofonun daha yakın yerleştirilmesi her konuşmacıya yardımcı olur ve arka plan gürültüsünün (fanlar, trafik, müzik) azaltılması ayrımı keskinleştirir. Günlüğe kaydetme kalitesi ses kalitesini yakından takip eder.

Telefon çağrıları iki ayrı dosya olarak kaydedilir. Kaydediciniz bir çağrının her iki tarafını da kendi mono dosyası olarak kaydettiyse, her iki dosyada da ayrıştırma yalnızca tek bir ses görür. Öncelikle ikisini tek bir karışık kayıtta birleştirin, böylece her iki ses de tek bir dosyada mevcut olsun, sonra bunu yazıya dökün.

İbreyi gerçekten hareket ettiren doğruluk ipuçları

Birkaç alışkanlık, ayrıştırmayı fark edilir derecede daha iyi hale getirir ve bunların çoğu yazılımla değil kayıtla ilgilidir:

Bunların hiçbirinin mükemmel olması gerekmez. Net dönüşler ve makul bir mikrofon konumu, kayıtların çoğunun temiz plak şirketlerine yapılmasını sağlar ve editör gerisini halleder.

Röportajlar ve toplantılar neden önemlidir?

ayrıştırma olmadan, çok kişili bir görüşmenin metni, en yaygın işleri için neredeyse kullanılamaz hale gelir:

ayrıştırmayla bunların her biri basittir ve transkript ham metin yerine belge haline gelir. İster gazetecilik, ister araştırma, ister podcast programı notları olsun, yayınlanacak veya alıntı yapılacak herhangi bir şey için, doğru atıf yapmak isteğe bağlı değildir ve bunu sesten yeniden oluşturmak yerine transkriptten almak, zamandan tasarruf edilen yerdir. Toplantı notları, röportaj araştırması veya İK kayıtları gibi dahili çalışmalar için etiketli yapı da aynı derecede değerlidir: bir diyaloğu taramak, bir metin duvarını okumaktan çok daha hızlıdır.

Bağlamda tam bir açıklama için gazetecilik ve araştırma için kayıt, transkripsiyon ve yeniden etiketlemeyi kapsayan bir röportajın nasıl yazıya geçirileceği ve nasıl yapıldığına bakın bir bölüm boyunca sunucuları ve konukları etiketlemek için bir podcast’i metne dönüştürmek.

Konuşmacı etiketleri her Hushscript transkriptinde ücretsizdir

konuşmacı ayrıştırma, her Hushscript transkriptinde hiçbir ekstra ücret ödemeden bulunur. ayrıştırma eklentisi yoktur, bunun için ayrı bir plan katmanı yoktur ve bir kaydın kaç konuşmacıya sahip olabileceğine ilişkin bir sınır yoktur. Hushscript’in kendisi abonelik gerektirmeden kullandıkça öde yöntemidir. Denemek için 30 ücretsiz dakikanız var ve yalnızca bundan sonra kullandığınız dakikalar için ödeme yaparsınız; ayrıntılar için fiyatlandırma sayfasına bakın.

Konuşmacı ayrımı ücretsiz olarak sunulur, çünkü o olmadan bir konuşmanın transkripti yalnızca transkriptin yarısı kadar kalır: kimin söylediği hakkında hiçbir fikri olmayan okunabilir metin. Bir kaydı bırakın, etiketleri otomatik olarak alın, tek tıklamayla yeniden adlandırın ve sonucu dışa aktarın. Tüm bunların birbirine nasıl uyduğuyla ilgili daha fazla bilgiyi sesten metne sayfasında bulabilirsiniz.

Bağımsız kaynaklar ve standartlar

Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.

Kaynakların incelenme tarihi:

Sıkça sorulan sorular

konuşmacı ayrıştırma nedir?

konuşmacı ayrıştırma, bir ses kaydını farklı konuşmacılara karşılık gelen parçalara ayırma işlemidir. Sonuçta, farklılaşmamış tek bir metin bloğu yerine, her satırın onu söyleyen konuşmacıya atfedildiği ('Konuşmacı A şunu söyledi, Konuşmacı B şunu söyledi') bir transkripsiyon ortaya çıktı. 'Kim ne zaman konuştu?' sorusunu yanıtlıyor. kimse konuşma metnini okumadan önce otomatik olarak.

konuşmacı ayrıştırma tutma ses tanımayla aynı mıdır?

Hayır. ayrıştırma, bir kayıttaki sesleri ayırır ve size bu bölümleri aynı kişinin söylediğini söyler ancak bu kişinin kim olduğunu bilmez. Ses tanıma (konuşmacı tanımlama), bir sesi bilinen bir referans örneğiyle karşılaştırarak ona bir ad verir. ayrıştırmanin referansa ihtiyacı yoktur ve ses profili oluşturmaz; bu nedenle konuşmacıları adları yerine 'Konuşmacı A' ve 'Konuşmacı B' olarak etiketler.

ayrıştırma kaç konuşmacıyı işleyebilir?

Hushscript'in konuşmacı sayısında ücretli bir üst sınırı yoktur, ancak ayrıştırmanin eşit derecede doğru kalacağı evrensel bir sayı yoktur. Örtüşme, benzer ses veren sesler, mikrofon mesafesi ve oda gürültüsü önemlidir. Temiz bir panel, gürültülü iki kişilik bir aramadan daha iyi ayırabilir; bu nedenle, ilişkilendirme önemli olduğunda etiketleri gözden geçirin.

Transkript neden bir kişiyi iki konuşmacıya böldü?

Genellikle bu kişinin ses biçiminde büyük bir değişiklik oldu: mikrofona yaklaştı veya uzaklaştı, kulaklıktan hoparlöre geçti veya hat kalitesi değişti. Motor, sesleri özelliklerine göre kümeler, dolayısıyla bu özelliklerde büyük bir değişiklik yeni bir ses olarak okunabilir. Düzenleyicide iki etiketi birleştirmek sorunu tek geçişte düzeltir.

ayrıştırma bana konuşmacının kim olduğunu ismine göre söyleyebilir mi?

Hayır. Günlüğe kaydetme, konuşmacıları ayırır ancak adlarına göre tanımlamaz. Bunları 'Konuşmacı A', 'Konuşmacı B' vb. olarak etiketler. Transkript oluşturulduktan sonra düzenleyicide gerçek adları kendiniz atarsınız ve her yeniden adlandırma, konuşmacının söylediği her satıra uygulanır.

konuşmacı ayrıştırma tutma, telefon görüşmesi kayıtlarında çalışır mı?

Evet, görüşmenin her iki tarafı da kaydedildiğinde. Kayıt, her iki sesin de yer aldığı tek bir karışık parçaysa, ayrıştırma bunları diğer iki konuşmacılı dosyalar gibi ayırır. Her iki taraf da kendi ayrı mono dosyası olarak kaydedilmişse, her iki sesin de aynı kayıtta yer alması için önce bunları tek bir miksajda birleştirin.

konuşmacı ayrıştırma, her Hushscript transkriptine dahil mi?

Evet. Her transkript, hiçbir ekstra ücret ödemeden, ayrı bir eklenti olmadan ve onlar için daha yüksek bir katman gerekmeden konuşmacı etiketlerini içerir. Transkripsiyondan sonra tek tıklamayla etiketleri gerçek adlarla yeniden adlandırabilirsiniz ve yeni ad, tüm transkript boyunca güncellenir.

30 ücretsiz dakikayla başlayın

Başlayın – 30 ücretsiz dakika