Konuşmacı ayrımı nasıl çalışır — ve nerede şaşar
Bir kaydı kimin konuştuğuna göre bölmek, ne söylendiğini yazmaktan başka bir iş. Model aslında neyi dinliyor?
Model aslında neyi dinliyor
Transkripsiyon modeli sesi kelimeye çevirir. Konuşmacı ayrımı başka bir soruyu yanıtlar: hangi anda kim konuşuyordu. Sistem sesi kısa parçalara böler, her parçayı sesin sayısal bir parmak izine dönüştürür ve birbirine benzeyen parmak izlerini gruplar. Her grup bir konuşmacı etiketi olur. Bu sürecin hiçbir yerinde kimsenin adı bilinmez — yalnızca şu sesin bu ses olmadığı bilinir.
Nerede şaşar
Hataların çoğu üç durumdan çıkar.
- Üst üste konuşma. İki kişi aynı anda konuştuğunda parça iki ses taşır ve hangisine daha çok benziyorsa o gruba düşer.
- Kısa sıralar. Tek kelimelik bir "evet" modele parmak izi çıkaracak kadar malzeme vermez; en çok yanlış etiketlenen şey kısa araya girmelerdir.
- Benzeyen sesler. Aynı yaşta, aynı cinsiyette, aynı aksanla konuşan ve aynı mikrofondan kaydedilen iki kişi tek bir etikete çökebilir.
Kayıt koşulları modelden daha belirleyicidir. Yankılı bir odada tek dizüstü mikrofonuyla alınan toplantı, aynı toplantının herkesin kendi kanalından kaydedilmiş hâlinden çok daha zor bir iştir.
Ne yapmalı
Etiketleri sonradan düzeltmek, kayıtla boğuşmaktan hızlıdır. WhoScribe'da bir konuşmacıyı bir kez yeniden adlandırırsınız, bütün satırlar yeni adı taşır.
İlk dakikayı dikkatle okuyun. Etiketler en çok selamlaşma ve tanışma bölümünde karışır; orayı erken düzeltmek transkriptin geri kalanının doğru okunması demektir.
Odada kaç kişi olduğunu biliyorsanız söyleyin. Üç ses olduğu söylenmiş bir model, arka plan gürültüsünden dördüncüsünü uydurmaz.
Blog
Kendi kaydınızı yazıya dökün
Dosyanızı yükleyin, transkripti dakikalar içinde okuyun — kayıt gerekmez.