Wszystkie artykuły
AI mowy 2 min czytania

Jak działa rozpoznawanie mówców — i gdzie się myli

Podział nagrania według tego, kto mówi, to inne zadanie niż zapisanie, co zostało powiedziane. Oto czego model naprawdę słucha.

Czego model naprawdę słucha

Model transkrypcji zamienia dźwięk w słowa. Rozpoznawanie mówców odpowiada na inne pytanie: kto mówił w danym momencie. System tnie nagranie na krótkie fragmenty, zamienia każdy w liczbowy odcisk głosu i grupuje odciski podobne do siebie. Każda grupa staje się etykietą mówcy. W żadnym miejscu tego procesu nie pada niczyje imię — wiadomo tylko, że ten głos to nie tamten głos.

Gdzie się myli

Trzy sytuacje odpowiadają za większość błędów.

  • Nakładanie się. Gdy dwie osoby mówią naraz, fragment niesie dwa głosy i trafia do grupy, do której bardziej pasuje.
  • Krótkie wypowiedzi. Jednowyrazowe „tak” daje bardzo mało materiału na odcisk, a krótkie wtrącenia jako pierwsze dostają złą etykietę.
  • Podobne głosy. Dwie osoby w tym samym wieku, tej samej płci i z tym samym akcentem, nagrane przez ten sam mikrofon, mogą zlać się w jedną etykietę.

Warunki nagrania ważą więcej niż sam model. Spotkanie zarejestrowane jednym mikrofonem laptopa w pogłosowym pomieszczeniu jest znacznie trudniejsze niż to samo spotkanie nagrane z osobnym kanałem dla każdego uczestnika.

Co z tym zrobić

Poprawienie etykiet po fakcie jest szybsze niż walka z nagraniem. W WhoScribe zmieniasz nazwę mówcy raz, a wszystkie jego wiersze przyjmują nową nazwę.

Przeczytaj uważnie pierwszą minutę. To przy powitaniach i przedstawianiu się etykiety najczęściej się zamieniają, a wczesna poprawka sprawia, że reszta transkrypcji czyta się prawidłowo.

Jeśli wiesz, ile osób jest w pokoju, podaj tę liczbę. Model, któremu powiedziano o trzech głosach, nie wymyśli czwartego z szumu tła.

Blog

Zamień własne nagranie w tekst

Wgraj plik i przeczytaj transkrypcję w kilka minut — bez zakładania konta.

Transkrypcja pliku