Все статьи
Речевой ИИ 2 мин чтения

Как работает разделение говорящих — и где оно ошибается

Разделить запись по тому, кто говорит, — задача, отличная от того, чтобы записать, что было сказано. Вот что модель слушает на самом деле.

Что модель слушает на самом деле

Модель расшифровки превращает звук в слова. Разделение говорящих отвечает на другой вопрос: кто говорил в каждый момент. Система режет аудио на короткие отрезки, превращает каждый в числовой отпечаток голоса и объединяет похожие отпечатки. Каждая группа становится меткой говорящего. Нигде в этом процессе имя человека не известно — известно только, что этот голос не тот голос.

Где оно ошибается

Большую часть ошибок дают три ситуации.

  • Наложение. Когда двое говорят одновременно, отрезок несёт два голоса и попадает в ту группу, на которую больше похож.
  • Короткие реплики. Односложное «да» почти не даёт материала для отпечатка, и короткие вставки первыми получают неверную метку.
  • Похожие голоса. Двое говорящих одного возраста, пола и с одинаковым акцентом, записанные через один микрофон, могут слиться в одну метку.

Условия записи значат больше, чем модель. Совещание, снятое одним микрофоном ноутбука в гулкой комнате, — куда более трудная задача, чем то же совещание с отдельным каналом на каждого участника.

Что с этим делать

Исправить метки потом быстрее, чем бороться с записью. В WhoScribe вы переименовываете говорящего один раз, и новое имя появляется во всех его строках.

Внимательно прочитайте первую минуту. Именно на приветствиях и представлениях метки путаются чаще всего, а ранняя правка означает, что вся остальная расшифровка читается верно.

Если вы знаете, сколько человек в комнате, укажите это. Модель, которой сказали о трёх голосах, не выдумает четвёртый из фонового шума.

Блог

Превратите свою запись в текст

Загрузите файл и прочитайте расшифровку за несколько минут — без регистрации.

Расшифровать файл