Как работает разделение говорящих — и где оно ошибается
Разделить запись по тому, кто говорит, — задача, отличная от того, чтобы записать, что было сказано. Вот что модель слушает на самом деле.
Что модель слушает на самом деле
Модель расшифровки превращает звук в слова. Разделение говорящих отвечает на другой вопрос: кто говорил в каждый момент. Система режет аудио на короткие отрезки, превращает каждый в числовой отпечаток голоса и объединяет похожие отпечатки. Каждая группа становится меткой говорящего. Нигде в этом процессе имя человека не известно — известно только, что этот голос не тот голос.
Где оно ошибается
Большую часть ошибок дают три ситуации.
- Наложение. Когда двое говорят одновременно, отрезок несёт два голоса и попадает в ту группу, на которую больше похож.
- Короткие реплики. Односложное «да» почти не даёт материала для отпечатка, и короткие вставки первыми получают неверную метку.
- Похожие голоса. Двое говорящих одного возраста, пола и с одинаковым акцентом, записанные через один микрофон, могут слиться в одну метку.
Условия записи значат больше, чем модель. Совещание, снятое одним микрофоном ноутбука в гулкой комнате, — куда более трудная задача, чем то же совещание с отдельным каналом на каждого участника.
Что с этим делать
Исправить метки потом быстрее, чем бороться с записью. В WhoScribe вы переименовываете говорящего один раз, и новое имя появляется во всех его строках.
Внимательно прочитайте первую минуту. Именно на приветствиях и представлениях метки путаются чаще всего, а ранняя правка означает, что вся остальная расшифровка читается верно.
Если вы знаете, сколько человек в комнате, укажите это. Модель, которой сказали о трёх голосах, не выдумает четвёртый из фонового шума.
Блог
Превратите свою запись в текст
Загрузите файл и прочитайте расшифровку за несколько минут — без регистрации.