Todos os artigos
IA de voz 2 min de leitura

Como funciona a separação de interlocutores — e onde falha

Dividir uma gravação por quem fala é um problema diferente de escrever o que foi dito. Eis o que o modelo realmente ouve.

O que o modelo realmente ouve

Um modelo de transcrição transforma som em palavras. A separação de interlocutores responde a outra pergunta: quem falava em cada momento. O sistema corta o áudio em segmentos curtos, converte cada um numa impressão numérica da voz e agrupa as impressões parecidas entre si. Cada grupo passa a ser uma etiqueta de interlocutor. Em nenhum ponto do processo se conhece o nome de alguém — sabe-se apenas que esta voz não é aquela voz.

Onde falha

Três situações explicam a maioria dos erros.

  • Sobreposição. Quando duas pessoas falam ao mesmo tempo, o segmento carrega duas vozes e cai no grupo a que mais se assemelha.
  • Turnos curtos. Um «sim» de uma só palavra dá muito pouco material à impressão, e as interjeições breves são as primeiras a ficar mal etiquetadas.
  • Vozes semelhantes. Duas pessoas da mesma idade, género e sotaque, gravadas pelo mesmo microfone, podem fundir-se numa única etiqueta.

As condições de gravação pesam mais do que o modelo. Uma reunião captada pelo microfone de um portátil numa sala com eco é bem mais difícil do que a mesma reunião gravada com um canal por participante.

O que fazer

Corrigir etiquetas depois é mais rápido do que lutar contra a gravação. No WhoScribe muda o nome de um interlocutor uma vez e todas as linhas passam a usar o nome novo.

Leia o primeiro minuto com atenção. É nos cumprimentos e nas apresentações que as etiquetas mais se trocam, e corrigi-las cedo faz com que o resto da transcrição se leia bem.

Se sabe quantas pessoas estão na sala, indique-o. Um modelo a quem se diz que há três vozes não inventa uma quarta a partir do ruído de fundo.

Blog

Transforme a sua própria gravação em texto

Carregue um ficheiro e leia a transcrição em minutos, sem registo.

Transcrever um arquivo