Comment fonctionne la séparation des locuteurs — et où elle dérape
Découper un enregistrement selon qui parle est un problème distinct de celui de transcrire ce qui est dit. Voici ce que le modèle écoute réellement.
Ce que le modèle écoute réellement
Un modèle de transcription transforme du son en mots. La séparation des locuteurs répond à une autre question : qui parlait à quel moment. Le système découpe l’audio en courts segments, transforme chacun en une empreinte numérique de la voix, puis regroupe les empreintes qui se ressemblent. Chaque groupe devient une étiquette de locuteur. À aucun moment le nom de quelqu’un n’est connu : on sait seulement que cette voix n’est pas celle-là.
Où elle dérape
Trois situations expliquent l’essentiel des erreurs.
- Chevauchement. Quand deux personnes parlent en même temps, le segment porte deux voix et rejoint le groupe auquel il ressemble le plus.
- Tours de parole courts. Un « oui » d’un seul mot laisse très peu de matière à l’empreinte, et les brèves interjections sont les premières mal étiquetées.
- Voix proches. Deux personnes de même âge, même genre et même accent, enregistrées sur le même micro, peuvent fusionner en une seule étiquette.
Les conditions d’enregistrement pèsent plus lourd que le modèle. Une réunion captée par le micro d’un ordinateur portable dans une pièce qui résonne est bien plus difficile que la même réunion enregistrée avec un canal par participant.
Que faire
Corriger les étiquettes après coup va plus vite que de lutter contre l’enregistrement. Dans WhoScribe, vous renommez un locuteur une fois et toutes ses lignes prennent le nouveau nom.
Lisez attentivement la première minute. C’est au moment des salutations et des présentations que les étiquettes s’inversent le plus souvent ; corriger tôt, c’est lire juste tout le reste.
Si vous savez combien de personnes sont présentes, indiquez-le. Un modèle à qui l’on annonce trois voix n’en inventera pas une quatrième à partir du bruit de fond.
Blog
Transformez votre propre enregistrement en texte
Importez un fichier et lisez la transcription en quelques minutes, sans inscription.