Pourquoi certaines transcriptions YouTube sont mauvaises
YouTube génère des sous-titres automatiques pour la plupart des vidéos, et pour un monologue clairement enregistré ils suffisent en général. Les ennuis commencent quand l'enregistrement n'est pas net : deux personnes qui parlent en même temps, un accent prononcé, de la musique en fond, du vocabulaire technique, un enregistrement au téléphone dans une pièce qui résonne. Les sous-titres automatiques se dégradent vite dans tous ces cas, et aucun outil d'extraction ne peut les améliorer, puisqu'il copie un fichier déjà faux.
La deuxième lacune, c'est la couverture. Les directs, les vidéos publiées dans les dernières heures, les mises en ligne privées ou non répertoriées, et beaucoup de petites chaînes n'ont aucune piste de sous-titres. Un extracteur n'a rien à copier et renvoie un résultat vide — c'est pourquoi tant d'entre eux échouent en silence précisément sur les vidéos qui comptent.
La vraie transcription lit l'audio au lieu du fichier de sous-titres, donc aucune de ces situations ne l'arrête. Elle demande plus de calcul et prend plus de temps que copier un fichier texte — un podcast de deux heures représente quelques minutes de travail, pas quelques secondes — mais elle produit une transcription là où il n'y en avait pas, et une transcription correcte là où les sous-titres étaient faux.
WhoScribe fait la seconde. Collez un lien et nous transcrivons l'audio lui-même, avec les noms des intervenants et l'horodatage, dans la langue d'origine ou traduit dans plus de 90 autres langues.