Wie Sprechertrennung funktioniert — und wo sie danebenliegt
Eine Aufnahme danach aufzuteilen, wer spricht, ist eine andere Aufgabe, als aufzuschreiben, was gesagt wurde. Worauf hört das Modell wirklich?
Worauf das Modell wirklich hört
Ein Transkriptionsmodell verwandelt Klang in Wörter. Die Sprechertrennung beantwortet eine andere Frage: Wer hat wann gesprochen? Das System zerlegt die Aufnahme in kurze Abschnitte, wandelt jeden in einen numerischen Fingerabdruck der Stimme um und gruppiert die Fingerabdrücke, die einander ähneln. Jede Gruppe wird zu einem Sprecher-Label. Nirgends in diesem Vorgang ist ein Name bekannt — bekannt ist nur, dass diese Stimme nicht jene Stimme ist.
Wo sie danebenliegt
Drei Situationen erklären die meisten Fehler.
- Überlappung. Sprechen zwei Personen gleichzeitig, trägt ein Abschnitt zwei Stimmen und landet in der Gruppe, der er stärker ähnelt.
- Kurze Beiträge. Ein einsilbiges „ja“ liefert kaum Material für einen Fingerabdruck; kurze Einwürfe werden zuerst falsch zugeordnet.
- Ähnliche Stimmen. Zwei Personen gleichen Alters, Geschlechts und Akzents, aufgenommen über dasselbe Mikrofon, können zu einem einzigen Label verschmelzen.
Die Aufnahmebedingungen wiegen schwerer als das Modell. Eine Besprechung, die in einem halligen Raum über ein einziges Laptop-Mikrofon aufgezeichnet wurde, ist deutlich schwieriger als dieselbe Besprechung mit einem eigenen Kanal pro Teilnehmer.
Was hilft
Labels nachträglich zu korrigieren geht schneller, als gegen die Aufnahme anzukämpfen. In WhoScribe benennen Sie einen Sprecher einmal um, und jede Zeile trägt den neuen Namen.
Lesen Sie die erste Minute genau. Bei Begrüßung und Vorstellung werden Labels am häufigsten vertauscht; wer dort früh korrigiert, liest den Rest des Transkripts richtig.
Wenn Sie wissen, wie viele Personen im Raum sind, geben Sie es an. Ein Modell, dem drei Stimmen genannt wurden, erfindet keine vierte aus Hintergrundrauschen.
Blog
Verwandeln Sie Ihre eigene Aufnahme in Text
Datei hochladen und das Transkript in Minuten lesen — ganz ohne Anmeldung.