全部文章
语音 AI 阅读 2 分钟

说话人分离是怎么工作的,又会在哪里出错

按“谁在说”来切分录音,和写下“说了什么”是两件不同的事。模型真正在听的是什么?

模型真正在听什么

转录模型把声音变成文字。说话人分离回答的是另一个问题:每个时刻是谁在说。系统把音频切成短片段,把每一段变成声音的数字指纹,再把彼此相似的指纹归到一起。每一组就成为一个说话人标签。整个过程中没有任何人的名字,它只知道这个声音不是那个声音。

会在哪里出错

大多数错误来自三种情况。

  • 重叠。 两个人同时说话时,一个片段里有两种声音,它会落进更相像的那一组。
  • 短发言。 单个词的“嗯”几乎给不出可用的指纹,简短的插话最先被贴错标签。
  • 相近的声音。 年龄、性别和口音相近的两个人,用同一支麦克风录制,可能被压成同一个标签。

录音条件比模型更要紧。在回声明显的房间里用一台笔记本麦克风录下的会议,比同一场会议为每位参与者单开一路录音要难得多。

该怎么办

事后改标签,比跟录音较劲快得多。在 WhoScribe 里,你只需重命名一次说话人,他的每一行都会用上新名字。

请仔细读开头一分钟。问候和自我介绍的部分最容易把标签弄反,早一点更正,后面的转录稿读起来就都对了。

如果你知道房间里有几个人,就告诉系统。被告知只有三个声音的模型,不会从背景噪声里再造出第四个。

博客

把你自己的录音变成文字

上传文件,几分钟内就能读到转录稿,无需注册。

转录文件