模型真正在听什么
转录模型把声音变成文字。说话人分离回答的是另一个问题:每个时刻是谁在说。系统把音频切成短片段,把每一段变成声音的数字指纹,再把彼此相似的指纹归到一起。每一组就成为一个说话人标签。整个过程中没有任何人的名字,它只知道这个声音不是那个声音。
会在哪里出错
大多数错误来自三种情况。
- 重叠。 两个人同时说话时,一个片段里有两种声音,它会落进更相像的那一组。
- 短发言。 单个词的“嗯”几乎给不出可用的指纹,简短的插话最先被贴错标签。
- 相近的声音。 年龄、性别和口音相近的两个人,用同一支麦克风录制,可能被压成同一个标签。
录音条件比模型更要紧。在回声明显的房间里用一台笔记本麦克风录下的会议,比同一场会议为每位参与者单开一路录音要难得多。
该怎么办
事后改标签,比跟录音较劲快得多。在 WhoScribe 里,你只需重命名一次说话人,他的每一行都会用上新名字。
请仔细读开头一分钟。问候和自我介绍的部分最容易把标签弄反,早一点更正,后面的转录稿读起来就都对了。
如果你知道房间里有几个人,就告诉系统。被告知只有三个声音的模型,不会从背景噪声里再造出第四个。
博客
把你自己的录音变成文字
上传文件,几分钟内就能读到转录稿,无需注册。