三个档位是什么
每次上传都会走三个档位中的一个,每一档是一个不同的模型:
- 快速 — Whisper large-v3-turbo。大模型的蒸馏版:解码层更少,保留了大部分准确度,只花一小部分时间。
- 均衡 — Whisper large-v3。完整的大模型,也是默认档。
- 最佳 — GPT-4o Transcribe。更新的架构,处理口音、抢话和噪声都比 Whisper 更稳。
三档都会返回词级时间信息,所以播放器在任何一档都能跟读,字幕导出也完全一样。
真正会变的部分
音质干净时,差别很小。安静房间里一个人用像样的麦克风说话,三档得到的结果几乎在同一个位置——正因如此,为这种文件去等「最佳」是白等。
差距是在声音变难时拉开的:抢话、口音重、背景噪声、专业术语、人名地名。这时「快速」会开始丢掉简短的插话,并对名字连蒙带猜。「最佳」会把它们留住。
不用多想的选法
就放在均衡。它之所以是默认,是因为大多数时候它是对的。
想快点拿到长录音的大意,或者音质干净、事情也不要紧的时候,用快速:语音备忘、一个人的录音、你只打算扫一眼的东西。
出错代价高的时候用最佳:你会引用的访谈、法律或医疗录音、口音很重、几个人同时讲话,以及任何你要当字幕发布的内容。
任何文件都可以换更高的档位重跑一次。原始音频会在你的套餐保留期内一直可用。
博客
把你自己的录音变成文字
上传文件,几分钟内就能读到转录稿,无需注册。