全部文章
语音 AI 阅读 2 分钟

快速、均衡、最佳:该选哪个质量档

三个档位,三个不同的模型。它们之间到底差在哪,以及最慢的那个什么时候值得等。

三个档位是什么

每次上传都会走三个档位中的一个,每一档是一个不同的模型:

  • 快速 — Whisper large-v3-turbo。大模型的蒸馏版:解码层更少,保留了大部分准确度,只花一小部分时间。
  • 均衡 — Whisper large-v3。完整的大模型,也是默认档。
  • 最佳 — GPT-4o Transcribe。更新的架构,处理口音、抢话和噪声都比 Whisper 更稳。

三档都会返回词级时间信息,所以播放器在任何一档都能跟读,字幕导出也完全一样。

真正会变的部分

音质干净时,差别很小。安静房间里一个人用像样的麦克风说话,三档得到的结果几乎在同一个位置——正因如此,为这种文件去等「最佳」是白等。

差距是在声音变难时拉开的:抢话、口音重、背景噪声、专业术语、人名地名。这时「快速」会开始丢掉简短的插话,并对名字连蒙带猜。「最佳」会把它们留住。

不用多想的选法

就放在均衡。它之所以是默认,是因为大多数时候它是对的。

想快点拿到长录音的大意,或者音质干净、事情也不要紧的时候,用快速:语音备忘、一个人的录音、你只打算扫一眼的东西。

出错代价高的时候用最佳:你会引用的访谈、法律或医疗录音、口音很重、几个人同时讲话,以及任何你要当字幕发布的内容。

任何文件都可以换更高的档位重跑一次。原始音频会在你的套餐保留期内一直可用。

博客

把你自己的录音变成文字

上传文件,几分钟内就能读到转录稿,无需注册。

转录文件