すべての記事
音声AI 読了 2 分

高速・バランス・最高:どの品質を選ぶか

三つの段階、三つの別々のモデル。実際に何が変わるのか、そして一番遅いものが待つ価値を持つのはいつか。

三つの段階とは

アップロードは三つのうちいずれかの段階で処理され、それぞれ別のモデルです。

  • 高速 — Whisper large-v3-turbo。大型モデルを蒸留したもので、デコーダ層が少なく、精度の大部分を保ったまま時間はごく一部で済みます。
  • バランス — Whisper large-v3。完全な大型モデルで、既定はこれです。
  • 最高 — GPT-4o Transcribe。より新しい構成で、なまり、重なった発話、雑音を Whisper より上手に扱います。

三つとも単語単位の時間情報を返すため、どの段階でもプレーヤーは本文を追い、字幕の書き出しも同じように動きます。

実際に変わるところ

きれいな音声では、ほとんど変わりません。静かな部屋でまともなマイクを使った一人語りなら、三段階ともほぼ同じ結果に落ち着きます。だからこそ、その種のファイルで「最高」を待つのは無駄になります。

差が開くのは音声が難しくなったときです。発話の重なり、強いなまり、背景の雑音、専門用語、固有名詞。ここで「高速」は短い相づちを落としはじめ、名前を推測しはじめます。「最高」はそれらを保ちます。

迷わず選ぶには

バランスのままにしてください。既定になっているのは、たいていそれが正解だからです。

長い録音の要点を早く知りたいとき、あるいは音声がきれいで重要度も高くないとき——音声メモ、一人での録音、ざっと目を通すだけのもの——は高速へ。

間違いが高くつくときは最高へ。引用する予定のインタビュー、法務・医療の録音、強いなまり、複数人が同時に話す場面、字幕として公開するものすべてが該当します。

ファイルはいつでも上の段階で処理し直せます。元の音声は、ご利用のプランが保持する期間のあいだ残ります。

ブログ

自分の録音をテキストにする

ファイルをアップロードすれば、数分で文字起こしが読めます。登録は不要です。

ファイルを文字に起こす