Rápida, Equilibrada, Máxima: qué nivel de calidad elegir
Tres niveles, tres modelos distintos. Qué cambia de verdad entre ellos y cuándo el más lento se gana la espera.
Qué son los tres niveles
Cada subida pasa por uno de tres niveles, y cada uno es un modelo distinto:
- Rápida — Whisper large-v3-turbo. Una versión destilada del modelo grande: menos capas de descodificación, casi toda la precisión, una fracción del tiempo.
- Equilibrada — Whisper large-v3. El modelo completo, y la opción por defecto.
- Máxima — GPT-4o Transcribe. Una arquitectura más reciente que maneja acentos, voces solapadas y ruido mejor que Whisper.
Los tres devuelven tiempos a nivel de palabra, así que el reproductor sigue el texto y la exportación de subtítulos funciona igual en cualquier nivel.
Qué cambia realmente
Con audio limpio, poco. Una sola persona con un micrófono decente en una sala silenciosa acaba casi en el mismo punto en los tres niveles; por eso pagar la espera de Máxima en ese archivo es tirarla.
La distancia se abre cuando el audio se complica: voces solapadas, acentos marcados, ruido de fondo, vocabulario técnico, nombres propios. Ahí Rápida empieza a perder interjecciones cortas y a adivinar nombres. Máxima los conserva.
Elegir sin darle muchas vueltas
Déjalo en Equilibrada. Es la opción por defecto porque acierta casi siempre.
Cambia a Rápida cuando quieras la idea general de una grabación larga cuanto antes, o cuando el audio esté limpio y no haya mucho en juego: una nota de voz, una grabación en solitario, algo que vas a ojear.
Cambia a Máxima cuando un error te cueste caro: entrevistas que vas a citar, grabaciones legales o médicas, acentos difíciles, varias personas hablando a la vez o cualquier cosa que publiques como subtítulos.
Siempre puedes volver a procesar un archivo en un nivel superior. El audio original sigue disponible mientras tu plan lo conserve.
Blog
Convierte tu propia grabación en texto
Sube un archivo y lee la transcripción en minutos, sin registrarte.