Transcribir un video largo de YouTube sin subtítulos
5 US$ o 3 US$ según tu país por el video completo, hasta 10 horas, pago único; al pagar ves el importe en tu moneda local en la mayoría de los países. Pega el enlace y WhoScribe transcribe el propio audio, así que el video no necesita subtítulos. Antes conviene comprobar si YouTube ya tiene la transcripción; y si prefieres no pagar nada, te explicamos cómo hacerlo en tu equipo con yt-dlp y Whisper.
Antes que nada
Primero: ¿de verdad no hay transcripción?
Medio minuto en YouTube puede ahorrarte todo el trabajo. En la computadora:
1
Abre la descripción
Haz clic en “…más” debajo del video para ver la descripción completa. Algunos creadores pegan ahí la transcripción o dejan un enlace a ella.
2
Busca “Mostrar transcripción”
Al final de la descripción abierta aparece el botón “Mostrar transcripción” cuando el video tiene subtítulos. Abre el texto junto al video, con marcas de tiempo (Ayuda de YouTube: ver transcripciones de videos).
3
Prueba otro idioma de subtítulos
Abre la Configuración del reproductor (el engranaje) y luego Subtítulos. Si aparece cualquier pista, aunque sea automática o en otro idioma, el video sí tiene subtítulos y la transcripción se puede mostrar en ese idioma.
Si nada de esto da resultado, el video no tiene ninguna pista de subtítulos y copiarlos no va a funcionar. La página de ayuda de YouTube sobre subtítulos automáticos explica los motivos habituales. La salida es transcribir el propio audio: en tu equipo (abajo) o aquí, sin instalar nada.
La vía gratuita
Hazlo tú, gratis: yt-dlp + Whisper
Si te manejas con la terminal, dos herramientas gratuitas y de código abierto hacen todo el trabajo en tu equipo: yt-dlp descarga el audio del video y Whisper, de OpenAI, convierte ese audio en texto. No se sube nada a ningún sitio.
Lo que necesitas, sin rodeos
Python. El README de Whisper dice que debería funcionar con Python 3.8 a 3.11, y el de yt-dlp pide 3.10 o posterior; Python 3.10 o 3.11 sirve para los dos.
ffmpeg (el programa, no el paquete de Python con el mismo nombre). Las dos herramientas lo necesitan; instálalo con tu gestor de paquetes, por ejemplo brew install ffmpeg en Mac o sudo apt install ffmpeg en Ubuntu.
Para YouTube, el README de yt-dlp también recomienda un entorno de JavaScript como Deno. Si instalas yt-dlp con el extra “default”, se añade el paquete yt-dlp-ejs, pero el entorno en sí (Deno, o Node o Bun) hay que instalarlo aparte.
Espacio en disco: los paquetes de Python, el modelo de Whisper (se descarga la primera vez) y el archivo de audio. Calcula unos cuantos GB.
Una tarjeta gráfica (GPU), o paciencia. La tabla de abajo muestra cuánta memoria de video (VRAM) pide cada modelo. Sin GPU, Whisper usa el procesador y un video largo exige paciencia.
Cambia <URL> por el enlace del video. -x guarda solo el audio y -o llama al archivo audio.mp3 (sin él, yt-dlp usa el título del video). Descarga solo videos que tengas derecho a descargar.
Whisper guarda audio.txt junto al audio. Usa --output_format srt si quieres subtítulos con marcas de tiempo. --language Spanish evita que se equivoque de idioma; cámbialo si el video está en otro.
Modelos de Whisper y la memoria de video que necesitan, citados del README de openai/whisper (comprobado el )
Modelo
Parámetros
Nombre en --model
VRAM necesaria
Velocidad relativa (frente a large)
tiny
39 M
tiny
~1 GB
~10x
base
74 M
base
~1 GB
~7x
small
244 M
small
~2 GB
~4x
medium
769 M
medium
~5 GB
~2x
large
1550 M
large
~10 GB
1x
turbo
809 M
turbo
~6 GB
~8x
El README midió las velocidades con voz en inglés en una GPU A100 y advierte que la velocidad real depende del idioma, del ritmo al hablar y del hardware. Describe turbo como una versión optimizada de large-v3, más rápida y con una pérdida mínima de precisión, pero no entrenada para traducir.
Lo que ganas: una transcripción gratuita y privada. Lo que cuesta: la primera instalación, el tiempo de tu equipo con videos largos y un archivo de texto plano, sin editor.
Sin instalar nada
O pega el enlace aquí, sin instalar nada
Pega el enlace de YouTube en la página Transcripción de YouTube. WhoScribe obtiene el audio y lo transcribe en sus propios servidores: nada que instalar y ninguna tarjeta gráfica necesaria.
Videos de hasta 10 horas
Los primeros 5 minutos se leen sin cuenta, y los primeros 15 con una cuenta gratuita
5 US$ o 3 US$ según tu país desbloquea el video completo: pago único, sin suscripción
Solo videos públicos (el enlace tiene que abrirse para cualquiera, sin iniciar sesión)
Preguntas frecuentes
Dudas antes de subir nada
¿Por qué el video no tiene el botón “Mostrar transcripción”?
El botón solo aparece cuando el video tiene una pista de subtítulos, subida por el creador o generada automáticamente por YouTube. Sin ninguna pista no hay transcripción que copiar: hay que transcribir el audio.
¿Funciona con un video de 3 horas o más?
Sí. WhoScribe acepta videos de hasta 10 horas, y el video completo cuesta 5 US$ o 3 US$ según tu país, en un pago único.
¿Se puede hacer gratis?
Sí, de dos maneras. Aquí, los primeros 5 minutos son gratis sin cuenta (15 con una cuenta gratuita). Y en tu equipo, yt-dlp y Whisper transcriben el video entero sin coste, si tienes Python, ffmpeg y una GPU o paciencia.
¿Funciona con videos privados?
No. El enlace tiene que abrirse para cualquiera, sin iniciar sesión. Si el video es tuyo, también puedes subir directamente el archivo de video o de audio.
¿Puedo descargar la transcripción como subtítulos (SRT)?
Sí. Después de desbloquear el video, descargas el texto en TXT, SRT, VTT, DOCX y PDF. SRT y VTT incluyen las marcas de tiempo, listos para usar como subtítulos.
Transcribe un video de YouTube
Pega el enlace. Los primeros 5 minutos son gratis sin cuenta y 15 con una cuenta gratuita. El archivo completo cuesta $5, en un pago único.
Los datos de otros servicios salen de la página de cada proveedor, comprobados el 7 oct 2026. Los precios cambian; abre el enlace de la fuente para ver su página actual.
Obtén 3 archivos al día y 15 minutos por archivo — gratis
Has agotado las transcripciones gratuitas de invitado de hoy. Crea una cuenta o inténtalo mañana.