everyaudiotool

Cómo transcribir audio a texto gratis y sacar subtítulos SRT

Transcribe entrevistas, clases o reuniones con Whisper en tu navegador: qué precisión elegir, cómo mejorar el resultado y cómo usar los subtítulos SRT.

Transcribir a mano es lento: una hora de entrevista puede llevar cuatro o cinco horas de teclear, parar y rebobinar. El reconocimiento de voz automático reduce ese trabajo a revisar y corregir. La clave está en saber qué esperar de él, preparar bien el audio y elegir el ajuste adecuado para cada grabación.

Qué es Whisper

Whisper es el modelo de reconocimiento de voz que OpenAI publicó en abierto en 2022. Se entrenó con unas 680.000 horas de audio en decenas de idiomas, y por eso entiende acentos, ruido moderado y vocabulario variado mucho mejor que los sistemas anteriores. Nuestra herramienta lo ejecuta dentro de tu navegador: el audio no se sube a ningún servidor, algo importante cuando transcribes entrevistas confidenciales, reuniones de trabajo o clases con datos de alumnos.

El modelo trabaja por fragmentos de 30 segundos y va mostrando el progreso, así que puedes transcribir grabaciones largas. Reconoce 33 idiomas en el selector y también puede detectar el idioma por sí solo.

Qué precisión elegir

PrecisiónDescargaCuándo usarla
Rápida≈ 40 MBVoz clara, sin ruido; móviles y equipos modestos
Equilibrada≈ 80 MBCasi todo: buena precisión sin mucha espera
Alta≈ 250 MBAcentos marcados, vocabulario técnico, audio difícil

En nuestras pruebas en un portátil actual, tres minutos de audio con la precisión Equilibrada se transcriben en menos de un minuto. En móviles y equipos antiguos tarda bastante más, y el modelo solo se descarga la primera vez.

Paso a paso

  1. Consigue el audio. Sube un MP3, WAV, M4A, OGG o FLAC, o pulsa «Grabar» para hablar al micrófono (hasta 10 minutos). Si lo que tienes es un vídeo, extrae antes su sonido con Vídeo a audio.
  2. Elige el idioma. Si sabes cuál es, selecciónalo: es más fiable que la detección automática, sobre todo en grabaciones cortas.
  3. Elige la precisión según la tabla de arriba.
  4. Transcribe y revisa. Lee el texto con el audio delante y corrige nombres, siglas y términos técnicos.
  5. Exporta. Copia el texto, descárgalo en TXT o descarga el SRT para subtitular un vídeo.

Cómo mejorar la transcripción

  • Limpia el ruido primero. Un ventilador, el tráfico o un zumbido eléctrico aumentan los errores. Pasa la grabación por el eliminador de ruido en modo Voz antes de transcribir.
  • Recorta los silencios largos. Con mucho silencio, el modelo a veces «inventa» frases que nadie dijo. Quítalos con el recortador.
  • Evita la música de fondo. Si la hay, la voz debe estar claramente por encima.
  • Un idioma por grabación. Si se mezclan dos, elige el que más se habla.
  • Graba cerca del micrófono. A un palmo de distancia se entiende mucho mejor que a dos metros, aunque la grabación suene más baja.

Qué es un archivo SRT y cómo usarlo

SRT es el formato de subtítulos más extendido. Es un archivo de texto en el que cada bloque tiene un número, el momento de inicio y fin y la frase. Por ejemplo, el bloque 1 puede ir de 00:00:01,000 --> 00:00:04,200 con el texto «Hola y bienvenidos al episodio». Casi todos los editores de vídeo y plataformas lo aceptan: lo importas y los subtítulos aparecen sincronizados.

  • Revisa antes de importar. Corregir una palabra en el SRT es fácil con cualquier editor de texto; no toques las líneas de tiempos.
  • Líneas cortas. Si una frase es muy larga, divídela en dos bloques para que se pueda leer a tiempo.
  • Guarda en UTF-8. Así las tildes y la «ñ» se ven bien en cualquier reproductor.

Qué esperar de la precisión

Con una sola persona hablando con claridad y poco ruido, la transcripción es muy fiel y solo necesitará retoques. Los errores aumentan con acentos muy marcados, gente que habla a la vez, música alta o mala calidad de grabación. Lo que más suele fallar son los nombres propios, las siglas y la jerga de cada sector: revisa siempre esas partes, sobre todo si vas a citar a alguien.

Preguntas frecuentes

¿Distingue a las personas que hablan?

No. La transcripción es un texto continuo con marcas de tiempo; si necesitas indicar quién habla, añádelo al revisar.

¿Sirve para sacar la letra de una canción?

Con música de fondo, la precisión baja mucho. Funciona bastante mejor si antes separas la voz con el Vocal Remover y transcribes solo la acapella, aunque el canto sigue siendo más difícil que el habla.

¿Puedo transcribir una nota de voz de WhatsApp o del iPhone?

Sí. Las notas de voz suelen ser M4A u OGG, y ambos formatos se admiten directamente. Si algún programa no te deja abrirlas, conviértelas antes con el convertidor de audio.

  1. Texto a voz gratis con IA: cómo conseguir una locución que suene natural

    Cómo funciona el texto a voz moderno, cómo escribir el guion para que suene humano, qué voz y velocidad elegir y cómo montar locuciones largas.

  2. Cómo quitar el ruido de fondo de un audio sin estropear la voz

    Qué ruidos se pueden eliminar y cuáles no, cómo elegir el modo y la intensidad, y los errores que dejan la voz metálica o enlatada.

  3. Cómo hacer un tono de llamada con cualquier canción (iPhone y Android)

    Recorta el fragmento perfecto, añade un fundido y ponlo como tono en Android o iPhone. Duración, formato y los pasos de cada sistema.

← Todos los artículos