everyaudiotool

02 Voz e IA

Speech to TextPasar audio a texto online, gratis

Pasa entrevistas, clases o reuniones a texto editable y exporta subtítulos SRT para tus vídeos.

Arrastra tu audio aquí

MP3, WAV, M4A, OGG, FLAC, WEBM · hasta 100 MB y 10 minutos

Elige el idioma en el que se habla: así la transcripción acierta más.

Precisión
Gratis · procesamiento local · sin cuenta

Comprueba la transcripción: puede equivocarse o inventar palabras, especialmente con silencio o ruido.

Primera descarga del modelo: Whisper multilingüe / multilingual · 40–250 MB. Al procesar se descargan sus archivos públicos; tu audio no se envía. Necesita conexión la primera vez y espacio en el dispositivo.

Motores y licencias

¿Cuánto tarda?

Depende de tu equipo: con una gráfica compatible con WebGPU va mucho más rápido. Tiempos aproximados para 10 minutos de audio con la precisión «Equilibrada»:

Ordenador con gráfica compatible (WebGPU: Chrome, Edge)
unos 4 min (la transcripción usa el procesador; la gráfica no la acelera)
Ordenador sin WebGPU (Firefox o gráfica no compatible)
unos 4 min
Safari u otro navegador que usa un solo núcleo
unos 13 min
Móvil o tableta
bastante más; mejor con archivos cortos
  • «Rápida» tarda más o menos la mitad y «Alta», unas tres veces más. La primera vez se descarga el modelo (40–250 MB según la precisión).
  • Todo se procesa en tu dispositivo: si cambias de pestaña o el equipo entra en reposo, el navegador puede pausar o cerrar la pestaña y habría que empezar de nuevo.

Acerca de Speech to Text

Speech to Text escucha una grabación, o lo que dices al micrófono, y lo convierte en texto escrito. Funciona con Whisper, el modelo de reconocimiento de voz de OpenAI, ejecutado en tu navegador: el audio no sale de tu dispositivo. Reconoce 33 idiomas, entre ellos español, catalán, gallego y euskera, o detecta el idioma solo. Puedes copiar la transcripción, descargarla en TXT o como subtítulos SRT con los tiempos de cada frase.

Para qué sirve

  • 01

    Subtítulos para tus vídeos

    Descarga el SRT con los tiempos ya puestos y cárgalo en tu editor o en la plataforma donde publiques el vídeo.

  • 02

    Apuntes de clase

    Graba la clase, transcríbela y busca en el texto lo que explicó el profesor en lugar de rebobinar el audio una y otra vez.

  • 03

    Entrevistas para citar bien

    Con las marcas de tiempo localizas cada declaración en la grabación y compruebas la cita palabra por palabra.

  • 04

    Notas de voz y reuniones

    Convierte notas de voz o la grabación de una reunión en texto para archivarlo, buscar en él o compartirlo con quien no estuvo.

Cómo se usa, en 3 pasos

  1. Graba o sube el audio

    Pulsa «Grabar» para hablar al micrófono (hasta 10 minutos) o sube un archivo de audio en MP3, WAV, M4A, OGG, FLAC u otro formato habitual.

  2. Elige idioma y precisión

    Indica el idioma que se habla o deja la detección automática, y elige la precisión: Rápida, Equilibrada o Alta.

  3. Transcribe y exporta

    Pulsa «Transcribir», revisa el texto, muestra u oculta las marcas de tiempo y descárgalo en TXT o SRT, o cópialo al portapapeles.

Precisión y formatos

  • Rápida (~40 MB)

    El modelo más ligero. Va bien con voz clara y poco ruido, y es la opción más rápida en móviles y equipos modestos.

  • Equilibrada (~80 MB)

    La recomendada para casi todo: buena precisión sin hacerte esperar demasiado.

  • Alta (~250 MB)

    La más precisa, con acentos marcados, vocabulario técnico o audio difícil. También es la más lenta.

  • Texto (TXT)

    La transcripción limpia, para pegarla en un documento, un correo o un artículo y seguir trabajándola.

  • Subtítulos (SRT)

    Cada fragmento con su hora de inicio y de fin, en el formato de subtítulos que admiten casi todos los editores y plataformas de vídeo.

Consejos para un mejor resultado

  • Comprueba la transcripción: puede equivocarse o inventar palabras, especialmente con silencio o ruido.
  • Cuanto más limpia sea la grabación, más fiel será el texto: si hay ruido de fondo, pásala antes por Noise Remover.
  • Recorta con Audio Trimmer los silencios largos o las partes que no te interesan antes de transcribir.
  • Si en la grabación se mezclan dos idiomas, selecciona el que más se hable.
  • Repasa nombres propios, siglas y términos técnicos: son lo que más suele necesitar un retoque.
  • Para transcribir un vídeo, extrae antes su audio con Video to Audio.

Preguntas frecuentes

¿Qué idiomas reconoce?

33 en el selector —español, inglés, catalán, gallego, euskera, portugués, francés, italiano, alemán, chino, japonés, árabe y más— y además puede detectar el idioma automáticamente.

¿Cómo saco los subtítulos de mi vídeo?

Extrae el audio del vídeo con Video to Audio, transcríbelo aquí y descarga el SRT. El archivo lleva los tiempos de cada frase y se carga directamente en tu editor o plataforma.

¿Es fiable la transcripción?

Con voz clara y poco ruido, el resultado es muy fiel. Los acentos muy marcados, la música de fondo o varias personas hablando a la vez aumentan los errores, y con silencios largos el modelo puede inventar palabras, así que conviene revisarla.

¿Puedo transcribir grabaciones largas?

Sí: el audio se procesa por tramos de 30 segundos y ves el avance mientras tanto. Diez minutos de audio tardan unos 4 minutos en un ordenador actual.

¿Se sube mi audio a internet?

No. La transcripción se hace en tu dispositivo; solo se descarga el modelo de Whisper la primera vez que lo usas.

¿Qué diferencia hay con Text to Speech?

Hacen el camino contrario: aquí conviertes voz en texto, y en Text to Speech conviertes un texto escrito en voz.