01 Voz e IA
Text to SpeechConvertir texto a voz online, gratis
Escribe o pega un texto, elige entre 30 voces en español e inglés y descárgalo convertido en una locución natural.
0/600 caracteres · 0 palabras · ≈ 0 s de audio a 1,0×
Elige una voz
Lee en españolEspañol · femenina
Español · masculina
Americano · femenina
Americano · masculina
Británico · femenina
Británico · masculina
Las voces españolas leen en español y las demás en inglés: escribe el texto en el idioma de la voz. Pulsa ▶ para oír una muestra sin cambiar de voz.
Gratis · procesamiento local · sin cuenta
Las voces españolas son Dora, Alex y Santa. La pronunciación y calidad varían por voz e idioma. Hasta 600 caracteres por generación. En ordenadores con gráfica compatible, tras el primer audio se descarga una versión acelerada (~310 MB, una sola vez) y los siguientes tardan segundos.
Primera descarga del modelo: Kokoro · ~90 MB. Al procesar se descargan sus archivos públicos; tu audio no se envía. Necesita conexión la primera vez y espacio en el dispositivo.
Motores y licencias¿Cuánto tarda?
Depende de tu equipo: con una gráfica compatible con WebGPU va mucho más rápido. Tiempos aproximados para un texto de 600 caracteres (unos 40 s de voz):
- Ordenador con gráfica compatible (WebGPU: Chrome, Edge)
- unos 30 s, desde el segundo audio (el primero se genera con el procesador mientras se descarga la versión acelerada, ~310 MB, una sola vez)
- Ordenador sin WebGPU (Firefox o gráfica no compatible)
- alrededor de 1,5 min
- Safari u otro navegador que usa un solo núcleo
- unos 2–2,5 min
- Móvil o tableta
- más que en un ordenador; depende mucho del móvil
- La primera vez se descarga el modelo de voz (unos 90 MB). Los textos cortos tardan proporcionalmente menos.
- Todo se procesa en tu dispositivo: si cambias de pestaña o el equipo entra en reposo, el navegador puede pausar o cerrar la pestaña y habría que empezar de nuevo.
Acerca de Text to Speech
Text to Speech transforma un texto escrito en una locución con pausas, entonación y ritmo de persona real. Usa Kokoro, un modelo de inteligencia artificial que se ejecuta en tu propio navegador: el texto no se envía a ningún servidor. Tienes 3 voces en español y 27 en inglés, con acento estadounidense o británico, y controlas la velocidad de lectura. Cada resultado se descarga en WAV y en MP3.
Para qué sirve
- 01
Voz en off para tus vídeos
Escribe el guion, elige una voz y ten la narración lista sin micrófono, sin buscar un sitio silencioso y sin repetir tomas.
- 02
Revisar textos de oído
Al escuchar lo que has escrito saltan a la vista las frases eternas, las palabras repetidas y las erratas que se escapan al leer.
- 03
Repasar escuchando
Convierte apuntes o fragmentos de un artículo en audio para repasarlos mientras caminas, a la velocidad que te resulte cómoda.
- 04
Pronunciación en inglés
Oye cómo suena una palabra o una frase con acento estadounidense o británico y repítela cuantas veces necesites.
Cómo se usa, en 3 pasos
Escribe o sube el texto
Pega el texto en el recuadro o sube un archivo .txt. Verás cuántos caracteres y palabras llevas y cuánto durará el audio aproximadamente.
Elige voz y velocidad
Escucha la muestra de cada voz antes de decidirte y ajusta la velocidad entre 0,5× y 2×. Con 1× se lee al ritmo normal de una conversación.
Genera y descarga
Pulsa «Generar voz», escucha el resultado y descárgalo en WAV o MP3. Si no te convence, cambia de voz o de velocidad y vuelve a generarlo.
Las 30 voces
Español (3)
Dora, clara y cercana; Alex, natural y serena; y Santa, grave y festiva. Escribe el texto en español para que la lectura suene natural.
Inglés de EE. UU., femeninas (11)
Heart, Bella, Sarah, Nicole, Nova, Sky, Alloy, Aoede, Jessica, Kore y River: de las cálidas y cercanas a las nítidas y profesionales.
Inglés de EE. UU., masculinas (8)
Adam, Michael, Eric, Liam, Onyx, Echo, Fenrir y Puck. Hay registros graves y serios, otros juveniles y alguno muy teatral.
Inglés británico (8)
Emma, Alice, Isabella y Lily, y George, Daniel, Lewis y Fable: voces elegantes que encajan en contenidos educativos y narraciones.
Consejos para un mejor resultado
- Las voces españolas son Dora, Alex y Santa. La pronunciación y calidad varían por voz e idioma. Hasta 600 caracteres por generación. En ordenadores con gráfica compatible, tras el primer audio se descarga una versión acelerada (~310 MB, una sola vez) y los siguientes tardan segundos.
- Cuida la puntuación: las comas crean pausas, los puntos cierran la frase y las interrogaciones cambian la entonación.
- Escribe cifras, siglas y abreviaturas tal como quieres oírlas; así evitas lecturas extrañas.
- Si un nombre propio o un término técnico suena raro, escríbelo como se pronuncia o reformula la frase.
- Prueba el mismo texto con dos o tres voces: a menudo la que mejor encaja no es la que habrías elegido de entrada.
- Para textos de más de 600 caracteres, genera varias partes y únelas después con Audio Joiner.
Preguntas frecuentes
¿Es gratis convertir texto a voz?
Sí, sin registro ni límite de usos. El modelo de voz se descarga una vez y funciona en tu navegador, así que no hay servidores que pagar por cada audio.
¿Hay voces en español?
Sí, tres: Dora, Alex y Santa. Las otras 27 leen en inglés con acento estadounidense o británico. Escribe el texto en el idioma de la voz que elijas.
¿Cuánto texto puedo convertir de una vez?
Hasta 600 caracteres por generación, unos 40 segundos de voz. Para textos más largos, divídelos en partes y únelas con Audio Joiner.
¿Descargo en WAV o en MP3?
Tienes los dos. El WAV conserva toda la calidad y es el adecuado si vas a editar la voz; el MP3, a 192 kbps, pesa mucho menos y es perfecto para publicar o compartir.
¿Cambiar la velocidad empeora la voz?
No. La velocidad se aplica al generar la voz, no acelerando la reproducción, así que no se deforma ni cambia de tono tanto a 0,5× como a 2×.
¿Se envía mi texto a algún servidor?
No. La voz se genera en tu dispositivo con el modelo Kokoro; lo único que se descarga de internet es el propio modelo, la primera vez.
¿Y si quiero que suene con mi propia voz?
Para eso está Voice Cloning, que imita una voz a partir de una muestra de unos segundos. De momento es experimental y solo lee en inglés.