everyaudiotool

03 Voz e IA

Voice CloningClonar una voz con IA en tu navegador

Graba unos segundos de tu voz y haz que lea en inglés el texto que escribas, con tu mismo timbre.

Lee esto en voz alta (unos 15 segundos):
«Me gusta pasear junto al río cuando cae la tarde. ¿Hay algo mejor que un día templado y tranquilo? Casi todo el mundo diría que no, aunque algunos prefieren las noches frescas del otoño.»

Habla claro y a tu ritmo, en una sala silenciosa y cerca del micrófono. Si tienes un micrófono externo o de auriculares, úsalo: el resultado copia lo que oye.

Tiempo de grabación y máximo:0:00 / 0:20

Solo inglésNecesita WebGPULa primera vez descarga más de 1 GBPuede tardar varios minutos

0/200 caracteres · 0 palabras · ≈ 0 s de audio a 1,0×

1,0×

Se aplica al resultado sin cambiar el tono de la voz.

0,50

0,50 es una entonación natural. Más alta, más emoción (y algo más de prisa); demasiado alta puede sonar exagerada.

Gratis · procesamiento local · sin cuenta

Experimental y solo en inglés: la variante multilingüe todavía no es compatible con este motor de navegador. Requiere WebGPU y mucha memoria. Muestra limpia de 5 a 15 s (de una más larga se usan los primeros 15 s) y texto de hasta 200 caracteres. Usa solo una voz con permiso.

Primera descarga del modelo: Chatterbox · >1 GB. Al procesar se descargan sus archivos públicos; tu audio no se envía. Necesita conexión la primera vez y espacio en el dispositivo.

Motores y licencias

¿Cuánto tarda?

Depende de tu equipo: con una gráfica compatible con WebGPU va mucho más rápido. Tiempos aproximados para una frase corta:

Ordenador con gráfica compatible (WebGPU: Chrome, Edge)
varios minutos; la primera vez descarga el modelo, de alrededor de 1,5 GB
Ordenador sin WebGPU (Firefox o gráfica no compatible)
no disponible: necesita WebGPU
Safari u otro navegador que usa un solo núcleo
no disponible: necesita WebGPU
Móvil o tableta
no disponible en la mayoría de móviles
  • Todo se procesa en tu dispositivo: si cambias de pestaña o el equipo entra en reposo, el navegador puede pausar o cerrar la pestaña y habría que empezar de nuevo.

Acerca de Voice Cloning

Voice Cloning imita el timbre de una voz a partir de una muestra de entre 5 y 15 segundos y la usa para leer el texto que escribas. Funciona con Chatterbox, un modelo de IA que se ejecuta en tu navegador gracias a WebGPU, así que la muestra no se sube a ningún servidor. Es una función experimental: de momento solo lee textos en inglés y necesita un ordenador con una gráfica compatible. Solo puedes clonar tu propia voz o la de alguien que te haya dado permiso.

Para qué sirve

  • 01

    Locuciones en inglés con tu voz

    Graba la muestra una vez y genera frases para tus vídeos o presentaciones escribiendo el guion, sin volver a ponerte delante del micro.

  • 02

    Corregir una frase

    Si te trabaste en una frase de una grabación en inglés, genera la versión correcta con tu voz y sustitúyela sin repetir toda la toma.

  • 03

    Probar cómo sonarías

    Escucha tu voz leyendo textos que nunca has grabado y comprueba cómo funciona la clonación de voz sin enviar tu voz a ninguna empresa.

  • 04

    Prototipos de audio

    Crea voces de prueba para un proyecto de animación, un juego o una maqueta antes de grabar la versión definitiva.

Cómo se usa, en 3 pasos

  1. Aporta la muestra

    Graba unos 15 segundos leyendo el texto de ejemplo o sube un audio limpio con la voz. Si es más largo, se usan los primeros 15 segundos.

  2. Escribe el texto en inglés

    Escribe lo que quieres que diga, hasta 200 caracteres. Ajusta la velocidad y la expresividad, de contenida a intensa.

  3. Confirma el permiso y genera

    Marca que es tu voz o que tienes permiso, pulsa generar y descarga el resultado en WAV o MP3.

Lo que necesitas

  • Un navegador con WebGPU

    Chrome o Edge recientes en un ordenador con una gráfica compatible. Sin WebGPU, la herramienta no puede funcionar.

  • Memoria y paciencia

    La primera vez descarga un modelo de más de 1 GB y la generación puede tardar varios minutos. Después el modelo queda guardado en el navegador.

  • Una muestra limpia

    Entre 5 y 15 segundos de una sola voz, sin música ni ruido de fondo. Cuanto más clara sea, más se parecerá el resultado.

  • Texto en inglés

    El modelo que funciona en el navegador solo habla inglés. Para voces en español, usa Text to Speech.

Consejos para un mejor resultado

  • Experimental y solo en inglés: la variante multilingüe todavía no es compatible con este motor de navegador. Requiere WebGPU y mucha memoria. Muestra limpia de 5 a 15 s (de una más larga se usan los primeros 15 s) y texto de hasta 200 caracteres. Usa solo una voz con permiso.
  • Graba en una habitación silenciosa y, si puedes, con un micrófono externo o el de unos auriculares.
  • Habla claro y a tu ritmo habitual: el clon imita lo que oye en la muestra, titubeos incluidos.
  • Si la muestra tiene ruido de fondo, límpiala antes con Noise Remover.
  • Sube la expresividad para un tono más emocional y bájala para una lectura más neutra.
  • Clona solo tu propia voz o la de alguien que te haya dado su permiso expreso: hacerlo sin consentimiento puede ser ilegal.

Preguntas frecuentes

¿Cuánto audio necesito?

Entre 5 y 15 segundos de voz clara. Si grabas desde la propia herramienta, tienes un texto de ejemplo preparado para leer en voz alta.

¿Puede hablar en español?

Todavía no. La versión multilingüe del modelo no funciona aún en el navegador, así que el texto tiene que estar en inglés. Para español, usa las voces de Text to Speech.

¿Por qué necesita WebGPU?

El modelo es grande y solo se puede ejecutar a una velocidad razonable usando la tarjeta gráfica del ordenador. Chrome y Edge la aprovechan con WebGPU.

¿Puedo clonar la voz de otra persona?

Solo si es tu propia voz o si su dueño te ha dado permiso expreso. Clonar la voz de alguien sin su consentimiento puede vulnerar sus derechos y la ley.

¿Se sube mi voz a algún servidor?

No. La muestra y el texto se procesan en tu dispositivo; de internet solo se descarga el modelo.

¿Qué diferencia hay con Text to Speech?

Text to Speech usa 30 voces ya preparadas, en español e inglés. Voice Cloning crea la voz a partir de la muestra que tú aportas, así que el resultado suena como esa persona.