NEWTu próximo anuncio UGC viral está a solo un clic. Conoce Studio.Crear anuncio
PopcraftPopcraft
Modelo de voz de ElevenLabs

Eleven v4 + Eleven v4 TurboNo lee el guion.
Lo interpreta.

ElevenLabs define Eleven v4 como «nuestro modelo de conversión de texto a voz más emotivo hasta la fecha». Escribe la interpretación directamente en el guión con etiquetas integradas, en más de 90 idiomas y con hasta 10 000 caracteres por toma. Y v4 Turbo responde lo suficientemente rápido como para mantener una conversación en directo.

[whispers] Don't move. It's right behind you.Eleven v4TTSGenerar
90+ idiomas10.000 caracteres por tomaEn línea Etiquetas de audio
Una actriz de voz ante un micrófono de condensador en una tenue cabina de grabación, iluminada por la luz cálida de una lámpara
Interpretación de personajes
Una sala de doblaje: una actriz observa una escena proyectada con el rostro iluminado por la pantalla
Doblaje
Una sala de control de noche con formas de onda brillando en los monitores frente a un ingeniero
Dirección
Un personaje de videojuego: un caballero con armadura a la luz del fuego, a mitad de frase
PNJ de videojuegos
Un agente de soporte en una llamada con auriculares en una oficina al amanecer
Agentes de voz
Un narrador de pelo canoso lee en voz alta un libro de tapa dura en un sillón bajo una lámpara de lectura
Audiolibros

Escúchalo. El guión está junto a cada clip.

Ocho tomas, generadas en Popcraft. Las palabras entre corchetes naranjas son toda la dirección: no hay edición, ni regrabaciones unidas, ni nada en el audio que no esté en la página.

01

Una frase, cinco interpretaciones

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

Un PNJ de videojuego que cambia de registro en una sola frase

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Un ritmo, cuatro idiomas

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Japonés

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugués de Brasil

[softly] 别害怕。等天亮了,我们一起过去。Mandarín

Misma voz, misma etiqueta y los cuatro idiomas que, según ElevenLabs, más han mejorado en v4.

04

Un agente de soporte que suena como tal

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

El registro que v4 Turbo está diseñado para mantener en una llamada en directo.

05

Un susurro que sigue siendo un susurro

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Un inicio en frío de un audiolibro

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 admite 10.000 caracteres en una sola solicitud, unos diez minutos de audio.

07

Lunes por la mañana

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Dirección en lenguaje sencillo

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Una etiqueta no tiene por qué proceder de una lista. Describe la interpretación y el modelo la realiza.

Dos modelos. Uno para la interpretación, otro para la conversación.

Hasta ahora tenías que elegir entre voces expresivas y voces rápidas. Eleven v4 acaba con esa disyuntiva: el modelo estándar se encarga del contenido extenso y Turbo, de las llamadas en directo.

Para creadores

Eleven v4

Diseñado para la creación de contenido y audio de formato largo: audiolibros, trabajo de personajes y narración con longitud de doblaje. La interpretación que escribes es la interpretación que obtienes, con sonidos de escena incluidos.

  • 10.000caracteres por solicitud, unos diez minutos de audio en una sola toma
  • 90+idiomas, frente a los más de 70 de v3
  • Etiquetasemoción, ritmo, reacciones, acentos y efectos de sonido, escritos directamente en el texto
  • IPApronunciación exacta, escrita entre barras diagonales
«La culminación de nuestra última investigación en generación de habla expresiva.»ElevenLabs, publicación de lanzamiento
Para agentes de voz

Eleven v4 Turbo

La misma expresividad, optimizada para tiempo real: unos 100 ms de latencia mediana de inferencia y unos 150 ms hasta la primera emisión de voz, según las mediciones de ElevenLabs.

  • ~100 mslatencia de inferencia mediana
  • ~150 mstiempo mediano hasta la primera voz
  • En directollamadas de soporte, ventas y programación que adaptan su tono a mitad de la conversación
«Más rápido que la pausa media entre dos personas al hablar.»ElevenLabs, publicación de lanzamiento

Dirígelo como a un talento en la cabina

Todo lo que ves a continuación está en el propio guión. Sin controles deslizantes ni posproducción.

Etiquetas de audio

Escribe la emoción donde ocurre

Las etiquetas van integradas entre corchetes y tienen efecto desde donde se ubican hasta la siguiente etiqueta. Seis tipos: emoción, entonación, ritmo, reacciones, acentos y efectos de sonido. Acumula indicaciones con comas y el modelo las interpretará en secuencia.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Un primer plano de un micrófono de condensador envuelto en una bruma de contraluz
Idiomas

Más de 90 idiomas, una sola voz

ElevenLabs considera que el habla expresiva en varios idiomas es uno de los problemas más difíciles de la IA de audio. v4 abarca más de noventa, con las mayores mejoras en japonés, portugués de Brasil, mandarín y cantonés. La misma voz mantiene la misma dirección de interpretación en todos ellos, por lo que el doblaje conserva su reparto.

Un reparto de drama radiofónico de cuatro actores reunidos alrededor de un micrófono
Tomas largas

10.000 caracteres en una sola solicitud

El doble de lo que aceptaba v3: unos diez minutos de audio en una sola generación. Un capítulo, un guion de apoyo completo o una escena larga mantienen su ritmo como una lectura continua en lugar de párrafos unidos.

Una pila alta de páginas de un manuscrito junto a un micrófono de estudio bajo la cálida luz de una lámpara
Pronunciación

Dilo exactamente, con IPA

Nombres, nombres de medicamentos, nombres de lugares, nombres de productos: escribe la pronunciación en IPA entre barras diagonales y el modelo lo dirá a tu manera, siempre. Para todo lo demás, v4 ha registrado la puntuación de pronunciación más alta que Artificial Analysis ha medido.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Una página de guion marcada con anotaciones a lápiz sobre un atril
Clones de voz

Vuelven los clones de voz profesionales

v3 nunca fue compatible con clones de voz profesionales. v4 sí lo es, por lo que una voz producida que poseas puede interpretar todo el vocabulario de etiquetas. Los clones creados en modelos anteriores se vuelven a entrenar para v4 con un solo clic, con el consentimiento verificado del propietario de la voz detrás de cada clon.

Dos magnetófonos de bobina abierta idénticos uno al lado del otro en un rack de estudio

La historia que hay detrás

Cada generación de ElevenLabs añadía una característica. v4 es la primera que no te obliga a elegir entre ellas.

  • Ago. 2023

    Multilingual v2

    29 idiomas, y ElevenLabs sale de la fase beta.

  • jul. 2024

    Turbo v2.5

    Diseñado para la velocidad.

  • Dic. 2024

    Flash

    La latencia se reduce a unos 75 ms. Rápida, pero no expresiva.

  • jun. 2025

    Eleven v3 alpha

    Llegan las etiquetas de audio, más de 70 idiomas y los diálogos. Es expresivo, pero la propia publicación de lanzamiento de v3 aconsejaba a quienes desarrollan en tiempo real que se mantuvieran en Flash.

  • feb. 2026

    Eleven v3 pasa a GA

    La línea expresiva madura. El compromiso de la velocidad se mantiene.

  • jun. 2026

    La vista previa de Varsovia

    En su cumbre de Varsovia, ElevenLabs hace una demostración del siguiente modelo susurrando, cambiando de acento y modificando la emoción en directo en el escenario.

  • 28 sep. 2026

    Eleven v4 + v4 Turbo

    Una nueva arquitectura que abarca ambas direcciones a la vez: el modelo más expresivo que ha creado ElevenLabs y una versión Turbo lo suficientemente rápida para conversaciones en directo.

La prueba

Primero, un análisis independiente: Artificial Analysis realiza pruebas a ciegas con oyentes en los principales modelos de voz.

Artificial Analysis, octubre de 2026Eleven v4Contexto
Arena de voces de proveedoresN.º 1Por delante de Cartesia Sonic 3.6 y Gemini 3.8 Flash TTS. Eleven v3 ocupa el puesto n.º 17 en la misma clasificación.
Robustez de la pronunciación91,7 %La puntuación más alta que Artificial Analysis ha medido en cualquier modelo.
Arena de voz controladaN.º 2Por detrás de Qwen-Audio-3.1-TTS-Plus. v3 obtuvo una puntuación muy inferior a ambos.
Velocidad de generación73,4 car./sFrente al 42,5 de v3, según mediciones de Artificial Analysis.

En la propia prueba de preferencia a ciegas de ElevenLabs, los oyentes eligieron v4 alrededor del 75 % de las veces en comparación con los modelos competidores. Esa cifra procede del proveedor; la clasificación de la comparativa anterior, no. Reacciones el día del lanzamiento: el hilo del anuncio y los resultados de Artificial Analysis.

¿Qué ha cambiado respecto a v3?

Eleven v3Eleven v4
ArquitecturaFamilia v3Totalmente nuevo
Idiomas70+90+
Longitud de la solicitud5.000 caracteres10.000 caracteres
Clones de voz profesionalesNo compatibleSoportado
DirecciónEtiquetas de audioEtiquetas, indicaciones en lenguaje natural, IPA
Tiempo realNo recomendadov4 Turbo, inferencia mediana de ~100 ms

Los guiones que escribiste para v3 funcionan en v4 sin cambios.

Preguntas frecuentes

¿Funcionan mis voces clonadas actuales en v4?

Tras un nuevo entrenamiento, sí. Los clones creados en modelos anteriores se vuelven a entrenar para v4 con un solo clic en la biblioteca de voces de ElevenLabs. Prepárate para ver diferencias: una voz reentrenada puede sonar sustancialmente diferente de su versión v3, los defectos de la grabación original se reproducen fielmente y las voces creadas con Voice Design pueden sonar menos expresivas que los clones grabados.

¿Funcionan siempre las etiquetas de audio?

No siempre. La propia documentación de ElevenLabs describe el seguimiento de etiquetas como «todavía no perfecto»: en ocasiones, una indicación de entonación se interpreta como un efecto de sonido. Obtendrás los resultados más fiables con una etiqueta por cláusula, colocada antes de las palabras a las que afecta, y combinando las indicaciones con comas dentro de un mismo corchete si quieres superponerlas.

¿Qué ocurre cuando una voz habla un idioma que no es el suyo?

Habla con el acento nativo de ese idioma, no con el acento de origen de la voz. ElevenLabs indica que esto es así por diseño y que se está investigando una opción para mantener el acento.

¿Qué controles tiene v4?

Estabilidad y similitud. No hay controles deslizantes de estilo o velocidad ni SSML; las pausas se escriben como [pause] y [long pause] en el guion, y todo lo demás son etiquetas.

¿v4 o v4 Turbo?

v4 para todo lo que generes y guardes: narración, personajes, lecturas con extensión de doblaje de hasta 10.000 caracteres. v4 Turbo para todo lo que responda al hablar: agentes de voz y aplicaciones interactivas, donde su latencia de inferencia mediana de ~100 ms mantiene fluida la conversación.

Escribe la interpretación. v4 la hace realidad.

Elige una voz, añade la indicación entre corchetes y escucha la toma en segundos.

Todo el audio de esta página se generó en Popcraft con voces de ElevenLabs; el guion completo de cada clip se muestra a su lado. Las imágenes han sido generadas por IA. Las frases citadas son propias de ElevenLabs, procedentes de la publicación de lanzamiento de Eleven v4. Clasificaciones obtenidas de Artificial Analysis, consultadas en octubre de 2026.

Sigue explorando

Modelos relacionados