Eleven v4 + Eleven v4 TurboNo lee el guion. Lo interpreta.
ElevenLabs define Eleven v4 como «nuestro modelo de conversión de texto a voz más emotivo hasta la fecha». Escribe la interpretación directamente en el guión con etiquetas integradas, en más de 90 idiomas y con hasta 10 000 caracteres por toma. Y v4 Turbo responde lo suficientemente rápido como para mantener una conversación en directo.
90+ idiomas10.000 caracteres por tomaEn línea Etiquetas de audio
Interpretación de personajesDoblajeDirecciónPNJ de videojuegosAgentes de vozAudiolibrosInterpretación de personajesDoblajeDirecciónPNJ de videojuegosAgentes de vozAudiolibrosInterpretación de personajesDoblajeDirecciónPNJ de videojuegosAgentes de vozAudiolibrosInterpretación de personajesDoblajeDirecciónPNJ de videojuegosAgentes de vozAudiolibros
Escúchalo. El guión está junto a cada clip.
Ocho tomas, generadas en Popcraft. Las palabras entre corchetes naranjas son toda la dirección: no hay edición, ni regrabaciones unidas, ni nada en el audio que no esté en la página.
01
Una frase, cinco interpretaciones
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
Un PNJ de videojuego que cambia de registro en una sola frase
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
Un ritmo, cuatro idiomas
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Japonés
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugués de Brasil
[softly] 别害怕。等天亮了,我们一起过去。Mandarín
Misma voz, misma etiqueta y los cuatro idiomas que, según ElevenLabs, más han mejorado en v4.
04
Un agente de soporte que suena como tal
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
El registro que v4 Turbo está diseñado para mantener en una llamada en directo.
05
Un susurro que sigue siendo un susurro
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
Un inicio en frío de un audiolibro
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4 admite 10.000 caracteres en una sola solicitud, unos diez minutos de audio.
07
Lunes por la mañana
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
Dirección en lenguaje sencillo
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
Una etiqueta no tiene por qué proceder de una lista. Describe la interpretación y el modelo la realiza.
Dos modelos. Uno para la interpretación, otro para la conversación.
Hasta ahora tenías que elegir entre voces expresivas y voces rápidas. Eleven v4 acaba con esa disyuntiva: el modelo estándar se encarga del contenido extenso y Turbo, de las llamadas en directo.
Para creadores
Eleven v4
Diseñado para la creación de contenido y audio de formato largo: audiolibros, trabajo de personajes y narración con longitud de doblaje. La interpretación que escribes es la interpretación que obtienes, con sonidos de escena incluidos.
10.000caracteres por solicitud, unos diez minutos de audio en una sola toma
90+idiomas, frente a los más de 70 de v3
Etiquetasemoción, ritmo, reacciones, acentos y efectos de sonido, escritos directamente en el texto
IPApronunciación exacta, escrita entre barras diagonales
«La culminación de nuestra última investigación en generación de habla expresiva.»ElevenLabs, publicación de lanzamiento
Para agentes de voz
Eleven v4 Turbo
La misma expresividad, optimizada para tiempo real: unos 100 ms de latencia mediana de inferencia y unos 150 ms hasta la primera emisión de voz, según las mediciones de ElevenLabs.
~100 mslatencia de inferencia mediana
~150 mstiempo mediano hasta la primera voz
En directollamadas de soporte, ventas y programación que adaptan su tono a mitad de la conversación
Todo lo que ves a continuación está en el propio guión. Sin controles deslizantes ni posproducción.
Etiquetas de audio
Escribe la emoción donde ocurre
Las etiquetas van integradas entre corchetes y tienen efecto desde donde se ubican hasta la siguiente etiqueta. Seis tipos: emoción, entonación, ritmo, reacciones, acentos y efectos de sonido. Acumula indicaciones con comas y el modelo las interpretará en secuencia.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
Idiomas
Más de 90 idiomas, una sola voz
ElevenLabs considera que el habla expresiva en varios idiomas es uno de los problemas más difíciles de la IA de audio. v4 abarca más de noventa, con las mayores mejoras en japonés, portugués de Brasil, mandarín y cantonés. La misma voz mantiene la misma dirección de interpretación en todos ellos, por lo que el doblaje conserva su reparto.
Tomas largas
10.000 caracteres en una sola solicitud
El doble de lo que aceptaba v3: unos diez minutos de audio en una sola generación. Un capítulo, un guion de apoyo completo o una escena larga mantienen su ritmo como una lectura continua en lugar de párrafos unidos.
Pronunciación
Dilo exactamente, con IPA
Nombres, nombres de medicamentos, nombres de lugares, nombres de productos: escribe la pronunciación en IPA entre barras diagonales y el modelo lo dirá a tu manera, siempre. Para todo lo demás, v4 ha registrado la puntuación de pronunciación más alta que Artificial Analysis ha medido.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Clones de voz
Vuelven los clones de voz profesionales
v3 nunca fue compatible con clones de voz profesionales. v4 sí lo es, por lo que una voz producida que poseas puede interpretar todo el vocabulario de etiquetas. Los clones creados en modelos anteriores se vuelven a entrenar para v4 con un solo clic, con el consentimiento verificado del propietario de la voz detrás de cada clon.
La historia que hay detrás
Cada generación de ElevenLabs añadía una característica. v4 es la primera que no te obliga a elegir entre ellas.
Ago. 2023
Multilingual v2
29 idiomas, y ElevenLabs sale de la fase beta.
jul. 2024
Turbo v2.5
Diseñado para la velocidad.
Dic. 2024
Flash
La latencia se reduce a unos 75 ms. Rápida, pero no expresiva.
jun. 2025
Eleven v3 alpha
Llegan las etiquetas de audio, más de 70 idiomas y los diálogos. Es expresivo, pero la propia publicación de lanzamiento de v3 aconsejaba a quienes desarrollan en tiempo real que se mantuvieran en Flash.
feb. 2026
Eleven v3 pasa a GA
La línea expresiva madura. El compromiso de la velocidad se mantiene.
jun. 2026
La vista previa de Varsovia
En su cumbre de Varsovia, ElevenLabs hace una demostración del siguiente modelo susurrando, cambiando de acento y modificando la emoción en directo en el escenario.
28 sep. 2026
Eleven v4 + v4 Turbo
Una nueva arquitectura que abarca ambas direcciones a la vez: el modelo más expresivo que ha creado ElevenLabs y una versión Turbo lo suficientemente rápida para conversaciones en directo.
La prueba
Primero, un análisis independiente: Artificial Analysis realiza pruebas a ciegas con oyentes en los principales modelos de voz.
Artificial Analysis, octubre de 2026
Eleven v4
Contexto
Arena de voces de proveedores
N.º 1
Por delante de Cartesia Sonic 3.6 y Gemini 3.8 Flash TTS. Eleven v3 ocupa el puesto n.º 17 en la misma clasificación.
Robustez de la pronunciación
91,7 %
La puntuación más alta que Artificial Analysis ha medido en cualquier modelo.
Arena de voz controlada
N.º 2
Por detrás de Qwen-Audio-3.1-TTS-Plus. v3 obtuvo una puntuación muy inferior a ambos.
Velocidad de generación
73,4 car./s
Frente al 42,5 de v3, según mediciones de Artificial Analysis.
En la propia prueba de preferencia a ciegas de ElevenLabs, los oyentes eligieron v4 alrededor del 75 % de las veces en comparación con los modelos competidores. Esa cifra procede del proveedor; la clasificación de la comparativa anterior, no. Reacciones el día del lanzamiento: el hilo del anuncio y los resultados de Artificial Analysis.
¿Qué ha cambiado respecto a v3?
Eleven v3
Eleven v4
Arquitectura
Familia v3
Totalmente nuevo
Idiomas
70+
90+
Longitud de la solicitud
5.000 caracteres
10.000 caracteres
Clones de voz profesionales
No compatible
Soportado
Dirección
Etiquetas de audio
Etiquetas, indicaciones en lenguaje natural, IPA
Tiempo real
No recomendado
v4 Turbo, inferencia mediana de ~100 ms
Los guiones que escribiste para v3 funcionan en v4 sin cambios.
Preguntas frecuentes
¿Funcionan mis voces clonadas actuales en v4?
Tras un nuevo entrenamiento, sí. Los clones creados en modelos anteriores se vuelven a entrenar para v4 con un solo clic en la biblioteca de voces de ElevenLabs. Prepárate para ver diferencias: una voz reentrenada puede sonar sustancialmente diferente de su versión v3, los defectos de la grabación original se reproducen fielmente y las voces creadas con Voice Design pueden sonar menos expresivas que los clones grabados.
¿Funcionan siempre las etiquetas de audio?
No siempre. La propia documentación de ElevenLabs describe el seguimiento de etiquetas como «todavía no perfecto»: en ocasiones, una indicación de entonación se interpreta como un efecto de sonido. Obtendrás los resultados más fiables con una etiqueta por cláusula, colocada antes de las palabras a las que afecta, y combinando las indicaciones con comas dentro de un mismo corchete si quieres superponerlas.
¿Qué ocurre cuando una voz habla un idioma que no es el suyo?
Habla con el acento nativo de ese idioma, no con el acento de origen de la voz. ElevenLabs indica que esto es así por diseño y que se está investigando una opción para mantener el acento.
¿Qué controles tiene v4?
Estabilidad y similitud. No hay controles deslizantes de estilo o velocidad ni SSML; las pausas se escriben como [pause] y [long pause] en el guion, y todo lo demás son etiquetas.
¿v4 o v4 Turbo?
v4 para todo lo que generes y guardes: narración, personajes, lecturas con extensión de doblaje de hasta 10.000 caracteres. v4 Turbo para todo lo que responda al hablar: agentes de voz y aplicaciones interactivas, donde su latencia de inferencia mediana de ~100 ms mantiene fluida la conversación.
Escribe la interpretación. v4 la hace realidad.
Elige una voz, añade la indicación entre corchetes y escucha la toma en segundos.
Todo el audio de esta página se generó en Popcraft con voces de ElevenLabs; el guion completo de cada clip se muestra a su lado. Las imágenes han sido generadas por IA. Las frases citadas son propias de ElevenLabs, procedentes de la publicación de lanzamiento de Eleven v4. Clasificaciones obtenidas de Artificial Analysis, consultadas en octubre de 2026.