ElevenLabs ha lanzado dos nuevos modelos de voz, v4 y v4 Turbo, con más control expresivo, menor latencia y soporte para más de 90 idiomas. La compañía afirma que la nueva arquitectura mejora la clonación de voz, permite generar audio con apenas 10 segundos de muestra y mantiene mejor la identidad vocal en textos largos. El anuncio refuerza su posición en un mercado donde la voz sintética se está convirtiendo en producto empresarial, creativo y de atención al cliente.
La versión anterior ya permitía etiquetas para controlar expresiones. Con v4, ElevenLabs amplía esas instrucciones y permite combinarlas en secuencia. Esto significa que un creador puede pedir una lectura que empiece calmada, pase a tono entusiasta y cierre con una pausa más contenida. En audiolibros, formación o anuncios, esos matices pueden marcar la diferencia entre una voz útil y una voz que suena mecánica.
La voz generada por IA está pasando de imitar timbres a dirigir interpretación, ritmo y contexto. Ese salto es relevante porque acerca estos sistemas a flujos profesionales donde no basta con leer texto; hay que transmitir intención.
La compañía también apunta a agentes conversacionales. Según TechCrunch, v4 puede empezar a generar audio en cuanto el modelo de lenguaje produce respuesta, lo que reduce tiempos muertos en conversaciones. Además, ElevenLabs destaca que el modelo maneja de forma distinta escaladas, esperas y situaciones de conflicto, elementos críticos en soporte telefónico o ventas.
El soporte lingüístico crece de 70 a más de 90 idiomas, con mejoras destacadas en japonés, portugués brasileño, mandarín y cantonés. Para empresas globales, esto reduce la necesidad de contratar soluciones separadas por mercado. Para creadores, abre versiones localizadas de vídeos, podcasts o cursos con voces más naturales y consistentes.
El avance de ElevenLabs hace más barata y rápida la localización de contenido, pero también sube el listón de autenticidad y consentimiento. Clonar una voz con pocos segundos de audio es potente para doblaje y accesibilidad, pero también facilita usos abusivos si no existen permisos claros y sistemas de detección.
La empresa llega al lanzamiento con fuerte tracción. TechCrunch recoge que más del 55% de su negocio procede de grandes compañías, que su ritmo anualizado de ingresos habría superado los 600 millones de dólares y que su plantilla ronda las 800 personas. La startup levantó 500 millones de dólares de Sequoia este año con una valoración de 11.000 millones.
El mercado se está llenando de competidores como Cartesia, Deepgram, Fish Audio, Boson, WellSaid Labs, Google y OpenAI. La diferenciación ya no será solo calidad de audio. Importarán latencia, controles de seguridad, licencias, facilidad de integración, coste por minuto y capacidad de funcionar en entornos regulados.
La presión competitiva también afectará al trabajo creativo. Un pequeño estudio puede producir versiones en varios idiomas sin rehacer todo el proceso de locución, y una marca puede adaptar mensajes por mercado con más velocidad. Ese ahorro solo será sostenible si se documenta qué voces son reales, cuáles son sintéticas y qué derechos acompañan a cada uso.
Para medios, marcas y plataformas españolas, v4 apunta a una etapa donde la voz sintética deja de ser experimento y entra en producción multilingüe. La oportunidad es clara, pero la gobernanza también: cada proyecto debería definir quién autoriza voces, cómo se etiqueta contenido generado y qué protección existe contra imitaciones no consentidas.
