Dirección de guion y control acústico
Eleven v4 introduce controles a nivel de guion que permiten a los creadores dirigir el tono emocional e insertar audio ambiental directamente en el texto. Los usuarios pueden colocar etiquetas como susurros, risas o efectos de sonido físicos en línea con el diálogo, que el modelo interpreta de manera contextual.
Para mantener la coherencia en producciones complejas, la unión de contexto preserva la locución y el ritmo del hablante a lo largo de guiones extensos, mientras que la regeneración de voz mantiene la estabilidad vocal sin desvíos entre tomas.
- Etiquetas de dirección en el guion para una locución expresiva y efectos de sonido incorporados
- Unión de contexto diseñada para ayudar a reducir cortes audibles en audios de formato largo
- Regeneración de voz diseñada para mantener la estabilidad del hablante a través de múltiples intentos
- Compatibilidad con diccionarios de pronunciación mediante definiciones fonéticas y del AFI para términos técnicos y nombres
Transmisión en tiempo real con Eleven v4 Turbo
Eleven v4 Turbo está diseñado para sistemas conversacionales interactivos, operando con una latencia de inferencia mediana reportada de aproximadamente 100 milisegundos y un tiempo mediano hasta el primer audio de aproximadamente 150 milisegundos.
El modelo admite transmisión bidireccional, lo que permite enviar texto generado de manera incremental por un modelo de lenguaje grande externo mientras el audio se transmite de vuelta antes de que se finalice la oración completa.
- Latencia de inferencia mediana de aproximadamente 100 ms y tiempo hasta la primera emisión de voz de aproximadamente 150 ms
- Transmisión bidireccional para integración directa en bucles de agentes conversacionales
- Compatibilidad con clonación de voz profesional para conservar las voces de marca a lo largo de los turnos de diálogo
- Compatibilidad multilingüe con acentos nativos en idiomas como japonés, español y portugués