Breeze TTS: seguimiento de instrucciones en la generación de habla

Breeze TTS es el modelo de habla con seguimiento de instrucciones de BreezeBlue para diseño de voz con IA controlable, dirección de voz y generación expresiva.

Research Demo

Demo de la motivación de la investigación de Breeze TTS

En BreezeBlue estamos repensando cómo debería sonar el futuro de la inteligencia de audio.

Las tecnologías de voz anteriores son excelentes copiando. Pero la próxima generación de IA de voz debería ir más lejos: entender los matices, adaptarse a cada contexto y seguir siendo controlable.

Breeze TTS es nuestro primer paso en esa dirección: un modelo generativo de habla que lleva a la generación de voz un seguimiento de instrucciones de vanguardia.

01

Motivación

La generación de habla se ha optimizado para el realismo. Creemos que ahora tiene que optimizarse para la intención.

El campo ha avanzado enormemente en naturalidad, consistencia del hablante y clonación de voz. Pero una reproducción de alta fidelidad no es lo mismo que una generación controlable. Una voz que suena perfecta no siempre es la voz que se siente adecuada, la que encaja en el contexto o la que sigue las indicaciones.

Otros campos generativos ya avanzaron en esa dirección. En generación de lenguaje y de imagen, el seguimiento de instrucciones es hoy una capacidad central. Los usuarios esperan que los modelos respondan a los prompts con precisión, flexibilidad y amplitud. La generación de habla no tendría por qué ser distinta.

Con Breeze TTS tratamos el seguimiento de instrucciones como una capacidad de primer nivel para el habla. El objetivo no es solo generar audio natural, sino generar habla que se pueda moldear según la intención creativa: una voz definida por un personaje, una interpretación moldeada por el contexto y una entrega que cambia con la escena.


02

Breeze TTS: un nuevo tipo de modelo de voz

En esencia, Breeze TTS es un modelo de lenguaje de audio construido sobre un gran modelo de lenguaje preentrenado. Se entrena además con secuencias intercaladas de texto y audio, lo que permite modelar ambos en un solo flujo. En esta formulación, el texto aporta las instrucciones y el guion, mientras que el audio funciona a la vez como señal de condicionamiento y como objetivo de generación.

Esto le da a Breeze TTS una gran capacidad de seguimiento de instrucciones en dos escenarios: crear una voz nueva solo a partir de texto y dirigir cómo interpreta una voz existente a partir de una referencia de habla.


2.1

Diseñar: crea una voz nueva a partir de un prompt de texto

Breeze TTS combina conocimiento del mundo con una comprensión profunda del lenguaje natural. Puede seguir prompts de texto abiertos —describan un personaje, un tono, un escenario o un estilo— y generar una voz acorde al personaje buscado.

Acoustic-Parameter SpecificationDescriptive-Style DirectiveRole-Play
Character 1Character 2Character 3Character 4

Instructions

Diseñar: crea una voz nueva a partir de un prompt de texto

Evaluamos Breeze TTS en InstructTTSEval, un benchmark para medir el control complejo del estilo mediante lenguaje natural en la generación de habla. InstructTTSEval cubre tres tipos de estilos de instrucción: Acoustic-Parameter Specification (APS), Descriptive-Style Directive (DSD) y Role-Play (RP), cada uno con 1K casos de prueba. Breeze TTS logra resultados de vanguardia en este benchmark y demuestra una gran capacidad para entender instrucciones complejas y generar voces diversas. Salvo que se indique lo contrario, usamos Gemini-3.1-pro como juez de la evaluación. Según nuestra evaluación humana interna, puntúa con menos sesgo que Gemini-2.5-pro.


2.2

Dirigir: indícale a una voz existente que interprete con un nuevo estilo de habla

La dirección de voz surge de forma natural del entrenamiento con datos de audio de largo horizonte. Breeze TTS puede seguir instrucciones en lenguaje natural para alterar el estilo de habla de un clip de referencia sin perder la identidad del hablante. Y algo importante: la intensidad de la guía se puede ajustar para equilibrar consistencia del hablante y seguimiento de instrucciones.

LedaSadachbiaSchedarVindemiatrix

Reference Voice

Scene 1Scene 2Scene 3

Instructions

Dirigir: indícale a una voz existente que interprete con un nuevo estilo de habla

Evaluamos este escenario en InstructTTSEval. Para cada uno de los 3K casos de prueba elegimos al azar una de las 30 voces preestablecidas de Gemini TTS como referencia one-shot para Breeze TTS. Variamos la intensidad de la guía en el momento de la prueba para medir el equilibrio entre seguimiento de instrucciones y consistencia del hablante. Breeze TTS alcanza una frontera de Pareto de vanguardia en dirección de voz, con una tendencia de escalado clara: a igual nivel de seguimiento de instrucciones, los modelos más grandes preservan mejor la consistencia del hablante.


03

Prueba Breeze TTS

La generación de habla está dejando atrás la reproducción para avanzar hacia la creación, la dirección y la interacción. Con Breeze TTS damos un primer paso hacia modelos de voz capaces de seguir la intención, adaptarse al contexto y abrir un abanico mucho más amplio de experiencias de voz.

Esto es solo el comienzo. Nuestra misión es crear la próxima generación de experiencias nativas de audio a través de la investigación y de los productos. Nos entusiasma compartir Breeze TTS con creadores, desarrolladores y equipos que están explorando en qué pueden convertirse esas experiencias.