Na BreezeBlue, estamos repensando como deve soar o futuro da inteligência de áudio.
As tecnologias de voz anteriores são excelentes em copiar. Mas a próxima geração de IA de voz precisa ir além: entender nuances, se adaptar a contextos diferentes e permanecer controlável.
O Breeze TTS é nosso primeiro passo nessa direção — um modelo generativo de fala que traz o estado da arte em seguimento de instruções para a geração de voz.
01
Motivação
A geração de fala vinha sendo otimizada para realismo. Acreditamos que agora ela precisa ser otimizada para intenção.
A área avançou enormemente em naturalidade, consistência de locutor e clonagem de voz. Mas reprodução de alta fidelidade não é o mesmo que geração controlável. Uma voz que soa perfeita nem sempre é a voz que parece certa, que combina com o contexto ou que segue a direção.
Outros domínios generativos já se moveram nessa direção. Na geração de linguagem e de imagens, seguir instruções virou uma capacidade central: os usuários esperam que os modelos respondam aos prompts com precisão, flexibilidade e amplitude. Com a geração de fala não deveria ser diferente.
Com o Breeze TTS, tratamos o seguimento de instruções como uma capacidade de primeira classe da fala. O objetivo não é apenas gerar áudio natural, e sim gerar fala que possa ser moldada pela intenção criativa: uma voz definida por uma persona, uma performance moldada pelo contexto e uma entrega que muda junto com a cena.
02
Breeze TTS — um novo tipo de modelo de fala
No núcleo, o Breeze TTS é um modelo de linguagem de áudio construído sobre um grande modelo de linguagem pré-treinado. Ele passa por um treinamento adicional com sequências intercaladas de texto e áudio, o que permite modelar os dois em um único fluxo. Nessa formulação, o texto fornece as instruções e o roteiro, enquanto o áudio funciona ao mesmo tempo como sinal de condicionamento e como alvo da geração.
É daí que vem a forte capacidade do Breeze TTS de seguir instruções em dois cenários: criar uma voz nova apenas a partir de texto e dirigir a performance de uma voz existente a partir de uma referência de fala.
2.1
Desenhar: criar uma voz nova a partir de um prompt de texto
O Breeze TTS combina conhecimento de mundo com uma compreensão sólida de linguagem natural. Ele segue prompts de texto abertos — descrevam eles a persona, o tom, o cenário ou o estilo — e gera uma voz à altura do personagem pretendido.
Instructions

Avaliamos o Breeze TTS no InstructTTSEval, um benchmark que mede o controle de estilo por linguagem natural complexa na geração de fala. O InstructTTSEval cobre três tipos de instrução: Acoustic-Parameter Specification (APS), Descriptive-Style Directive (DSD) e Role-Play (RP), cada um com 1K casos de teste. O Breeze TTS atinge o estado da arte nesse benchmark, o que demonstra uma forte capacidade de entender instruções complexas e gerar vozes diversas. Salvo indicação em contrário, usamos o Gemini-3.1-pro como juiz da avaliação: pela nossa avaliação humana interna, ele pontua de forma menos enviesada que o Gemini-2.5-pro.
2.2
Dirigir: instruir uma voz existente a atuar em um novo estilo de fala
A direção de voz emerge naturalmente do treinamento com dados de áudio de longa duração. O Breeze TTS segue instruções em linguagem natural para alterar o estilo de fala de um trecho de áudio de referência, preservando a identidade do locutor. E, o mais importante, a intensidade da orientação pode ser ajustada para equilibrar consistência de locutor e seguimento de instruções.
Reference Voice
Instructions

Avaliamos esse cenário também no InstructTTSEval. Para cada um dos 3K casos de teste, escolhemos aleatoriamente uma das 30 vozes predefinidas do Gemini TTS como referência one-shot do Breeze TTS. Variamos a intensidade da orientação no momento do teste para medir o equilíbrio entre seguir instruções e manter a consistência de locutor. Em direção de voz, o Breeze TTS alcança uma fronteira de Pareto no estado da arte, com uma tendência de escala nítida: no mesmo nível de seguimento de instruções, modelos maiores preservam melhor a consistência de locutor.
03
Experimente o Breeze TTS
A geração de fala está indo além da reprodução, rumo à criação, à direção e à interação. Com o Breeze TTS, damos um primeiro passo em direção a modelos de fala capazes de seguir a intenção, se adaptar ao contexto e destravar uma gama muito maior de experiências de voz.
Isso é só o começo. Nossa missão é criar a próxima geração de experiências nativas de áudio por meio de pesquisa e de produtos. Mal podemos esperar para compartilhar o Breeze TTS com criadores, desenvolvedores e times que estão explorando no que essas experiências podem se transformar.