O Breeze TTS 2 é agora o modelo de texto para voz de pesos abertos Nº 1 no ranking da Provider Voice Arena da Artificial Analysis, com pontuação Elo de Qualidade de 1215.
No recorte do ranking de 26 de agosto de 2026, o Breeze TTS 2 ficou à frente de todos os outros modelos TTS de pesos abertos avaliados pela Artificial Analysis. Terminou 90 pontos Elo acima do segundo colocado, Fish Audio S2 Pro, e 113 pontos acima do terceiro, Step Audio EditX.
É um marco importante para a BreezeBlue e para a IA de voz de pesos abertos. O ranking se baseia em preferências de escuta cegas de pessoas reais, não em pontuações escolhidas pelo fornecedor nem em métricas automáticas de áudio, e consolida o Breeze TTS 2 como o modelo de pesos abertos mais bem avaliado nesta avaliação independente de TTS.
O que é a TTS Arena da Artificial Analysis?
A Text to Speech Arena da Artificial Analysis é um benchmark independente que compara modelos de geração de fala por meio de testes de escuta cegos, um contra o outro.
Em cada comparação, os ouvintes escutam dois clipes de áudio gerados a partir do mesmo texto sem saber quais modelos os produziram. Eles escolhem o clipe que soa mais natural, e a Artificial Analysis agrega essas preferências em uma pontuação relativa de Elo de Qualidade. Um Elo mais alto significa que os ouvintes preferiram aquele modelo com mais frequência em comparação com os outros modelos da Arena.
O ranking foi desenhado para capturar a qualidade de fala percebida por ouvintes reais. Isso inclui qualidades como:
Naturalidade
Qualidade do áudio
Pronúncia
Ritmo
Prosódia e expressividade
Na Provider Voice Arena, a Artificial Analysis avalia cada modelo com um conjunto representativo das vozes disponíveis. A meta é cobrir vozes masculinas e femininas com sotaques americano e britânico, com até oito vozes por modelo. A pontuação resultante reflete, portanto, a experiência geral de usar as vozes associadas a cada modelo, e não uma única demonstração escolhida a dedo.
A Artificial Analysis também publica o número de amostras, intervalos de confiança, filtros por categoria e filtros por sotaque para ajudar na interpretação do ranking. O Elo é uma medida relativa, então as pontuações podem mudar conforme novos votos são coletados e novos modelos entram na Arena.
Breeze TTS 2 lidera o ranking de pesos abertos

Os cinco melhores modelos de pesos abertos na Provider Voice Arena foram:
| Posição | Modelo | Criador | Elo de Qualidade |
|---|---|---|---|
| 1 | Breeze TTS 2 | BreezeBlue | 1215 |
| 2 | Fish Audio S2 Pro | Fish Audio | 1125 |
| 3 | Step Audio EditX (March 2026) | StepFun | 1102 |
| 4 | Voxtral TTS | Mistral | 1082 |
| 5 | Magpie-Multilingual 357M | NVIDIA | 1066 |
O Breeze TTS 2 manteve 90 pontos de vantagem sobre o concorrente de pesos abertos mais próximo. Em um sistema baseado em Elo, cada pontuação é definida em relação às preferências dos ouvintes em todo o conjunto de modelos, o que torna essa vantagem um sinal relevante de quão consistentemente os ouvintes escolheram o Breeze TTS 2.
A Provider Voice Arena completa também coloca o Breeze TTS 2 entre os sistemas TTS mais bem avaliados no geral, ao lado dos principais modelos proprietários. Como as pontuações da Arena são atualizadas continuamente à medida que novos votos chegam, a imagem do ranking completo abaixo reflete um recorte posterior.

Por que essa posição de Nº 1 importa
Acreditamos que desenvolvedores não deveriam ter que escolher entre acesso e qualidade de voz excepcional. Modelos de fala de pesos abertos oferecem mais flexibilidade para inspecionar, avaliar e executar um modelo na infraestrutura da própria equipe, mas historicamente ficaram atrás das APIs comerciais mais fortes em qualidade percebida.
O resultado da Artificial Analysis mostra um cenário diferente. Em comparações cegas, os ouvintes colocaram o Breeze TTS 2 claramente à frente do restante dos modelos de pesos abertos e no mesmo patamar superior dos principais sistemas TTS proprietários.
Isso torna o ranking relevante para equipes que constroem:
Agentes de voz conversacionais
Personagens de jogos e animações
Audiolivros e conteúdo narrativo
Fluxos de dublagem com IA e localização
Podcasts e ferramentas para criadores
Aplicações de atendimento ao cliente
Para esses produtos, a fala precisa fazer mais do que pronunciar as palavras corretamente. Ela precisa soar natural, transmitir intenção, manter uma identidade de voz convincente e se encaixar no contexto da interação. Os testes de preferência humana são valiosos porque os ouvintes julgam essas qualidades em conjunto, em vez de reduzi-las a um único sinal automático.
Feito para desenhar uma voz e dirigir sua performance
Criamos o Breeze TTS 2 para dar a cada personagem a voz certa e a cada fala a performance certa. Ele combina qualidade de fala altamente avaliada com controles para criar e dirigir vozes:
[Design de voz](/voice-design) cria uma voz marcante a partir de uma descrição em linguagem natural, sem precisar de áudio de referência.
[Clonagem de voz](/voice-cloning) usa um áudio de referência e sua transcrição para preservar o timbre, o ritmo, a emoção e o estilo do locutor.
Direção de voz usa instruções em linguagem natural para guiar tom, emoção, ritmo e entrega, mantendo a voz de referência reconhecível.
Eventos vocais adicionam momentos expressivos como risadas, suspiros, tosses e pigarros diretamente no roteiro.
Streaming em tempo real suporta geração de áudio em streaming, com tempo até o primeiro áudio (TTFA) abaixo de 40 ms.
Geração em inglês e chinês está disponível na versão de pesos abertos.
Essas capacidades fazem do Breeze TTS 2 muito mais do que uma coleção de vozes predefinidas. Desenvolvedores e criadores podem desenhar um personagem, preservar sua identidade e dirigir como ele interpreta uma fala específica, tudo no mesmo modelo.
O resultado da Arena acrescenta um sinal externo importante a esse conjunto de capacidades: quando os ouvintes compararam a fala gerada sem saber o nome do modelo, o Breeze TTS 2 surgiu como a escolha Nº 1 entre os modelos de pesos abertos.
Uma nova referência para a IA de voz de pesos abertos
Nenhum ranking público consegue representar todos os roteiros, locutores, idiomas ou ambientes de produção. Mas a preferência humana cega oferece um dos testes mais claros da experiência que mais importa: como a voz gerada realmente soa para quem escuta.
O resultado é um ponto de partida sólido. O Breeze TTS 2 alcançou:
A posição Nº 1 entre os modelos TTS de pesos abertos
Uma pontuação Elo de Qualidade de 1215
Uma vantagem de 90 pontos sobre o segundo colocado entre os modelos de pesos abertos
Para nós, esse resultado valida uma ideia central por trás do Breeze TTS 2: um modelo de pesos abertos pode entregar fala natural e expressiva e, ao mesmo tempo, dar aos desenvolvedores mais controle sobre criação de voz, performance e implantação.
O Breeze TTS 2 está disponível no BreezeBlue Creator e na API da BreezeBlue. Desenvolvedores também podem acessar os pesos do modelo Breeze TTS 2 no Hugging Face e o código oficial de inferência em PyTorch no GitHub.
