Breeze TTS 2 ya es el modelo de texto a voz de pesos abiertos #1 en el ranking Provider Voice Arena de Artificial Analysis, con una puntuación Elo de calidad de 1215.
En la instantánea del ranking del 26 de agosto de 2026, Breeze TTS 2 superó a todos los demás modelos TTS de pesos abiertos evaluados por Artificial Analysis. Terminó 90 puntos Elo por delante de Fish Audio S2 Pro, en segundo lugar, y 113 puntos por delante de Step Audio EditX, en tercero.
Es un hito importante para BreezeBlue y para la IA de voz de pesos abiertos. El ranking se basa en las preferencias de oyentes humanos en pruebas a ciegas, no en puntuaciones elegidas por los proveedores ni en métricas de audio automatizadas, y sitúa a Breeze TTS 2 como el modelo de pesos abiertos mejor valorado en esta evaluación independiente de TTS.
¿Qué es la TTS Arena de Artificial Analysis?
La Text to Speech Arena de Artificial Analysis es un benchmark independiente que compara modelos de generación de voz mediante pruebas de escucha a ciegas, uno contra uno.
En cada comparación, los oyentes escuchan dos clips de audio generados a partir del mismo texto sin saber qué modelos los produjeron. Eligen el clip que suena más natural y Artificial Analysis agrega esas preferencias en una puntuación relativa Elo de calidad. Cuanto más alta es la puntuación Elo, más veces prefirieron los oyentes ese modelo frente al resto de modelos de la Arena.
El ranking está diseñado para capturar la calidad de voz percibida tal como la experimentan oyentes reales. Eso incluye cualidades como:
Naturalidad
Calidad de audio
Pronunciación
Ritmo
Prosodia y expresividad
Para la Provider Voice Arena, Artificial Analysis evalúa cada modelo con un conjunto representativo de las voces que tiene disponibles. Busca cubrir voces masculinas y femeninas con acentos estadounidense y británico, con hasta ocho voces por modelo. La puntuación resultante refleja, por tanto, la experiencia global de usar las voces asociadas a cada modelo, y no una única demo escogida a mano.
Artificial Analysis también publica el número de muestras, los rangos de confianza, los filtros por categoría y los filtros por acento para ayudar a interpretar el ranking. El Elo es una medida relativa, así que las puntuaciones pueden cambiar a medida que se recogen nuevos votos y entran nuevos modelos en la Arena.
Breeze TTS 2 lidera el ranking de pesos abiertos

Los cinco mejores modelos de pesos abiertos de la Provider Voice Arena fueron:
| Puesto | Modelo | Creador | Elo de calidad |
|---|---|---|---|
| 1 | Breeze TTS 2 | BreezeBlue | 1215 |
| 2 | Fish Audio S2 Pro | Fish Audio | 1125 |
| 3 | Step Audio EditX (March 2026) | StepFun | 1102 |
| 4 | Voxtral TTS | Mistral | 1082 |
| 5 | Magpie-Multilingual 357M | NVIDIA | 1066 |
Breeze TTS 2 mantuvo 90 puntos de ventaja sobre su competidor de pesos abiertos más cercano. En un sistema basado en Elo, cada puntuación se determina en relación con las preferencias de los oyentes en todo el conjunto de modelos, así que esa ventaja es una señal significativa de con cuánta consistencia los oyentes eligieron Breeze TTS 2.
La Provider Voice Arena completa también sitúa a Breeze TTS 2 entre los sistemas TTS mejor valorados en general, junto a los principales modelos propietarios. Como las puntuaciones de la Arena se actualizan de forma continua a medida que llegan nuevos votos, la imagen del ranking completo que aparece abajo refleja una instantánea posterior.

Por qué importa este puesto n.º 1
Creemos que los desarrolladores no deberían tener que elegir entre acceso y una calidad de voz excepcional. Los modelos de voz de pesos abiertos ofrecen más flexibilidad para inspeccionar, evaluar y ejecutar un modelo en la infraestructura propia de cada equipo, pero históricamente han ido por detrás de las API comerciales más potentes en calidad percibida.
El resultado de Artificial Analysis muestra otra imagen. En comparaciones a ciegas, los oyentes situaron a Breeze TTS 2 claramente por delante del resto de modelos de pesos abiertos y en el mismo nivel superior que los principales sistemas TTS propietarios.
Eso hace que el ranking sea relevante para los equipos que construyen:
Agentes de voz conversacionales
Personajes de videojuegos y animación
Audiolibros y contenido narrativo
Flujos de trabajo de doblaje y localización con IA
Pódcasts y herramientas para creadores
Aplicaciones de atención al cliente
En estos productos, la voz tiene que hacer algo más que pronunciar bien las palabras. Debe sonar natural, transmitir intención, mantener una identidad de voz convincente y encajar en el contexto de la interacción. Las pruebas de preferencia humana son valiosas porque los oyentes juzgan todas esas cualidades a la vez, en lugar de reducirlas a una única señal automatizada.
Creado para diseñar una voz y dirigir su interpretación
Creamos Breeze TTS 2 para dar a cada personaje la voz adecuada y a cada línea la interpretación adecuada. Combina una calidad de voz muy bien valorada con controles para crear y dirigir voces:
[Diseño de voz](/voice-design) crea una voz distintiva a partir de una descripción en lenguaje natural, sin necesidad de audio de referencia.
[Clonación de voz](/voice-cloning) usa un audio de referencia y su transcripción para conservar el timbre, el ritmo, la emoción y el estilo de un hablante.
Dirección de voz usa instrucciones en lenguaje natural para guiar el tono, la emoción, el ritmo y la entrega, manteniendo reconocible la voz de referencia.
Eventos vocales añaden momentos expresivos como risas, suspiros, toses y carraspeos directamente en el guion.
Streaming en tiempo real permite generar audio en streaming, con un tiempo hasta el primer audio (TTFA) inferior a 40 ms.
Generación en inglés y chino, disponible en la versión de pesos abiertos.
Estas capacidades hacen de Breeze TTS 2 algo más que una colección de voces predefinidas. Desarrolladores y creadores pueden diseñar un personaje, conservar su identidad y dirigir cómo interpreta una línea concreta, todo dentro del mismo modelo.
El resultado de la Arena añade una señal externa importante a ese conjunto de capacidades: cuando los oyentes compararon la voz generada sin conocer el nombre del modelo, Breeze TTS 2 fue su primera opción entre los modelos de pesos abiertos.
Un nuevo referente para la IA de voz de pesos abiertos
Ningún ranking público puede representar todos los guiones, hablantes, idiomas o entornos de producción. Pero la preferencia humana a ciegas ofrece una de las pruebas más claras de la experiencia que más importa: cómo suena realmente la voz generada para quien la escucha.
El resultado es un punto de partida sólido. Breeze TTS 2 logró:
El puesto n.º 1 entre los modelos TTS de pesos abiertos
Una puntuación Elo de calidad de 1215
90 puntos de ventaja sobre el segundo modelo de pesos abiertos
Para nosotros, este resultado valida una idea central de Breeze TTS 2: un modelo de pesos abiertos puede ofrecer una voz natural y expresiva y, al mismo tiempo, dar a los desarrolladores un control más profundo sobre la creación de voces, la interpretación y el despliegue.
Breeze TTS 2 está disponible en BreezeBlue Creator y en la API de BreezeBlue. Los desarrolladores también pueden acceder a los pesos del modelo Breeze TTS 2 en Hugging Face y al código de inferencia oficial en PyTorch en GitHub.
