El modelo de texto a voz más expresivo y dirigible

Todo lo que necesitas para dirigir una interpretación

Un juego completo de controles para moldear cada voz y cada línea.

Empieza con frialdad y distancia, conteniendo la ira. Mantén la voz baja y carga las dos últimas preguntas de un sarcasmo cortante.

“ Vale, tienes razón en todo, yo me equivoqué. ¿Así te vale? ¿Qué más quieres que haga? ”

Voces que diriges en lenguaje natural

Tomamos una instrucción en lenguaje natural — cómo debe sentirse una línea, a quién debe parecerse, con qué ritmo debe avanzar — e interpretamos tu guion para que coincida. Así moldeas la entrega como un director guía a un actor, en lugar de conformarte con una sola lectura fija.

Estas grabaciones muestran una misma voz con distintas indicaciones de interpretación. El texto conserva la puntuación y las pausas de cada toma. Las indicaciones son traducciones de las instrucciones en inglés usadas para grabar.

Expresividad que se puede medir

En el Voice Direction Benchmark abierto (700 tareas de dirección, evaluado en agosto de 2026), Breeze TTS 2 lidera con un Voice Direction Score global de 4.25 sobre 5, manteniendo la similitud de hablante en 0.67: la voz sigue tu dirección sin derivar hacia otro timbre.

Explorar el benchmark completo de Voice Direction
4.25
Voice Direction Score global, en escala de 1 a 5
0.67
Similitud de hablante mantenida bajo dirección (0–1)
9
Ejes de control, del acento y la emoción a la intención

Tiempo real, hecho para baja latencia

El audio llega en streaming en milisegundos, lo bastante rápido para agentes en vivo y medios interactivos. Puedes crear experiencias que responden en el instante en que el usuario habla, sin esperar a que se renderice nada.

Voces que interpretan

Cada línea vuelve con un rango emocional real: un susurro, una emoción que crece, un instante de duda. El resultado suena actuado, no leído en voz alta por una máquina.

Una biblioteca de voces con carácter real

Elige entre una selección curada de voces, cada una con su propia personalidad, o clona y diseña la tuya. Todas las voces son totalmente dirigibles y están listas para actuar.

Un solo motor de voz, para todo tipo de trabajo

Sea lo que sea que estés produciendo, las voces de BreezeBlue están hechas para interpretarlo.

Interfaz de lector de audiolibros narrando un capítulo

Audiolibros y narración

Convierte manuscritos y guiones en narración de sonido natural, con personaje y ritmo consistentes a lo largo de los capítulos, en una fracción del tiempo.

Fotograma de video con un subtítulo de voz en off dirigida

Voces en off para video

Produce voces en off para videos, series y animaciones con tono y emoción dirigibles, para que la lectura encaje con la escena sin pasar por un estudio.

Transcripción de una conversación de podcast entre dos anfitriones

Podcasts

Crea podcasts con una narración profesional y consistente que puedes dirigir línea por línea, reduciendo el tiempo de grabación manual.

Asistente de chat respondiendo con una voz natural

Agentes conversacionales

Dale a tus chatbots y asistentes virtuales una voz natural y humana que responde en tiempo real, para interacciones que se sienten realmente conversacionales.

Personajes de videojuego con interpretación emocional

Videojuegos y personajes

Pon voz a personajes de videojuegos y repartos originales mediante la API de texto a voz, con una interpretación consciente del contexto y emocionalmente precisa para cada escena.

Disponible en la app web y vía API

Una instrucción, dos formas de ejecutarla

Usa esta indicación y este texto en el Creator, o envíalos por la API, para crear tu propia interpretación.

Instrucción

Empieza con frialdad y distancia, conteniendo la ira. Mantén la voz baja y carga las dos últimas preguntas de un sarcasmo cortante.

Texto

Vale, tienes razón en todo, yo me equivoqué. ¿Así te vale? ¿Qué más quieres que haga?

En el Creator, colócalos en los campos de instrucción y guion. Por la API, envía las mismas dos cadenas en una sola petición de síntesis y recibe el audio en streaming.

BreezeBlue Creator

Diseña, dirige y genera voces en una sola herramienta de creación en el navegador.

Espacio de trabajo de texto a voz de BreezeBlue Creator con instrucción, guion y reproductor

API y SDK de Texto a voz

Integra Texto a voz de BreezeBlue en tu producto mediante API o SDK.

Ejemplo de código del SDK de Python transmitiendo audio de texto a voz de BreezeBlue

Preguntas frecuentes

¿En qué se diferencia BreezeBlue de otras herramientas de texto a voz?

Con nuestro modelo de voz, escribes tu instrucción en lenguaje natural — “habla como un locutor de radio nocturna, cálido y sin prisa” — y la voz ajusta su interpretación para que coincida. Es dirección en lenguaje natural, como le explicarías el papel a un actor de doblaje, y no una lista fija de emociones predefinidas.

¿Puedo ajustar la interpretación de líneas concretas?

Sí. Además de la instrucción general, puedes insertar señales breves entre corchetes como [sob], [sigh] o [giggle] en cualquier punto del texto para moldear un solo momento. Y el control Instruction Commitment te permite decidir hasta dónde lleva la voz tu dirección: de estable y contenida a audaz y expresiva.

¿Qué tipo de voz de referencia puedo usar para texto a voz?

Cualquier voz de la plataforma puede ser tu referencia. Elige de una biblioteca curada — donde cada voz tiene una personalidad propia en vez de ser una narración intercambiable —, clona la tuya a partir de una muestra corta o diseña una voz nueva desde un prompt de texto.

¿Qué idiomas admite BreezeBlue?

Breeze TTS 2 Multilingual admite 51 idiomas. Los idiomas disponibles dependen del modelo que elijas, y BreezeBlue solo muestra los que ese modelo expone en cada momento.

¿Puedo usar el audio comercialmente?

El audio generado en los planes de pago de BreezeBlue puede usarse en proyectos comerciales, desde videos y anuncios hasta juegos y audiolibros.

¿Cuánto cuesta? ¿Hay un plan gratuito?

Sí. Empezar con BreezeBlue es gratis y cada usuario puede reclamar créditos gratuitos todos los días. Los planes de pago crecen desde ahí con más créditos mensuales, más espacios de voz y generación más rápida a medida que aumentan tus necesidades. Consulta el desglose completo en nuestra página de precios.

¿Qué formatos de audio puedo exportar?

El audio generado en Texto a voz y Studio se descarga en WAV, mientras que las voces de la Biblioteca de voces se descargan en MP3.

¿El texto a voz con IA puede sonar realmente emocional?

Sí, y está medido, no solo prometido. En el Voice Direction Benchmark abierto (agosto de 2026), Breeze TTS 2 obtuvo 4.25 sobre 5 de puntuación global en nueve ejes de control que incluyen emoción, intención y acento. En la práctica describes el sentimiento que buscas — un dolor contenido, una emoción que crece, un sarcasmo seco — y la voz lo interpreta, en lugar de aplicar un preset genérico de alegre o triste.

¿Cómo escribo una instrucción de voz que el modelo siga?

Trátala como la nota de un director: nombra la emoción, la intención detrás de la línea y el ritmo, en vez de acumular adjetivos. “Dilo susurrando, muy bajo y con tensión, como si temieras que alguien te escuche” funciona mejor que “susurra dramáticamente”. Cada muestra de esta página enseña su instrucción completa tal cual, así que puedes partir de una, cambiar un solo detalle y escuchar exactamente qué cambia.

¿La API me da el mismo control por instrucciones que la app web?

Sí. La API de texto a voz ejecuta el mismo modelo que el Creator web, así que la misma instrucción en lenguaje natural produce la misma interpretación dirigida en ambos. El audio llega en streaming por la API, los SDK resuelven la petición en pocas líneas, y las entradas idénticas de esta página te permiten comprobar que las dos rutas coinciden.