Describe al personaje. Escucha su voz.

El diseño de voz convierte una descripción escrita en una voz original y reutilizable. Sin grabaciones ni voz de referencia: escribe quién es el personaje, escucha el resultado y guárdalo para usarlo en todo Breeze Blue.

Tú describes

Una capitana de barco curtida, de unos sesenta años. Voz grave y rasposa, ritmo lento y deliberado, un leve acento irlandés, cálida bajo la aspereza.

Tú escuchas

Una voz femenina grave y áspera, de entrega pausada y con un suave deje irlandés: severa por fuera, amable por dentro.

Interpretando la frase

«Amarra ese cabo, muchacho: el mar no perdona dos veces».

Tú describes

Un robot ayudante hiperactivo de una caricatura infantil. Tono agudo con resonancia metálica, habla rápido y siempre está a punto de reírse.

Tú escuchas

Una voz sintética brillante y saltarina, de ritmo veloz y energía risueña, que se mantiene nítida incluso a toda velocidad.

Interpretando la frase

«¡Plan nuevo! Igual que el anterior, ¡pero con muchos más jetpacks!»

Tú describes

Una guía de meditación serena, andrógina, de unos treinta y cinco años. Suave y con aire, pegada al micrófono, casi un susurro pero perfectamente clara.

Tú escuchas

Una voz íntima y aireada, de ritmo suave y medios graves cálidos: silenciosa sin perder nunca la inteligibilidad.

Interpretando la frase

«Deja pasar el pensamiento, como una nube cruzando un cielo abierto».

De la descripción escrita a la voz guardada en tres pasos

Todo el ciclo —describir, escuchar, guardar— ocurre en un mismo espacio de trabajo, y la voz que conservas se convierte en un activo permanente.

1

Describe

Escribe quién es el personaje en lenguaje natural: edad, textura, ritmo, acento, actitud. Si el personaje ya está dibujado, sube la ilustración y parte de la imagen.

2

Escucha

Genera una voz candidata y escúchala interpretar una frase de prueba. ¿No encaja del todo? Ajusta la descripción —más grave, más lenta, menos pulida— y vuelve a generar hasta que coincida con la voz que tienes en la cabeza.

3

Guarda

Guarda la elegida en tu lista de voces. Desde ese momento es un activo reutilizable: úsala en texto a voz, repártela en proyectos de Studio y llámala por ID desde la API.

Cómo escribir una descripción que funcione

Los rasgos concretos y audibles funcionan mejor que los adjetivos abstractos de personalidad. Las mejores descripciones mencionan directamente varios de estos puntos:

Edad y género
«una mujer de unos sesenta años»
Textura
«rasposa», «con aire», «metálica»
Ritmo
«lento y deliberado», «habla rápido»
Acento
«un leve acento irlandés»
Rol y actitud
«un detective agotado del turno de noche»

Con una o dos frases basta. Describe cómo suena la voz; omite lo que el personaje hace en la historia.

Cuándo el diseño de voz es la herramienta correcta

Cinco situaciones que los creadores traen al diseño de voz, y qué ocurre exactamente en cada una.

01

La voz predefinida siempre se queda a un paso

Tienes la voz clara en la cabeza y cada opción prefabricada falla por poco: el tono correcto pero la edad equivocada, el acento correcto pero demasiado pulido. El diseño de voz cierra ese último tramo: escribe exactamente la voz que oyes, escucha el resultado y afina la descripción hasta que encaje. Y cuando lo suficientemente parecido de verdad basta, partir de una voz curada sigue siendo el camino más rápido.

Elige un punto de partida en la biblioteca de voces
02

El personaje no tiene locutor de referencia

NPC de videojuegos, personajes de novela, presentadores virtuales: los personajes originales no traen una grabación que se pueda clonar. El diseño de voz no necesita audio de origen: la descripción es el origen. Convierte la ficha del personaje en una o dos frases y obtendrás una voz original sin ningún locutor humano detrás.

Mira cómo los creadores montan repartos completos de personajes
03

El personaje está dibujado, pero aún no se oye

A veces el arte llega antes que la voz. En el espacio de diseño de voz puedes partir de la propia imagen del personaje: sube la ilustración y genera una voz acorde con lo que ves, añadiendo una descripción escrita para dirigir lo que la imagen no puede mostrar: ritmo, acento, actitud.

Diseña una voz a partir de la ilustración del personaje
04

Hasta 3 candidatas por petición a la API

En la web escuchas una candidata cada vez y refinas la descripción entre intentos. La Voice Design API trabaja a mayor escala: una sola petición al endpoint de diseño devuelve hasta 3 voces candidatas a partir de la misma descripción, de modo que un pipeline puede generar una preselección de forma programática y dejar que una persona elija la definitiva.

Consulta la documentación de la Voice Design API
POST /v1/text-to-voice/design
{
  "voice_description": "A weathered sea captain in her
    sixties, low and gravelly, with a faint Irish accent.",
  "text": "Tie that line down, lad.",
  "preview_count": 3
}
05

La voz te encanta: lo que necesitas son nuevas interpretaciones

Entonces el diseño ya está terminado. Cuando la misma voz debe susurrar una frase y gritar la siguiente, conserva la voz y dirige la entrega: Breeze TTS 2 acepta instrucciones en lenguaje natural frase a frase. El diseño de voz decide quién habla; la dirección de voz decide cómo se interpreta cada frase.

Dirige interpretaciones en texto a voz

¿Diseño, biblioteca, clonación o dirección?

Cuatro herramientas, cuatro puntos de partida. Elige según lo que ya tengas.

Biblioteca de voces

Parte de una voz terminada. Explora voces curadas por estilo e idioma, escúchalas al instante y úsalas tal cual: la vía más rápida cuando una voz lista encaja.

Explora la biblioteca de voces

Clonación de voz

Parte de una grabación real. Cuando la voz ya existe y cuentas con el permiso del locutor, la clonación reproduce esa voz concreta a partir de una muestra corta autorizada.

Cómo funciona la clonación de voz de 5 segundos

Diseño de voz

Parte de una descripción: esta página. Cuando la voz solo existe en tu cabeza o en la ilustración del personaje, el diseño crea una voz original sin grabación ni locutor de referencia.

Dirección de voz

Parte de una voz en la que ya confías. La dirección cambia cómo se entrega una frase —emoción, ritmo, estilo— sin cambiar quién habla.

Dirige cualquier voz con instrucciones en lenguaje natural

Evidencia, no adjetivos

El Voice Design Benchmark abierto evalúa 1,000 tareas de diseño de voz de personajes en los principales modelos (evaluación de agosto de 2026). Breeze TTS 2 ocupa el primer puesto en ajuste al rol y diversidad de voces:

78.02

Role Fit (ajuste al rol)

Cuánto coinciden las voces generadas con el rol descrito, normalizado a 100: la puntuación más alta entre los modelos evaluados.

708

Clústeres de voz distintos

Clústeres de locutor WavLM distintos en el conjunto completo de tareas: la mayor diversidad de voces de la evaluación.

98.5%

Transcripción correcta

Porcentaje de clips generados que pronuncian con claridad su frase de prueba.

Del navegador a la API

Diseña en la aplicación web

Describe al personaje —o sube su ilustración—, escucha candidatas y guarda la elegida. Las voces guardadas entran de inmediato en tu lista, listas para usarse en texto a voz y para formar parte del reparto en proyectos de Studio.

Escala con la Voice Design API

Genera candidatas con POST /v1/text-to-voice/design y guarda la definitiva con POST /v1/text-to-voice. Las voces guardadas se referencian por ID desde los mismos endpoints que ya usa tu integración de texto a voz.

Hasta 3 candidatas por petición de diseño vía API; el espacio web escucha una candidata cada vez.

Preguntas frecuentes

¿Qué es el diseño de voz con IA?

El diseño de voz crea una voz original a partir de una descripción escrita o de la imagen de un personaje, en lugar de una grabación. Describes al hablante —edad, textura, ritmo, acento, actitud—, escuchas la voz generada y la guardas como activo reutilizable para texto a voz, proyectos de Studio y la API.

¿Necesito una muestra de voz o una grabación?

No. El diseño de voz no requiere audio de origen ni locutor de referencia: la descripción es toda la entrada. Si tienes una grabación autorizada de la voz exacta que buscas, la clonación de voz es la herramienta adecuada para ese caso.

¿De quién es una voz diseñada?

De nadie. Una voz diseñada se genera a partir de tu descripción; no es la grabación de una persona ni está pensada para reproducir a un hablante concreto. Descripciones parecidas pueden dar resultados parecidos, así que trata la voz diseñada como una creación original y no como un sonido garantizado irrepetible.

¿Puedo obtener varias voces candidatas de una misma descripción?

En la aplicación web escuchas una candidata cada vez y refinas la descripción entre intentos. A través de la API, una sola petición al endpoint de diseño puede devolver hasta 3 candidatas, ideal para flujos que preseleccionan de forma programática antes de que una persona elija la voz final.

¿Dónde puedo usar una voz diseñada después de guardarla?

En todo Breeze Blue. Una vez guardada, la voz aparece en tu lista: úsala en texto a voz, repártela en proyectos de Studio con varios personajes y referencia su ID en llamadas a la API. La misma voz, el mismo personaje, en todas las superficies.

¿Puede una misma voz diseñada expresar emociones distintas?

Sí, pero eso es dirección de voz, no diseño de voz. Conserva la voz guardada y da instrucciones frase a frase en texto a voz: susurra esta línea, sube la emoción en la siguiente. El diseño fija quién habla; la dirección cambia cómo se interpreta cada frase.

¿Cuánto cuesta el diseño de voz?

El diseño de voz usa el mismo saldo de créditos que el resto de Breeze Blue, y puedes empezar con el nivel gratuito. Consulta la página de precios para ver los planes actuales y cómo se traducen los créditos en generación.