Descreva o personagem. Ouça a voz dele.

O design de voz transforma uma descrição escrita em uma voz original e reutilizável. Sem gravações, sem voz de referência: escreva quem é o personagem, ouça o resultado e salve para usar em todo o Breeze Blue.

Você descreve

Uma capitã de navio marcada pelo tempo, na casa dos sessenta. Voz grave e rouca, ritmo lento e deliberado, um leve sotaque irlandês, calor por baixo da aspereza.

Você ouve

Uma voz feminina grave e áspera, de entrega tranquila e com um suave toque irlandês — dura por fora, gentil por dentro.

Interpretando a fala

“Amarra esse cabo, rapaz — o mar não perdoa duas vezes.”

Você descreve

Um robô ajudante hiperativo de desenho infantil. Tom agudo com ressonância metálica, fala rápido e está sempre à beira de uma risadinha.

Você ouve

Uma voz sintética brilhante e saltitante, de ritmo acelerado e energia risonha, que continua nítida mesmo em alta velocidade.

Interpretando a fala

“Plano novo! Igual ao antigo, só que com muito mais jetpacks!”

Você descreve

Uma guia de meditação serena, andrógina, por volta dos trinta e cinco. Suave e soprada, perto do microfone, quase um sussurro, mas perfeitamente clara.

Você ouve

Uma voz íntima e aerada, de ritmo suave e médios-graves quentes — silenciosa sem nunca perder a inteligibilidade.

Interpretando a fala

“Deixe o pensamento passar, como uma nuvem cruzando um céu aberto.”

Da descrição escrita à voz salva em três passos

O ciclo inteiro — descrever, ouvir, salvar — acontece em um único espaço de trabalho, e a voz escolhida vira um ativo permanente.

1

Descreva

Escreva quem é o personagem em linguagem natural: idade, textura, ritmo, sotaque, atitude. Se o personagem já foi desenhado, envie a arte e parta da imagem.

2

Ouça

Gere uma voz candidata e ouça-a interpretar uma fala de teste. Não ficou certo? Ajuste a descrição — mais grave, mais lenta, menos polida — e gere de novo até a voz bater com a que está na sua cabeça.

3

Salve

Salve a escolhida na sua lista de vozes. A partir daí ela é um ativo reutilizável: selecione no texto para fala, escale em projetos do Studio e chame por ID na API.

Como escrever uma descrição que funciona

Traços concretos e audíveis valem mais que adjetivos abstratos de personalidade. As melhores descrições dizem diretamente alguns destes pontos:

Idade e gênero
“uma mulher na casa dos sessenta”
Textura
“rouca”, “soprada”, “metálica”
Ritmo
“lento e deliberado”, “fala rápido”
Sotaque
“um leve sotaque irlandês”
Papel e atitude
“um detetive exausto do turno da noite”

Uma ou duas frases bastam. Descreva como a voz soa; deixe de fora o que o personagem faz na história.

Quando o design de voz é a ferramenta certa

Cinco situações que os criadores trazem para o design de voz — e o que acontece exatamente em cada uma.

01

A voz pronta sempre fica quase lá

Você ouve a voz na sua cabeça, e cada opção pronta erra por pouco: o tom certo com a idade errada, o sotaque certo, mas polido demais. O design de voz fecha esse último trecho: escreva exatamente a voz que você está ouvindo, avalie o resultado e lapide a descrição até encaixar. E quando “quase lá” realmente basta, partir de uma voz curada continua sendo o caminho mais rápido.

Escolha um ponto de partida na biblioteca de vozes
02

O personagem não tem locutor de referência

NPCs de jogos, personagens de histórias, apresentadores virtuais — personagens originais não vêm com uma gravação para clonar. O design de voz não precisa de nenhum áudio de origem: a descrição é a origem. Transforme a ficha do personagem em uma ou duas frases e o resultado é uma voz original sem nenhum locutor humano por trás.

Veja como criadores montam elencos completos de personagens
03

O personagem foi desenhado, mas ainda não tem voz

Às vezes a arte chega antes da voz. No espaço de design de voz você pode partir da própria imagem do personagem: envie a arte e gere uma voz alinhada ao que você vê, acrescentando uma descrição escrita para dirigir o que a imagem não mostra — ritmo, sotaque, atitude.

Comece uma voz a partir da arte do personagem
04

Até 3 candidatas por requisição na API

Na web você ouve uma candidata por vez e refina a descrição entre as tentativas. A Voice Design API trabalha em escala maior: uma única requisição ao endpoint de design retorna até 3 vozes candidatas da mesma descrição, permitindo que um pipeline gere uma pré-seleção de forma programática antes de uma pessoa escolher a definitiva.

Leia a documentação da Voice Design API
POST /v1/text-to-voice/design
{
  "voice_description": "A weathered sea captain in her
    sixties, low and gravelly, with a faint Irish accent.",
  "text": "Tie that line down, lad.",
  "preview_count": 3
}
05

Você ama a voz — o que falta são novas interpretações

Então o design já terminou. Quando a mesma voz precisa sussurrar uma fala e gritar a seguinte, mantenha a voz e dirija a entrega: o Breeze TTS 2 aceita instruções em linguagem natural, fala por fala. O design de voz decide quem fala; a direção de voz decide como cada fala é interpretada.

Dirija interpretações no texto para fala

Design, biblioteca, clonagem ou direção?

Quatro ferramentas, quatro pontos de partida. Escolha pelo que você já tem.

Biblioteca de vozes

Parta de uma voz pronta. Navegue por vozes curadas por estilo e idioma, ouça na hora e use como estão — o caminho mais rápido quando uma voz pronta serve.

Explore a biblioteca de vozes

Clonagem de voz

Parta de uma gravação real. Quando a voz já existe e você tem a permissão do locutor, a clonagem reproduz aquela voz específica a partir de uma amostra curta autorizada.

Como funciona a clonagem de voz com 5 segundos

Design de voz

Parta de uma descrição — esta página. Quando a voz só existe na sua cabeça ou na arte do personagem, o design cria uma voz original sem gravação e sem locutor de referência.

Direção de voz

Parta de uma voz em que você já confia. A direção muda como a fala é entregue — emoção, ritmo, estilo — sem mudar quem está falando.

Dirija qualquer voz com instruções em linguagem natural

Evidência, não adjetivos

O Voice Design Benchmark aberto avalia 1,000 tarefas de design de voz de personagens nos principais modelos (avaliação de agosto de 2026). O Breeze TTS 2 fica em primeiro lugar em adequação ao papel e diversidade de vozes:

78.02

Role Fit (adequação ao papel)

O quanto as vozes geradas correspondem ao papel descrito, normalizado para 100 — a maior pontuação entre os modelos avaliados.

708

Clusters de voz distintos

Clusters de locutor WavLM distintos no conjunto completo de tarefas — a maior diversidade de vozes da avaliação.

98.5%

Transcrição aprovada

Parcela dos clipes gerados que pronunciam com clareza a fala de teste pretendida.

Veja o ranking completo e a metodologia do Voice Design Benchmark

Voice Design Benchmark · avaliado em agosto de 2026

Do navegador à API

Crie no aplicativo web

Descreva o personagem — ou envie a arte dele —, ouça candidatas e salve a escolhida. Vozes salvas entram imediatamente na sua lista, prontas para o texto para fala e para o elenco de projetos do Studio.

Escale com a Voice Design API

Gere candidatas com POST /v1/text-to-voice/design e salve a definitiva com POST /v1/text-to-voice. Vozes salvas são endereçáveis por ID nos mesmos endpoints que sua integração de texto para fala já usa.

Até 3 candidatas por requisição de design via API; o espaço web avalia uma candidata por vez.

Perguntas frequentes

O que é design de voz com IA?

O design de voz cria uma voz original a partir de uma descrição escrita ou da imagem de um personagem, em vez de uma gravação. Você descreve o falante — idade, textura, ritmo, sotaque, atitude —, ouve a voz gerada e a salva como ativo reutilizável para texto para fala, projetos do Studio e a API.

Preciso de uma amostra de voz ou gravação?

Não. O design de voz não precisa de áudio de origem nem de locutor de referência — a descrição é toda a entrada. Se você tiver uma gravação autorizada exatamente da voz que quer, a clonagem de voz é a ferramenta certa para esse caso.

De quem é uma voz criada por design?

De ninguém. Uma voz criada por design é gerada a partir da sua descrição; não é a gravação de uma pessoa nem foi feita para reproduzir um falante específico. Descrições parecidas podem levar a resultados parecidos, então trate a voz como uma criação original, não como um som garantidamente único.

Posso obter várias vozes candidatas de uma mesma descrição?

No aplicativo web você ouve uma candidata por vez e refina a descrição entre as tentativas. Pela API, uma única requisição ao endpoint de design pode retornar até 3 candidatas — ideal para fluxos que fazem a pré-seleção de forma programática antes de uma pessoa escolher a voz final.

Onde posso usar uma voz criada depois de salvá-la?

Em todo o Breeze Blue. Depois de salva, a voz aparece na sua lista: selecione no texto para fala, escale em projetos do Studio com vários personagens e referencie o ID dela nas chamadas de API — a mesma voz, o mesmo personagem, em todas as superfícies.

A mesma voz criada pode expressar emoções diferentes?

Sim — mas isso é direção de voz, não design de voz. Mantenha a voz salva e dê instruções fala por fala no texto para fala: sussurre esta linha, aumente a emoção na próxima. O design define quem fala; a direção muda como cada fala é interpretada.

Quanto custa o design de voz?

O design de voz usa o mesmo saldo de créditos do restante do Breeze Blue, e você pode começar no nível gratuito. Veja a página de preços para os planos atuais e como os créditos se convertem em geração.