O modelo de texto para voz mais expressivo e dirigível
Tudo o que você precisa para dirigir uma interpretação
Um conjunto completo de controles para moldar cada voz e cada fala.
Comece com frieza e distanciamento, contendo a raiva. Mantenha a voz baixa e transforme as duas últimas perguntas em um sarcasmo cortante.
“ Tá bom... você tem toda a razão, eu errei. Satisfeito agora? O que mais você quer que eu faça? ”
Vozes que você dirige em linguagem natural
Recebemos uma instrução em linguagem natural — como uma fala deve soar, com quem ela deve se parecer, em que ritmo ela deve andar — e interpretamos seu roteiro de acordo. Assim você molda a entrega como um diretor orienta um ator, em vez de aceitar uma única leitura fixa.
Estas gravações mostram a mesma voz com diferentes orientações de interpretação. O texto preserva a pontuação e as pausas de cada tomada. As orientações são traduções das instruções em inglês usadas nas gravações.
Expressividade que dá para medir
No Voice Direction Benchmark aberto (700 tarefas de direção, avaliado em agosto de 2026), o Breeze TTS 2 lidera com um Voice Direction Score geral de 4.25 em 5, mantendo a similaridade de locutor em 0.67 — a voz segue a sua direção sem escorregar para outro timbre.
Explorar o benchmark completo de Voice Direction- 4.25
- Voice Direction Score geral, em escala de 1 a 5
- 0.67
- Similaridade de locutor mantida sob direção (0–1)
- 9
- Eixos de controle, do sotaque e da emoção à intenção
Tempo real, feito para baixa latência
A fala volta em streaming em milissegundos, rápido o bastante para agentes ao vivo e mídia interativa. Você cria experiências que respondem no instante em que o usuário fala, sem esperar por renderização.
Vozes que interpretam
Cada fala volta com alcance emocional real: um sussurro, uma empolgação crescente, um instante de hesitação. O resultado soa atuado, não lido em voz alta por uma máquina.
Uma biblioteca de vozes com personalidade
Escolha entre uma seleção curada de vozes, cada uma com personalidade própria — ou clone e projete a sua. Toda voz chega totalmente dirigível, pronta para atuar.
Um motor de voz, todo tipo de trabalho
Seja lá o que você estiver produzindo, as vozes da BreezeBlue foram feitas para atuar nisso.

Audiolivros e narração
Transforme manuscritos e roteiros em narração de som natural, com personagem e ritmo consistentes ao longo dos capítulos, em uma fração do tempo.

Locução para vídeo
Produza locuções para vídeos, séries e animações com tom e emoção dirigíveis, para que a leitura combine com a cena sem sessão de estúdio.

Podcasts
Crie podcasts com narração profissional e consistente que você dirige fala por fala, reduzindo o tempo gasto com gravação manual.

Agentes conversacionais
Dê aos chatbots e assistentes virtuais uma voz natural e humana que responde em tempo real, para interações que soam realmente conversacionais.

Games e personagens
Dê voz a personagens de games e elencos originais pela API de texto para voz, com entrega sensível ao contexto e emocionalmente precisa em cada cena.
Disponível no app web e via API
Uma instrução, dois jeitos de executar
Use esta orientação e este texto no Creator, ou envie-os pela API, para criar sua própria interpretação.
Instrução
Comece com frieza e distanciamento, contendo a raiva. Mantenha a voz baixa e transforme as duas últimas perguntas em um sarcasmo cortante.
Texto
Tá bom... você tem toda a razão, eu errei. Satisfeito agora? O que mais você quer que eu faça?
No Creator, coloque-os nos campos de instrução e roteiro. Pela API, envie as mesmas duas strings em uma única requisição de síntese e receba o áudio em streaming.
BreezeBlue Creator
Projete, dirija e gere vozes em uma única ferramenta de criação no navegador.

API e SDKs de Texto para voz
Integre o Texto para voz da BreezeBlue ao seu produto via APIs ou SDKs.

Para onde ir agora
Texto para voz é uma etapa de um fluxo de trabalho de voz — estas páginas cobrem as vozes que você usa como entrada e o trabalho que entrega no final.
Perguntas frequentes
Como o BreezeBlue é diferente de outras ferramentas de texto para voz?
Com o nosso modelo de voz, você escreve a instrução em linguagem natural — “fale como um locutor de rádio da madrugada, caloroso e sem pressa” — e a voz ajusta a entrega para combinar. É direção em linguagem natural, do jeito que você orientaria um dublador, e não uma lista fixa de emoções predefinidas.
Dá para ajustar a entrega de falas específicas?
Sim. Além da instrução geral, insira marcações curtas entre colchetes como [sob], [sigh] ou [giggle] em qualquer ponto do texto para moldar um momento específico. E o controle Instruction Commitment define o quanto a voz leva a sua direção adiante: do estável e contido ao ousado e expressivo.
Que tipo de voz de referência posso usar para texto para voz?
Qualquer voz da plataforma pode ser sua referência. Escolha em uma biblioteca curada — em que cada voz tem personalidade própria, em vez de uma narração intercambiável —, clone a sua a partir de uma amostra curta ou projete uma voz nova a partir de um prompt de texto.
Quais idiomas o BreezeBlue oferece?
O Breeze TTS 2 Multilingual oferece 51 idiomas. Os idiomas disponíveis dependem do modelo escolhido, e o BreezeBlue mostra apenas os idiomas expostos por esse modelo no momento.
Posso usar o áudio comercialmente?
O áudio gerado nos planos pagos do BreezeBlue pode ser usado em projetos comerciais, de vídeos e anúncios a games e audiolivros.
Quanto custa? Existe um plano gratuito?
Sim. Começar no BreezeBlue é grátis, e todo usuário pode resgatar créditos gratuitos por dia. Os planos pagos crescem a partir daí, com mais créditos mensais, mais slots de voz e geração mais rápida conforme suas necessidades aumentam. Veja o detalhamento completo na nossa página de preços.
Quais formatos de áudio posso exportar?
O áudio gerado em Texto para voz e no Studio é baixado em WAV, enquanto as vozes da Biblioteca de vozes são baixadas em MP3.
Texto para voz com IA consegue soar emocional de verdade?
Consegue — e isso é medido, não apenas prometido. No Voice Direction Benchmark aberto (agosto de 2026), o Breeze TTS 2 alcançou 4.25 em 5 de pontuação geral em nove eixos de controle, incluindo emoção, intenção e sotaque. Na prática, você descreve o sentimento que quer — uma dor contida, uma empolgação que cresce, um sarcasmo seco — e a voz interpreta, em vez de aplicar um preset pronto de alegre ou triste.
Como escrevo uma instrução de voz que o modelo vai seguir?
Trate a instrução como a anotação de um diretor: nomeie a emoção, a intenção por trás da fala e o ritmo, em vez de empilhar adjetivos. “Fale sussurrando, muito baixo e tenso, como se tivesse medo de ser ouvido” funciona melhor do que “sussurre dramaticamente”. Cada amostra desta página mostra a instrução completa na íntegra, então você pode partir de uma, mudar um único detalhe e ouvir exatamente o que muda.
A API oferece o mesmo controle por instruções do app web?
Sim. A API de texto para voz roda o mesmo modelo do Creator web, então a mesma instrução em linguagem natural produz a mesma interpretação dirigida nos dois. O áudio volta em streaming pela API, os SDKs resolvem a requisição em poucas linhas, e as entradas idênticas desta página facilitam verificar que os dois caminhos batem.
