BreezeBlue는 오디오 인텔리전스의 미래가 어떤 소리여야 하는지를 다시 생각하고 있어요.
지금까지의 음성 기술은 복제에 뛰어났어요. 하지만 다음 세대의 음성 AI는 그 이상을 해내야 해요. 뉘앙스를 이해하고, 맥락에 따라 달라지며, 언제나 제어할 수 있어야 하죠.
Breeze TTS는 그 방향으로 내디딘 첫걸음이에요. 최고 수준의 지시 따르기 능력을 음성 생성에 가져온 생성형 음성 모델이죠.
01
동기
음성 생성은 지금까지 사실감을 향해 최적화돼 왔어요. 이제는 의도를 향해 최적화될 차례라고 생각해요.
이 분야는 자연스러움과 화자 일관성, 음성 복제에서 엄청난 진전을 이뤘어요. 하지만 고품질 재현이 곧 제어 가능한 생성인 것은 아니에요. 완벽하게 들리는 음성이라고 해서 늘 알맞게 느껴지거나, 맥락에 어울리거나, 디렉션을 따르지는 않으니까요.
다른 생성 분야는 이미 그 방향으로 움직였어요. 언어와 이미지 생성에서 지시 따르기는 이제 핵심 능력이에요. 사용자는 모델이 프롬프트에 정확하고 유연하며 폭넓게 반응하기를 기대해요. 음성 생성이라고 다를 이유는 없어요.
Breeze TTS는 지시 따르기를 음성의 일급 능력으로 다뤄요. 목표는 단지 자연스러운 오디오를 만드는 것이 아니라, 창작 의도로 빚어낼 수 있는 음성을 만드는 것이에요. 페르소나가 정의하는 음색, 맥락이 빚어내는 연기, 장면에 따라 달라지는 전달 방식이죠.
02
Breeze TTS — 새로운 종류의 음성 모델
Breeze TTS의 핵심은 사전학습된 대규모 언어 모델 위에 세운 오디오 언어 모델이에요. 여기에 텍스트와 오디오가 교차된 시퀀스로 추가 학습해, 텍스트와 오디오를 하나의 스트림에서 함께 모델링해요. 이 구성에서 텍스트는 지시와 대본을 제공하고, 오디오는 조건 신호이자 생성 대상이 돼요.
덕분에 Breeze TTS는 두 가지 상황 모두에서 강력한 지시 따르기 능력을 발휘해요. 텍스트만으로 새로운 음성을 만들어 내는 경우, 그리고 참조 음성을 바탕으로 기존 음성의 연기를 연출하는 경우예요.
2.1
음성 디자인: 텍스트 프롬프트로 새로운 음성 만들기
Breeze TTS는 세계 지식과 뛰어난 자연어 이해를 함께 갖추고 있어요. 페르소나든 톤이든 상황이든 스타일이든, 열린 형태의 텍스트 프롬프트를 따라 의도한 캐릭터에 맞는 음성을 생성해요.
Instructions

Breeze TTS는 InstructTTSEval로 평가해요. 음성 생성에서 복잡한 자연어 스타일 제어를 측정하는 벤치마크예요. InstructTTSEval은 Acoustic-Parameter Specification(APS), Descriptive-Style Directive(DSD), Role-Play(RP) 세 가지 지시 유형을 다루고, 유형마다 1K개의 테스트 케이스가 있어요. Breeze TTS는 이 벤치마크에서 최고 수준의 결과를 기록하며 복잡한 지시를 이해하고 다양한 음성을 생성하는 능력을 보여줬어요. 별도 언급이 없으면 평가 심판으로 Gemini-3.1-pro를 사용해요. 내부 인적 평가 결과 Gemini-2.5-pro보다 편향이 적은 점수를 주기 때문이에요.
2.2
음성 디렉션: 기존 음성에 새로운 말하기 스타일을 지시하기
음성 디렉션 능력은 긴 호흡의 오디오 데이터를 학습하는 과정에서 자연스럽게 나타나요. Breeze TTS는 자연어 지시를 따라 참조 음성 클립의 말하기 스타일을 바꾸면서도, 바탕이 되는 화자의 정체성은 그대로 지켜요. 무엇보다 가이던스 강도를 조절해 화자 일관성과 지시 따르기 사이의 균형을 맞출 수 있어요.
Reference Voice
Instructions

이 설정도 InstructTTSEval로 평가해요. 3K개의 테스트 케이스마다 Gemini TTS의 프리셋 음성 30개 중 하나를 무작위로 골라 Breeze TTS의 원샷 참조로 사용하고, 추론 시점의 가이던스 강도를 바꿔 가며 지시 따르기와 화자 일관성 사이의 트레이드오프를 측정해요. Breeze TTS는 음성 디렉션에서 최고 수준의 파레토 프런티어를 달성했고, 뚜렷한 스케일링 경향도 함께 나타났어요. 같은 수준의 지시 따르기에서는 더 큰 모델일수록 화자 일관성을 더 잘 지켜요.
03
Breeze TTS 체험하기
음성 생성은 재현을 넘어 창작과 연출, 상호작용으로 옮겨 가고 있어요. Breeze TTS로 우리는 의도를 따르고 맥락에 적응하며 더 넓은 음성 경험을 열어 주는 음성 모델을 향해 이른 첫걸음을 내딛고 있어요.
이건 시작일 뿐이에요. 우리의 미션은 연구와 제품을 통해 차세대 오디오 네이티브 경험을 만들어 내는 것이에요. 그런 경험이 어떤 모습이 될 수 있을지 함께 탐색하는 창작자와 개발자, 팀에게 Breeze TTS를 선보이게 되어 기뻐요.