Breeze TTS 2가 Artificial Analysis Provider Voice Arena 리더보드에서 품질 Elo(Quality Elo) 점수 1215로 오픈 웨이트 텍스트 음성 변환 모델 1위에 올랐어요.
2026년 8월 26일 리더보드 스냅샷에서 Breeze TTS 2는 Artificial Analysis가 평가한 다른 모든 오픈 웨이트 TTS 모델을 앞섰어요. 2위 Fish Audio S2 Pro보다 90 Elo 점수, 3위 Step Audio EditX보다 113점 높은 결과예요.
BreezeBlue에게도, 오픈 웨이트 음성 AI 전체에도 의미 있는 이정표예요. 이 순위는 벤더가 고른 점수나 자동화된 오디오 지표가 아니라 블라인드 청취 선호도를 바탕으로 매겨져요. 그래서 Breeze TTS 2는 이 독립적인 TTS 평가에서 가장 높은 평가를 받은 오픈 웨이트 모델로 자리 잡았어요.
Artificial Analysis TTS 아레나란?
Artificial Analysis Text to Speech Arena는 블라인드 1:1 청취 테스트로 음성 생성 모델을 비교하는 독립 벤치마크예요.
각 비교에서 청취자는 같은 텍스트로 생성한 오디오 클립 두 개를 어떤 모델이 만들었는지 모른 채 들어요. 더 자연스럽게 들리는 클립을 고르면, Artificial Analysis가 그 선호도를 모아 상대 지표인 품질 Elo 점수로 집계해요. Elo 점수가 높을수록 아레나의 다른 모델과 비교했을 때 청취자가 그 모델을 더 자주 선택했다는 뜻이에요.
이 리더보드는 실제 청취자가 느끼는 음성 품질을 담아내도록 설계됐어요. 다음과 같은 요소가 여기에 포함돼요.
자연스러움
오디오 품질
발음
속도감
운율과 표현력
Provider Voice Arena에서 Artificial Analysis는 각 모델이 제공하는 음성 가운데 대표성 있는 세트를 골라 평가해요. 미국과 영국 억양의 남성·여성 음성을 모델당 최대 8개까지 포함하는 것이 목표예요. 그래서 점수는 손수 고른 데모 하나가 아니라, 각 모델에 딸린 음성을 실제로 쓸 때의 전반적인 경험을 반영해요.
Artificial Analysis는 순위를 해석하는 데 도움이 되도록 샘플 수, 신뢰 구간, 카테고리 필터, 억양 필터도 함께 공개해요. Elo는 상대 지표라서 새 투표가 쌓이고 새 모델이 아레나에 들어오면 점수가 바뀔 수 있어요.
오픈 웨이트 리더보드를 이끄는 Breeze TTS 2

Provider Voice Arena의 오픈 웨이트 모델 상위 5개는 다음과 같았어요.
| 순위 | 모델 | 개발사 | 품질 Elo |
|---|---|---|---|
| 1 | Breeze TTS 2 | BreezeBlue | 1215 |
| 2 | Fish Audio S2 Pro | Fish Audio | 1125 |
| 3 | Step Audio EditX (March 2026) | StepFun | 1102 |
| 4 | Voxtral TTS | Mistral | 1082 |
| 5 | Magpie-Multilingual 357M | NVIDIA | 1066 |
Breeze TTS 2는 가장 가까운 오픈 웨이트 경쟁 모델을 90점 차로 앞섰어요. Elo 기반 시스템에서는 모든 점수가 모델 전체에 걸친 청취자 선호도에 따라 상대적으로 정해지기 때문에, 이 격차는 청취자가 얼마나 꾸준히 Breeze TTS 2를 골랐는지 보여 주는 의미 있는 신호예요.
전체 Provider Voice Arena에서도 Breeze TTS 2는 주요 독점 모델과 나란히 가장 높은 평가를 받은 TTS 시스템에 속해요. 아레나 점수는 새 투표가 들어올 때마다 계속 갱신되기 때문에, 아래 전체 리더보드 이미지는 조금 더 나중의 스냅샷이에요.

이 1위가 중요한 이유
저희는 개발자가 접근성과 뛰어난 음성 품질 사이에서 하나를 포기해야 해서는 안 된다고 믿어요. 오픈 웨이트 음성 모델은 팀의 자체 인프라 안에서 모델을 들여다보고, 평가하고, 실행할 수 있는 더 큰 유연성을 주지만, 체감 품질에서는 그동안 가장 강력한 상용 API에 뒤처져 왔어요.
Artificial Analysis의 결과는 다른 그림을 보여 줘요. 블라인드 비교에서 청취자는 Breeze TTS 2를 나머지 오픈 웨이트 모델보다 확실히 앞에, 그리고 주요 독점 TTS 시스템과 같은 최상위 그룹에 두었어요.
그래서 이 순위는 다음과 같은 제품을 만드는 팀에게 의미가 있어요.
대화형 보이스 에이전트
게임과 애니메이션 캐릭터
오디오북과 내러티브 콘텐츠
AI 더빙과 현지화 워크플로
팟캐스트와 크리에이터 도구
고객 서비스 애플리케이션
이런 제품에서 음성은 단어를 정확히 발음하는 것 이상을 해내야 해요. 자연스럽게 들리고, 의도를 담고, 설득력 있는 음성 정체성을 유지하고, 상호작용의 맥락에 맞아야 하죠. 사람의 선호도 테스트가 가치 있는 이유는, 청취자가 이 품질들을 하나의 자동화된 신호로 환원하지 않고 한꺼번에 판단하기 때문이에요.
음성을 디자인하고 연기를 연출하도록 만들었어요
저희는 모든 캐릭터에게 알맞은 음성을, 모든 대사에 알맞은 연기를 주기 위해 Breeze TTS 2를 만들었어요. 높은 평가를 받은 음성 품질에 음성을 만들고 연출하는 컨트롤을 더했어요.
[음성 디자인](/voice-design)은 참조 오디오 없이 자연어 설명만으로 개성 있는 음성을 만들어요.
[음성 복제](/voice-cloning)는 참조 오디오와 그 대본을 사용해 화자의 음색과 리듬, 감정, 스타일을 보존해요.
음성 디렉션은 자연어 지시로 톤과 감정, 속도, 전달 방식을 조정하면서도 참조 음성을 계속 알아볼 수 있게 유지해요.
보컬 이벤트는 웃음, 한숨, 기침, 헛기침 같은 표현의 순간을 대본 안에 바로 넣어요.
실시간 스트리밍은 스트리밍 오디오 생성을 지원하고, 첫 오디오까지의 시간(TTFA)이 40ms 미만이에요.
영어와 중국어 생성을 오픈 웨이트 릴리스에서 지원해요.
이런 능력 덕분에 Breeze TTS 2는 프리셋 음성 모음 그 이상이에요. 개발자와 크리에이터는 캐릭터를 디자인하고, 그 정체성을 보존하고, 특정 대사를 어떻게 연기할지 연출하는 일을 모두 같은 모델 안에서 할 수 있어요.
아레나 결과는 이 능력 세트에 중요한 외부 신호를 더해 줘요. 청취자가 모델 이름을 모른 채 생성된 음성을 비교했을 때, Breeze TTS 2가 오픈 웨이트 모델 중 가장 선호하는 선택으로 떠올랐다는 거예요.
오픈 웨이트 음성 AI의 새로운 기준
어떤 공개 리더보드도 모든 대본과 화자, 언어, 프로덕션 환경을 대표할 수는 없어요. 하지만 블라인드 청취 선호도는 가장 중요한 경험, 즉 생성된 음성이 청취자에게 실제로 어떻게 들리는지를 가장 분명하게 시험하는 방법 중 하나예요.
이 결과는 든든한 출발점이에요. Breeze TTS 2가 이룬 것은 다음과 같아요.
오픈 웨이트 TTS 모델 중 1위
품질 Elo 점수 1215
오픈 웨이트 2위 모델을 90점 차로 앞섬
저희에게 이 결과는 Breeze TTS 2의 핵심 아이디어를 입증해 줘요. 오픈 웨이트 모델도 자연스럽고 표현력 있는 음성을 내면서, 개발자에게 음성 생성과 연기, 배포에 대한 더 깊은 제어권을 줄 수 있다는 거예요.
Breeze TTS 2는 BreezeBlue Creator와 BreezeBlue API에서 사용할 수 있어요. 개발자는 Hugging Face의 Breeze TTS 2 모델 웨이트와 GitHub의 공식 PyTorch 추론 코드도 이용할 수 있어요.
