不知道你有没有过这种困扰:想做短视频配音,但找不到合适的音色;想给有声书加旁白,但市面上的 TTS 机械感太重;或者想克隆某个角色的声音,却被商业 API 的昂贵价格劝退……
最近,开源社区出现了一匹黑马——Breeze TTS 2。它在 Artificial Analysis 的 TTS 排行榜上,开源权重模型排名第一,Elo 评分高达 1215 分,不仅碾压了同级别的开源模型,甚至超越了一部分闭源商业产品。
而且,它原生支持中文和英文,中文发音自然流畅,几乎听不出机器味。更厉害的是,它不仅仅是一个“朗读器”,而是一个声音创作平台。
✨ 三大核心能力,重新定义 TTS
1. 🎨 声音设计(Voice Design)—— 凭空“捏”出你想要的声音
不需要任何参考音频,你只需要输入一段自然语言描述,比如“一位温暖、知性的年轻女性,声音清晰,语速平静且富有感染力”,模型就能直接生成一个符合描述的全新声音。你可以自由创造无数种音色,再也不用到处找音频素材了。
2. 🎙️ 声音克隆(Voice Clone)—— 复刻任何人的声音
只要提供一段 3~10 秒的干净语音(以及对应的文字稿),就能完美克隆说话人的音色和韵律。无论是家人、朋友,还是你喜欢的影视角色,都能用克隆出来的声音朗读任意新文本。效果非常逼真,细节还原度极高。
3. 🎛️ 声音指导(Voice Direction)—— 像导演一样调教语气
在克隆声音的基础上,你还可以用指令控制语气、情绪和节奏。比如让原本平静的声音“语速放慢,语气严肃而克制”,或者“带着调侃的笑意”。这种细粒度的控制,让合成语音能精准匹配任何场景。
🎭 让声音更有“人味儿”的彩蛋
Breeze TTS 2 支持在文本中嵌入特殊标签,例如 (laugh)、(sigh)、[笑]、[叹气] 等。模型会在这些位置自然地生成笑声、叹气、咳嗽等非语言声音,让合成语音瞬间生动起来,彻底告别冷冰冰的机器感。
🧰 汉化增强版界面,开箱即用
官方虽然提供了代码,但界面是纯英文的,且缺少快捷操作。为了方便国内小伙伴体验,我对官方 Gradio 界面做了以下本地化增强(所有修改均已开源):
全界面汉化:所有菜单、按钮、提示信息均为中文,零学习成本。
内置中文示例:直接展示多条中文样例,点一下就能试听,快速了解效果。
一键插入事件标签:文本框下方新增 8 个快捷按钮(含中英文标签),点击即可将标签插入当前光标位置,不用手打。
自动保存音频:生成的 WAV 文件自动保存到
output/目录,文件名按日期+随机数命名(如20260829_123456_7890.wav),方便整理归档。
有了这个增强版界面,你无需编写任何代码,打开浏览器就能像使用专业软件一样体验所有功能。
⚖️ 使用前必知:许可证限制
重要提醒:Breeze TTS 2 的源代码采用 Apache 2.0 开源协议,可以自由修改和使用。但模型权重遵循 “研究与非商业许可”,严禁用于任何商业目的(包括但不限于嵌入商业产品、提供付费 API、商业内容创作等)。
如需商业使用,请直接联系 BreezeBlue 公司获取书面授权。
请大家尊重开源协议,在合法合规的范围内发挥它的价值。
📢 写在最后
Breeze TTS 2 的出现,让高质量、高表现力的 TTS 能力真正走进了开源世界。无论你是 AI 爱好者、内容创作者,还是研究者,都值得亲自感受一下它带来的惊艳效果。


整合包说明
1 英伟达显卡8G 就可以玩耍了
2 需要显卡能支持flash_attn,有些过于老旧的显卡可能不支持
3 人气高就继续开发
随便生成几个音频你们听下