受够了机械配音?这个开源TTS能笑会叹气,中文自然到离谱!声音设计+声音克隆+声音指导 Breeze-TTS-2 一键整合包 解压即可使用 v20260829

AI 2855

不知道你有没有过这种困扰:想做短视频配音,但找不到合适的音色;想给有声书加旁白,但市面上的 TTS 机械感太重;或者想克隆某个角色的声音,却被商业 API 的昂贵价格劝退……

最近,开源社区出现了一匹黑马——Breeze TTS 2。它在 Artificial Analysis 的 TTS 排行榜上,开源权重模型排名第一,Elo 评分高达 1215 分,不仅碾压了同级别的开源模型,甚至超越了一部分闭源商业产品。

而且,它原生支持中文和英文,中文发音自然流畅,几乎听不出机器味。更厉害的是,它不仅仅是一个“朗读器”,而是一个声音创作平台

✨ 三大核心能力,重新定义 TTS

1. 🎨 声音设计(Voice Design)—— 凭空“捏”出你想要的声音
不需要任何参考音频,你只需要输入一段自然语言描述,比如“一位温暖、知性的年轻女性,声音清晰,语速平静且富有感染力”,模型就能直接生成一个符合描述的全新声音。你可以自由创造无数种音色,再也不用到处找音频素材了。

2. 🎙️ 声音克隆(Voice Clone)—— 复刻任何人的声音
只要提供一段 3~10 秒的干净语音(以及对应的文字稿),就能完美克隆说话人的音色和韵律。无论是家人、朋友,还是你喜欢的影视角色,都能用克隆出来的声音朗读任意新文本。效果非常逼真,细节还原度极高。

3. 🎛️ 声音指导(Voice Direction)—— 像导演一样调教语气
在克隆声音的基础上,你还可以用指令控制语气、情绪和节奏。比如让原本平静的声音“语速放慢,语气严肃而克制”,或者“带着调侃的笑意”。这种细粒度的控制,让合成语音能精准匹配任何场景。

🎭 让声音更有“人味儿”的彩蛋

Breeze TTS 2 支持在文本中嵌入特殊标签,例如 (laugh)(sigh)[笑][叹气] 等。模型会在这些位置自然地生成笑声、叹气、咳嗽等非语言声音,让合成语音瞬间生动起来,彻底告别冷冰冰的机器感。

🧰 汉化增强版界面,开箱即用

官方虽然提供了代码,但界面是纯英文的,且缺少快捷操作。为了方便国内小伙伴体验,我对官方 Gradio 界面做了以下本地化增强(所有修改均已开源):

  • 全界面汉化:所有菜单、按钮、提示信息均为中文,零学习成本。

  • 内置中文示例:直接展示多条中文样例,点一下就能试听,快速了解效果。

  • 一键插入事件标签:文本框下方新增 8 个快捷按钮(含中英文标签),点击即可将标签插入当前光标位置,不用手打。

  • 自动保存音频:生成的 WAV 文件自动保存到 output/ 目录,文件名按日期+随机数命名(如 20260829_123456_7890.wav),方便整理归档。

有了这个增强版界面,你无需编写任何代码,打开浏览器就能像使用专业软件一样体验所有功能。

⚖️ 使用前必知:许可证限制

重要提醒:Breeze TTS 2 的源代码采用 Apache 2.0 开源协议,可以自由修改和使用。但模型权重遵循 “研究与非商业许可”严禁用于任何商业目的(包括但不限于嵌入商业产品、提供付费 API、商业内容创作等)。
如需商业使用,请直接联系 BreezeBlue 公司获取书面授权。

请大家尊重开源协议,在合法合规的范围内发挥它的价值。

📢 写在最后

Breeze TTS 2 的出现,让高质量、高表现力的 TTS 能力真正走进了开源世界。无论你是 AI 爱好者、内容创作者,还是研究者,都值得亲自感受一下它带来的惊艳效果。

整合包说明

1 英伟达显卡8G 就可以玩耍了

2 需要显卡能支持flash_attn,有些过于老旧的显卡可能不支持

3 人气高就继续开发

随便生成几个音频你们听下

点击查看

下载地址
夸克网盘

下载有疑问看下这里


相关推荐:

我要评论:

◎欢迎参与讨论,请自觉遵守国家法律法规。