声音克隆、音乐生成、语音识别 一个工具全部搞定,AI音频处理的“瑞士军刀”支持49个模型,audio.cpp v0.6 解压就可以运行

AI 65 24055

它能做什么? —— 一个功能强大的音频“百宝箱”

audio.cpp 几乎集成了当下最热门的音频AI任务,堪称音频处理领域的“瑞士军刀”。它支持的功能包括但不限于:

  • 🎤 语音识别与理解

    • ASR(语音识别):将语音精准地转为文字,支持多种语言。

    • VAD(语音活动检测):智能检测人声的起始和结束。

    • Diarization(说话人分离):识别“谁在什么时候说话”,非常适合会议记录场景。

    • Forced Alignment(强制对齐):将文本与音频中的发音进行时间轴对齐。

  • 🗣️ 语音合成与克隆

    • TTS(文本转语音):将文字转换为自然流畅的语音。

    • Voice Cloning(声音克隆):用几秒钟的样本音频,复制出任何人的声音。

    • Voice Conversion(声音转换):将一段音频的音色转换为另一个人的声音,但保留原话的内容和情感。

  • 🎼 音乐与音频生成

    • Music Generation(音乐生成):根据文字描述或提示生成音乐片段。

    • Audio-to-MIDI:将音频信号转换为MIDI符号,方便音乐制作。

    • Source Separation(音源分离):像“解魔方”一样,将一首歌里的人声、鼓点、贝斯等不同乐器分离出来。

  • 其他强大工具

    • 内置音频降噪、增强、重采样等实用工具。

为什么说它是“性能野兽”?

audio.cpp 不仅功能多,而且非常快!项目文档中展示了一组令人印象深刻的性能数据(在NVIDIA RTX 5090上测试),相比Python实现的版本,速度提升是成倍的:

  • 惊人的实时倍率

    • 使用Pocket TTS模型生成语音,速度是实时播放速度的48.4倍!意味着生成1小时的音频,实际只需1分多钟。

    • 使用Supertonic 3模型生成音乐,速度更是达到了恐怖的187倍实时,生成10小时的音频仅需约3分钟(在RTX 5090上)。

  • 吊打Python实现

    • 多个TTS模型的推理速度比Python参考实现快 1.8倍 到 10倍

    • 端到端延迟降低了 45% - 90%

  • 极低的首字延迟:在流式传输模式下,CUDA后端可实现低至47毫秒的首字延迟(TTFT),交互体验极其流畅。

海量模型支持,一站搞定

audio.cpp 支持了49个模型家族70多种模型变体,你熟知的许多热门模型都在其中:

  • TTS/语音克隆:Fish Audio, VibeVoice, VoxCPM2, IndexTTS2, OmniVoice, Qwen3-TTS, PocketTTS 等。

  • ASR(语音识别):Qwen3-ASR, Fun-ASR-Nano, Voxtral, SenseVoice, Citrinet 等。

  • 音乐/音源分离:Stable Audio, ACE-Step, HTDemucs, Mel-Band RoFormer 等。

  • 其他:RVC(变声器), Silero VAD, MarbleNet VAD 等。

可以看到,从通义千问(Qwen)系列到各种前沿社区模型,都得到了很好的支持。

跨平台,多后端,部署无忧

无论你是什么硬件和系统,audio.cpp 都能很好地运行:

  • 操作系统:支持 Windows、Linux、macOS

  • 硬件加速:充分利用你的硬件潜力,支持 NVIDIA(CUDA)、AMD(HIP/ROCm)、Apple Silicon(Metal)、以及通用的Vulkan和CPU 后端。

你既可以通过命令行工具(CLI)快速调用,也可以启动一个内置的 WebUI 界面,在浏览器里像使用本地软件一样操作,甚至还可以把它作为一个HTTP API服务器,集成到你的其他应用中。

整合包说明

1 大部分模型8G英伟达显卡就可以愉快玩耍

2 我只分享了windows版本

3 默认下载indextts 2.5 模型

4 模型文件我放在models。也可以自己根据需要手动下载模型文件(需开启科学上网)

点击查看

下载地址
夸克网盘

下载有疑问看下这里


相关推荐:

我要评论:

◎欢迎参与讨论,请自觉遵守国家法律法规。

已有 65 条评论

  1. 勤奋爱大船 勤奋爱大船

    录制后不知道干啥要学的太多

  2. 柔弱向小蜜蜂 柔弱向小蜜蜂

    这个之前用过,后来出现网络错误后就换了其他的了 有修复就继续使用

  3. 自由向白昼 自由向白昼

    适当 大的大事

  4. 航空醉熏 航空醉熏

    谢谢

  5. 正直与蓝天 正直与蓝天

    感谢

  6. 开心扯尊云 开心扯尊云

    感谢

  7. 爱听歌用咖啡 爱听歌用咖啡

    这个很方便欸

  8. 虚拟用冷风 虚拟用冷风

    这东西真是不错!

  9. 顺心笑酸奶 顺心笑酸奶

    你好

  10. 皮带优雅 皮带优雅

    感谢大佬

  11. 大地无辜 大地无辜

    支持大佬

    1. 猎豹冷艳 猎豹冷艳

      支持

  12. 大雁甜美 大雁甜美

  13. 微笑用鱼 微笑用鱼

    抖音录制无敌

  14. 石头粗暴 石头粗暴

    支持楼主

  15. 殷勤柠檬 殷勤柠檬

    感谢楼主

只显示最新的15条留言