它能做什么? —— 一个功能强大的音频“百宝箱”
audio.cpp 几乎集成了当下最热门的音频AI任务,堪称音频处理领域的“瑞士军刀”。它支持的功能包括但不限于:
🎤 语音识别与理解
ASR(语音识别):将语音精准地转为文字,支持多种语言。
VAD(语音活动检测):智能检测人声的起始和结束。
Diarization(说话人分离):识别“谁在什么时候说话”,非常适合会议记录场景。
Forced Alignment(强制对齐):将文本与音频中的发音进行时间轴对齐。
🗣️ 语音合成与克隆
TTS(文本转语音):将文字转换为自然流畅的语音。
Voice Cloning(声音克隆):用几秒钟的样本音频,复制出任何人的声音。
Voice Conversion(声音转换):将一段音频的音色转换为另一个人的声音,但保留原话的内容和情感。
🎼 音乐与音频生成
Music Generation(音乐生成):根据文字描述或提示生成音乐片段。
Audio-to-MIDI:将音频信号转换为MIDI符号,方便音乐制作。
Source Separation(音源分离):像“解魔方”一样,将一首歌里的人声、鼓点、贝斯等不同乐器分离出来。
其他强大工具
内置音频降噪、增强、重采样等实用工具。
为什么说它是“性能野兽”?
audio.cpp 不仅功能多,而且非常快!项目文档中展示了一组令人印象深刻的性能数据(在NVIDIA RTX 5090上测试),相比Python实现的版本,速度提升是成倍的:
惊人的实时倍率:
使用Pocket TTS模型生成语音,速度是实时播放速度的48.4倍!意味着生成1小时的音频,实际只需1分多钟。
使用Supertonic 3模型生成音乐,速度更是达到了恐怖的187倍实时,生成10小时的音频仅需约3分钟(在RTX 5090上)。
吊打Python实现:
多个TTS模型的推理速度比Python参考实现快 1.8倍 到 10倍。
端到端延迟降低了 45% - 90%。
极低的首字延迟:在流式传输模式下,CUDA后端可实现低至47毫秒的首字延迟(TTFT),交互体验极其流畅。
海量模型支持,一站搞定
audio.cpp 支持了49个模型家族和70多种模型变体,你熟知的许多热门模型都在其中:
TTS/语音克隆:Fish Audio, VibeVoice, VoxCPM2, IndexTTS2, OmniVoice, Qwen3-TTS, PocketTTS 等。
ASR(语音识别):Qwen3-ASR, Fun-ASR-Nano, Voxtral, SenseVoice, Citrinet 等。
音乐/音源分离:Stable Audio, ACE-Step, HTDemucs, Mel-Band RoFormer 等。
其他:RVC(变声器), Silero VAD, MarbleNet VAD 等。
可以看到,从通义千问(Qwen)系列到各种前沿社区模型,都得到了很好的支持。
跨平台,多后端,部署无忧
无论你是什么硬件和系统,audio.cpp 都能很好地运行:
操作系统:支持 Windows、Linux、macOS。
硬件加速:充分利用你的硬件潜力,支持 NVIDIA(CUDA)、AMD(HIP/ROCm)、Apple Silicon(Metal)、以及通用的Vulkan和CPU 后端。
你既可以通过命令行工具(CLI)快速调用,也可以启动一个内置的 WebUI 界面,在浏览器里像使用本地软件一样操作,甚至还可以把它作为一个HTTP API服务器,集成到你的其他应用中。





整合包说明
1 大部分模型8G英伟达显卡就可以愉快玩耍
2 我只分享了windows版本
3 默认下载indextts 2.5 模型
4 模型文件我放在models。也可以自己根据需要手动下载模型文件(需开启科学上网)
录制后不知道干啥要学的太多
这个之前用过,后来出现网络错误后就换了其他的了 有修复就继续使用
适当 大的大事
谢谢
感谢
感谢
这个很方便欸
这东西真是不错!
你好
感谢大佬
支持大佬
支持
牛
抖音录制无敌
支持楼主
感谢楼主