小红书出品 开源TTS新选择:FireRedTTS3 实现高质量 对话语音合成 声音克隆 +声音设计+ 语音编辑 一键整合包 v20260824

小红书出品 开源TTS新选择:FireRedTTS3 实现高质量 对话语音合成 声音克隆 +声音设计+ 语音编辑 一键整合包 v20260824

FireRedTTS 是一个开源的文本转语音(Text-to-Speech, TTS)项目,由 FireRedTeam 开发并维护。该项目致力于提供高质量、低延迟、易于集成的语音合成能力,适用于多种应用场景,如语音助手、有声读物生成、无障碍访问、智能客服等。项目基于深度学习技术,采用了先进的神经网络架构(如 Tacotron、FastSpee...
AI,开源 1.9万 0
声音克隆、音乐生成、语音识别 一个工具全部搞定,支持MiniMax-Music3,AI音频处理的“瑞士军刀”支持49个模型,支持audio.cpp v0.6 解压就可以运行

声音克隆、音乐生成、语音识别 一个工具全部搞定,支持MiniMax-Music3,AI音频处理的“瑞士军刀”支持49个模型,支持audio.cpp v0.6 解压就可以运行

它能做什么? —— 一个功能强大的音频“百宝箱”audio.cpp 几乎集成了当下最热门的音频AI任务,堪称音频处理领域的“瑞士军刀”。它支持的功能包括但不限于:🎤 语音识别与理解ASR(语音识别):将语音精准地转为文字,支持多种语言。VAD(语音活动检测):智能检测人声的起始和结束。Diarization(说话人分离):识别“谁在...
AI 2.5万 5
IndexTTS v2.5 重新定义中文语音合成,让AI发音比真人更懂‘断句’!AI文本转语音一键整合包 新增支持多人对话 附效果演示 20260816更新

IndexTTS v2.5 重新定义中文语音合成,让AI发音比真人更懂‘断句’!AI文本转语音一键整合包 新增支持多人对话 附效果演示 20260816更新

IndexTTS是由B站推出的一款基于XTTS和Tortoise的GPT风格文本转语音(TTS)模型。该项目在中文文本转语音领域展现出显著的技术优势和应用,以下从项目背景、技术架构、应用场景、社区支持及未来挑战五个维度进行详细介绍。一、项目背景:重新定义中文TTS技术标杆IndexTTS的诞生旨在解决传统TTS系统在中文语音合成中的两大核心痛...
AI,软件 2.4万 44
小米出品开源 MiDashengLM-Gen 只要写一段话,AI就能帮你生成一段完整的音频 一键整合包 v20260814

小米出品开源 MiDashengLM-Gen 只要写一段话,AI就能帮你生成一段完整的音频 一键整合包 v20260814

🎵 用AI凭空“捏造”声音?这个模型有点酷!输入文字描述,AI就能生成一段完整的音频——包括人声、音乐、环境音效!你有没有想过,只要写一段话,AI就能帮你生成一段完整的音频?不是简单的文字转语音,而是包含人声对话、背景音乐、环境音效、气氛渲染的完整声音场景。今天要介绍的 MiDashengLM-Gen,就是这样一个“声音魔法师”。它...
AI 6187 0
Audio8-TTS 智能语音合成工具,一键生成自然人声 上传一段音频,AI 学会用你的声音朗读任何文字 一键整合包 v20260801

Audio8-TTS 智能语音合成工具,一键生成自然人声 上传一段音频,AI 学会用你的声音朗读任何文字 一键整合包 v20260801

这是什么?这是一个智能语音合成工具,能把您输入的文字转换成自然流畅的语音。无论是几百字的短文还是几千字的长文章,它都能轻松处理。核心功能🎯 智能长文本处理自动分块:遇到长文本会自动切分成多个小段,一段一段合成无缝拼接:合成后自动拼接,使用智能淡入淡出技术,听起来流畅自然智能识别:自动判断文本是中文还是英文,调整最佳分割策略🎤 声音克隆功能参考...
AI 3417 2
多图预览 开源 线谱打谱软件 MuseScore 中文多语免费版 v4.7.4

多图预览 开源 线谱打谱软件 MuseScore 中文多语免费版 v4.7.4

介绍MuseScore是一款功能强大的乐谱编辑软件,它以其跨平台、免费开源的特点,在音乐创作和乐谱编辑领域广受好评。以下是对MuseScore的详细介绍:一、软件概述MuseScore(中文有时译作缪斯乐谱或谬斯乐谱)是一个支持Linux、Microsoft Windows和Mac操作系统的乐谱编辑软件。它以其所见即所得的编辑器特性,让用户能...
软件 3481 0
 AI 音视频深度分析引擎 audio-think v1.0 生成字幕+音频内容分析+转录文本 一键整合包 解压即可使用

AI 音视频深度分析引擎 audio-think v1.0 生成字幕+音频内容分析+转录文本 一键整合包 解压即可使用

🎙️ 你的音视频“第二大脑”:AI 深度分析引擎,让每一段声音都变成可检索的智慧你有没有过这样的经历——收藏了几百个小时的播客,却再也没打开过第二期;开完一场两小时的会议,翻遍笔记也找不到那个关键数据;刷到一个干货满满的视频教程,一周后只记得“好像讲了个很厉害的东西”;听完一本有声小说,想和朋友分享某个情节,却怎么也想不起在第几章……信息爆炸...
AI 3702 3
音乐卡点视频 一键生成 支持图片+视频素材  新增镜头分镜切割+人声分离+ MTV 模式+音频编辑 无显卡要求 剑二十七原创作品 KA v20260629

音乐卡点视频 一键生成 支持图片+视频素材 新增镜头分镜切割+人声分离+ MTV 模式+音频编辑 无显卡要求 剑二十七原创作品 KA v20260629

卡点视频生成器是一款基于 AI大模型 智能视频自动生成工具,专为音乐爱好者、短视频创作者、自媒体运营者设计。它能根据你上传的音乐节拍/鼓点,自动从指定图片或视频素材中智能选取片段,生成节奏精准、视觉流畅的“卡点”视频,适用于抖音、快手、B站、Instagram 等平台。无需剪辑经验,一键生成专业级卡点视频!🎯 核心功能1. 🖼️ 图片卡点模式...
AI 1.4万 0
网易开源AI语音克隆大模型Confucius4-TTS 极速克隆 支持14种语言 支持情感迁移 一键整合包 v20260621 解压即可使用

网易开源AI语音克隆大模型Confucius4-TTS 极速克隆 支持14种语言 支持情感迁移 一键整合包 v20260621 解压即可使用

想象一下这样的场景: 录一段自己说话的声音,AI 就能用你的音色,带着你的情绪,流利地说出英语、日语、韩语……而且完全听不出是外国人在说。这不是科幻电影,而是Confucius4-TTS正在做的事。Confucius4-TTS 是由网易有道开发的一款前沿语音合成(TTS)系统。它的核心理念可以用一句话概括:「 一种音色,任意语言 」简单来说...
AI 4000 0
专为无显卡的小伙伴打造的AI语音生成工具,小巧,免费,无字数限制,速度超快,解压即可使用 Edge-TTS-Text-to-Speech-3.0

专为无显卡的小伙伴打造的AI语音生成工具,小巧,免费,无字数限制,速度超快,解压即可使用 Edge-TTS-Text-to-Speech-3.0

🎙️ Edge TTS 文本转语音 - 功能说明一、核心功能表格功能说明文本转语音使用微软 Edge TTS 引擎,将输入文本转换为自然流畅的 MP3 音频长文本支持自动分段处理(每段 ≤800 字符),支持超长文本合成音频合并自动将分段音频合并为单一文件输出多国语言支持中文、英语、日语、韩语、法语、德语等数十种语言二、语音选择系统两级联动选...
AI 5059 0
小红书 开源配音神器 dots.tts 只需3秒音频,完美复刻你的声音! 一键整合包 v20260617 解压即可使用

小红书 开源配音神器 dots.tts 只需3秒音频,完美复刻你的声音! 一键整合包 v20260617 解压即可使用

dots.tts是由小红书人工智能实验室(RedNote Hilab)研发并免费开源的一款新一代 AI 语音合成(配音)系统。抛开复杂的技术术语,你可以把它简单理解为一个“拥有录音棚级音质的超级 AI 配音员”。你只需要输入一段文字,它就能用极其逼真、富有感情的声音把文字读出来,甚至能完美模仿任何人的声音。以下是它最核心的几个“超能力”,也是...
AI 1.2万 27
MOSS-TTS-v1.5+MOSS-TTSD+ MOSS-TTS-Nano 支持CPU运行,一个高质量的开源中文文本到语音合成系统 一键整合包 v20260604 支持免费商业使用 支持暂停

MOSS-TTS-v1.5+MOSS-TTSD+ MOSS-TTS-Nano 支持CPU运行,一个高质量的开源中文文本到语音合成系统 一键整合包 v20260604 支持免费商业使用 支持暂停

🎙️ MOSS-TTS:让文字拥有“千人千面”的超级嗓音一句话看懂:这是一个由复旦大学和模思智能联合开发的开源人工智能项目。它的核心本领就是把文字变成极其逼真、带有感情的真人声音。✨ 为什么它比传统的“机器朗读”更厉害?传统的配音软件听起来往往像没有感情的机器人,而 MOSS-TTS 拥有以下 5 大“超能力”:1. 🎭 神奇的“声音克隆”魔...
AI 1万 20
给你配了个“AI配音导演”:阿里这款新模型,能直接给电影配音了! Fun-CineForge 一键整合包 v20260603 解压即可使用

给你配了个“AI配音导演”:阿里这款新模型,能直接给电影配音了! Fun-CineForge 一键整合包 v20260603 解压即可使用

Fun-CineForge是阿里通义实验室(FunAudioLLM 团队)推出的一款非常强大的AI影视配音模型。如果用一句话来概括:它就像一个不知疲倦的“AI配音导演+全能配音演员”,能够直接给电影、电视剧或各类视频进行高质量的自动配音,而且对口型、分角色都不在话下。为了让你轻松了解这个模型,我们从它的核心能力、应用场景以及背后的黑科技三个方...
AI 4144 1
高德开源项目 PilotTTS - 让AI学会"说话"的语音生成开源项目,支持11种情绪+14种方言 一键整合包 v20260530 解压即可使用

高德开源项目 PilotTTS - 让AI学会"说话"的语音生成开源项目,支持11种情绪+14种方言 一键整合包 v20260530 解压即可使用

这是高德地图语音团队开发的一个AI语音合成工具,可以让电脑用自然的声音朗读文字,还能模仿不同人的声音、表达不同情绪。✨ 它能做什么?1️⃣模仿任何人说话只需录一段5-15秒的音频,AI就能学会这个人的声音比如:用你朋友的声音读你写的文字2️⃣带感情地朗读支持11种情绪:😊 开心、😢 悲伤、😠 生气😲 惊讶、😨 害怕、🤢 厌恶😐 严肃、🥺 关切...
AI 2674 0
输入歌词,AI自动作曲:你的音乐创作助手 HeartMuLa 一键中文整合包 v20260507

输入歌词,AI自动作曲:你的音乐创作助手 HeartMuLa 一键中文整合包 v20260507

HeartMuLa/heartlib:开源音乐基础模型家族深度解析项目定位与愿景HeartMuLa是一个全面的开源音乐基础模型家族,旨在推动跨任务与多模态的大规模音乐理解与生成技术发展。该项目不仅仅是一个单一的模型,而是一个完整的生态系统,涵盖了从音乐理解到完整曲目生成的全链条能力。其核心目标是为研究社区和开发者提供可复现、可扩展的音乐AI工...
AI,开源 9364 9
索尼开源AI模型 Woosh 一句话生成音效,一键为视频配音 一键AI整合包 解压即可使用 v20260424

索尼开源AI模型 Woosh 一句话生成音效,一键为视频配音 一键AI整合包 解压即可使用 v20260424

索尼人工智能研究院(Sony AI)发布的音效生成基础模型📌 项目定位Woosh是专为音效生成(Sound Effects)优化的多模态生成式 AI 模型套件,旨在为音频研究社区提供高质量的开源基座模型,支持文本到音频(T2A)和视频到音频(V2A)两大核心任务。🔗 技术报告:arXiv:2604.01929🧩 核心模块组成1️⃣ Woosh...
AI 3678 0
QuickCut v1.8.0 开源的音视频处理工具 绿色软件 免安装

QuickCut v1.8.0 开源的音视频处理工具 绿色软件 免安装

Quick Cut 是一款轻量、强大、好用的视频处理软件。它是一个轻量的工具,而不是像 Davinci Resolve、Adobe Premiere 那样专业的、复杂的庞然大物。Quick Cut 可以满足普通人一般的视频处理需求:压缩视频、转码视频、倒放视频、合并片段、根据字幕裁切片段、自动配字幕、自动剪辑…&...
开源 2312 0
小米开源大模型AI语音合成,600种语言+声音克隆,生成速度提升40倍 不限字数 支持自动语气标签 OmniVoice v20260407 一键整合包

小米开源大模型AI语音合成,600种语言+声音克隆,生成速度提升40倍 不限字数 支持自动语气标签 OmniVoice v20260407 一键整合包

OmniVoice:600+语种的语音合成新纪元剑二十七 · 技术前沿🔹一句话了解由小米下一代 Kaldi 团队(k2-fsa)打造的超大规模多语言零样本 TTS 模型,支持600+ 语种,以卓越音质与极速推理,重新定义语音合成体验。✨ 核心能力一览🗣️全球语种覆盖支持 600+ 语言与方言,从英语、中文到低资源语种,一模型通全球。🔁声音克隆...
AI 4525 0
 一键克隆任意音色,生成自然口语级语音  1B/3.5B 双模型自由切换,还原你最真实的声音  LongCat-AudioDiT v1.0 20260402 更新 一键整合包

一键克隆任意音色,生成自然口语级语音 1B/3.5B 双模型自由切换,还原你最真实的声音 LongCat-AudioDiT v1.0 20260402 更新 一键整合包

LongCat-AudioDiT 语音合成工具 - 功能说明🎯 主要功能本工具基于美团开源的 LongCat-AudioDiT 扩散模型,提供高质量的文本到语音合成,并支持零样本语音克隆(只需几秒参考音频即可克隆音色)。界面采用 Gradio 构建,操作直观,适用于中文和英文混合文本。📌 核心功能模块1. 模型选择支持 1B&nbs...
AI 4007 2
语音识别 + 声音克隆 + 模型训练,一个工具全搞定!Easy-Voice-Toolkit v1.3.5

语音识别 + 声音克隆 + 模型训练,一个工具全搞定!Easy-Voice-Toolkit v1.3.5

Easy-Voice-Toolkit 是由 Spr-Aachen开发的一款开源、用户友好的 AI 语音工具箱,旨在为开发者、研究人员和爱好者提供一站式、本地化部署的语音处理解决方案。项目设计注重易用性与功能性,支持多种主流语音任务,适用于科研实验、产品原型开发、语音助手构建等多种应用场景。🌟 核心特性本地部署:所有功能均可在本地运行,保障数据...
AI,开源 5336 0
轻如羽,快如电 LuxTTS 语音克隆 一键整合包 CPU也能跑,30秒音频 1秒生成 v20260206

轻如羽,快如电 LuxTTS 语音克隆 一键整合包 CPU也能跑,30秒音频 1秒生成 v20260206

LuxTTS 项目介绍LuxTTS 是由开发者 Yatharth Sharma 创建的开源轻量级文本转语音(TTS)系统,专注于高质量零样本语音克隆与超高速推理。项目在保持卓越音质的同时,显著降低了计算资源需求,适用于资源受限环境下的语音合成任务。核心特性1. 零样本语音克隆仅需 3–5 秒参考音频即可克隆任意人声,无需针对目标说话人进行额外...
AI,开源 7574 20
免费 AI 人声 替换AI 唱歌 伴奏分离软件 Replay 附视频演示和教程 v8.7.0

免费 AI 人声 替换AI 唱歌 伴奏分离软件 Replay 附视频演示和教程 v8.7.0

上面是这个工具的视频演示和教程。基本上是有手就行了。早几天分享的文字转语音工具,有小伙伴在问是否有人声替换工具?今天分享这个的工具 不仅是人声替换,还可以分离人声,AI唱歌就太简单了。像网上流传很广的孙燕姿唱周杰伦的歌这类的视频和教程已经很多了。我之前也不是没有研究过,但是一直没有分享是因为这类教程对于普通的小伙伴来讲入门的门槛有点高,操作...
软件 2.7万 46
Qwen3-TTS:让文字拥有灵魂的声音艺术家 文字生成语音 语音克隆 新增多人对话 一键整合包 v20260130

Qwen3-TTS:让文字拥有灵魂的声音艺术家 文字生成语音 语音克隆 新增多人对话 一键整合包 v20260130

Qwen3-TTS 开源项目介绍Qwen3-TTS 是由 Qwen 团队开发的一系列强大语音生成模型,于 2026 年 1 月 22 日正式发布。该项目提供全面的语音生成能力,包括语音克隆、语音设计、超高质量类人语音生成和基于自然语言的语音控制,为开发者和用户提供了目前最广泛的语音生成功能集。核心特性1. 多语言支持Qwen3-TTS 覆盖 ...
AI 7753 4
免费 开源  虚拟声音效增强器FxSound 2 Pro 数字媒体音效增强工具中文免费版 v1.2.5.0

免费 开源 虚拟声音效增强器FxSound 2 Pro 数字媒体音效增强工具中文免费版 v1.2.5.0

Fxsound 是一款免费无广告的且功能强大音效增强神器。通过对比输出声音的算法优化,让声音听起来更清晰,音质效果大幅提升。而且均衡器定制性强,内置多种预设,包含:3D环绕音响、超重低音、立体声音场、高保真还原、动态增强等等。自从由之前的付费转为免费软件之后,对于上古机型的声卡有较大的音质提升效果。软件特色:增强声音:全新算法改进音质提高音质...
开源 5765 7
开源 简易语音工具包 用于语音识别、语音转录、语音转换等。Easy-Voice-Toolkit  v1.3.4

开源 简易语音工具包 用于语音识别、语音转录、语音转换等。Easy-Voice-Toolkit v1.3.4

🎙️ Easy-Voice-Toolkit —— 一体化开源语音处理工具箱将复杂的语音 AI 技术封装为直观易用的自动化工作流,零门槛构建从音频输入到语音合成的完整 pipeline。🔍 项目定位Easy-Voice-Toolkit 是一个模块化、全流程的语音处理平台,整合 Whisper、GPT-SoVITS 等主流开源技术,通过图形化界面...
开源 5239 1
多图预览 跨平台音频编辑工具 ocenaudio 绿色免安装 可批量处理 v3.17.1

多图预览 跨平台音频编辑工具 ocenaudio 绿色免安装 可批量处理 v3.17.1

最近我正好需要编辑下音频,无意中居然发现我很久以前就分享了这个工具,这次截图多一点,让小伙伴能更好的看看这个强大的音频编辑工具,可以批量处理。ocenaudio 中文版是一款跨平台,易于使用,快速且功能强大的音频编辑器。对于需要编辑和分析音频文件而无需复杂的人来说,它是理想的软件。 ocenaudio 还具有强大的功能,可以满足更多高级用户的...
软件 4960 3
 VoiceSculptor:基于指令驱动的下一代语音合成开源框架——让AI语音拥有精准的情感与音色控制能力 v20260108 一键整合包

VoiceSculptor:基于指令驱动的下一代语音合成开源框架——让AI语音拥有精准的情感与音色控制能力 v20260108 一键整合包

🎵 VoiceSculptor - 指令驱动的语音合成模型📌 项目概述VoiceSculptor是由ASLP实验室(Audio, Speech and Language Processing Laboratory)开发的一款先进的指令式文本到语音(instruct text-to-speech)开源模型。2该项目代表了语音合成技术的前沿发展方...
开源 3053 0
GPT-SoVITS2507+SAVA46 一个强大的开源工具,专注于少样本语音转换和文本到语音(TTS)的合成 一键整合包

GPT-SoVITS2507+SAVA46 一个强大的开源工具,专注于少样本语音转换和文本到语音(TTS)的合成 一键整合包

GPT-SoVITS是一个强大的开源工具,专注于少样本语音转换和文本到语音(TTS)的合成。该工具由RVC-Boss团队开发,并在GitHub上公开分享,为用户提供了一个灵活且功能丰富的平台,以满足语音合成的多样化需求。核心功能GPT-SoVITS的核心功能包括零样本和少样本TTS。零样本TTS允许用户仅通过输入一个5秒的语音样本,就能即时体...
AI,开源 1.1万 4
"方言通+翻译官:一个AI,能说18种中国方言和9国语言" Fun-CosyVoice3-0.5B AI语音生成工具 一键整合包 v20251217

"方言通+翻译官:一个AI,能说18种中国方言和9国语言" Fun-CosyVoice3-0.5B AI语音生成工具 一键整合包 v20251217

CosyVoice:基于大语言模型的先进语音合成系统CosyVoice 是一个由 FunAudioLLM 团队开发的开源文本到语音(TTS)系统,目前已迭代至Fun-CosyVoice 3.0版本。该项目基于大语言模型(LLM)架构,在语音合成领域实现了多项技术突破。核心技术特点Fun-CosyVoice 3.0作为最新版本,在内容一致性、说...
AI,开源 5347 1
GLM-TTS 大语言模型重塑语音合成 3秒克隆人声?GLM-TTS 做到了!声音克隆相似度极高 一键整合包 v20251212

GLM-TTS 大语言模型重塑语音合成 3秒克隆人声?GLM-TTS 做到了!声音克隆相似度极高 一键整合包 v20251212

GLM-TTS是由ZAI 组织开发并开源的高质量文本转语音(Text-to-Speech, TTS)系统。它基于大语言模型(LLM),专注于实现可控、富有情感表达的零样本语音克隆,并通过多奖励强化学习框架显著提升传统 TTS 系统的自然度与表现力。核心特性🗣️ 零样本语音克隆仅需3–10 秒的目标说话人提示音频,即可克隆任意声音,无需微调或说...
AI,开源 4817 6
AI音乐生成工具v2.0 基于 DiffRhythm 二次开发。webui界面 不卡死,速度快 英伟达显卡6g即可运行, 一键整合包

AI音乐生成工具v2.0 基于 DiffRhythm 二次开发。webui界面 不卡死,速度快 英伟达显卡6g即可运行, 一键整合包

DiffRhythm:基于差分节奏建模的通用音乐流派分类开源项目DiffRhythm是由ASLP实验室提出的开源项目,旨在通过创新的差分节奏建模(Differential Rhythm Modeling)框架解决音乐流派分类任务。该项目结合传统信号处理与深度学习技术,从节奏这一音乐核心要素出发,构建了具有强解释性和泛化能力的分类模型。其代码已...
AI,开源 6202 6