阿里出品 Ovis-U1-3b 多模态理解、文本到图像生成+图像编辑。 一键整合包

阿里出品 Ovis-U1-3b 多模态理解、文本到图像生成+图像编辑。 一键整合包

Ovis-U1 是由阿里巴巴AIDC-AI团队开发的一个先进的多模态大语言模型项目。这个项目专注于构建能够同时处理文本和图像信息的AI系统。核心特点多模态融合能力能够同时理解和处理文本与图像数据实现跨模态的信息理解和生成支持图文混合的输入输出场景统一架构设计采用统一的模型架构处理不同类型的模态数据简化了传统多模态系统中复杂的模块组合提高了模型...
AI,开源 4391 0
LoRA 千面 AI图片编辑 超N多风格转换 Kontext-Style-LoRAs v20250722

LoRA 千面 AI图片编辑 超N多风格转换 Kontext-Style-LoRAs v20250722

在huggingface瞎逛的时候,无意中发现了这个开源的模型,真的超级强,聚集了N多风格lora模型,操作也是极其简单,感觉可能有小伙伴能用的上,就花了时间做了整合,并进行了小小的二次开发,自我感觉还行。整合包说明1 支持50系显卡,最低英伟达8G显卡可以运行,如果你的显卡刚好是8G的话,可能内存要超过30G,安装好你显卡能支持的最高版本c...
AI,开源 4663 5
光影魔法来了!AI一键切换日光/夜景/霓虹灯效果 relighting-kontext v20250720

光影魔法来了!AI一键切换日光/夜景/霓虹灯效果 relighting-kontext v20250720

在网上瞎逛的时候,发现了这个模型,很不错,光影效果做出来很逼真,虽然我以前也做过一个类似的整合包,但是跟这个没法比,所以抽空进行了二次开发。🌟 Relighting Kontext [dev] LoRA v3 模型介绍Relighting Kontext [dev] LoRA v3是一个针对 FLUX.1-Kontext-dev模型优化的低秩...
AI,开源 5892 8
AI 视频生成新突破:FramePack 开源项目引领视频扩散技术变革 一键汉化整合包 FramePack-F1 20250716更新 支持magcache加速 支持50系显卡

AI 视频生成新突破:FramePack 开源项目引领视频扩散技术变革 一键汉化整合包 FramePack-F1 20250716更新 支持magcache加速 支持50系显卡

FramePack 是一个开源项目,旨在通过创新的神经网络结构实现高效的视频生成。以下是对其的详细介绍:项目概述FramePack 是 “Packing Input Frame Contexts in Next - Frame Prediction Models for Video Generation” 论文的官方实现和桌面软件。它采用逐帧...
AI,开源 2万 39
FLUX.1-Kontext-dev:图文协同,让AI图像编辑更可控,支持局部重绘与图文控制,英伟达12G可运行 v20250716

FLUX.1-Kontext-dev:图文协同,让AI图像编辑更可控,支持局部重绘与图文控制,英伟达12G可运行 v20250716

前段时间一直死劲在更新的nunchaku-flux.1-kontext-dev,还算受到大伙的欢迎,主要是显卡要求很低。运行速度快,但是有些好显卡的小伙伴说能否出一个出图质量更好的版本?量化不要这么强的,对出图有一定要求的小伙伴。所以我今天就分享了这个FLUX.1-Kontext-dev,虽然也是nunchaku量化下的,但是相对来讲这个出图...
AI,开源 3434 6
FishAudio 推出 OpenAudio-S1-Mini:革新语音合成技术, 一键整合包 v20250627

FishAudio 推出 OpenAudio-S1-Mini:革新语音合成技术, 一键整合包 v20250627

openaudio-s1-mini 是一个开源的音频生成模型,主要特点是能够将文本高效地转换为自然流畅的语音。下面是对该模型的详细介绍:基本信息模型名称:openaudio-s1-mini开源平台:ModelScope.cn开发者:FishAudio 团队主要特点高效的文本转语音能力:该模型经过大量数据训练,能够将输入的文本快速转换为自然流畅...
AI,开源 5532 11
MiniMax-Remover:基于 Minimax 优化的高效视频物体移除工具 v20250621 一键整合包

MiniMax-Remover:基于 Minimax 优化的高效视频物体移除工具 v20250621 一键整合包

MiniMax-Remover是一个基于 minimax 优化的视频物体移除工具,旨在高效、高质量地从视频中移除指定对象,并生成视觉上无缝的修复结果。该项目由 Bojia Zi 等人开发,核心目标是实现 快速(Fast)、有效(Effective)和鲁棒(Robust)的视频内容编辑。核心特性两阶段训练策略第一阶段:使用简化版的 DiT(Di...
AI,开源 5700 0
 让模糊照片变清晰 —— AI 图像增强器 GSASR v20250620 一键整合包

让模糊照片变清晰 —— AI 图像增强器 GSASR v20250620 一键整合包

GSASR(Generalized and Efficient 2D Gaussian Splatting for Arbitrary-scale Super-Resolution),是由研究人员开发的一种新型的图像超分辨率技术。它的核心目标是:让图片“变清晰”,而且可以按任意倍数放大,不会失真或模糊。🌟 什么是图像超分辨率?简单来说,图像超...
AI,开源 6844 10
AI 人工智能 一键高清修复模糊照片(支持批量处理),还原清晰细节 Finegrain Image Enhancer  v20250617 一键汉化整合包

AI 人工智能 一键高清修复模糊照片(支持批量处理),还原清晰细节 Finegrain Image Enhancer v20250617 一键汉化整合包

Finegrain Image Enhancer开源图像增强工具通过人工智能技术将低分辨率图像转化为高分辨率版本,智能生成细节以提升画质 。核心功能超分辨率放大支持模糊或低分辨率图像放大(最高可达4倍),增强细节的清晰度和真实感 。细粒度参数控制提供增强强度、风格一致性等参数调节,允许用户进行精细化编辑 。结果可重复性通过种子管理保存特定增强...
AI,开源 8349 10
Meissonic 开源高性能文生图模型 一键整合包 v20250619

Meissonic 开源高性能文生图模型 一键整合包 v20250619

Meissonic 是一个基于 Masked Generative Transformer的高效高分辨率文本到图像生成模型,旨在通过消费级显卡实现高质量的图像生成任务。该项目在 ICLR 2025 上发表,其核心目标是重新激发 Masked Generative Transformers 在图像合成中的潜力,并提供一种高效的推理方案。核心特性...
AI,开源 2977 0
图片加音乐转视频,傻瓜卡点神器 人工智障全自动卡点神器 v3.9

图片加音乐转视频,傻瓜卡点神器 人工智障全自动卡点神器 v3.9

简介: “图片加音乐转视频,傻瓜卡点神器”是一款专为视频创作者设计的工具,旨在简化将图片和音乐结合生成视频的过程。这款工具特别适合那些在视频编辑软件中进行卡点操作时感到困难的用户。它提供了一种简单、直观的方式来创建具有音乐节奏的视频,无需复杂的编辑技巧。功能特点:时长控制:用户可以根据音频的长度和可用图片的数量,灵活控制视频的时长。如果音频时...
软件 5176 0
字节开源BAGEL:70亿参数多模态大模型,图像生成+理解全新突破 v20250613 一键整合包

字节开源BAGEL:70亿参数多模态大模型,图像生成+理解全新突破 v20250613 一键整合包

BAGEL 是一个由 ByteDance-Seed团队开发的开源多模态基础模型,具有 70 亿(7B)活跃参数(总参数为 140 亿),并在大规模交错的多模态数据(包括语言、图像、视频和网页数据)上进行了训练。该项目的目标是通过统一的架构来实现强大的多模态理解和生成能力,并进一步扩展到复杂的视觉操作任务。核心特点1. 先进的模型架构BAGEL...
AI,开源 4600 0
smplayer v25.6.0 一款开源的全能多媒体播放器

smplayer v25.6.0 一款开源的全能多媒体播放器

SMPlayer是一款开源的多媒体播放器,专为那些追求高质量视频和音频播放体验的用户设计。它不仅支持几乎所有格式的视频和音频文件,还集成了强大的解码器,确保流畅无阻的播放体验。以下是对SMPlayer的详细介绍:一、丰富的功能特性广泛的格式支持:SMPlayer几乎可以播放任何类型的视频和音频文件,无需额外安装任何解码器或插件。这得益于其内置...
软件 3677 0
Mozilla Firefox 火狐浏览器 v140.0b6 简体中文官方

Mozilla Firefox 火狐浏览器 v140.0b6 简体中文官方

火狐浏览器这个没什么讲的,太有名了。软件简介:Mozilla Firefox是一款由Mozilla基金会开发的免费开源的网络浏览器。它于2002年首次发布,经过多年的发展和改进,已成为全球最受欢迎的网络浏览器之一。Firefox以其速度、安全性、稳定性和可定制性而闻名,并且提供了丰富的功能和扩展,以满足用户的各种需求。首先,Firefox注重...
软件 4066 0
视频自动分镜工具,一键智能分割画面 视频自动分割分镜工具

视频自动分镜工具,一键智能分割画面 视频自动分割分镜工具

视频自动分割(分镜)工具介绍说明这是一款基于Python和PyQt5开发的桌面应用程序,名为“视频自动分割(分镜)工具”。它主要用于通过检测画面变化来自动分割视频片段,帮助用户快速实现视频的分镜处理。主要功能自动分割视频工具能够分析视频内容,根据画面变化进行智能分割,将视频分成多个独立片段。支持多种视频格式支持常见的视频文件格式,无需额外转换...
软件 2606 0
开源 Tux Paint 0.9.35 一款针对儿童设计的免费绘图软件

开源 Tux Paint 0.9.35 一款针对儿童设计的免费绘图软件

Tux Paint 是一款针对儿童设计的免费绘图软件,旨在提供一个简单、有趣和教育性强的绘画工具。以下是对 Tux Paint 的详细介绍:用户界面:Tux Paint 的用户界面设计简洁明了,适合儿童使用。包含各种绘图工具,如画笔、填充桶、橡皮擦等,支持多种颜色选择。提供海量的贴纸、图案和特效供用户选择,让绘画过程更加有趣。特色功能:独特的...
软件 2623 0
多图预览 全媒体格式转换 格式工厂 FormatFactory v5.21.0去广告绿色版

多图预览 全媒体格式转换 格式工厂 FormatFactory v5.21.0去广告绿色版

标题:格式工厂——全能多媒体文件转换工具引言】在数码时代,我们常常会遇到多媒体文件格式不兼容的问题。有时我们想播放一段音频或视频,却发现播放器无法识别文件格式,这给我们的使用带来很大的不便。为了解决这个问题,开发人员推出了一个强大的软件工具——格式工厂(Format Factory)。本文将向您介绍格式工厂的基本信息、功能特点、操作流程以及使...
软件 5690 8
windows 系统万能网卡驱动 3DP Chip v2505 中文绿色便携版

windows 系统万能网卡驱动 3DP Chip v2505 中文绿色便携版

介绍3DP Net是一款功能强大的网络检测与驱动程序安装软件,它以其自动化、高效的特点受到用户的广泛好评。以下是对3DP Net的详细介绍:一、软件概述3DP Net官方版是一款免费的集成驱动程序安装器,专为解决用户重新安装Windows后无法连接到互联网的问题而设计。它能够自动检测用户电脑上的网络适配器类型,并从其集成的以太网卡驱动程序池中...
软件 2940 0
AI 自动生成短剧解说视频 输入一段话就能生成短剧解说视频  一键整合包 NarratoAI v0.6.1

AI 自动生成短剧解说视频 输入一段话就能生成短剧解说视频 一键整合包 NarratoAI v0.6.1

这个工具是做什么的?你可以把 NarratoAI 理解成一个“AI自动剪辑视频的神器”,它最大的特点就是:输入一段文字或口播内容,就能自动生成一部短剧解说视频。是不是听起来像你写了个剧本,AI 就帮你拍成了短视频?没错,就是这样!🧠 它是怎么工作的?它的流程大概是这样的:你提供一段文字内容(比如口播文案、剧情简介)比如:“今天给大家讲一个爱情...
AI,开源 8627 3
一键提取伴奏/人声!轻松搞定音乐音轨分离 支持批量处理 开源一键整合包 6G N卡就可以愉快玩耍 UVR5 UI v1.8.4

一键提取伴奏/人声!轻松搞定音乐音轨分离 支持批量处理 开源一键整合包 6G N卡就可以愉快玩耍 UVR5 UI v1.8.4

UVR5-UI是基于 python-audio-separator(即 UVR5 的命令行版本)开发的,提供了友好的可视化界面,使得用户无需掌握编程知识或命令行操作即可使用强大的音频处理功能。它支持多种模型和功能,包括:所有主流音源分离模型:VR Arch 模型MDX-NET 模型Demucs v4 模型Mel-Band Roformer 和...
AI,开源 6836 3
你负责写文字(支持中文),画画交给 AI!Kolors 让想象秒变现实 一键整合包 v20250523

你负责写文字(支持中文),画画交给 AI!Kolors 让想象秒变现实 一键整合包 v20250523

Kolors 是一个“文字生成图片”的人工智能工具,你可以输入一段中文或英文的文字描述,它就能根据你的描述自动生成一张对应的图像。比如你写:“一只穿着西装的熊猫,在山顶上喝咖啡,背景是日出,风格是写实高清”它就能根据这段话,画出这样的一张图!🧠 它是怎么工作的?简单来说,这个 AI 模型已经学习了非常多的文字和图片之间的对应关系。所以当你输入...
AI,开源 8163 3
小巧实用效率高AI生成动漫图片整合包,12G英伟达显卡即可愉快玩耍 v20250520

小巧实用效率高AI生成动漫图片整合包,12G英伟达显卡即可愉快玩耍 v20250520

   今天在网上逛的时候,无意发现这个模型,一个动漫图片生成的模型,感觉还不错,生成的动漫效果也还可以,所以就花了几分钟写了个界面,然后又汉化了下,感觉还可以,就随手发到群里,各位小伙伴要求分享出来,所以就打包上传上来了。这个模型是支持NSFW ,所以请勿用于任何非法途径,所造成的任何后果请自行承担,本人只做AI图片生成技...
AI 5539 5
开源AI图像描述:JoyCaption ,图片AI反推提示词 支持批量操作 v20250515 一键整合包

开源AI图像描述:JoyCaption ,图片AI反推提示词 支持批量操作 v20250515 一键整合包

JoyCaption 是一个开源的图像描述生成视觉语言模型(VLM),旨在为社区提供一个免费、开放且无审查的工具,用于训练扩散模型。以下是该项目的主要特点和相关信息:项目特点免费与开放:JoyCaption 以免费、开放的权重发布,没有使用限制,并且提供训练脚本及详细的构建细节。无审查:平等覆盖适合工作场合(SFW)和不适合工作场合(NSFW...
AI,开源 1万 10
穿越千年的文字魔法:AI助力现代文变古文 ancient_text_generation_LLM v20250514一键整合包

穿越千年的文字魔法:AI助力现代文变古文 ancient_text_generation_LLM v20250514一键整合包

一个专注于将现代汉语句子转换为古汉语风格句子的创新项目。以下是对该项目的详细介绍:项目概述:该项目旨在通过先进的自然语言处理技术,实现现代汉语到古汉语风格的自动转换,为文化传承、文学创作等领域提供有力支持。技术背景:项目基于荀子基座大模型,该模型作为起点,为项目提供了强大的语言理解和生成能力。通过采用LoRA(Low-Rank Adaptat...
AI,开源 5163 0
想换脸、换衣服还是换风格?DreamO图像定制,一键搞定!v20250513 AI生成图片 一键整合包

想换脸、换衣服还是换风格?DreamO图像定制,一键搞定!v20250513 AI生成图片 一键整合包

DreamO是一个由字节跳动开源的统一图像定制化框架(A Unified Framework for Image Customization),旨在通过先进的算法和技术,为用户提供高度灵活和高质量的图像定制化服务。以下是该项目的详细介绍说明:核心功能:图像定制化:DreamO允许用户根据需求定制图像,支持多种定制化任务,包括但不限于人物形象定...
AI,开源 6006 8
开源 AstrOrz Player播放器 v2.4.5 绿色版 一款功能强大、专业实用且设计极简的视频播放软件

开源 AstrOrz Player播放器 v2.4.5 绿色版 一款功能强大、专业实用且设计极简的视频播放软件

介绍AstrOrz Player是一款功能强大、专业实用且设计极简的视频播放软件,它为用户提供了丰富的视频和音频播放体验。以下是对该软件的详细介绍:软件概述AstrOrz Player官方版基于WMP(Windows Media Player)和VLC(VideoLAN Client)内核开发,这意味着它能够支持多种视频和音频格式,包括mkv...
软件 3477 3
吾爱出品 开源 口算出题工具 v1.1.3 家有小学生必备工具

吾爱出品 开源 口算出题工具 v1.1.3 家有小学生必备工具

这个开源工具是ArithmeticGenerator,它是一个简单的口算生成工具。以下是关于该工具的详细介绍:功能描述:生成口算题目:该工具能够生成口算题目,方便用户进行口算练习。保存常用题型:用户可以将常用的题型保存为题库,方便日后重复使用。支持导出:生成的口算题目或题库可以导出,便于打印或分享。使用场景:教育领域:教师可以利用该工具生成口...
软件 3941 1
 KaKaDa AI答题辅助工具V1.0.0.3

KaKaDa AI答题辅助工具V1.0.0.3

KaKaDa是一款创新的答题辅助工具,它借助了阿里云开源的72B大模型进行问题推断,旨在为用户提供快速、准确的答题推荐。与传统的答题工具不同,KaKaDa直接显示推荐的选项,而不是先解释后展示文字答案,从而大大节省了用户的时间。一、主要功能OCR识别与推送:KaKaDa支持在问题界面使用Alt+Q快捷键截取完整的题目和选项,然后利用OCR技术...
AI 3836 0
文本转语音,如此简单真实:Nari Labs开源Dia,一轮处理生成高度逼真的对话音频

文本转语音,如此简单真实:Nari Labs开源Dia,一轮处理生成高度逼真的对话音频

Dia是一个由Nari Labs创建的文本转语音(TTS)模型,它拥有16亿(1.6B)参数,能够在一轮处理中生成超逼真的对话。这个项目的核心特点是其高度真实的语音生成能力,可以直接从文本中生成高度逼真的对话,同时支持通过音频条件来控制输出,实现情感和语调的调整。主要功能高度逼真的对话生成:Dia能够直接从文本中生成高质量的对话,无需多轮处理...
AI 3761 0
OmniGen:统一框架,高效灵活,图像生成从未如此简单  基于最新模型一键整合包 已经汉化

OmniGen:统一框架,高效灵活,图像生成从未如此简单 基于最新模型一键整合包 已经汉化

OmniGen 是一个由 VectorSpaceLab 开发的开源项目,旨在提供一个统一的图像生成模型,能够处理多种图像生成任务,而无需依赖额外的插件或复杂的预处理步骤。该项目的核心目标是简化图像生成流程,使其像 GPT 在语言生成中的应用一样灵活和高效。OmniGen 支持多种任务,包括文本到图像生成、图像编辑、主题驱动生成和经典计算机视觉...
AI 7026 6
绿色免安装 免费 XnConvert (批量图片处理软件) v1.105 便携版

绿色免安装 免费 XnConvert (批量图片处理软件) v1.105 便携版

XnConvert是一款功能强大的图像格式转换和批处理工具。它支持超过80种不同的图像格式,包括常见的JPG、PNG和GIF,以及RAW格式和动态图片格式,如GIF和APNG。它可以处理大量的图像文件,批量转换、重命名、调整大小、裁剪、添加水印、添加边框、调整颜色等操作,从而可以大大缩短处理图片的时间。此外,XnConvert还具有多种有用的...
软件 3161 0
字节开源 UNO:电商图片生成的高效利器,一键汉化整合包 ,支持文生图和图生图

字节开源 UNO:电商图片生成的高效利器,一键汉化整合包 ,支持文生图和图生图

UNO(Universal Customization)是由字节跳动公司开发并开源的一个通用自定义方法的项目,旨在解决单主体和多主体条件下的图像生成问题,具有很强的可控性和通用性。该项目通过提出一种高度一致的数据合成流程,利用扩散变换器的内在上下文生成能力,生成高一致性的多主体配对数据。UNO模型包含渐进式跨模态对齐和通用旋转位置嵌入,是从文...
AI,开源 4531 4