开源项目
-
昆仑万维开源首个面向AI短剧创作的视频生成模型SkyReels-V1
昆仑万维于2025年2月18日宣布开源中国首个面向AI短剧创作的视频生成模型SkyReels-V1,以及中国首个SOTA级别基于视频基座模型的表情动作可控算法SkyReels-A1。 SkyReels-V1的特点 SkyReels-A1的特点 开源的意义 昆仑万维此次开源SkyReels-V1和SkyReels-A1,旨在解决当前AI视频生成模型不开源、费用高、难以使用等问题,…
-
新发布的开源语音模型 Zonos
Zonos 被称为最强开源语音模型,其语音生成质量非常高,并且有中文版本。它包含两种 1.6B 模型,分别是 transformer 和 SSM。可以使用 5 到 30 秒的语音进行高保真语音克隆。还能够调节速度、音高、音频质量和情绪。通过添加文本和音频前缀,可以实现更丰富的说话人匹配效果。在 RTX 4090 显卡上运行时,实时率约为 2 倍。 详情: https://www…
-
DeepSeek发布Janus-Pro多模态大模型,进军文生图领域
在一些基准测试中,Janus-Pro-7B 击败了 OpenAI 的 DALL-E 3 以及 Stable Diffusion、Emu3-Gen 等热门模型。Janus Pro 采用 MIT 开源协议,可无限制用于商业场景。并且该大模型是 2024 年 11 月 13 日发布的 JanusFlow 大模型的高级版本。(暂时只能处理384×384分辨率的图像) 模型地址…
-
微软开源 140 亿参数小语言 AI 模型 Phi-4
微软于2025年1月8日在Hugging Face平台上开源了其小型语言模型Phi-4。Phi-4是微软2023年推出的小型语言模型系列的第四代产品,拥有140亿参数。该模型基于Transformer架构,采用仅解码器型架构,只关注单词之前的文本,减少了需要处理的数据量,从而降低了推理成本。 Phi-4在多个基准测试中表现优异,甚至超越了参数量更大的Llama 3.3 70B和…
-
Leffa:Meta开源的AI试衣模型
Meta开源的AI试衣模型名为Leffa,它是一个用于生成可控人物图像的统一框架,能够精确操控人物的外观(如虚拟试穿)和姿势(如姿势转移)。Leffa通过在注意力层中引导目标查询关注正确的参考键,显著减少了细粒度细节的失真,同时保持了高图像质量。此外,Leffa的损失函数是模型无关的,可以用于提高其他扩散模型的性能。 Leffa的主要功能包括: Leffa的效果确实非常好,可以…
-
一个端到端的社会视觉-语言-动作建模框架
根据您的请求,以下是关于端到端的社会视觉-语言-动作建模框架SOLAMI的详细介绍: SOLAMI的推出标志着视觉-语言-动作模型在社会交互领域的新进展,为3D自主角色的社交智能提供了新的解决方案。 项目地址: https://solami-ai.github.io
-
MMAudio:输入视频或文本可自动给视频配音效
MMAudio是一项由伊利诺伊大学厄巴纳-香槟分校、Sony AI及Sony集团联合推出的新技术,它能够实现视频到音频的高质量合成。这项技术的核心创新在于利用视频和文本输入生成同步音频,从而拓展了音频生成的应用场景。MMAudio的设计使其能够在各种视听和音频文本数据集上进行训练,这种多模态联合训练的方式,不仅提高了合成音频的质量,还确保了生成的音频与视频帧之间的同步。 MMA…
-
Exo Labs来袭!让Mac M4电脑也能本地运行强大开源AI模型
家人们,好消息!Exo Labs带着他们的黑科技来了,现在你的Mac M4电脑也能变身强大的本地AI模型运行器啦!🌌 🍎【Apple M4芯片的力量】 Exo Labs利用Apple M4芯片,在本地计算集群上成功运行开源AI模型,这意味着我们可以告别昂贵的NVIDIA GPU,用我们手头的设备就能搞定! 💼【成本与隐私】 本地运行AI模型不仅降低了成本,还提高了隐私安全,再也…
-
Fashion-VDM:一键试衣,视频见证你的时尚变身!👗📹
亲爱的时尚达人们,想要快速预览穿上心仪衣物的效果吗?Fashion-VDM来帮你实现这个愿望!只需一张图+视频,就能展示穿上输入衣物后的神奇效果,让你的穿搭选择更简单、更直观! 👚【时尚新体验】 Fashion-VDM技术,让你在选择衣物时不再犹豫。只需上传一张你的照片和想要试穿的衣物图片,系统就能生成一段视频,展示你穿上这件衣物的样子,让你在购买前就能预见穿搭效果。 📱【操作…
