开源项目
-
DeepSeek发布Janus-Pro多模态大模型,进军文生图领域
在一些基准测试中,Janus-Pro-7B 击败了 OpenAI 的 DALL-E 3 以及 Stable Diffusion、Emu3-Gen 等热门模型。Janus Pro 采用 MIT 开源协议,可无限制用于商业场景。并且该大模型是 2024 年 11 月 13 日发布的 JanusFlow 大模型的高级版本。(暂时只能处理384×384分辨率的图像) 模型地址…
-
微软开源 140 亿参数小语言 AI 模型 Phi-4
微软于2025年1月8日在Hugging Face平台上开源了其小型语言模型Phi-4。Phi-4是微软2023年推出的小型语言模型系列的第四代产品,拥有140亿参数。该模型基于Transformer架构,采用仅解码器型架构,只关注单词之前的文本,减少了需要处理的数据量,从而降低了推理成本。 Phi-4在多个基准测试中表现优异,甚至超越了参数量更大的Llama 3.3 70B和…
-
Leffa:Meta开源的AI试衣模型
Meta开源的AI试衣模型名为Leffa,它是一个用于生成可控人物图像的统一框架,能够精确操控人物的外观(如虚拟试穿)和姿势(如姿势转移)。Leffa通过在注意力层中引导目标查询关注正确的参考键,显著减少了细粒度细节的失真,同时保持了高图像质量。此外,Leffa的损失函数是模型无关的,可以用于提高其他扩散模型的性能。 Leffa的主要功能包括: Leffa的效果确实非常好,可以…
-
一个端到端的社会视觉-语言-动作建模框架
根据您的请求,以下是关于端到端的社会视觉-语言-动作建模框架SOLAMI的详细介绍: SOLAMI的推出标志着视觉-语言-动作模型在社会交互领域的新进展,为3D自主角色的社交智能提供了新的解决方案。 项目地址: https://solami-ai.github.io
-
MMAudio:输入视频或文本可自动给视频配音效
MMAudio是一项由伊利诺伊大学厄巴纳-香槟分校、Sony AI及Sony集团联合推出的新技术,它能够实现视频到音频的高质量合成。这项技术的核心创新在于利用视频和文本输入生成同步音频,从而拓展了音频生成的应用场景。MMAudio的设计使其能够在各种视听和音频文本数据集上进行训练,这种多模态联合训练的方式,不仅提高了合成音频的质量,还确保了生成的音频与视频帧之间的同步。 MMA…
-
Exo Labs来袭!让Mac M4电脑也能本地运行强大开源AI模型
家人们,好消息!Exo Labs带着他们的黑科技来了,现在你的Mac M4电脑也能变身强大的本地AI模型运行器啦!🌌 🍎【Apple M4芯片的力量】 Exo Labs利用Apple M4芯片,在本地计算集群上成功运行开源AI模型,这意味着我们可以告别昂贵的NVIDIA GPU,用我们手头的设备就能搞定! 💼【成本与隐私】 本地运行AI模型不仅降低了成本,还提高了隐私安全,再也…
-
Fashion-VDM:一键试衣,视频见证你的时尚变身!👗📹
亲爱的时尚达人们,想要快速预览穿上心仪衣物的效果吗?Fashion-VDM来帮你实现这个愿望!只需一张图+视频,就能展示穿上输入衣物后的神奇效果,让你的穿搭选择更简单、更直观! 👚【时尚新体验】 Fashion-VDM技术,让你在选择衣物时不再犹豫。只需上传一张你的照片和想要试穿的衣物图片,系统就能生成一段视频,展示你穿上这件衣物的样子,让你在购买前就能预见穿搭效果。 📱【操作…
-
可一键生成“多机位”视频大片-ReCapture
利用多视角扩散模型和遮罩视频微调技术,实现粗略视频到清晰、连贯、动感视频的转变。适用于各种视频和视角转换,让普通用户也能制作专业级“多机位”视频。 项目地址: https://generative-video-camera-controls.github.io
-
FLUX.1-dev LoRA秒出服装效果图
FLUX.1-dev LoRA 是由 TryOn Labs 开发的一款服装生成器,它利用先进的人工智能技术,能够根据用户输入的服装描述(包括颜色、图案、材质、风格等细节)快速生成相应的服装设计图。这款工具的强大之处在于其灵活的输入格式和丰富的时尚知识库,使得用户可以充分发挥创意,描述出心目中的理想服装。 例如,如果用户输入“一件森林绿色缎面连身裤,宽腿,金色植物印花,系着米白色…
