开源项目

  • DeepSeek发布Janus-Pro多模态大模型,进军文生图领域

    在一些基准测试中,Janus-Pro-7B 击败了 OpenAI 的 DALL-E 3 以及 Stable Diffusion、Emu3-Gen 等热门模型。Janus Pro 采用 MIT 开源协议,可无限制用于商业场景。并且该大模型是 2024 年 11 月 13 日发布的 JanusFlow 大模型的高级版本。(暂时只能处理384×384分辨率的图像) 模型地址…

    2025年1月28日
  • 微软开源 140 亿参数小语言 AI 模型 Phi-4

    微软于2025年1月8日在Hugging Face平台上开源了其小型语言模型Phi-4。Phi-4是微软2023年推出的小型语言模型系列的第四代产品,拥有140亿参数。该模型基于Transformer架构,采用仅解码器型架构,只关注单词之前的文本,减少了需要处理的数据量,从而降低了推理成本。 Phi-4在多个基准测试中表现优异,甚至超越了参数量更大的Llama 3.3 70B和…

    2025年1月10日
  • Leffa:Meta开源的AI试衣模型

    Meta开源的AI试衣模型名为Leffa,它是一个用于生成可控人物图像的统一框架,能够精确操控人物的外观(如虚拟试穿)和姿势(如姿势转移)。Leffa通过在注意力层中引导目标查询关注正确的参考键,显著减少了细粒度细节的失真,同时保持了高图像质量。此外,Leffa的损失函数是模型无关的,可以用于提高其他扩散模型的性能。 Leffa的主要功能包括: Leffa的效果确实非常好,可以…

    2024年12月16日
  • 一个端到端的社会视觉-语言-动作建模框架

    根据您的请求,以下是关于端到端的社会视觉-语言-动作建模框架SOLAMI的详细介绍: SOLAMI的推出标志着视觉-语言-动作模型在社会交互领域的新进展,为3D自主角色的社交智能提供了新的解决方案。 项目地址: https://solami-ai.github.io

    2024年12月14日
  • MMAudio:输入视频或文本可自动给视频配音效

    MMAudio是一项由伊利诺伊大学厄巴纳-香槟分校、Sony AI及Sony集团联合推出的新技术,它能够实现视频到音频的高质量合成。这项技术的核心创新在于利用视频和文本输入生成同步音频,从而拓展了音频生成的应用场景。MMAudio的设计使其能够在各种视听和音频文本数据集上进行训练,这种多模态联合训练的方式,不仅提高了合成音频的质量,还确保了生成的音频与视频帧之间的同步。 MMA…

    2024年12月14日
  • HelloMeme 是一个开源工具,它集成了空间编织注意力机制,专注于生成高保真图像和视频内容,尤其是表情克隆技术。这项技术基于SD1.5架构,支持ComfyUI界面,用户可以通过简单的操作将一张图片的表情迁移到另一张图片或视频上,生成效果超越了同类工具。以下是HelloMeme的一些核心功能和特点: HelloMeme的出现,不仅提升了AI生成视频的稳定性与自然度,还可能对娱…

    2024年12月14日
  • Exo Labs来袭!让Mac M4电脑也能本地运行强大开源AI模型

    家人们,好消息!Exo Labs带着他们的黑科技来了,现在你的Mac M4电脑也能变身强大的本地AI模型运行器啦!🌌 🍎【Apple M4芯片的力量】 Exo Labs利用Apple M4芯片,在本地计算集群上成功运行开源AI模型,这意味着我们可以告别昂贵的NVIDIA GPU,用我们手头的设备就能搞定! 💼【成本与隐私】 本地运行AI模型不仅降低了成本,还提高了隐私安全,再也…

    2024年11月14日
  • Fashion-VDM:一键试衣,视频见证你的时尚变身!👗📹

    亲爱的时尚达人们,想要快速预览穿上心仪衣物的效果吗?Fashion-VDM来帮你实现这个愿望!只需一张图+视频,就能展示穿上输入衣物后的神奇效果,让你的穿搭选择更简单、更直观! 👚【时尚新体验】 Fashion-VDM技术,让你在选择衣物时不再犹豫。只需上传一张你的照片和想要试穿的衣物图片,系统就能生成一段视频,展示你穿上这件衣物的样子,让你在购买前就能预见穿搭效果。 📱【操作…

    2024年11月14日
  • 可一键生成“多机位”视频大片-ReCapture

    利用多视角扩散模型和遮罩视频微调技术,实现粗略视频到清晰、连贯、动感视频的转变。适用于各种视频和视角转换,让普通用户也能制作专业级“多机位”视频。 项目地址: https://generative-video-camera-controls.github.io

    2024年11月11日
  • FLUX.1-dev LoRA秒出服装效果图

    FLUX.1-dev LoRA 是由 TryOn Labs 开发的一款服装生成器,它利用先进的人工智能技术,能够根据用户输入的服装描述(包括颜色、图案、材质、风格等细节)快速生成相应的服装设计图。这款工具的强大之处在于其灵活的输入格式和丰富的时尚知识库,使得用户可以充分发挥创意,描述出心目中的理想服装。 例如,如果用户输入“一件森林绿色缎面连身裤,宽腿,金色植物印花,系着米白色…

    2024年11月7日