开源项目

  • MCP 服务器是什么?Anthropic 推出的 AI 工具连接新标准详解

    MCP (Model Context Protocol) 是 Anthropic 推出的开放协议,让 AI 助手能够安全连接本地文件、数据库和 API。本文详解 MCP 的功能、使用场景和上手方法。

    2026年3月4日
  • OminiControl Art发布:将GPT-4o的吉卜力等艺术风格提炼至FLUX模型

    几种风格选择:吉卜力工作室 伊拉苏托亚插图 《辛普森一家》 史努比 体验地址: https://huggingface.co/spaces/Yuanshi/OminiControl_Art

    2025年4月14日
  • 智谱开源文生图模型CogView4,中文的开源图片模型来了

    主要特点:支持中英双语提示词输入,擅长理解和遵循中文提示词首个能够在画面中生成汉字的开源文生图模型支持生成任意宽高的图片以及任意长度提示词输入 后续还会开源对应的Controlnet、Comfyui支持和模型微调工具图像模型在今年终于有了一点动静了,而且这个模型在 DPG-Bench基准测试中的综合评分排名第一项目地址: https://github.com/THUDM/Cog…

    2025年3月4日
  • 微软发布开源OmniParser V2.0,秒变操控电脑AI智能体

    微软推出的OmniParser V2.0是一个新型的解析工具,其主要功能是将用户界面(UI)截图转换为结构化数据。这一工具的目的是提升基于大型语言模型(LLM)的用户操作体验,使AI模型能够更好地理解和操作用户界面。OmniParser V2.0通过对数据集和算法进行改进,显著提高了图标识别的准确性和处理速度,从而提升了用户在操作虚拟机时的效率。 OmniParser V2.0…

    2025年2月19日
  • 阶跃同时开源视频生成+实时语音模型

    2025年2月18日,阶跃星辰与吉利汽车集团联合开源了两款多模态大模型,其中包括全球范围内参数量最大、性能最好的开源视频生成模型阶跃Step-Video-T2V,以及行业内首款产品级开源语音交互大模型阶跃Step-Audio。 阶跃Step-Video-T2V的特点 阶跃Step-Audio的特点 项目地址: https://github.com/stepfun-ai/Step…

    2025年2月19日
  • 昆仑万维开源首个面向AI短剧创作的视频生成模型SkyReels-V1

    昆仑万维于2025年2月18日宣布开源中国首个面向AI短剧创作的视频生成模型SkyReels-V1,以及中国首个SOTA级别基于视频基座模型的表情动作可控算法SkyReels-A1。 SkyReels-V1的特点 SkyReels-A1的特点 开源的意义 昆仑万维此次开源SkyReels-V1和SkyReels-A1,旨在解决当前AI视频生成模型不开源、费用高、难以使用等问题,…

    2025年2月18日
  • 新发布的开源语音模型 Zonos

    Zonos 被称为最强开源语音模型,其语音生成质量非常高,并且有中文版本。它包含两种 1.6B 模型,分别是 transformer 和 SSM。可以使用 5 到 30 秒的语音进行高保真语音克隆。还能够调节速度、音高、音频质量和情绪。通过添加文本和音频前缀,可以实现更丰富的说话人匹配效果。在 RTX 4090 显卡上运行时,实时率约为 2 倍。 详情: https://www…

    2025年2月11日
  • DeepSeek发布Janus-Pro多模态大模型,进军文生图领域

    在一些基准测试中,Janus-Pro-7B 击败了 OpenAI 的 DALL-E 3 以及 Stable Diffusion、Emu3-Gen 等热门模型。Janus Pro 采用 MIT 开源协议,可无限制用于商业场景。并且该大模型是 2024 年 11 月 13 日发布的 JanusFlow 大模型的高级版本。(暂时只能处理384×384分辨率的图像) 模型地址…

    2025年1月28日
  • 微软开源 140 亿参数小语言 AI 模型 Phi-4

    微软于2025年1月8日在Hugging Face平台上开源了其小型语言模型Phi-4。Phi-4是微软2023年推出的小型语言模型系列的第四代产品,拥有140亿参数。该模型基于Transformer架构,采用仅解码器型架构,只关注单词之前的文本,减少了需要处理的数据量,从而降低了推理成本。 Phi-4在多个基准测试中表现优异,甚至超越了参数量更大的Llama 3.3 70B和…

    2025年1月10日
  • Leffa:Meta开源的AI试衣模型

    Meta开源的AI试衣模型名为Leffa,它是一个用于生成可控人物图像的统一框架,能够精确操控人物的外观(如虚拟试穿)和姿势(如姿势转移)。Leffa通过在注意力层中引导目标查询关注正确的参考键,显著减少了细粒度细节的失真,同时保持了高图像质量。此外,Leffa的损失函数是模型无关的,可以用于提高其他扩散模型的性能。 Leffa的主要功能包括: Leffa的效果确实非常好,可以…

    2024年12月16日