开源项目

  • 通过区域性图像编码来提升多模态大模型的感知定位能力:Groma

    Groma,这是一个具有视觉感知能力的多模态大型语言模型。Groma能够理解用户指定的区域输入,并将文本输出与图像联系起来。通过将区域标记集成到用户指令和模型响应中,Groma展现出在标准指代和定位基准测试中优越的性能。它是一个具有出色区域理解和视觉定位能力的多模态大型语言模型。 核心思路是将定位任务转移到多模态大模型的vision tokenizer中,利用其空间理解能力定位…

    2024年5月27日
  • 从任意数量的图像生成一致的高质量3D新视图只需要1分钟的CAT3D

    CAT3D是一种用于创建任何物体的3D方法,通过模拟真实世界的捕捉过程,使用多视角扩散模型生成高度一致的新视图。这些生成的视图可以用作强大的3D重建技术的输入,以实时渲染任何视角的3D表示。CAT3D可以在一分钟内创建完整的3D场景,并优于现有的单图像和少视角3D场景创建方法。 项目地址: https://cat3d.github.io/index.html  

    2024年5月18日
  • 号称最强的 RAG Search API的Trieve开源,支持向量/全文检索、混合检索等

    Trieve是一款强大的RAG Search API,支持数据摄入、全栈搜索、推荐和LLM答案生成。支持开源嵌入/推理模型、向量/全文检索、混合检索,私有化部署和API访问,以及配套的Search UI组件。 重点评论:1. Trieve提供私有化部署、语义搜索、关键字/全文检索、混合检索等多种特性。2. Trieve支持推荐、Filter检索,以及通过OpenRouter提供…

    2024年5月11日
  • AniTalker:通过静态的肖像画和输入音频,生成生动多样的面部说话视频

    AniTalker是一个创新的框架,它能够将单一静态肖像和输入的音频转换成具有自然流畅动作的动画说话视频。以下是该产品的主要特征的归纳总结: 1. **面部动态捕捉**:AniTalker能够捕捉到广泛的面部动态,包括微妙的表情和头部动作。 2. **通用运动表示**:该框架使用一种通用的运动表示方法,与仅关注口头线索(如唇部同步)的现有模型不同,AniTalker能够更全面地…

    2024年5月11日
  • 具备OCR能力,可解读4K图片的多模态开源项目

    在多个基准测试上取得了接近GPT-4V和GeminiPro的性能,具备强大的多模态对话能力和OCR能力,可用于解析图片,为图片配文等(比如根据图片写小红书文案) 体验地址: https://huggingface.co/spaces/OpenGVLab/InternVL

    2024年5月3日
  • 一个本地且开源的“动漫女友”平台:anime

    Anime gf 是一个本地开源工具,为用户提供了与虚拟角色互动的平台,类似于 CharacterAI。你可以自定义创建各种角色,让每个虚拟角色都有自己的独特个性和语言风格。 体验地址: https://www.anime.gf/ 项目地址: https://github.com/cyanff/anime.gf

    2024年5月3日
  • ZeST:上传要改变材质的图片,再上传材质参考,即可修改图片中物体的材质

    ZeST是一种零训练的方法,用于在单个图像中进行材质转移。这种方法可以轻松扩展到在单个图像中执行多个材质编辑,以及对纹理网格的渲染执行隐式光照感知编辑。通过结合材质示例图像和输入图像,ZeST可以在输入图像中传输材质属性,同时保留所有其他属性。该方法在真实图像上工作,不需要任何训练,实现了零训练的方法。ZeST展示了在真实和合成数据集上的定性和定量结果,输出具有传输材质的逼真图…

    2024年5月3日
  • 利用AI大模型,只需提供一个视频主题或关键词 ,就可以全自动生成视频文案、视频素材

    功能特性 🎯完整的 MVC架构,代码 结构清晰,易于维护,支持 API 和 Web界面 支持视频文案 AI自动生成,也可以自定义文案 支持多种 高清视频 尺寸 竖屏 9:16,1080×1920横屏 16:9,1920×1080支持 批量视频生成,可以一次生成多个视频,然后选择一个最满意的 支持 视频片段时长设置,方便调节素材切换频率 支持 中文 和 英文 …

    2024年5月3日
  • 字节跳动与旷视科技联合推出HiDiffusion,革新图像生成技术

    **字节跳动与旷视科技联合推出HiDiffusion,革新图像生成技术** 字节跳动与旷视科技的最新合作成果——HiDiffusion,为图像生成技术带来了革命性的突破。这项技术通过简化操作流程,仅需一行代码即可显著提升生成图像的清晰度,并大幅加快生成速度。 ### **HiDiffusion技术亮点:** – **无需训练:** 直接应用于现有的扩散模型,无需额外…

    2024年4月25日
  • 苹果也开始学 Meta,完全开源了 OpenELM 一系列模型,包括270M、450M、1.1B和3B四个规模的模型

    苹果公司在人工智能领域迈出了重要的一步,通过开源OpenELM系列模型,展示了其对开放科学和共享资源的承诺。以下是对苹果这一举措的优化文案: **苹果公司推动AI开放创新,开源OpenELM系列模型** 苹果公司最近宣布了一个重大的人工智能开源项目——OpenELM,这一系列模型包括了从270M到3B不等规模的多个模型。这一举措不仅为AI研究和开发社区带来了前所未有的资源,也体…

    2024年4月25日