开源项目

  • ToonCrafter:可自动生成卡通动画的中间帧 ,并根据参考图像对动画草图自动上色

    ToonCrafter,它可以通过预训练的图像到视频扩散先验来插值两幅卡通图像。项目支持生成512×320分辨率的视频,推荐使用Anaconda安装环境并通过命令行或本地Gradio演示进行推理。需要注意的是,由于生成视频先验的多样性,成功率并不保证。 ToonCrafter 通过生成性插值方法,在卡通动画帧之间生成自然、连贯的中间帧。能够处理复杂的非线性运动和遮挡问…

    2024年5月31日
  • 视频虚拟试穿的框架:ViViD,解决视频虚拟试穿的问题

    可以合成自然、逼真的视频,保留目标服装的身份,同时保持源视频其余部分不变 项目地址: https://github.com/novitalabs/AnimateAnyone 论文地址: https://arxiv.org/pdf/2405.11794 这篇论文介绍了一种名为ViViD的视频虚拟试穿技术,通过强大的扩散模型来实现视频虚拟试穿。他们提出了一种新的架构,利用扩散模型生…

    2024年5月31日
  • 一款基于LLM的AI本地文件管理器:llama-fs

    LlamaFS是一个自组织的文件管理器,可以根据文件内容和约定自动重命名和整理文件。它支持各种文件类型,甚至包括图像和音频。它有批处理模式和交互式守护程序模式。用户可以发送目录到LlamaFS,它会返回建议的文件结构并整理文件。它还有“隐身模式”切换,可以通过Ollama而不是Groq路由每个请求。使用Python后端构建,集成了Ollama和Groq,前端使用Electron…

    2024年5月29日
  • ChatTTS:一个专为对话场景设计的语音生成模型

    ChatTTS是一个专为对话场景设计的语音生成模型,支持中文和英文,通过大量数据训练,提供高质量和自然度的语音合成。项目团队计划开源一个基础模型,注重模型的可控性和安全性。用户在使用ChatTTS时需注意免责声明,开源模型将为社区带来新的学习和创新机会。 项目地址: https://github.com/2noise/ChatTTS 视频演示地址: https://www.bi…

    2024年5月28日
  • Open-Sora 1.1发布,视频质量提升,生成时长延长至21秒

    Open-Sora1.1发布带来了显著提升,尤其在视频生成质量和时长方面。新版本模型能生成最长约21秒视频,使用高质量视觉数据和字幕训练,提升对世界运作的理解。CausalVideoVAE架构优化提高性能和推理效率。 项目地址: https://github.com/PKU-YuanGroup/Open-Sora-Plan

    2024年5月28日
  • 通过区域性图像编码来提升多模态大模型的感知定位能力:Groma

    Groma,这是一个具有视觉感知能力的多模态大型语言模型。Groma能够理解用户指定的区域输入,并将文本输出与图像联系起来。通过将区域标记集成到用户指令和模型响应中,Groma展现出在标准指代和定位基准测试中优越的性能。它是一个具有出色区域理解和视觉定位能力的多模态大型语言模型。 核心思路是将定位任务转移到多模态大模型的vision tokenizer中,利用其空间理解能力定位…

    2024年5月27日
  • 从任意数量的图像生成一致的高质量3D新视图只需要1分钟的CAT3D

    CAT3D是一种用于创建任何物体的3D方法,通过模拟真实世界的捕捉过程,使用多视角扩散模型生成高度一致的新视图。这些生成的视图可以用作强大的3D重建技术的输入,以实时渲染任何视角的3D表示。CAT3D可以在一分钟内创建完整的3D场景,并优于现有的单图像和少视角3D场景创建方法。 项目地址: https://cat3d.github.io/index.html  

    2024年5月18日
  • 号称最强的 RAG Search API的Trieve开源,支持向量/全文检索、混合检索等

    Trieve是一款强大的RAG Search API,支持数据摄入、全栈搜索、推荐和LLM答案生成。支持开源嵌入/推理模型、向量/全文检索、混合检索,私有化部署和API访问,以及配套的Search UI组件。 重点评论:1. Trieve提供私有化部署、语义搜索、关键字/全文检索、混合检索等多种特性。2. Trieve支持推荐、Filter检索,以及通过OpenRouter提供…

    2024年5月11日
  • AniTalker:通过静态的肖像画和输入音频,生成生动多样的面部说话视频

    AniTalker是一个创新的框架,它能够将单一静态肖像和输入的音频转换成具有自然流畅动作的动画说话视频。以下是该产品的主要特征的归纳总结: 1. **面部动态捕捉**:AniTalker能够捕捉到广泛的面部动态,包括微妙的表情和头部动作。 2. **通用运动表示**:该框架使用一种通用的运动表示方法,与仅关注口头线索(如唇部同步)的现有模型不同,AniTalker能够更全面地…

    2024年5月11日
  • 具备OCR能力,可解读4K图片的多模态开源项目

    在多个基准测试上取得了接近GPT-4V和GeminiPro的性能,具备强大的多模态对话能力和OCR能力,可用于解析图片,为图片配文等(比如根据图片写小红书文案) 体验地址: https://huggingface.co/spaces/OpenGVLab/InternVL

    2024年5月3日