开源项目

  • 出门问问发布“序列猴子开源数据集1.0”

    出门问问昨日在其微信公众号宣布,将向公众开放其超大规模语言模型“序列猴子”的部分训练数据集,命名为“序列猴子开源数据集1.0”。本次开源的“序列猴子数据集1.0”包含了中文通用文本语料、古诗今译语料以及文本生成语料,这些数据资源经过精心挑选和整理,确保了数据质量和数据格式。同时,出门问问采用宽松的许可协议,为广大开发者和研究人员提供了便捷的使用条件。 序列猴子是出门问问提供的超…

    2024年2月23日
  • 一个可控的虚拟服装试穿开源工具-OOTDiffusion,和模特非常贴合

    可以根据不同性别和体型自动调整,和模特非常贴合。也可以根据自己的需求和偏好调整试穿效果 OOTDiffusion支持半身模型和全身模型两种模式。 主要功能: 1、基于潜在扩散的装备融合:利用潜在扩散模型(latent diffusion models)的先进技术,OOTDiffusion实现了高质量的服装图像生成和融合,确保试穿效果自然且逼真。 2、半身和全身虚拟试穿:OOTD…

    2024年2月20日
  • MIT研究团队开发的项目PixelPlayer,能自动从视频中识别和分离出不同的声音源

    PixelPlayer:MIT研究团队开发的项目,能自动从视频中识别和分离出不同的声音源,并与画面位置匹配。 例如,它可以识别出视频中哪个人物正在说话或哪个乐器正在被演奏。 而且还能够分别提取和分离这些声音源的声音。 PixelPlayer能自我学习分析,无需人工标注数据。 这种能力为音视频编辑、多媒体内容制作、增强现实应用等领域提供了强大的工具,使得例如独立调整视频中不同声音…

    2024年2月20日
  • 字节研究院发布视频控制方式Boximator,可以精确控制物品结束运动的位置

    这种控制方式比Runway的运动笔刷更进一步,你可以精确控制物品结束运动的位置。 演示中使用的视频模型也是字节研发的PixelDance视频生成模型。 项目简介: 我们提出了Boximator,这是一种用于精细运动控制的新方法。Boximator采用了两种约束机制:硬性约束(hard box)和软性约束(soft box)。 用户可以利用硬性约束选取视频中某一帧(称为条件帧)的…

    2024年2月5日
  • 苹果开源名为多模态大语言模型引导的编辑(MGIE),可通过指令修改图片

    苹果发布了一项名为多模态大语言模型引导的编辑(MGIE)的新技术,该技术可以帮助用户通过自然语言指令来修改图片,使得编辑图片变得更加简单和自然。 MGIE利用多模态大型语言模型(MLLMs)生成图像编辑指令,并通过端到端训练来捕捉视觉想象力并执行图像处理操作。该方法在ICLR’24上获得了Spotlight成果。 多模态大语言模型引导的编辑技术(MGIE)不仅可以帮…

    2024年2月5日
  • Motion-I2V :可以让开源视频模型也有类似 Runway 的运动笔刷能力

    昨天清华大学和商汤公司的这个视频生成项目可以让开源视频模型也具备类似Runway的运动笔刷能力。而且比Runway更进一步,支持在涂抹区域后使用画笔描绘运动方向,也可以分开使用。 希望可以与现有的开源视频生成模型兼容,我在论文中没有看到相关内容。 详细介绍: 我们推出了一种名为Motion-I2V的创新框架,用于实现一致且可控的图片到视频转换(I2V)。与以往直接学习复杂映射关…

    2024年2月4日
  • 只需要100美金,就能手搓一个Humane Pin

    ADeus是一个人工智能可穿戴设备项目,所有零件都可以在网上购买,代码也是开源的。 它能够实时记录和保存语音和环境数据,并通过手机或电脑上的应用进行访问。你可以与它聊天,并询问它关于你的任何记录信息。 主要功能和特点包括: 1. 数据记录和处理:它可以实时记录你的声音和其他数据,并发送到网络上的一个服务进行处理。 2. 个人助手:通过手机或电脑上的应用,你可以与它聊天,就像与朋…

    2024年2月3日
  • 智能 AI 照片生成器EasyPhoto,用于生成AI肖像画,创作数字分身

    EasyPhoto是一个Webui UI插件,用于生成AI肖像画。这段代码可以用来训练与您相关的数字分身。建议使用5到20张肖像图片进行训练,最好是半身照片,并且最好不要佩戴眼镜(少量可以接受)。一旦训练完成,我们可以在推理部分生成图像。我们支持使用预设模板图片或上传自己的图片进行推理。 点击上传按钮后,我们可以开始上传图片。建议上传5到20张图片,包括不同的角度和光照条件。最…

    2024年1月21日
  • 一个界面非常简洁美观功能强大的的开源知识库程序:Outline

    Outline是一个快速、协作的团队知识库,界面美观,功能强大,兼容Markdown。 它适用于各种文档和知识管理需求。 Outline是一个直观、快速且协作的文档编辑和管理平台,具有以下特点: – 直观的编辑体验:提供了一个快速编辑器,支持Markdown、斜线命令、互动嵌入等功能。 – 实时协作:支持团队成员在文档上实时协作,评论和线程帮助组织对话。…

    2024年1月19日
  • 1分钟语音即可训练一个自己的TTS模型:GPT-SoVITS

    GPT-SoVITS是一个声音克隆和文本到语音转换的开源 Python RAG框架。 只需5秒的数据,它就可以模仿你的声音,只需1分钟的声音数据,就可以训练出一个高质量的TTS模型,完美克隆你的声音! 根据演示来看,它似乎是目前中文支持比较好的模型。 界面也很易用。 主要特点包括: 1. 零样本TTS:只需5秒的声音样本即可体验即时的文本到语音转换。 2. 少量样本训练:只需1…

    2024年1月19日