开源项目

  • 可一键生成“多机位”视频大片-ReCapture

    利用多视角扩散模型和遮罩视频微调技术,实现粗略视频到清晰、连贯、动感视频的转变。适用于各种视频和视角转换,让普通用户也能制作专业级“多机位”视频。 项目地址: https://generative-video-camera-controls.github.io

    2024年11月11日
  • FLUX.1-dev LoRA秒出服装效果图

    FLUX.1-dev LoRA 是由 TryOn Labs 开发的一款服装生成器,它利用先进的人工智能技术,能够根据用户输入的服装描述(包括颜色、图案、材质、风格等细节)快速生成相应的服装设计图。这款工具的强大之处在于其灵活的输入格式和丰富的时尚知识库,使得用户可以充分发挥创意,描述出心目中的理想服装。 例如,如果用户输入“一件森林绿色缎面连身裤,宽腿,金色植物印花,系着米白色…

    2024年11月7日
  • VQAScore评测方案,搞定文生图模型评测

    VQAScore是一种新的文本到视觉生成评估指标,通过CLIP-FlanT5模型计算图像与文本提示的匹配度,优于传统CLIPScore。它使用VQA模型评估生成图像,提供简单有效的评估方法,并推出GenAI-Bench基准测试,挑战现有生成模型。 项目地址: https://linzhiqiu.github.io/papers/vqascore

    2024年11月6日
  • InstantX图像生成黑科技!可精确控制 FLUX 生成图片时每个区域的内容

    这个GitHub仓库名为“Regional-Prompting-FLUX”,由instantX-research组织创建。它提供了一个名为“Training-free Regional Prompting for Diffusion Transformers”的项目,这个项目的核心是一个无需训练的区域提示方法,用于扩散变换(Diffusion Transformers)模型。这…

    2024年11月6日
  • Standard Intelligence Lab推出的Hertz-Dev开源音频模型,实现了超低延迟的实时对话AI

    Hertz-Dev 是一个开源音频模型,它具有 8.5 亿参数。该模型在延迟方面表现出色,理论延迟仅有 80 毫秒,实际延迟为 120 毫秒。这种低延迟的特性极大地提升了实时对话的体验,使得人与机器之间的交流更加流畅和自然。例如,在客户支持场景中,用户可以更快地得到回应,提高服务效率;在智能家居环境中,设备的响应速度更快,增强了用户的使用感受。 地址: https://si.i…

    2024年11月5日
  • 阿里IC-LoRA给图像生成模型增加情节记忆力能力

    研究人员设计出一种简单有效的流程,这个流程能够唤醒 Diffusion 模型的 “上下文学习” 能力。这样做的好处是大大降低了 AI 模型的训练成本。由于训练成本降低,更多的人可以参与到 AI 创作中来。 项目地址: https://ali-vilab.github.io/In-Context-LoRA-Page

    2024年11月5日
  • 腾讯混元-3D: 首个同时支持 文生和图生的3D开源模型

    腾讯发布了开源的 3D 生成模型。这个模型是第一个能够同时支持通过文字生成 3D 以及通过图片生成 3D 的开源模型。用户可以上传一张照片,通过这个模型生成 3D 模型,进而可以进行 3D 打印。并且展望未来,通过这个模型有望实现玩具自由,即可以轻松制作各种玩具。 为了解决现有的3D生成模型在生成速度和泛化能力上存在不足,我们开源了混元3D-1.0模型,可以帮助3D创作者和艺术…

    2024年11月5日
  • 腾讯混元又开源了两个重磅模型:混元Large和Hunyuan3D-1.0

    腾讯混元 Large 模型与腾讯混元 Pro、腾讯混元 Turbo 等不同尺寸模型源于同一技术体系,在腾讯内部近 700 个业务和场景中广泛应用,如腾讯元宝、微信公众号等。该模型总参数量为 389B,激活参数量 52B,上下文长度达 256K,采用主流的 MoE 架构模型,推理成本远低于同等参数稠密模型,在多学科综合评测集及 9 大维度中全面领先。已同步上架腾讯云 TI 平台,…

    2024年11月5日
  • 黑森林实验室推出了图像生成模型Flux1.1Pro

    黑森林实验室推出了图像生成模型 Flux1.1Pro。这个模型在速度和画质上有重大突破,比前代模型快六倍,图像质量也显著提升。开发者能够借助 BFL API 把 Flux 模型整合到自己的应用程序中,该模型价格合理,性能出色。 还有网友发现最新 AI 生图模型 Flux1.1 隐藏玩法,添加单反相机文件名就能去除图中的“AI 味”,获得超写实图像。(下面是我测试的效果) 可以在…

    2024年10月13日
  • 又一个虚拟试衣技术~GS-VTON

    实现了从2D到3D虚拟试衣的无缝过渡,提升了不同视角下的连贯性。 个性化扩散模型和低秩适配技术使用户能在多个视角下编辑衣物效果,保持高度一致性,提升真实感。 项目地址: https://yukangcao.github.io/GS-VTON

    2024年10月13日