开源项目
-
阿里IC-LoRA给图像生成模型增加情节记忆力能力
研究人员设计出一种简单有效的流程,这个流程能够唤醒 Diffusion 模型的 “上下文学习” 能力。这样做的好处是大大降低了 AI 模型的训练成本。由于训练成本降低,更多的人可以参与到 AI 创作中来。 项目地址: https://ali-vilab.github.io/In-Context-LoRA-Page
-
腾讯混元-3D: 首个同时支持 文生和图生的3D开源模型
腾讯发布了开源的 3D 生成模型。这个模型是第一个能够同时支持通过文字生成 3D 以及通过图片生成 3D 的开源模型。用户可以上传一张照片,通过这个模型生成 3D 模型,进而可以进行 3D 打印。并且展望未来,通过这个模型有望实现玩具自由,即可以轻松制作各种玩具。 为了解决现有的3D生成模型在生成速度和泛化能力上存在不足,我们开源了混元3D-1.0模型,可以帮助3D创作者和艺术…
-
腾讯混元又开源了两个重磅模型:混元Large和Hunyuan3D-1.0
腾讯混元 Large 模型与腾讯混元 Pro、腾讯混元 Turbo 等不同尺寸模型源于同一技术体系,在腾讯内部近 700 个业务和场景中广泛应用,如腾讯元宝、微信公众号等。该模型总参数量为 389B,激活参数量 52B,上下文长度达 256K,采用主流的 MoE 架构模型,推理成本远低于同等参数稠密模型,在多学科综合评测集及 9 大维度中全面领先。已同步上架腾讯云 TI 平台,…
-
黑森林实验室推出了图像生成模型Flux1.1Pro
黑森林实验室推出了图像生成模型 Flux1.1Pro。这个模型在速度和画质上有重大突破,比前代模型快六倍,图像质量也显著提升。开发者能够借助 BFL API 把 Flux 模型整合到自己的应用程序中,该模型价格合理,性能出色。 还有网友发现最新 AI 生图模型 Flux1.1 隐藏玩法,添加单反相机文件名就能去除图中的“AI 味”,获得超写实图像。(下面是我测试的效果) 可以在…
-
又一个虚拟试衣技术~GS-VTON
实现了从2D到3D虚拟试衣的无缝过渡,提升了不同视角下的连贯性。 个性化扩散模型和低秩适配技术使用户能在多个视角下编辑衣物效果,保持高度一致性,提升真实感。 项目地址: https://yukangcao.github.io/GS-VTON
-
一键重绘世界名画魔法项目 Inverse Painting
这项魔法来自华盛顿大学,项目名为 Inverse Painting,从原图 → 绘画过程延时视频,Inverse Painting 采用基于扩散的逆绘画方法。 项目地址:https://inversepainting.github.io/
-
超高清视频生成模型Pyramid-Flow
Pyramid-Flow是一款超高清视频生成模型,由快手、北京大学和北京邮电大学研究团队联合开源。该模型能够生成10秒、1280×768分辨率、24帧的视频,质量出色。 项目地址: https://pyramid-flow.github.io
-
一个轻量级的AI证件照制作算法:HivisionIDPhotos
HivisionIDPhoto 可以做到: 轻量级抠图(纯离线,仅需 CPU 即可快速推理)根据不同尺寸规格生成不同的标准证件照、六寸排版照支持 纯离线 或 端云 推理美颜智能换正装(waiting) 项目地址: https://github.com/Zeyi-Lin 体验地址: https://swanhub.co/ZeYiLin/HivisionIDPhotos/demo
-
专门为动画视频线稿上色工具LVCD,可以把黑白线稿自动转化为彩色动画视频
本文介绍了“LVCD:Reference–based Lineart Video Colorization with Diffusion Models”,发表于 ACM Transactions on Graphics & SIGGRAPH Asia 2024。作者包括 Zhitong Huang、Mohan Zhang、Jing Liao,来自香港城市大学…
-
一致性角色图像解决方案来咯,StoryMaker可以用于生成系列图片构成的故事情节
StoryMaker 可以通过文本提示控制生成图像的背景、姿势和风格,使得用户可以根据不同的场景需求生成符合叙事需求的图像序列。 该模型支持包括服装交换、角色插值等功能,并能与其他生成插件(如 LoRA、ControlNet)集成,提供多样化的生成应用场景。 地址: https://huggingface.co/RED-AIGC/StoryMaker
