开源项目
-
一键重绘世界名画魔法项目 Inverse Painting
这项魔法来自华盛顿大学,项目名为 Inverse Painting,从原图 → 绘画过程延时视频,Inverse Painting 采用基于扩散的逆绘画方法。 项目地址:https://inversepainting.github.io/
-
超高清视频生成模型Pyramid-Flow
Pyramid-Flow是一款超高清视频生成模型,由快手、北京大学和北京邮电大学研究团队联合开源。该模型能够生成10秒、1280×768分辨率、24帧的视频,质量出色。 项目地址: https://pyramid-flow.github.io
-
一个轻量级的AI证件照制作算法:HivisionIDPhotos
HivisionIDPhoto 可以做到: 轻量级抠图(纯离线,仅需 CPU 即可快速推理)根据不同尺寸规格生成不同的标准证件照、六寸排版照支持 纯离线 或 端云 推理美颜智能换正装(waiting) 项目地址: https://github.com/Zeyi-Lin 体验地址: https://swanhub.co/ZeYiLin/HivisionIDPhotos/demo
-
专门为动画视频线稿上色工具LVCD,可以把黑白线稿自动转化为彩色动画视频
本文介绍了“LVCD:Reference–based Lineart Video Colorization with Diffusion Models”,发表于 ACM Transactions on Graphics & SIGGRAPH Asia 2024。作者包括 Zhitong Huang、Mohan Zhang、Jing Liao,来自香港城市大学…
-
一致性角色图像解决方案来咯,StoryMaker可以用于生成系列图片构成的故事情节
StoryMaker 可以通过文本提示控制生成图像的背景、姿势和风格,使得用户可以根据不同的场景需求生成符合叙事需求的图像序列。 该模型支持包括服装交换、角色插值等功能,并能与其他生成插件(如 LoRA、ControlNet)集成,提供多样化的生成应用场景。 地址: https://huggingface.co/RED-AIGC/StoryMaker
-
可以处理各种复杂的OCR任务的 OCR 模型 – GOT-OCR2.0
可以处理各种复杂的OCR任务,不仅包括普通文本,还可以识别公式、表格、乐谱等复杂内容。 项目地址: https://github.com/Ucas-HaoranWei/GOT-OCR2.0
-
一款开源多模态大型语言模型Mini-Omni,具有实时语音处理能力和边思考边说话的独特能力
Mini-Omni是一款开源多模态大型语言模型,具有实时语音处理能力和边思考边说话的独特能力,为用户带来自然交互体验。它支持多种输入模态,包括语音和文本,展现出全面的实力和强大的潜力。Mini-Omni的 Any Model Can Talk 功能使得其他AI模型能够集成其实时语音能力,扩展了AI应用的可能性。 项目地址: https://github.com/gpt-omni…
-
零一万物开源 Yi-Coder 系列模型:一款小而强大的编程助手
北京零一万物科技有限公司宣布正式开源Yi-Coder系列模型,标志着在人工智能领域取得重要进展。Yi-Coder系列模型专注于编程任务,提供1.5B和9B两种参数规模的模型,展现出卓越性能。 项目地址: https://github.com/01-ai/Yi-Coder
-
一个基于需求描述自动生成项目源码的开源项目GPT Engineer
项目特点:只需一个提示就能生成代码库,提出需澄清的问题,生成技术规范,编写所有必要代码,易于添加推理步骤、修改和实验,项目开源。主要理念:简单易用,为用户提供价值;灵活且易于添加新的 “AI 步骤”;支持高级提示,能记住用户反馈;能快速在 AI 和人类之间切换;所有计算 “可恢复” 并持久保存到文件系统。生成过程:整个过程分需求细化促进和软件构建两个阶段,前者循环提问直至需求澄…
-
通过简短视频克隆人像并转化为3D数字形象的技术ExAvatar
全文总结本文主要介绍了一种名为 ExAvatar 的新型表达性全身 3D 高斯化身。它结合了 SMPL–X 的全身驱动性和 3DGS 的强大外观建模能力,可通过短时间的手机扫描创建,并支持新的身体姿势、手部姿势、面部表情的动画和任意视角的渲染。文中还阐述了其混合表示、身体各部位的协同注册、架构以及与先前技术和生成式 AI 的比较等方面。重要亮点 地址: https:…
