开源项目
-
全新的图像生成模型 FLUX.1来了
新公司名叫 Black Forest Lab,黑森林实验室。宣布推出全新的图像生成模型 FLUX.1。FLUX.1 包含专业版、开发者版、快速版三种模型,其中前两款模型击败 SD3-Ultra 等主流模型,较小规模的 FLUX.1 [schnell] 也超越了 Midjourney v6.0、DALL・E 3 等更大的模型。 体验地址: https://replicate.co…
-
AI生成3D新框架TexGen
由阿尔伯塔大学、多伦多大学和华为诺亚方舟实验室联合推出的新技术,能够根据用户的文本描述生成高质量的3D纹理,解决了传统方法中的接缝和过度平滑问题。 https://dong-huo.github.io/TexGen
-
阿里巴巴的研究团队推出了基于轨迹的视频生成新模型Tora
Tora以高保真度、精准运动控制和多样化输入著称,采用先进的Diffusion Transformer架构,突破视频生成限制,实现60秒高质量视频生成。 项目地址: https://ali-videoai.github.io/tora_video
-
智谱 AI 将与“清影”同源的视频生成模型 ——CogVideoX 开源
重要亮点 项目地址: https://github.com/THUDM/CogVideo
-
以即插即用方式控制全身多模态运动生成的统一框架 ControlMM
本文主要探讨了全身多模态运动生成的相关内容,指出其在视频生成和角色动画等方面有诸多应用,但在统一模型完成不同条件模态的生成任务时面临运动分布漂移、混合条件优化复杂以及现有数据集运动格式不一致等挑战。为此,提出了以即插即用方式控制全身多模态运动生成的统一框架 ControlMM。重要亮点 实验效果:大量实验表明 ControlMM 在各种标准运动生成任务中达到了最先进的性能。 面…
-
Stability AI 开源 Stable Fast 3D(SF3D)只需 0.5s 就能将图片转为 3D?
全文总结Stability AI 推出了创新的 3D 资产生成技术 Stable Fast 3D,它能在极短时间内将单张输入图像转化为详细的 3D 资产,为 3D 重建领域树立了速度和质量的新标杆。重要亮点 项目页:https://stable-fast-3d.github.io代码地址:https://github.com/Stability-AI/stable-fast-3…
-
开源的OpenSearchGPT来了
全文总结此段内容主要介绍了 OpenSearch GPT,这是一款为用户个性化定制的开源 AI 搜索引擎。重要亮点 面临问题:有人询问其如何处理长期和短期的记忆管理,以及如何定期更新,还有网站似乎出现故障的情况。 个性化学习:随着用户提问增多,它能了解用户,用户还能教导它自己是谁,并且控制关于自身的已知信息。 超快速度:提供了链接 opensearch-ai.pages.dev…
-
LivePortrait 的视频驱动肖像动画框架:合成逼真的肖像动画
主要介绍了名为 LivePortrait 的视频驱动肖像动画框架。该框架旨在从单张源图像合成逼真视频,其运动来自驱动视频、音频、文本或生成。作者探索并扩展了基于隐式关键点的框架潜力,通过多种手段提升了生成质量和泛化能力,包括扩大训练数据、采用混合图像–视频训练策略、升级网络架构以及设计更好的运动变换和优化目标等。文中还详细阐述了框架的各个模块和训练流程,并展示了实验…
-
FoleyCrafter:让无声视频瞬间拥有逼真配音
全文摘要本文介绍了FoleyCrafter,一个基于文本的视频到音频生成框架,它可以生成与输入视频在语义上相关且时间上同步的高质量音频。FoleyCrafter通过语义适配器和时间控制器,利用预训练的文本到音频模型,实现音频的高质量生成和精确的音视频同步,同时支持文本提示以实现可控和多样化的视频到音频生成。 关键段落 项目地址: https://foleycrafter.git…
-
EchoMimic:音频+角色照片生成生动配嘴型视频
全文摘要本文介绍了EchoMimic,一种新型的肖像视频生成技术,它能够通过音频、面部关键点或二者的组合来驱动生成逼真的动态肖像。EchoMimic通过创新的训练策略,解决了传统方法在音频驱动不稳定或关键点驱动导致不自然的问题,并通过公共数据集和自收集数据集的比较,证明了其在定量和定性评估中的优越性能。 关键段落 参考文献格式 项目地址: https://badtobest.g…
