开源项目
-
Stability AI 开源 Stable Fast 3D(SF3D)只需 0.5s 就能将图片转为 3D?
全文总结Stability AI 推出了创新的 3D 资产生成技术 Stable Fast 3D,它能在极短时间内将单张输入图像转化为详细的 3D 资产,为 3D 重建领域树立了速度和质量的新标杆。重要亮点 项目页:https://stable-fast-3d.github.io代码地址:https://github.com/Stability-AI/stable-fast-3…
-
开源的OpenSearchGPT来了
全文总结此段内容主要介绍了 OpenSearch GPT,这是一款为用户个性化定制的开源 AI 搜索引擎。重要亮点 面临问题:有人询问其如何处理长期和短期的记忆管理,以及如何定期更新,还有网站似乎出现故障的情况。 个性化学习:随着用户提问增多,它能了解用户,用户还能教导它自己是谁,并且控制关于自身的已知信息。 超快速度:提供了链接 opensearch-ai.pages.dev…
-
LivePortrait 的视频驱动肖像动画框架:合成逼真的肖像动画
主要介绍了名为 LivePortrait 的视频驱动肖像动画框架。该框架旨在从单张源图像合成逼真视频,其运动来自驱动视频、音频、文本或生成。作者探索并扩展了基于隐式关键点的框架潜力,通过多种手段提升了生成质量和泛化能力,包括扩大训练数据、采用混合图像–视频训练策略、升级网络架构以及设计更好的运动变换和优化目标等。文中还详细阐述了框架的各个模块和训练流程,并展示了实验…
-
FoleyCrafter:让无声视频瞬间拥有逼真配音
全文摘要本文介绍了FoleyCrafter,一个基于文本的视频到音频生成框架,它可以生成与输入视频在语义上相关且时间上同步的高质量音频。FoleyCrafter通过语义适配器和时间控制器,利用预训练的文本到音频模型,实现音频的高质量生成和精确的音视频同步,同时支持文本提示以实现可控和多样化的视频到音频生成。 关键段落 项目地址: https://foleycrafter.git…
-
EchoMimic:音频+角色照片生成生动配嘴型视频
全文摘要本文介绍了EchoMimic,一种新型的肖像视频生成技术,它能够通过音频、面部关键点或二者的组合来驱动生成逼真的动态肖像。EchoMimic通过创新的训练策略,解决了传统方法在音频驱动不稳定或关键点驱动导致不自然的问题,并通过公共数据集和自收集数据集的比较,证明了其在定量和定性评估中的优越性能。 关键段落 参考文献格式 项目地址: https://badtobest.g…
-
可将动态涂鸦融入视频中的编辑技术VideoDoodles
可将动态涂鸦融入视频中的编辑技术VideoDoodles https://em-yu.github.io/research/videodoodles/ 这项技术能够在视频中的物体上添加动态涂鸦,并且涂鸦能够随着物体的移动而移动,并以适当的透视和遮挡进行表达。使用这项技术可以轻松地创造出独特而令人印象深刻的视频,而无需专业技能或大量时间。 来源:https://mp.weixin…
-
阿里通义音频生成大模型 FunAudioLLM
该项目包括两个核心模型: SenseVoice和CosyVoice,分别致力于语音生成和语音识别。FunAudioLLM支持多种人机交互应用场景,如多语言翻译、情绪语音对话、互动播客和有声读物等。 地址: https://fun-audio-llm.github.io 在线体验地址: https://www.modelscope.cn/studios/iic/CosyVoice…
-
快手文生图大模型“可图”宣布开源,现已上线微信小程序和网页版
快手“可图”大模型于今年 5 月对外开放,目前已经上线网页版和微信小程序,支持文生图和图生图两类功能,可用于 AI 创作图像以及 AI 形象定制。 在 AI 创作模块,用户只需输入描述文字并选择期望的画作风格,即可快速获取专属的 AI 画作。其中,画作风格可以选择默认、皮克斯、卡通盲盒、新海诚、动漫 3D、怀旧动漫、电子游戏、水彩插画、莫奈油画、高清写实等。 此外,用户还可以上…
-
一款使用AI来解析PDF的开源工具:gptpdf
1、使用 PyMuPDF 库,对 PDF 进行解析出所有非文本区域,并做好标记 2、使用视觉大语言模型(如 GPT-4o)将 PDF 解析为 markdown。 我们的方法非常简单(只有293行代码),但几乎可以完美地解析排版、数学公式、表格、图片、图表等。 每页平均价格:0.013 美元 项目地址: https://github.com/CosmosShadow/gptpdf
-
微软在官网开源了基于图的RAG(检索增强生成)——GraphRAG
微软在官网开源了基于图的RAG(检索增强生成)——GraphRAG,通过构建知识图谱来增强大模型的搜索、问答、摘要、推理等能力。Graph RAG的核心是通过两阶段构建基于图谱的文本索引,帮助大模型更好地捕捉文本中的复杂联系和交互。该方法在处理大规模数据集时表现出色,提升了信息检索和生成的协同工作,适用于处理复杂问题和解读PDF、Word等文档。 项目地址: https://g…
