开源项目
-
免费的开源ChatGPT克隆版:LibreChat
LibreChat,它不仅支持多种AI模型,还提供了灵活的自定义选项,解决了多AI模型整合和切换的问题。 LibreChat是一个开源的聊天平台,它致力于提供一个自由和安全的通信环境。这个基于Web的解决方案强调用户隐私和数据主权,使用户无需担心信息被第三方截取或滥用。LibreChat使用现代Web技术构建,前端主要使用React库,后端逻辑则使用Go语言。它采用Signal…
-
RTranslator是一款开源、免费和离线的实时翻译应用
开源、免费和离线的实时翻译应用,支持多人对话翻译和文本翻译模式。应用主要功能包括对话模式和对讲模式,保障用户隐私,所有翻译和语音识别模型均在手机上运行。 地址: https://github.com/niedev/RTranslator
-
推荐一个好的视频转绘项目
这篇内容介绍了Diffutoon是一种卡通渲染方法,适用于渲染高分辨率视频和快速运动。提供了几个例子,包括使用配置字典修改参数的卡通渲染、支持视频编辑信号的卡通渲染以及原生Python代码中使用的卡通渲染。这些例子可以在GitHub上找到。 项目地址: https://github.com/modelscope/DiffSynth-Studio/tree/main/exampl…
-
图片风格迁移项目RB-Modulation,可以将原图的风格迁移到生成的图象上
一种名为RB-Modulation的新方法,用于训练免费的扩散模型个性化。该方法可以实现风格化和内容风格组合,同时保持样本多样性和提示对齐。通过引入交叉注意力特征聚合方案,RB-Modulation可以将内容和风格从参考图像中解耦。该方法在风格化和内容风格组合方面表现优异,具有理论基础和实证证据支持。RB-Modulation的提出为未来研究开辟了新的方向。 项目地址: htt…
-
Controlnet 作者新项目 Omost ,帮你更好的理解现有图像模型的提示词
controlnet作者张吕敏公开了新项目, Omost:一个将 LLM 的编码能力转换为图像生成(或更准确地说,图像合成)能力的项目。 Omost是一个将LLM的编码能力转换为图像生成(或更准确地说是图像合成)能力的项目。 Omost(发音:almost)这个名字有两个意思:1)每次使用Omost后,你的图像几乎已经完成;2)O代表“omni”(多模态),most表示我们希望…
-
ToonCrafter:可自动生成卡通动画的中间帧 ,并根据参考图像对动画草图自动上色
ToonCrafter,它可以通过预训练的图像到视频扩散先验来插值两幅卡通图像。项目支持生成512×320分辨率的视频,推荐使用Anaconda安装环境并通过命令行或本地Gradio演示进行推理。需要注意的是,由于生成视频先验的多样性,成功率并不保证。 ToonCrafter 通过生成性插值方法,在卡通动画帧之间生成自然、连贯的中间帧。能够处理复杂的非线性运动和遮挡问…
-
视频虚拟试穿的框架:ViViD,解决视频虚拟试穿的问题
可以合成自然、逼真的视频,保留目标服装的身份,同时保持源视频其余部分不变 项目地址: https://github.com/novitalabs/AnimateAnyone 论文地址: https://arxiv.org/pdf/2405.11794 这篇论文介绍了一种名为ViViD的视频虚拟试穿技术,通过强大的扩散模型来实现视频虚拟试穿。他们提出了一种新的架构,利用扩散模型生…
-
一款基于LLM的AI本地文件管理器:llama-fs
LlamaFS是一个自组织的文件管理器,可以根据文件内容和约定自动重命名和整理文件。它支持各种文件类型,甚至包括图像和音频。它有批处理模式和交互式守护程序模式。用户可以发送目录到LlamaFS,它会返回建议的文件结构并整理文件。它还有“隐身模式”切换,可以通过Ollama而不是Groq路由每个请求。使用Python后端构建,集成了Ollama和Groq,前端使用Electron…
-
ChatTTS:一个专为对话场景设计的语音生成模型
ChatTTS是一个专为对话场景设计的语音生成模型,支持中文和英文,通过大量数据训练,提供高质量和自然度的语音合成。项目团队计划开源一个基础模型,注重模型的可控性和安全性。用户在使用ChatTTS时需注意免责声明,开源模型将为社区带来新的学习和创新机会。 项目地址: https://github.com/2noise/ChatTTS 视频演示地址: https://www.bi…
-
Open-Sora 1.1发布,视频质量提升,生成时长延长至21秒
Open-Sora1.1发布带来了显著提升,尤其在视频生成质量和时长方面。新版本模型能生成最长约21秒视频,使用高质量视觉数据和字幕训练,提升对世界运作的理解。CausalVideoVAE架构优化提高性能和推理效率。 项目地址: https://github.com/PKU-YuanGroup/Open-Sora-Plan
