开源项目
-
完美支持中英日语言的开源TTS模型来了:Fish Speech
Fish Speech是一个开源的TTS模型,支持中英日语言,语音处理接近人类水平。模型使用约十五万小时的三语数据训练,对中文支持非常完美。 项目地址: https://github.com/fishaudio/fish-speech 体验地址: https://fish.audio/zh-CN/text-to-speech 这是邓紫棋的声音:
-
腾讯发布了一个根据图片生成跳舞视频的项目MimicMotion
该研究提出了一种名为MimicMotion的可控视频生成框架,可以生成任意长度的高质量视频,并具有自信的姿势引导。该方法结合了图像到视频扩散模型和新颖的自信姿势引导,通过这种方式,视频的生成质量和流畅度得到了显著提高。研究表明,MimicMotion在多个方面都比以往方法有显著改进,是视频生成领域的重要进展。 项目地址: https://tencent.github.io/Mi…
-
Dify-FeiShu-bot:可以非常方便的支持利用Dify接入飞书搭建飞书机器人
Dify-FeiShu-bot是一个使用python FastAPI框架编写的后端,可以非常方便的支持利用Dify接入飞书搭建飞书机器人,并且充分利用飞书消息卡片,可以搭建出漂亮的UI界面。 项目特点: 项目地址: https://github.com/Mr-KID-github/Dify-FeiShu-bot
-
Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放



Gemma 2是一款高性能的AI模型,具有出色的推断效率和成本效益。通过优化的架构设计,Gemma 2在27B参数规模下表现出色,提供了与两倍大小的模型竞争力相当的性能。而9B参数规模的Gemma 2模型在其类别中也表现卓越,超越了其他同规模的开源模型。 Gemma 2的推断效率和成本节约优势显著,27B模型设计能够在单个Google Cloud TPU主机、NVIDIA A1…
-
图片高清修复模型AuraSR开源,可放大4倍并补充细节
AuraSR 是基于 GAN 的 Super-Resolution 模型,通过图像条件化增强技术,提升生成图像的质量。该模型采用 GigaGAN 论文的变体实现,并使用 Torch 框架。AuraSR 的优势在于能够有效提高图像的分辨率和质量,适用于图像处理领域。 这里可以在线体验: https://fal.ai/models/fal-ai/aura-sr/playground…
-
免费的开源ChatGPT克隆版:LibreChat
LibreChat,它不仅支持多种AI模型,还提供了灵活的自定义选项,解决了多AI模型整合和切换的问题。 LibreChat是一个开源的聊天平台,它致力于提供一个自由和安全的通信环境。这个基于Web的解决方案强调用户隐私和数据主权,使用户无需担心信息被第三方截取或滥用。LibreChat使用现代Web技术构建,前端主要使用React库,后端逻辑则使用Go语言。它采用Signal…
-
RTranslator是一款开源、免费和离线的实时翻译应用
开源、免费和离线的实时翻译应用,支持多人对话翻译和文本翻译模式。应用主要功能包括对话模式和对讲模式,保障用户隐私,所有翻译和语音识别模型均在手机上运行。 地址: https://github.com/niedev/RTranslator
-
推荐一个好的视频转绘项目
这篇内容介绍了Diffutoon是一种卡通渲染方法,适用于渲染高分辨率视频和快速运动。提供了几个例子,包括使用配置字典修改参数的卡通渲染、支持视频编辑信号的卡通渲染以及原生Python代码中使用的卡通渲染。这些例子可以在GitHub上找到。 项目地址: https://github.com/modelscope/DiffSynth-Studio/tree/main/exampl…
-
图片风格迁移项目RB-Modulation,可以将原图的风格迁移到生成的图象上
一种名为RB-Modulation的新方法,用于训练免费的扩散模型个性化。该方法可以实现风格化和内容风格组合,同时保持样本多样性和提示对齐。通过引入交叉注意力特征聚合方案,RB-Modulation可以将内容和风格从参考图像中解耦。该方法在风格化和内容风格组合方面表现优异,具有理论基础和实证证据支持。RB-Modulation的提出为未来研究开辟了新的方向。 项目地址: htt…
-
Controlnet 作者新项目 Omost ,帮你更好的理解现有图像模型的提示词
controlnet作者张吕敏公开了新项目, Omost:一个将 LLM 的编码能力转换为图像生成(或更准确地说,图像合成)能力的项目。 Omost是一个将LLM的编码能力转换为图像生成(或更准确地说是图像合成)能力的项目。 Omost(发音:almost)这个名字有两个意思:1)每次使用Omost后,你的图像几乎已经完成;2)O代表“omni”(多模态),most表示我们希望…
