开源项目
-
一个本地且开源的“动漫女友”平台:anime
Anime gf 是一个本地开源工具,为用户提供了与虚拟角色互动的平台,类似于 CharacterAI。你可以自定义创建各种角色,让每个虚拟角色都有自己的独特个性和语言风格。 体验地址: https://www.anime.gf/ 项目地址: https://github.com/cyanff/anime.gf
-
ZeST:上传要改变材质的图片,再上传材质参考,即可修改图片中物体的材质
ZeST是一种零训练的方法,用于在单个图像中进行材质转移。这种方法可以轻松扩展到在单个图像中执行多个材质编辑,以及对纹理网格的渲染执行隐式光照感知编辑。通过结合材质示例图像和输入图像,ZeST可以在输入图像中传输材质属性,同时保留所有其他属性。该方法在真实图像上工作,不需要任何训练,实现了零训练的方法。ZeST展示了在真实和合成数据集上的定性和定量结果,输出具有传输材质的逼真图…
-
利用AI大模型,只需提供一个视频主题或关键词 ,就可以全自动生成视频文案、视频素材
功能特性 🎯完整的 MVC架构,代码 结构清晰,易于维护,支持 API 和 Web界面 支持视频文案 AI自动生成,也可以自定义文案 支持多种 高清视频 尺寸 竖屏 9:16,1080×1920横屏 16:9,1920×1080支持 批量视频生成,可以一次生成多个视频,然后选择一个最满意的 支持 视频片段时长设置,方便调节素材切换频率 支持 中文 和 英文 …
-
字节跳动与旷视科技联合推出HiDiffusion,革新图像生成技术
**字节跳动与旷视科技联合推出HiDiffusion,革新图像生成技术** 字节跳动与旷视科技的最新合作成果——HiDiffusion,为图像生成技术带来了革命性的突破。这项技术通过简化操作流程,仅需一行代码即可显著提升生成图像的清晰度,并大幅加快生成速度。 ### **HiDiffusion技术亮点:** – **无需训练:** 直接应用于现有的扩散模型,无需额外…
-
苹果也开始学 Meta,完全开源了 OpenELM 一系列模型,包括270M、450M、1.1B和3B四个规模的模型
苹果公司在人工智能领域迈出了重要的一步,通过开源OpenELM系列模型,展示了其对开放科学和共享资源的承诺。以下是对苹果这一举措的优化文案: **苹果公司推动AI开放创新,开源OpenELM系列模型** 苹果公司最近宣布了一个重大的人工智能开源项目——OpenELM,这一系列模型包括了从270M到3B不等规模的多个模型。这一举措不仅为AI研究和开发社区带来了前所未有的资源,也体…
-
保持角色一致生成动画:ID-Animator
这项研究介绍了一种零样本人类视频生成方法,名为ID-Animator,可以根据单个面部参考图像进行个性化视频生成,无需进一步训练。该方法结合了现有的扩散式视频生成技术,并引入了面部适配器来编码与身份相关的嵌入。通过构建面向身份的数据集和随机面部参考训练方法,提高了模型的准确性和泛化能力。实验证明ID-Animator在个性化人类视频生成方面优于以往模型,同时与各种社区模型兼容,…
-
字节跳动发布图像模型蒸馏算法Hyper-SD
字节跳动的Lightning团队发布的新图像模型蒸馏算法Hyper-SD,以下是对文章内容的归纳总结: 1. **技术进展**:Hyper-SD是一项在图像处理和机器学习领域的重要技术进展。 2. **核心特点**:– **分段轨迹一致性蒸馏**:通过在预设时间段内进行蒸馏,保持原始ODE(常微分方程)轨迹的完整性。– **人类反馈学习机制**:引入人类…
-
中文聊天模型Llama3-8B-Chinese-Chat发布
Llama3-8B-Chinese-Chat 是一个专为中文优化的聊天模型,基于 Meta-Llama-3-8B-Instruct 模型并通过 ORPO 进行微调。该模型显著减少了中文问题英文回答以及回答中中英文混合的现象,同时减少了回答中表情符号的使用,使得回答更加正式。 User: 我的蓝牙耳机坏了,我该去看牙科还是耳鼻喉科? Assistant: 很抱歉听到你的蓝牙耳机出…
-
Stable Diffusion 3 的 API 版本正式发布
Stable AI宣布了Stable Diffusion 3和Stable Diffusion 3 Turbo在Stability AI开发者平台API上的可用性。 1. **模型性能**:Stable Diffusion 3在排版和提示遵循性方面,根据人类偏好评估,与DALL-E 3和Midjourney v6等最先进的文本到图像生成系统相当或更优。 2. **架构更新**:…
-
AI换装MagicClothing:实现可控的换装效果
MagicClothing这个AI换装的演示效果确实很强大。它基于潜在扩散模型(LDM)开发的新型网络架构,专门处理服装驱动的图像合成任务。通过服装特征提取器和自注意力融合技术,能够保留服装细节并忠实于文本提示,确保生成的角色穿着定制的服装。同时,采用联合无分类器指导技术平衡服装特征和文本提示的影响,提高生成图像的多样性和可控性。此外,还提出了一种新型评估指标MP-LPIPS用…
