开源项目
-
一个端到端的社会视觉-语言-动作建模框架
根据您的请求,以下是关于端到端的社会视觉-语言-动作建模框架SOLAMI的详细介绍: SOLAMI的推出标志着视觉-语言-动作模型在社会交互领域的新进展,为3D自主角色的社交智能提供了新的解决方案。 项目地址: https://solami-ai.github.io
-
MMAudio:输入视频或文本可自动给视频配音效
MMAudio是一项由伊利诺伊大学厄巴纳-香槟分校、Sony AI及Sony集团联合推出的新技术,它能够实现视频到音频的高质量合成。这项技术的核心创新在于利用视频和文本输入生成同步音频,从而拓展了音频生成的应用场景。MMAudio的设计使其能够在各种视听和音频文本数据集上进行训练,这种多模态联合训练的方式,不仅提高了合成音频的质量,还确保了生成的音频与视频帧之间的同步。 MMA…
-
Exo Labs来袭!让Mac M4电脑也能本地运行强大开源AI模型
家人们,好消息!Exo Labs带着他们的黑科技来了,现在你的Mac M4电脑也能变身强大的本地AI模型运行器啦!🌌 🍎【Apple M4芯片的力量】 Exo Labs利用Apple M4芯片,在本地计算集群上成功运行开源AI模型,这意味着我们可以告别昂贵的NVIDIA GPU,用我们手头的设备就能搞定! 💼【成本与隐私】 本地运行AI模型不仅降低了成本,还提高了隐私安全,再也…
-
Fashion-VDM:一键试衣,视频见证你的时尚变身!👗📹
亲爱的时尚达人们,想要快速预览穿上心仪衣物的效果吗?Fashion-VDM来帮你实现这个愿望!只需一张图+视频,就能展示穿上输入衣物后的神奇效果,让你的穿搭选择更简单、更直观! 👚【时尚新体验】 Fashion-VDM技术,让你在选择衣物时不再犹豫。只需上传一张你的照片和想要试穿的衣物图片,系统就能生成一段视频,展示你穿上这件衣物的样子,让你在购买前就能预见穿搭效果。 📱【操作…
-
可一键生成“多机位”视频大片-ReCapture
利用多视角扩散模型和遮罩视频微调技术,实现粗略视频到清晰、连贯、动感视频的转变。适用于各种视频和视角转换,让普通用户也能制作专业级“多机位”视频。 项目地址: https://generative-video-camera-controls.github.io
-
FLUX.1-dev LoRA秒出服装效果图
FLUX.1-dev LoRA 是由 TryOn Labs 开发的一款服装生成器,它利用先进的人工智能技术,能够根据用户输入的服装描述(包括颜色、图案、材质、风格等细节)快速生成相应的服装设计图。这款工具的强大之处在于其灵活的输入格式和丰富的时尚知识库,使得用户可以充分发挥创意,描述出心目中的理想服装。 例如,如果用户输入“一件森林绿色缎面连身裤,宽腿,金色植物印花,系着米白色…
-
VQAScore评测方案,搞定文生图模型评测
VQAScore是一种新的文本到视觉生成评估指标,通过CLIP-FlanT5模型计算图像与文本提示的匹配度,优于传统CLIPScore。它使用VQA模型评估生成图像,提供简单有效的评估方法,并推出GenAI-Bench基准测试,挑战现有生成模型。 项目地址: https://linzhiqiu.github.io/papers/vqascore
-
InstantX图像生成黑科技!可精确控制 FLUX 生成图片时每个区域的内容
这个GitHub仓库名为“Regional-Prompting-FLUX”,由instantX-research组织创建。它提供了一个名为“Training-free Regional Prompting for Diffusion Transformers”的项目,这个项目的核心是一个无需训练的区域提示方法,用于扩散变换(Diffusion Transformers)模型。这…
-
Standard Intelligence Lab推出的Hertz-Dev开源音频模型,实现了超低延迟的实时对话AI
Hertz-Dev 是一个开源音频模型,它具有 8.5 亿参数。该模型在延迟方面表现出色,理论延迟仅有 80 毫秒,实际延迟为 120 毫秒。这种低延迟的特性极大地提升了实时对话的体验,使得人与机器之间的交流更加流畅和自然。例如,在客户支持场景中,用户可以更快地得到回应,提高服务效率;在智能家居环境中,设备的响应速度更快,增强了用户的使用感受。 地址: https://si.i…
