开源项目
-
可识别图像中文字并转换为可编辑文本的工具:2txt
2txt是一个基于AI的图像转文字工具,使用Claude Haiku和Vercel AI SDK创建。它可以快速准确地识别图片中的文字,并转换成可编辑的文本格式。通过这个工具,用户可以方便地从图像中提取文字,提高工作效率。 项目地址: https://github.com/ai-ng/2txt
-
可自动为动画中的线条图着色技术:通过仅需对一帧进行手动彩色化,算法便能自动将颜色传播到后续的所有帧
本文介绍了一种新的学习方法,用于自动给手绘动画上色。传统的上色方法需要手动对每个线条所围成的区域进行上色,非常耗时且繁琐。而本文提出的方法则通过学习线条之间的包含关系,来实现更加精细和准确的上色效果。 具体而言,本文的方法采用了两个阶段的估计模块。首先是粗糙的颜色扭曲模块,用于将参考帧中的颜色通过对齐线条特征传递到目标帧。然后是包含匹配模块,用于理解线条之间的包含关系,并根据这…
-
用于3D重建和生成的大型高斯重建模型GRM:少量图片能在短时间内构建出物体的3D模型或整个场景
该内容介绍了一种名为GRM的大规模重建器,能够从稀疏视图图像中恢复3D模型。GRM是一种基于Transformer的前馈模型,能够有效地将输入像素转化为像素对齐的高斯函数,从而创建一组表示场景的密集分布的3D高斯函数。该方法在重建质量和效率方面表现出优势,并展示了在生成任务中的潜力。该项目得到了Google、三星和瑞士博士后流动奖学金的支持。 项目地址: https://jus…
-
一个高质量的多语言文本到语音(TTS)库:MeloTTS(完美支持中文)
1、MeloTTS支持多种语言的文本转语音,包括英语(包括美国、英国、印度、澳大利亚等口音)、西班牙语、法语、中文、日语和韩语。这使得它适用于全球各种语言环境的应用场景。 2、特别是对于中文,MeloTTS支持中英文混合的发音,这在多语言交流中非常实用,可以处理包含英文单词的中文文本。 3、MeloTTS经过优化设计,能够在没有GPU加速的情况下,在CPU上实现实时语音合成,提…
-
一个开源的「贴纸生成器」StickerBaker
开源贴纸制作工具StickerBaker,傻瓜式操作即可,输入关键词就能生成卡通贴纸,支持批量制作多样化贴纸。 StickerBaker是一个使用fofr/sticker-maker强大功能的应用,为用户提供高效、便捷的贴纸制作体验。它不仅支持批量制作贴纸,还能一次性创建多个独特的贴纸,为聊天和分享增添更多乐趣。 无论你想制作具有地域特色的贴纸,如乌克兰国旗色的豹子,还是创造出…
-
出门问问发布“序列猴子开源数据集1.0”
出门问问昨日在其微信公众号宣布,将向公众开放其超大规模语言模型“序列猴子”的部分训练数据集,命名为“序列猴子开源数据集1.0”。本次开源的“序列猴子数据集1.0”包含了中文通用文本语料、古诗今译语料以及文本生成语料,这些数据资源经过精心挑选和整理,确保了数据质量和数据格式。同时,出门问问采用宽松的许可协议,为广大开发者和研究人员提供了便捷的使用条件。 序列猴子是出门问问提供的超…
-
一个可控的虚拟服装试穿开源工具-OOTDiffusion,和模特非常贴合
可以根据不同性别和体型自动调整,和模特非常贴合。也可以根据自己的需求和偏好调整试穿效果 OOTDiffusion支持半身模型和全身模型两种模式。 主要功能: 1、基于潜在扩散的装备融合:利用潜在扩散模型(latent diffusion models)的先进技术,OOTDiffusion实现了高质量的服装图像生成和融合,确保试穿效果自然且逼真。 2、半身和全身虚拟试穿:OOTD…
-
MIT研究团队开发的项目PixelPlayer,能自动从视频中识别和分离出不同的声音源
PixelPlayer:MIT研究团队开发的项目,能自动从视频中识别和分离出不同的声音源,并与画面位置匹配。 例如,它可以识别出视频中哪个人物正在说话或哪个乐器正在被演奏。 而且还能够分别提取和分离这些声音源的声音。 PixelPlayer能自我学习分析,无需人工标注数据。 这种能力为音视频编辑、多媒体内容制作、增强现实应用等领域提供了强大的工具,使得例如独立调整视频中不同声音…
-
字节研究院发布视频控制方式Boximator,可以精确控制物品结束运动的位置
这种控制方式比Runway的运动笔刷更进一步,你可以精确控制物品结束运动的位置。 演示中使用的视频模型也是字节研发的PixelDance视频生成模型。 项目简介: 我们提出了Boximator,这是一种用于精细运动控制的新方法。Boximator采用了两种约束机制:硬性约束(hard box)和软性约束(soft box)。 用户可以利用硬性约束选取视频中某一帧(称为条件帧)的…
-
苹果开源名为多模态大语言模型引导的编辑(MGIE),可通过指令修改图片
苹果发布了一项名为多模态大语言模型引导的编辑(MGIE)的新技术,该技术可以帮助用户通过自然语言指令来修改图片,使得编辑图片变得更加简单和自然。 MGIE利用多模态大型语言模型(MLLMs)生成图像编辑指令,并通过端到端训练来捕捉视觉想象力并执行图像处理操作。该方法在ICLR’24上获得了Spotlight成果。 多模态大语言模型引导的编辑技术(MGIE)不仅可以帮…
