模型框架

  • Meta推出了一款名为Audiobox的音频生成模型,通过语音输入和自然语言文本提示来生成语音和音效

    Meta推出了一款名为Audiobox的音频生成模型,它可以通过语音输入和自然语言文本提示来生成语音和音效,用于创建自定义音频。据Meta称,Audiobox是第一个支持语音和文本双输入进行语音重新设计的模型。Meta将在接下来的几周内开放基于Audiobox的应用程序,并展示Audiobox功能的交互式演示。 详情: https://ai.meta.com/blog/audi…

    2023年12月2日
  • 在速度提升30倍的情况下生成与Stable Diffusion v1.5相当的图像质量的方法:DMD

    Adobe和麻省理工学院的研究人员共同发布论文,介绍一种分布匹配蒸馏(Distribution Matching Distillation,DMD)方法,可在速度提升30倍的情况下生成与Stable Diffusion v1.5相当的图像质量。 项目地址: https://tianweiy.github.io/dmd/

    2023年12月2日
  • 一个专门针对角色动画的新框架Animate Anyone,可从静态图像AI生成动态视频

    来自阿里的研究团队发布论文,利用扩散模型的能力,提出了一个专门针对角色动画的新框架Animate Anyone,可从静态图像AI生成动态视频,从而将任意角色动画化。 论文地址: https://arxiv.org/pdf/2311.17117.pdf

    2023年12月2日
  • 基于大学知识的多模态LLM测评基准MMMU发布

    《专家级人工智能的大规模多学科多模态理解和推理基准》是一个新的基准,旨在评估多模态模型在大规模多学科任务上的专家级理解能力。该基准包括来自大学考试、测验和教科书的11500个精心收集的多模态问题,涵盖了艺术与设计、商业、科学、健康与医学、人文与社会科学以及技术与工程等六个核心学科。与现有的基准不同,该基准侧重于具有领域特定知识的高级感知和推理,挑战模型执行类似于专家面临的任务。…

    2023年12月2日
  • Meta AI 发布实时人工智能语言翻译模型:Seamless,可以实时翻译100多种语言,延迟不到2秒钟

    在我们与SeamlessM4T的合作基础上,我们今天公开发布了一些改进,这些改进可以跨语言保留表达,并将延迟降低到约两秒。在我们日益互联的世界中,语言差异可能成为沟通的障碍,翻译系统可以使来自不同语言背景的人更无缝地分享知识和经验。然而,如今许多这些系统并不能保留人类沟通所具有的关键要素。具体而言,传达我们想要表达的不仅仅是我们选择的词语,还有我们说话的方式。语调、停顿和强调都…

    2023年12月2日
  • MagicDance:序列动作+角色参考生成动作视频

    摘要:在这项工作中,我们提出了MagicDance,一种基于扩散的模型,用于挑战性的人类舞蹈视频的二维人体动作和面部表情转移。具体而言,我们的目标是在保持身份不变的情况下,生成任何目标身份驱动的人类舞蹈视频,其驱动因素是新颖的姿势序列。为此,我们提出了一个两阶段的训练策略,用于解开人体动作和外观(例如面部表情、肤色和着装)之间的关系,包括对外观控制块的预训练和对相同数据集的人类…

    2023年11月23日
  • 还没试用 OpenAI 新发布的 TTS 文字转语音?

    有人询问有多少人还没有试用OpenAI新发布的TTS文字转语音,提供了一个在线版本的链接,可以直接在网页上输入文字,并提供了多种男声和女声选择,无需安装和部署,还免费试用。其中一个评论试用了中文绕口令,使用了喜欢的声音。 地址: https://huggingface.co/spaces/ysharma/OpenAI_TTS_New

    2023年11月7日
  • X.ai 官方公布的大模型产品Grok一些相关信息

    原文: https://x.ai/ Grok是一个AI,模仿了《银河系漫游指南》,旨在回答几乎任何问题,并且更难的是建议提出什么问题!Grok被设计为带有一点机智并且有叛逆倾向,所以如果你不喜欢幽默,请不要使用它!Grok的一个独特而基本的优势是,通过𝕏平台,它具有对世界的实时知识。它还会回答大多数其他AI系统拒绝的辛辣问题。Grok仍然是一个非常早期的测试产品,我们在2个月的…

    2023年11月5日
  • 比Whisper快6倍,体积小50%的语音识别模型:Distil-Whisper

    Distil-Whisper:比Whisper快6倍,体积小50%的语音识别模型。它在Whisper核心功能的基础上进行了优化和简化,速度提高了6倍。主要优点包括速度、尺寸、准确性、抗噪声、减少幻听和推测性解码。该模型使用了伪标签方法和知识蒸馏,参数减少了51%。实验结果显示,Distil-Whisper在处理速度和准确性方面都有显著提升。评论中的一些关键亮点包括该模型适用于移…

    2023年11月5日
  • 一种自动生成大规模数据集的工具:MimicGen

    MimicGen是一种自动生成大规模数据集的工具,只需少量人类示范即可。它可以自动生成超过50,000个示范,仅使用不到200个人类示范,涵盖了18个任务、多个模拟器和真实世界。MimicGen可以生成各种不同的数据集,包括新的复位分布、新的对象和新的机器人硬件。它适用于长期任务、高精度任务、移动操作任务和真实世界任务。此外,MimicGen还可以生成高质量的数据集和策略,即使…

    2023年10月28日