应用 编辑推荐
TwelveLabs 发布 Pegasus 1.6:从第一人称视频提取机器人训练数据,AI 学会「看视频学操作」
想象一下这样的场景:你戴着智能眼镜录制了一段自己组装家具的视频,AI 看完后就学会了这个技能——…
文章目录
想象一下这样的场景:你戴着智能眼镜录制了一段自己组装家具的视频,AI 看完后就学会了这个技能——这不是科幻情节,而是 TwelveLabs 最新发布的 Pegasus 1.6 要实现的功能。
一分钟速览
- Pegasus 1.6:TwelveLabs 最新发布的视频理解模型
- 第一人称视频:专门优化从第一人称视角视频中提取训练数据
- 机器人训练:为机器人提供从视频中学习的 capability
- 企业应用:适用于包装、组装等具体工作流程
- AI 学习新范式:从「看」到「做」,AI 正在学会观察人类操作
深度分析
什么是 TwelveLabs?
TwelveLabs 是一家专注于视频理解的 AI 公司,其模型能够「看懂」视频内容。与只能处理文本或图像的模型不同,TwelveLabs 的模型可以理解视频中的动作、场景、物体关系等复杂信息。
Pegasus 1.6 的新能力
根据 VentureBeat 的报道,Pegasus 1.6 的最大亮点是优化了第一人称视频的理解能力。这意味着:
- 视角转换:AI 可以从「人的视角」理解操作过程
- 动作提取:识别视频中的具体动作和步骤
- 训练数据生成:将视频转化为机器人可学习的训练数据
为什么第一人称视角很重要?
传统的机器人训练数据通常来自第三人称视角(旁观者视角),但第一人称视角更接近机器人实际操作时的「视角」。通过第一人称视频训练,机器人可以更好地理解:
- 操作顺序:先做什么,后做什么
- 力度控制:用多大力气抓取、旋转
- 空间关系:物体之间的相对位置
应用场景
TwelveLabs 建议企业从一个具体的工作流程开始,比如:
- 包装产品:学习如何正确包装特定产品
- 组装零件:学习组装特定部件的步骤
- 质量检查:学习如何检查产品质量
数据支撑
- 1.6:Pegasus 模型的最新版本号
- 第一人称:专门优化的视频视角
- 3 个场景:包装、组装、质检等核心应用
产品链接
趋势洞察
AI 正在从「被动学习」转向「主动观察」。通过观看人类的操作视频,AI 可以更快地学习新技能,这将大大降低机器人训练的成本和时间。未来,我们可能会看到更多「看视频学操作」的 AI 应用。
结语
TwelveLabs 的 Pegasus 1.6 展示了视频理解技术的巨大潜力。当 AI 能够「看」懂人类的操作,它就能更好地「做」出正确的动作——这是机器人技术的重要一步。
本文地址:https://www.163264.com/16335