TwelveLabs发布Pegasus 1.6模型,以第一人称视频理解切入物理AI领?

大多数关于体力工作的知识,例如握力的变化,或打滑后的恢复动作,从未以机器可以学习的形式被记录下来。

视频智能公司TwelveLabs今日宣布发布Pegasus 1.6模型,新增对复杂真实环境的理解与导航能力。该模型标志着TwelveLabs正式进入物理AI领域——即通过机器人、无人机、自动驾驶车辆和工业设备等机器来感知、推理并作用于物理世界的人工智能分支。

随着物理世界加速数字化,物理AI团队正在采集大量复杂视频数据,但将原始素材转化为可用于模型训练的结构化智能仍是一项关键挑战。TwelveLabs试图弥合这一差距,从真实视角视频中自动生成丰富洞察,使机器能够以前所未有的方式观察、理解并安全地与周围环境交互。

TwelveLabs首席执行官兼联合创始人Jae Lee表示:“我们的使命始终是帮助机器通过视频理解世界如何运转。物理AI是这一使命的下一阶段体现。大多数关于体力工作的知识,例如握力的变化,或打滑后的恢复动作,从未以机器可以学习的形式被记录下来。通过最新的模型发布,我们现在可以将这些视频素材转化为结构化的、可审查的知识,使机器人技术和物理AI团队能够基于真实的人类经验进行训练,而不必从零开始。”

Pegasus 1.6是TwelveLabs首个专为理解第一人称视角视频而构建的模型。第一人称视频从执行工作的人的角度拍摄,无论是烹饪、在工厂流水线上组装零件,还是远程操作机器人。该模型目前支持五种核心工作流。

动作分割与标注功能可从原始视频中自动生成精确的、带时间戳的动作标签,涵盖任务、步骤、物体及手物交互,并完美映射到用户特定领域的分类体系,从而通过标准化数据集加速模型训练。密集描述标注功能通过为空间关系、场景上下文和手物交互生成丰富的描述性语言,为机器人提供自然语言理解能力,以训练高级的语言条件机器人策略。质量评分功能可在将视频片段发送给人工审核之前,自动评估并评分动作清晰度、构图和稳定性,从而过滤低质量视频以节省时间。搜索与策展功能则可在整个视频库中轻松呈现罕见事件、长尾场景和重复片段,帮助发现关键边缘案例。

TwelveLabs此次发布的背景是,物理AI正成为人工智能行业的重要发展方向。随着机器人、自动驾驶和工业自动化等领域对真实世界数据的需求激增,如何高效处理和利用第一人称视角视频成为关键瓶颈。传统方法依赖人工标注或合成数据,成本高且难以覆盖真实场景的复杂性。TwelveLabs的Pegasus 1.6试图通过视频原生模型自动完成从原始素材到结构化知识的转化,降低物理AI团队的训练门槛。

从行业影响来看,该模型的推出意味着视频理解技术正从通用的内容识别向垂直场景的深度应用演进。物理AI团队可以借助此类工具将人类操作经验转化为可复用的训练数据,从而缩短模型开发周期。不过,该领域也面临数据隐私、标注标准统一以及跨场景泛化能力等挑战。TwelveLabs能否在竞争日益激烈的物理AI基础设施赛道中建立差异化优势,仍有待市场检验。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
Aembit将访问控制扩展至个人AI代理,以混合身份机制防范企业数据泄露
上一篇 2小时前
Userlytics推出AI研究设计器与定性报告功能,打通AI辅助UX研究全流程
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部