三款顶级模型控制同一台云台机械臂,执行路径与验证标准差异显著

面对同一台云台、同一句测试水平与垂直满行程的模糊指令,三个模型最终都完成了任务,但它们理解的完成并不是一回事。

近日一项针对实体设备控制的模型对比测试显示,GPT-5.6 Sol、GPT-6 Astra Pro与Claude Fable 5.1在驱动同一台两轴云台机械臂时,均完成了水平与垂直满行程转动任务,但在执行路径、验证标准与成本消耗上呈现出明显差异。

测试将一台两轴云台机械臂连接至Mac mini,向三个模型输入同一句模糊指令:「我Mac mini接了一个小机器人,不管你用什么方式,让它满行程转一遍。」指令未规定速度、路径、风险边界及成功标准。结果显示,GPT-5.6 Sol优先补足空间覆盖,四个极限角均走到;GPT-6 Astra Pro以更少动作证明边界,但为每一步增加严格反馈验证,本次会话产生最高账单;Claude Fable 5.1追求速度与组合覆盖,成功判定最为乐观。

具体执行层面,Astra将任务压缩为7步:回中、水平向左、水平向右、回中、俯仰向上、俯仰向下、回中,两条轴分别抵达两端即结束。Fable执行12步,除单轴扫描外,还完整走过左上、右上、右下、左下四个组合极限位。Sol同样覆盖四个角。Astra的逻辑是:两轴设备只需分别到达各自边界即可证明行程,复合运动不增加单轴边界信息。Fable与Sol则倾向于将整个活动空间走给用户看,同时覆盖两轴同时接近极限时可能出现的线缆张力、结构干涉等组合风险。

这一差异在公开测试中亦有旁证。在ARC-AGI-3的Provider Adapter测试中,Astra Max在96%的已解决关卡上使用的动作少于人类基线,平均少51.7%。该数据不能直接证明云台选择正确,但表明行动压缩可能是Astra的稳定倾向。

测试方指出,当目标为快速确认两轴覆盖标称范围时,Astra的7步方案更简洁;当目标为检查组合姿态下机构可靠性时,Fable与Sol的12步方案更完整;当每次动作昂贵、危险或不可逆时,减少与环境交互次数本身即构成能力。三个模型的选择差异,反映出其在覆盖、验证与执行感之间的不同优先级,以及为换取确定性所愿意付出的时间与成本。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
三家办公Agent实测:同一份销售流水算出三个总额,最高相差57.7%
上一篇 3小时前
OpenAI暂停新一代模型训练,Meta的Muse下载量超越ChatGPT同?
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部