Epoch AI于9月23日发布家具组装基准测试(Furniture Assembly Benchmark,FAB)结果,多模态AI在识别宜家家具组装错误方面的能力较此前有明显提升。OpenAI最新的GPT-6 Astra在该测试中取得80%的准确率,位居首位,较2025年底的领先水平提升近三倍。
FAB基准测试专门用于评估AI理解现实世界装配过程的能力。测试方法为选取三款宜家家具进行故意错误组装,拍摄60张不同阶段的组装过程照片,要求AI将照片与官方安装说明书进行比对,找出错误位置并说明具体问题。测试过程中,AI可获取组装照片、官方PDF说明书、图片放大工具以及Python解释器,需判断是否存在错误,并指出具体出错步骤和问题描述。评分采用多阶段验证,模型能够正确定位错误步骤并大致说明问题即可获得相应分数。
Epoch AI指出,该测试并非考察AI对说明书的记忆能力,而是模拟真实使用场景:用户拍摄组装中的家具,AI判断零件是否装反、安装顺序是否错误或是否遗漏关键部件。研究团队认为,这类能力与汽车维修、家电检修等需要结合图像和技术说明进行判断的任务具有较高相关性。
在具体排名中,Anthropic Claude Fable 5.1和Claude Opus 5分别以70%和61%的准确率位列其后。作为对比,2025年11月时的领先模型Claude Opus 4.5准确率仅为28%,前沿模型在约10个月内实现了显著提升。推理效率方面,GPT-6 Astra完成单张照片分析的中位耗时约为3分钟,是研究中速度最快的模型,比此前领先模型快约2至10倍。研究团队同时指出,这一速度距离真正意义上的实时识别仍有差距。
研究还分析了不同模型的错误模式。谷歌Gemini和阿里Qwen系列模型倾向于先假设存在错误再寻找错误,而早期Anthropic和OpenAI模型则经常完全无法识别错误。研究者发现,不同家具对模型难度的影响与宜家复杂度指数无明显关联,错误隐蔽性、拍摄视角及错误后继续组装的程度影响更大。
在中国模型中,目前表现最好的开源权重模型Kimi K3相比国际前沿模型约落后7个月,这一差距比其在综合能力评估中的约4.4个月差距更大。研究认为,视觉推理能力仍是当前部分中国模型相对薄弱的方向,而DeepSeek V4 Pro、GLM 5.3等热门模型暂未提供图像支持。
随着多模态模型在视觉推理与多步骤指令匹配方面的能力持续提升,AI有望在家具组装、设备安装、维修指导等场景中提供更具针对性的实时辅助。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。