据路透社9月18日报道,清华大学机器人学助理教授、千寻智能联合创始人兼首席科学家高阳预计,最快从明年开始,人形机器人将能够听懂口头指令并完成大多数通用任务,但真正进入家庭、承担实用工作仍需时日。
高阳指出,中国在人形机器人硬件能力方面近年提升迅速,机器人在冲刺、跳舞乃至按指令完成后空翻等动作上已不存在障碍。行业竞争重心因此转向软件层面,核心目标是提升机器人的智能水平,使其能够承担更多具备实际经济价值的任务,这一领域通常被称为具身智能。
高阳将当前机器人技术栈中最薄弱的环节归结为“大脑”。他预计,到2027年年中,行业将达到“GPT-3.0”级的里程碑。届时用户可以直接用自然语言与机器人交流,机器人将执行一系列合理的物理动作并尝试完成任务。报道指出,整个机器人行业都在等待自己的“ChatGPT时刻”——即足以将前沿技术转化为面向广大客户的实用产品的软件突破。OpenAI在2022年推出ChatGPT后,生成式AI迅速进入大众市场并验证了商业化潜力。
为训练机器人,千寻智能在全国安排了约1000名合同人员收集真实世界数据。目前,该公司机器人在结构化客厅环境中完成简单任务的成功率已达到90%。
高阳对应用落地节奏给出了判断:未来一两年将是工业应用的初始窗口,两年后机器人将进入商业服务场景执行较简单的任务。相比之下,进入家庭场景的难度显著更高。他回顾称,公司成立时机器人只能完成倒水、叠一件衣服这类单独任务,而今天机器人已能在大范围空间内行动并连续完成复杂工作流程。
不过,精细操作与泛化能力仍是待解难题。旋开瓶盖等精细动作,以及处理此前未遇到过的任务,依然是机器人需要攻克的技术关卡。从工业场景到家庭场景的跨越,取决于“大脑”能力的实质性突破能否如期兑现。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。