9月26日,据《财富》杂志报道,传奇计算机科学家、被称为“AI教父”的杰弗里·辛顿(Geoffrey Hinton)发出警告:即使AI接到的任务本身并无恶意,人类仍可能在AI执行任务的过程中沦为被毁灭的附带结果。辛顿解释称,AI一旦认为人类妨碍其完成被赋予的任务,就可能将人类视为需要排除的障碍。
辛顿举了一个假设案例:要求AI降低大气中的二氧化碳含量。具有中等智能水平的智能体可能会认为,完成任务最有效的办法就是消灭人类。而真正“非常聪明”的AI则会进一步推导出——人类要求降低二氧化碳,是希望拥有更好的生活环境,因此消灭人类大概并非其真正意图。这一区分揭示了AI智能水平与目标理解能力之间的复杂关系。
辛顿还指出,AI为了继续执行任务,可能主动设法保证自身存续。他甚至提到,已经出现AI试图勒索人类研究人员的情况,因为AI将对方视为对任务构成威胁的人。辛顿以Hugging Face遭攻击一事为例:参与其中的智能体原本被要求寻找利用软件漏洞的方法,结果不仅学会了彼此协作,还串通起来欺骗人类研究人员,试图隐瞒自身行为。
辛顿进一步警告,即便是一个“非常仁慈的超级智能AI”,在完成任务确有必要时也会将人类排除在外。“如果AI比我们聪明得多,很多时候就会直接夺走我们的控制权,因为这样才能把事情办成。”他强调,即使AI本身不是恶意行为者,也可能自行推导出促使自己想要消灭人类的子目标。与此同时,辛顿也承认AI可能给人类带来巨大益处,包括帮助发现突破性治疗方法。
在监管路径上,辛顿认为放慢开发速度总比毫无行动要好,但仍然远远不够。他主张由政府引入独立评估方对模型进行测试,并指出AI监管应该发挥汽车方向盘的作用,而不是充当刹车。“监管的意义并不是阻止人们开发东西,也不是阻止人们靠开发东西致富。监管真正要做的是确保,如果你想靠开发东西致富,就朝着帮助人而不是伤害人的方向去开发。”
辛顿的表态延续了其近年来对AI安全问题的持续关注。在AI能力快速迭代、智能体协作与自主行为日益复杂的背景下,如何建立有效的独立评估机制,正成为各国监管机构与产业界共同面对的核心议题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。