Anthropic与OpenAI正计划将独立安全评估员嵌入其人工智能实验室内部。这一举措被视为AI安全治理领域的一次重要尝试,旨在让外部评估人员更深入地了解前沿模型的开发过程与潜在风险。
据披露,两家公司提出的方案允许独立评估员在模型开发和部署的早期阶段介入,从而获得对训练流程、系统能力及安全测试环节的前所未有的访问权限。研究人员对此表示欢迎,认为这是迈向更负责任AI开发的一步。
然而,多位研究人员同时发出警告,指出嵌入式评估模式面临结构性挑战。评估员虽然获得了访问权限,但其独立性可能受到雇佣关系、保密协议以及商业利益冲突的影响。若缺乏足够的透明度机制和制度保障,这种嵌入模式可能沦为形式上的合规动作,而非实质性的安全监督。
研究人员强调,有意义的监督需要三个核心要素:透明度、独立性和最终的外部监管。透明度要求评估过程和发现能够被适当披露;独立性要求评估员不受被评估公司的直接控制;而监管则意味着需要建立外部问责框架,确保安全评估不依赖于企业的自愿配合。
当前,AI安全评估的行业实践仍处于早期阶段。Anthropic与OpenAI的探索可能为行业树立参考模式,但也引发了关于评估员权限边界、利益冲突管理以及评估结果披露范围的讨论。若嵌入式评估无法解决独立性问题,其实际效果将受到质疑。
这一动向反映出前沿AI公司在监管压力与公众期待下,正试图通过内部治理创新来回应外部关切。但研究人员普遍认为,企业主导的评估机制无法替代外部监管,最终仍需政策制定者介入,建立具有约束力的安全标准与问责体系。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。