谷歌于8月27日宣布推出全球首个针对前沿专有AI模型的双盲评估机制,将外部评估限制在加密“黑箱”环境中,以避免模型提前获取测试信息来优化性能。该技术旨在解决当前AI模型评估中因“基准污染”导致的结果可信度问题,即在模型提前接触测试题目的情况下,评估数据难以反映真实水平。
此次试点中,谷歌联合新加坡人工智能安全研究所、OpenMined、AVERI以及MLCommons,在隐私保护环境中对Gemini Flash Lite模型进行了机密基准测试。传统高风险外部评估长期面临两难困境:评估方需要提交测试提示词,存在模型方提前看到题目的风险;或者模型方交出模型权重,面临知识产权泄露风险。双盲评估通过谷歌云保密计算产品组合中的Confidential Space,利用加密验证确保外部评估数据和专有模型分别对各自所有者保持隐私——评估方无法看到Gemini模型权重,谷歌也无法获取评估方的测试提示词。
这种加密手段能够有效防止基准污染,同时保护敏感数据,对于网络安全或政府机构开展的高敏感度评估尤为重要。双盲评估使独立机构能够在不损害数据主权和安全的前提下,对先进AI模型进行严格测试,为模型监督提供了新的技术路径。
谷歌表示,希望这一试点能够为模型监督开辟新方向,帮助整个行业构建更安全、更可靠、更受公众信任的AI系统。随着AI模型能力的持续提升,评估机制的公信力正成为行业关注焦点,双盲评估的推出或将为第三方评测提供可复用的技术范式。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。