Baseten旗下研究机构Base Labs于今年早些时候成立,近日宣布与Hugging Face及AI可解释性初创公司Goodfire达成合作,共同推进开放权重AI模型的安全研究。该合作项目将开发并公开发布针对开放模型的训练与监控方法,旨在为开源AI生态建立可复用的安全工具链。
Base Labs由企业级AI推理平台Baseten孵化,定位为专注AI安全与对齐的研究团队。Baseten本身是一家为企业提供模型部署与推理基础设施的科技公司,其客户覆盖多个需要大规模运行AI模型的企业场景。Base Labs的成立标志着Baseten从基础设施层向AI安全研究领域的延伸。
此次合作的三方各自承担不同角色。Hugging Face作为全球最大的开源AI模型与数据集托管平台,将提供开放权重模型的发布渠道与社区分发能力。Goodfire则专注于AI可解释性研究,其技术能力集中在理解和干预模型内部表征,这对于开发有效的安全监控方法至关重要。Base Labs作为研究主导方,负责方法论的开发与实验验证。
开放权重模型的安全问题近年来受到越来越多关注。与闭源模型不同,开放权重模型的参数可被任何人下载、修改和部署,这意味着传统的集中式安全防护手段难以直接适用。一旦模型被恶意微调或用于不当用途,开发方很难进行事后干预。因此,业界需要一套针对开放模型特点设计的安全训练与监控方法,使模型在发布后仍能保持一定程度的安全可控性。
当前AI安全工具的研究主要集中在闭源模型上。OpenAI、Anthropic、Google DeepMind等头部AI实验室拥有对模型训练和部署全流程的控制权,可以在模型层面嵌入安全机制,并通过API层面的过滤和监控来管理输出。但这种模式无法直接迁移到开放权重场景。开放模型的开发者往往缺乏持续监控模型使用情况的能力,也无法在模型被下载后实施干预。
Base Labs此次合作的核心目标正是填补这一空白。根据公开信息,该项目将聚焦于两个方向:一是开发针对开放权重模型的安全训练方法,使模型在训练阶段就具备更强的抗滥用能力;二是构建发布后的监控工具,帮助模型开发者和部署者识别潜在的安全风险。所有研究成果将以公开方式发布,供开源社区使用。
这一合作项目的推出,与当前AI安全监管环境的变化密切相关。欧盟AI法案已对通用目的AI模型提出安全要求,其中对开放权重模型设置了有条件的豁免条款,但前提是模型发布方需具备足够的安全评估能力。美国方面,白宫关于AI的行政令也要求对开放模型进行安全测试。在此背景下,一套可操作、可复用的开放模型安全工具链具有明确的政策需求基础。
从行业格局来看,开放权重模型与闭源模型之间的安全能力差距正在成为讨论焦点。Meta的Llama系列、Mistral的模型以及阿联酋TII的Falcon系列等开放权重模型已在企业场景中广泛部署,但其安全防护水平与GPT-4、Claude等闭源模型相比仍有明显差距。如果Base Labs与Hugging Face、Goodfire的合作能够产出有效的安全方法,将有助于缩小这一差距,使企业在采用开放模型时获得更强的安全保障。
值得注意的是,Goodfire此前已获得多家投资机构支持,其可解释性技术能够在不影响模型性能的前提下识别和调控模型内部的特定概念表征。这种能力对于开放模型的安全监控尤为关键——它提供了一种在模型层面而非输出层面进行安全干预的路径,且不依赖于对模型推理过程的集中控制。
Base Labs方面表示,项目成果将以开源方式发布,包括训练方法、评估基准和监控工具。Hugging Face将利用其平台优势推动这些工具在开源社区中的采用。三方合作的具体产出时间表尚未公布。
从更宏观的视角看,此次合作反映了AI安全领域的一个趋势:随着开放权重模型的能力持续提升,安全研究正从闭源实验室的专属领域向开源社区扩展。如何在保持开放生态创新活力的同时建立有效的安全护栏,将成为未来一段时间内AI行业需要持续回答的问题。Base Labs与Hugging Face、Goodfire的这次尝试,为这一问题提供了一种多方协作的解决思路。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。