Abliteration.AI近日宣布推出一项新业务,专注于提供去除安全护栏的AI模型访问服务。该公司认为,让防御者拥有与攻击者相同的工具,最终可能提升网络安全水平。
所谓“abliteration”是指通过技术手段移除大语言模型中的安全对齐机制,使模型能够响应未经限制的指令。这一做法在AI安全研究领域长期处于争议地带。Abliteration.AI的立场是,安全研究人员和防御方需要理解模型的未约束行为,才能更有效地构建防护体系。
该公司并未透露具体的技术实现细节,也未说明其模型来源和授权方式。目前,Abliteration.AI提供的服务主要面向网络安全研究人员、渗透测试团队以及学术机构,而非普通消费者或企业客户。
这一商业模式的出现在AI行业引发讨论。一方面,主流AI开发商普遍投入大量资源进行安全对齐训练,以防止模型被滥用;另一方面,安全社区中一直存在“红队测试”需求,即通过模拟攻击来发现系统漏洞。Abliteration.AI试图在两者之间寻找市场空间,但其服务的合规性和潜在滥用风险尚未得到明确界定。
目前,各国监管机构对AI安全性的要求日趋严格,尤其是欧盟《人工智能法案》等法规对高风险AI系统的约束正在收紧。去除安全护栏的模型服务是否会被纳入监管范围,仍是未知数。Abliteration.AI表示,其服务设有使用审核机制,并呼吁行业建立更统一的“无护栏模型”获取标准。
随着AI安全攻防博弈的持续演进,类似Abliteration.AI的第三方服务可能会增多。如何在开放研究与防止滥用之间取得平衡,将是AI行业和监管者共同面对的长期课题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。