谷歌近日推出SynthID Bio,将数字水印技术引入合成生物学领域。该技术可将不可感知的签名直接嵌入生物编码,不仅能在数字模型上验证,还可在合成的物理蛋白质上完成验证,同时在实验室测试中保持蛋白质的生物学功能。
生成式AI正在帮助科学家解决关键生物学挑战,从预测蛋白质结构到设计全新蛋白质,再到开发新型噬菌体。但这类工具也带来了新的安全与诚信问题:新型AI设计可能绕过传统DNA合成筛选,而标记错误的合成3D结构会污染公共数据库,误导后续研究。SynthID Bio是专门为合成生物学开发的水印方法系列,旨在加强生物安全和科学诚信。
该技术会根据数据类型调整水印策略:对序列的氨基酸选择进行细微引导,对预测的3D结构调整原子坐标,从而创建可靠的检测信号。实验表明,这些调整不会损害蛋白质的生物学功能。在针对VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1三种靶蛋白的湿实验室测试中,带水印的设计在命中率、结合亲和力和自然序列多样性方面,与未带水印的版本表现一致,成功创造了首个带有水印且具备生物学功能的蛋白质结合剂。
对于蛋白质折叠,SynthID Bio对AlphaFold 3扩散网络的一小部分进行微调,将水印能力直接构建到模型权重中。这确保预测的3D坐标本身就带有可检测特征,无论由谁运行模型,SynthID Bio都能保持AlphaFold 3的预测准确性,同时提供近乎完美的可检测性,维持关键结构特征分布,并能抵御数字噪声或微小坐标变化。
生物安全依赖分层防御。SynthID Bio的水印方法可作为嵌入生物设计本身的重要验证层,对DNA合成筛选尤其重要。当前AI可以创造与已知危害几乎不相似的全新序列,筛选人员无法再沿用旧假设,而SynthID Bio可提供自动验证信号,证明订单来自带有内置安全措施的可信模型。类似地,该技术还可以帮助维护蛋白质数据库、UniProt、GenBank等数据库的完整性,确保合成条目得到正确标记或标记以供进一步审查。
谷歌表示,虽然没有单一的生物安全干预措施是万能灵药,但SynthID Bio把经过验证的水印工具SynthID带入了合成生物学,是可靠识别和跟踪AI生成生物序列与结构的重要第一步。未来的关键挑战包括让水印对故意篡改具备更强的鲁棒性。SynthID Bio还可以与来源元数据方法或AI生成生物数据的中央存储库配合使用,更好地识别和跟踪AI生成的蛋白质。
谷歌目前正研究如何将水印技术应用于更复杂的生物物体。在与斯坦福大学Hie实验室和Arc Institute的合作研究中,SynthID Bio已被集成到先进基因组模型Evo 2中,为Evo 2设计的噬菌体基因组添加水印,早期实验室测试已确认这些带水印的噬菌体具备功能。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。