苹果公司的研究人员本月初公布了一项名为SimpleDesign的蛋白质设计模型,相关研究论文以预印本形式发布在arXiv上。该模型能够联合生成蛋白质的氨基酸序列和三维结构,采用直接在原始数据上训练的方式,省去了传统多阶段训练流程中的中间表示转换环节。
根据论文描述,现有不少蛋白质联合设计模型需要先训练自编码器,将蛋白质结构转换为离散的潜在表示,再训练生成模型处理这些表示。SimpleDesign则直接使用氨基酸序列和连续三维坐标进行端到端训练,从而简化了整个建模流程。这一技术路线延续了苹果此前SimpleFold项目的思路。SimpleFold通过流匹配模型,根据氨基酸序列直接预测蛋白质三维结构。SimpleDesign将这一简化架构从结构预测扩展至蛋白质设计任务,不仅预测结构,还尝试同时生成能够形成相应结构的氨基酸序列。
在训练数据方面,研究团队使用了超过200万组蛋白质序列与结构配对数据,主要来自AFESM数据集。该数据集整合了AlphaFold数据库的预测结构及其他样本。训练过程中,模型会随机遮盖氨基酸序列中的部分内容,同时向对应的三维结构添加噪声。通过调整序列和结构的破坏程度,模型可以学习不同的蛋白质任务。当序列基本完整而结构受到较大干扰时,任务类似于蛋白质折叠,即根据已知序列恢复结构;当结构基本完整而序列被大量遮盖时,则类似于逆折叠,即生成能够形成指定结构的氨基酸序列;当序列与结构同时受到部分破坏时,模型需要联合处理两类信息,从而学习蛋白质序列与结构的协同设计。
根据研究结果,SimpleDesign在蛋白质联合设计、结构生成和序列生成等基准测试中取得了具有竞争力的表现。研究人员发现,该模型能够生成具有合理形态的蛋白质结构,生成的氨基酸序列整体质量与多数竞品多模态模型相当或更好。不过,论文目前仅报告了计算机评估结果。研究团队尚未通过实验验证生成蛋白质能否实际折叠、发挥功能或在生物系统中安全运行,因此这些结果还不能直接证明模型设计出的蛋白质具备实际应用能力。
从行业视角看,蛋白质设计是AI在生命科学领域最具落地潜力的方向之一。传统蛋白质设计依赖大量实验试错,周期长、成本高。近年来,以AlphaFold为代表的深度学习模型在结构预测上取得突破后,研究重心逐步向“从头设计”迁移。联合生成序列与结构的能力,意味着模型可以在一次推理中同时输出可折叠的氨基酸链和对应的空间构象,减少多阶段流程中的信息损失和误差累积。苹果此次发布的SimpleDesign,在方法论上强调端到端训练和架构简化,与当前部分研究追求更大规模、更复杂模块的趋势形成对比。
值得注意的是,苹果在AI基础研究领域的投入正逐步从消费端功能向科学计算延伸。SimpleFold和SimpleDesign两个项目均聚焦蛋白质建模,显示该公司在AI for Science方向上有持续布局。尽管距离实验验证和商业化应用仍有距离,但端到端联合设计模型的探索,为降低蛋白质工程门槛提供了新的技术路径。后续研究若能在湿实验中验证生成蛋白的功能性与安全性,该类模型有望在药物研发、酶工程和合成生物学等场景中发挥实际作用。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。