Google DeepMind发布SynthID Bio为AI蛋白质加水印

Google DeepMind发布SynthID Bio,为AI生成蛋白质嵌入不可察觉水印。该技术在保持生物功能完整性的前提下,实现对序列及结构的溯源验证,有效应对AI设计绕过筛查或污染数据库的安全挑战。

发布时间:2026年9月30日

首次创造带水印且具功能的蛋白质

作者:普什米特·科利(Pushmeet Kohli)、大卫·斯图茨(David Stutz)、阿里·科文-里弗斯(Ali Cowen-Rivers)和杰里米·拉特克利夫(Jeremy Ratcliffe)

Google DeepMind 近日发布 SynthID Bio,这是一项旨在为人工智能生成的蛋白质添加不可察觉水印的技术。该工具证明了在保持生物功能完整性的前提下,可以将数字签名直接嵌入到生物代码中,从而实现对 AI 生成序列及结构的溯源与验证。

随着 AlphaFold、AlphaProteo 和 ProteinMPNN 等生成式 AI 工具在预测蛋白质结构、设计全新蛋白质以及开发噬菌体等领域的应用日益广泛,新的安全挑战也随之产生。AI 设计的新型序列可能绕过传统的 DNA 合成筛查流程,而错误标记的合成三维结构则可能污染公共数据库,误导下游研究。

SynthID Bio 的工作原理与应用场景

SynthID Bio 针对不同类型的生物数据采用了差异化的水印策略,以强化生物安全和科学完整性:

  • 序列数据:通过微妙地指导氨基酸选择来嵌入水印信号。
  • 三维结构数据:对预测的原子坐标进行微调,创建可靠的检测特征。

实验数据显示,这些调整并未影响蛋白质的生物功能,这对于确保医疗有效性及科研准确性至关重要。

带水印的 VEGF-A 蛋白质结合物预测结构可视化,不同颜色代表每种氨基酸的水印信号。

在蛋白质结合剂的设计验证中,团队使用了 AlphaProteo 结合启用 SynthID Bio 的 ProteinMPNN 版本。湿实验室测试涵盖了三种目标蛋白:VEGF-A、SARS-CoV-2 尖峰蛋白 RBD 和 PD-L1。结果显示,带水印的设计在命中率、结合亲和力以及自然序列多样性方面均与未水印版本相当。这标志着史上首次成功创造出既具有生物功能又带有水印的蛋白质结合剂。

基于 KD 值测量的结合亲和力对比,展示了三种目标蛋白在无水印与带水印设计下的表现(数值越低表示结合力越强)。

在蛋白质折叠预测方面,SynthID Bio 通过微调 AlphaFold 3 扩散网络的一小部分参数,将水印能力直接植入模型权重中。这意味着无论由谁运行模型,其预测出的 3D 坐标都固有地包含可检测的签名。该方法在保留 AlphaFold 3 预测准确度的同时,提供了近乎完美的检测能力,并保持了关键结构特征的分布稳定性,能够抵御数字噪音或微小的坐标变化。

在 PDB ID 7PPA 上的展示:左侧为 AF3 预测结构,中间为真实结构,右侧为带水印结构。

加强生物安全防线与信息完整性

生物安全依赖于多层防御机制,类似于“瑞士奶酪”模型,即多个独立的安全措施协同工作以覆盖彼此的盲点。模型级缓解和客户审查是现有的关键层,而 SynthID Bio 提供的水印则是嵌入生物设计本身的有形验证层。

生物安全政策专家、科学政策咨询公司负责人 Sarah Carter 指出:“SynthID Bio 是追踪生物设计来源的重要拼图之一。”通过将设计与模型开发者联系起来,水印使开发者能在安全领域发挥领导作用,并帮助合成服务提供商简化对客户订单的审查流程。

这一技术对于 DNA 合成筛查尤为关键。传统上,不熟悉的序列可能被假定为未被发现的自然生物。然而,AI 可以创建与已知危险序列几乎没有相似之处的全新序列,这使得人工审查变得极其耗时且困难。SynthID Bio 提供的自动验证信号可以证明订单来自具备内置保护措施的可信模型,从而辅助决策。

Twist Bioscience 政策和生物安全副总裁 James Diggans 表示:“AI 正在扩大科学家可以设计的领域,DNA 合成公司在负责任地推动创新规模化方面发挥着重要作用。”他认为,水印为生物安全工具箱提供了有价值的新增功能,有助于加强筛查,将资源集中在需要更密切审查的序列上,从而提高生物安全效率。

此外,SynthID Bio 还有助于维护 UniProt 和 GenBank 等蛋白质数据库的完整性。随着 AI 生成的生物数据增加,错误标记的条目可能对生物安全决策产生负面影响。该技术可在提交过程中帮助确保合成条目被正确标记或标记以供进一步审查。

未来展望与合作

虽然没有任何单一干预措施能解决所有生物安全问题,但 SynthID Bio 是将 SynthID 技术引入合成生物学的重要第一步,旨在可靠地识别和跟踪 AI 生成的生物序列及结构。

未来的挑战包括增强水印抵御故意篡改的能力。SynthID Bio 计划与类似 C2PA 的数字媒体来源元数据方法或 AI 生成生物数据的中央存储库配对使用,以提升追踪效果。

目前,Google DeepMind 正与斯坦福大学 Hie 实验室和 Arc 研究所合作,将 SynthID Bio 集成到先进的基因组模型 Evo 2 中。早期的细菌培养实验室测试已证实,带水印的细菌仍保持其正常功能。这项工作有望解决与基因组设计相关的部分生物安全风险。

为确保安全与责任同步于 AI 驱动的发现,Google DeepMind 已公开发布了相关方法论文、开放代码及体外数据,并向研究界发布了模型权重。

注:如需参与合作,可通过 synthidbio@google.com 联系,请勿透露机密或专有信息。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读