2026-10-01

IT之家 9 月 30 日消息,谷歌于今日正式推出 SynthID Bio,将数字水印技术延伸至合成生物学领域。该技术能够在生物编码中植入无法被感知的签名,既可在数字模型层面进行验证,也能在人工合成的物理蛋白质上进行确认,且在实验室检测过程中不会影响蛋白质的正常生物学功能。

生成式人工智能正助力科学家应对关键生物学难题,从预测蛋白质构型到设计全新蛋白质,再到开发新型噬菌体。然而,这类工具也引发了新的问题:新型人工智能设计可能绕过传统 DNA 合成筛选流程,而带有错误标记的合成 3D 结构会污染公共数据库,进而误导后续研究。

SynthID Bio 是一套专为合成生物学研发的水印技术方案,其目标在于强化生物安全与科学诚信。

它会依据数据类型调整具体方法,对序列中的氨基酸选择进行细微引导,对预测的 3D 结构调整原子坐标,从而生成可靠的检测信号。实验结果显示,这些调整不会破坏蛋白质的生物学功能,这对于有效治疗疾病和推动科学研究至关重要。

在针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 这三种靶蛋白的湿实验室测试里,带有水印的设计在命中率、结合亲和力以及自然序列多样性方面,与未加水印的版本表现一致,成功创制出首个带有水印且保持生物学功能的蛋白质结合剂。

针对蛋白质折叠问题,SynthID Bio 对 AlphaFold 3 扩散网络的一小部分进行了微调,将水印能力直接嵌入模型权重中。这确保了预测的 3D 坐标本身便携带可检测的特征,无论由谁运行该模型,SynthID Bio 都能维持 AlphaFold 3 的预测精度,同时提供近乎完美的可检测性,保持关键结构特征分布,并能抵御数字噪声或微小的坐标变动。

生物安全依赖于多层次的防御体系,SynthID Bio 的水印方法可作为一项关键的验证层,直接嵌入生物设计本身。这一层对于 DNA 合成筛选尤为重要,因为当前人工智能能够创造出与已知危害几乎无相似之处的新序列,筛选人员无法再沿用旧有假设,而 SynthID Bio 能提供自动验证信号,证明订单源自带有内置安全措施的可信模型。

类似地,SynthID Bio 还能帮助维护蛋白质数据库、UniProt、GenBank 等数据库的完整性,确保合成条目被正确标记或标注,以供进一步审查。

谷歌表示,尽管没有单一的生物安全干预措施是万能药,但 SynthID Bio 将经过验证的水印工具 SynthID 引入合成生物学,这是可靠识别和追踪人工智能生成生物序列与结构的重要第一步。

未来的关键挑战包括让水印对故意篡改具备更强的鲁棒性。SynthID Bio 还可与来源元数据方法或人工智能生成生物数据的中央存储库配合使用,以便更好地识别和追踪人工智能生成的蛋白质。

谷歌目前正研究如何将水印技术应用于更复杂的生物物体,在与斯坦福大学 Hie 实验室和 Arc Institute 的合作研究中,已成功将 SynthID Bio 集成到先进基因组模型 Evo 2 中,为 Evo 2 设计的噬菌体基因组添加水印,早期实验室测试已确认这些带水印的噬菌体具备功能。

IT之家附上参考

  • Function-preserving watermarking of AI-generated proteins