DeepMind为AI设计的蛋白质,打上来源水印
DeepMind为AI设计的蛋白质,打上来源水印
Google DeepMind发布了一个研究,如何给AI生成的蛋白质“打水印”,而且不影响蛋白质本身的功能。
1 为什么要打水印
现在AI设计蛋白质越来越强,AlphaFold3、各种蛋白设计模型都在用。问题是,怎么知道一个蛋白质序列或结构是不是AI生成的、是哪个模型生成的。这关系到生物安全,也关系到数据库里的信息真假。DNA合成公司拿到一个订单,如果不知道来源,可能就被用来做危险的东西。
2 现有办法不够用
有人提议建中心数据库,但容易误报,还有隐私问题。有人提议在元数据里加签名,但元数据随便就能删掉。水印的思路是把签名直接嵌进AI生成的对象本身,这样更难去掉,也不需要中心协调。
3 他们怎么做序列水印
方法叫SynthIDBio-sequence,把水印嵌进ProteinMPNN这个常用的序列设计模型里。用的是SynthID-text里的tournament sampling,简单说就是在采样氨基酸的时候,用密钥和上下文算一个随机种子,给每个候选氨基酸打分,让高分的更容易被选中。检测的时候,知道密钥的人重新算一遍分数,水印序列的平均分会明显高于随机水平。
4 他们怎么做结构水印
方法叫SynthIDBio-structure,微调AlphaFold3的扩散模块,同时训练一个检测器。扩散损失加上水印损失一起训练,让模型生成的结构里藏进水印信息。检测器看的是原子间距离和扭转角,所以对旋转平移天然免疫。
5 关键验证
他们真的做了湿实验。设计了针对SC2RBD、VEGF-A、PD-L1三个靶点的结合蛋白,水印版和非水印版比,结合亲和力分布和命中率没有显著差异。也就是说,水印确实没影响功能。检测方面,在极低假阳性率下能做到接近百分之百的真阳性率。
6 局限和意义
序列水印可以被重新测序攻击去掉,但攻击本身也会降低结合命中率。结构水印对松弛处理不够鲁棒。目前都是零比特水印,只能标记“有水印”,不能区分不同用户。
总的来说,这是第一个证明“保功能生物水印”可行的概念验证。离实际部署还有距离,但方向很清楚:以后AI设计的蛋白质,也许天生就带着来源标记。
参考: Stutz, D., Cowen-Rivers, A. I., Ortiz-Jimenez, G., Kohli, P., & Hassabis, D. (2026). Function-preserving watermarking of AI-generated proteins. Nature.
更多精彩:
2026可视化工具TOP3
《保姆级R可视化教程》来了!
Python matplotlib保姆级教程
嫌Matplotlib繁琐?试试Seaborn!