2026 年 9 月初,苹果公司研究人员在论文预印本平台 arXiv 上公布了蛋白质设计模型 SimpleDesign。这是一款用人工智能设计蛋白质的工具,属于「AI for Science」(用 AI 推动科学研究)这一热门方向。它的核心能力是:同时生成蛋白质的氨基酸序列和三维结构。氨基酸序列是蛋白质的「构件清单」,三维结构是这些构件折叠成的立体形状,两者共同决定一种蛋白质能干什么。能按需设计蛋白质,相当于人类可以定制自然界不存在的分子,用来做药物、材料或催化剂——这正是这项研究值得关注的原因。

目前论文还只是预印本(正式评审发表前先公开的版本),研究结果也只停留在计算机模拟层面,尚未经过实验验证。

蛋白质设计是个难题

蛋白质是生物体内干活的主力分子:催化化学反应的酶、传递信号的激素、抵御病原的抗体,本质上都是蛋白质。想设计一种新蛋白质,就要同时回答两个问题:氨基酸按什么顺序排列(序列),这条序列会折叠成什么形状(结构)。结构错了,蛋白质就没法干活。

传统做法是分步走:先用「自编码器」(一种先把结构压缩成简短代码、再还原出来的神经网络组件)把蛋白质结构转成中间表示,再训练生成模型去处理这些表示。环节多、转换繁琐。

SimpleDesign 的做法:端到端一步到位

SimpleDesign 把流程简化了:不再经过中间表示转换,而是直接把氨基酸序列和连续三维坐标喂给模型训练,一步出结果。机器学习里这叫「端到端」——输入到输出之间没有人工设计的中间环节。

训练时,研究团队用了 超过 200 万组蛋白质序列与结构配对数据,主要来自 AFESM 数据集(这个数据集整合了 AlphaFold 数据库的预测结构等样本)。训练中模型会随机遮盖序列的一部分,同时向对应的三维结构添加噪声。

通过调整「破坏程度」,模型能学会不同的任务:

  • 序列基本完整、结构被大幅干扰时,任务类似蛋白质折叠:根据已知序列恢复出结构;
  • 结构基本完整、序列被大量遮盖时,任务类似逆折叠:生成能形成指定结构的氨基酸序列;
  • 序列和结构都部分破坏时,模型要同时处理两类信息,学会序列与结构的协同设计。

延续苹果自家的 SimpleFold 路线

这款模型延续了苹果此前 SimpleFold 项目的思路。SimpleFold 是一款蛋白质结构预测模型,用「流匹配」(一种生成模型技术,让随机噪声逐步演变成目标数据的生成方式)根据氨基酸序列直接预测三维结构。SimpleDesign 把这条简化路线从「预测结构」推进到「设计蛋白质」:不只预测结构,还尝试同时生成能形成对应结构的氨基酸序列。

目前的验证程度:有竞争力,但没进实验室

研究结果显示,SimpleDesign 在蛋白质联合设计、结构生成和序列生成等基准测试(用统一考题比较不同模型水平的评测体系)中表现有竞争力;生成的结构形态合理,生成的序列质量与多数竞品多模态模型相当或更好。

但论文目前只报告了计算机评估结果。生成出来的蛋白质能不能真正折叠、有没有功能、在生物系统中是否安全,都还没有实验证据,因此这些结果还不能证明设计出的蛋白质具备实际应用能力。

值得记住的两点

第一,从 AlphaFold 的「读懂蛋白质结构」到 SimpleDesign 的「直接设计蛋白质」,AI 正在把蛋白质研究从理解自然推进到改写自然,苹果这次以「简化、端到端」的差异化路线入局。第二,这项成果目前还停留在计算机模拟层面,实际应用能力有待实验验证——可以把它看作苹果在 AI for Science 赛道的一次正式布局,方向明确,距离落地还有一段路。