苹果SimpleDesign模型亮相:端到端联合生成蛋白质序列与结构
苹果研究人员发布SimpleDesign蛋白质设计模型,可同时生成氨基酸序列与三维结构,采用端到端训练,在多项基准测试中表现竞争力,但尚未经实验验证。
从SimpleFold到SimpleDesign:架构简化思路的延伸
苹果公司研究人员本月初公开了一项名为SimpleDesign的蛋白质设计模型,相关论文以预印本形式发布于arXiv。该模型的核心突破在于能够联合生成蛋白质的氨基酸序列与三维结构,且采用直接在原始数据上训练的方式,跳过了传统多阶段流程中必需的中间表示转换环节。
这一研究延续了苹果此前SimpleFold项目的技术脉络。SimpleFold利用流匹配模型从氨基酸序列直接预测蛋白质三维结构,而SimpleDesign将这种简化架构进一步拓展至设计任务——不仅预测结构,还同步生成能够形成对应结构的氨基酸序列。
端到端训练:绕过自编码器的中间表示
论文指出,现有不少蛋白质联合设计模型需要先训练自编码器,将蛋白质结构转换为离散的潜在表示,再训练生成模型处理这些表示。SimpleDesign则直接使用氨基酸序列和连续三维坐标进行端到端训练,省去了这一中间步骤。
研究团队使用了超过200万组蛋白质序列与结构配对数据,主要来自AFESM数据集。该数据集整合了AlphaFold数据库的预测结构及其他样本。训练过程中,模型会随机遮盖氨基酸序列中的部分内容,同时向对应的三维结构添加噪声。
通过调整序列和结构的破坏程度,模型可以学习不同的蛋白质任务:
- 当序列基本完整而结构受到较大干扰时,任务类似于蛋白质折叠,即根据已知序列恢复结构;
- 当结构基本完整而序列被大量遮盖时,则类似于逆折叠,即生成能够形成指定结构的氨基酸序列;
- 当序列与结构同时受到部分破坏时,模型需要联合处理两类信息,从而学习蛋白质序列与结构的协同设计。
蛋白质折叠是指氨基酸链形成特定三维结构的过程,逆折叠则是根据目标结构寻找可能对应的氨基酸序列。
基准测试表现与实验验证空白
根据研究结果,SimpleDesign在蛋白质联合设计、结构生成和序列生成等基准测试中取得了具有竞争力的表现。研究人员还发现,该模型能够生成具有合理形态的蛋白质结构,生成的氨基酸序列整体质量与多数竞品多模态模型相当或更好。
不过,论文目前仅报告了计算机评估结果。研究团队尚未通过实验验证生成蛋白质能否实际折叠、发挥功能或在生物系统中安全运行,因此这些结果还不能直接证明模型设计出的蛋白质具备实际应用能力。
行业影响:简化架构或降低蛋白质设计门槛
SimpleDesign的端到端思路若被进一步验证,可能降低蛋白质设计对复杂中间表示工程的依赖,让更多研究者直接基于序列和坐标数据训练模型。但计算评估与湿实验之间的鸿沟依然显著,该模型能否从基准测试走向真实生物应用,仍需等待后续实验数据的支撑。