ProteinZero:透過線上強化學習進行自我改進的蛋白質生成

Back
Category : News

[Submitted on 9 Jun 2025 (v1), last revised 19 Aug 2026 (this version, v4)]

View PDF
HTML (experimental)

Abstract:蛋白質生成模型在蛋白質設計方面展現了顯著的潛力,但其成功率仍受限於依賴人工整理的序列-結構資料集,以及監督式目標與實際設計目標之間的錯位。我們提出 ProteinZero,這是一個用於反向摺疊模型的線上強化學習框架,能夠實現可擴展、自動化且持續的自我改進,並提供計算效率高的回饋。ProteinZero 採用結合來自 ESMFold 的結構引導與新型自我衍生的 ddG 預測器的獎勵管線,在避免物理基礎方法高昂成本的同時提供穩定的多目標訊號。為了確保線上 RL 的穩健性,我們進一步引入一種新型的嵌入層級多樣性正則化器,可減輕模式崩潰並促進具功能意義的序列變異。在平衡多獎勵優化、來自參考模型的 KL 散度以及多樣性正則化的一般 RL 表述中,ProteinZero 在可設計性、穩定性、回復率與多樣性等方面均取得穩健的改進。在 CATH-4.3 基準測試中,它持續優於包含 ProteinMPNN、ESM-IF 與 InstructPLM 在內的現有最先進基準,將設計失敗率降低 36-48%,並在多樣摺疊中達到超過 90% 的成功率。重要的是,完整的 RL 運行可在單一 8 張 GPU 節點上於三天內執行完畢,包括獎勵計算與資料生成。這些結果顯示,高效的線上 RL 微調可透過讓蛋白質生成模型從自身輸出中持續演化並在無標記資料下優化多重設計目標,來補充監督式預訓練,為探索廣大的蛋白質設計空間開啟新的可能性。完整原始碼與模型檢查點將於發表後釋出。

Submission history

From: Jiajun Fan [view email]
[v1]
Mon, 9 Jun 2025 06:08:59 UTC (4,052 KB)
[v2]
Tue, 10 Jun 2025 18:30:51 UTC (4,052 KB)
[v3]
Mon, 2 Mar 2026 05:31:24 UTC (11,066 KB)
[v4]
Wed, 19 Aug 2026 22:42:25 UTC (11,067 KB)

https://www.worldprogramming.org/posts/proteinzero-self-improving-protein-generation-via-online-reinforcement-learning-cm4mfm