← 所有文章
Protein AI深度學習ESM-2Transformer

ESM-2:蛋白質語言模型如何「讀懂」序列

從 Transformer 架構到蛋白質嵌入,解釋 ESM-2 為什麼能在不需要結構資訊的情況下捕捉進化約束。

為什麼蛋白質需要語言模型?

傳統的序列分析工具(BLAST、HMMER)依賴進化資料庫的比對。但當你手上是一段全新設計的序列, 沒有同源蛋白可比對時,這些工具就失靈了。

蛋白質語言模型(PLM)用另一種方式看待序列:把胺基酸當成「詞」,把序列當成「句子」, 用大規模自監督學習從數億條序列中學到隱性的物理化學規律。

ESM-2 架構解析

Meta 的 ESM-2 是目前最廣泛使用的開源 PLM。核心是 Transformer encoder:

輸入序列: M K T I I A L S Y I ...
   ↓ 胺基酸 tokenizer(詞彙表大小 = 33)
Token embeddings (d_model = 1280)
   ↓ L × Multi-head Self-Attention + FFN
每個位置的 embedding (d=1280)
   ↓ 平均池化 (mean pooling)
全序列 embedding (1280-dim 向量)

關鍵設計決策:

嵌入空間的意義

ESM-2 的 embedding 並非隨機數字,而是編碼了:

  1. 功能保守性:功能重要的位置(活性位點、二硫鍵)在嵌入空間中對擾動更敏感。
  2. 結構偏好性:α-helix 與 β-sheet 在嵌入空間的分布有可分離的模式。
  3. 進化距離:親緣關係越近的蛋白,其序列嵌入的餘弦相似度越高。

在本站的實際應用

本站的蛋白質相似度 Demo 呼叫 HuggingFace Space 上的 ESM-2(8M), 讓你直接輸入兩段序列,計算語意相似度。

完整的蛋白質設計 Pipeline(含 Bayesian Optimization 和 ProteinMPNN)可以在 蛋白質 AI 報告頁面 找到。

延伸閱讀

元嬰不說頭像

元嬰不說

你好!我是元嬰不說,不說 的作品集助手 🤖
可以問我關於他的學經歷、技術專長、或是作品集內容。