跳到內容

Technology

新聞|Carbon-A 用單一 1.2B 模型標註真核生物基因,建出 5.66 億個預測位點的資料庫

Hugging Face 與北京中關村學院等單位 10 月 8 日釋出 Carbon-A,一個 12 億參數的雙向編碼器,用一個 checkpoint 從 DNA 預測六大類真核生物的蛋白質編碼區,並據此建成涵蓋 22,617 個分類單元的 Carbon Annotation Database。整理模型設計、訓練資料、註解流程、基準與 Iso-Seq 結果,以及技術報告自己列出的限制。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

要解決的問題

定序的成本已經降了好幾個數量級,瓶頸移到下游的結構註解:找出基因在哪裡、哪些區段編碼蛋白質、外顯子與內含子怎麼排列。

傳統做法是替每個基因組分別收集證據:組裝並比對轉錄本、把已知蛋白質比對回基因組、從近緣物種轉移註解。這些證據在生命樹上分布很不平均,越冷門的類群越缺。不靠外部證據的 ab initio 預測器多半也依類群分開訓練。依報告的統計,Tiberius 有 9 個 checkpoint,ANNEVO 有 6 個,OrionGeno 有 8 個。模型離訓練用的類群越遠,準確度掉得越多。

Carbon-A 想回答的問題是:單一模型能不能跨越差異很大的真核類群,學到共通的編碼規則。

模型

Carbon-A 的骨幹來自同團隊的 GENERator-1.2B,把原本的因果解碼器換成雙向編碼器。報告的理由是,某個位置是否屬於編碼區,要同時看上游與下游的訊號,例如起始與終止密碼子、剪接點與外顯子的排列。

項目設定
參數量12 億
層數、隱藏維度26 層,2,048 維
注意力頭32 個,KV 頭 4 個
分詞不重疊的 6-mer,每個 token 代表 6 個鹼基
上下文16,384 個 token,即 98,304 bp
輸出正、反兩股各一個分類頭,每個鹼基輸出編碼與非編碼的機率
授權Apache 2.0

幾個設計重點:

發布在 Hugging Face 的權重,其 provenance.json 記載來源為 GenerTeam 的 GENERanno-eukaryote-1.2b-cds-annotator-preview,Hugging Face 只為 Transformers 5.x 相容性修改了模型程式碼。

訓練資料

訓練資料是 RefSeq 中 GCF 編號的組裝,只收長度至少 98,304 bp 的序列記錄:

類群滑動步長(bp)
哺乳類、其他脊椎動物98,304
無脊椎動物65,536
植物49,152
真菌4,096
原生生物1,024

訓練在 32 張 NVIDIA A100 上進行,每步 256 個視窗(約 400 萬個 6-mer token),依類群逐步加入,全程約 50 萬步。

從機率到基因結構

模型本身只給出每個鹼基的編碼機率。註解流程分成四步:

  1. 全基因組推論:以 98,304 bp 的視窗掃過,相鄰視窗重疊 6,144 bp,重疊處取平均。
  2. 轉換網路:一個 11,077 個參數的小型網路,找出基因間區、外顯子與內含子之間的候選邊界。
  3. Viterbi 解碼:強制基因文法,基因從起始密碼子開始、到同框的終止密碼子結束,內含子從供體位點開始、到相容的受體位點結束,重建出合法的 CDS。
  4. 信心網路:結合機率軌跡與解碼出的結構,給每個基因一個分數,代表結構完全正確的機率。

報告把這個分數類比為 AlphaFold 的 pLDDT 與 pTM。流程保留所有預測,使用者可以自己選門檻。

基準結果

42 個基準基因組分成兩組:28 個是訓練快照中的既有參考基因組,例如人類、斑馬魚、果蠅與阿拉伯芥;14 個是 2026 年起才加入 RefSeq 的時間保留組,所有受測模型都沒看過。Carbon-A 在兩組各自排名第一。

各類群的平均基因層級 F1:

類群基因 F1
原生生物0.956
真菌0.815
植物0.776
哺乳類0.744
其他脊椎動物0.667
無脊椎動物0.614

其他數字:

在人類 1 號染色體上的執行時間:

方法秒數
NTv31,894
Carbon-A2,027
Helixer6,030
AUGUSTUS(單一 CPU 執行緒)7,510
SegmentNT8,547

Tiberius、ANNEVO 與 OrionGeno 快三到四倍,但它們依類群分成多個 checkpoint,參數量分別是 800 萬、1,500 萬與 2.12 億。AUGUSTUS 用 CPU、其他方法用單張 GPU,硬體並不對等。把上下文從 16,384 個 token 減半到 8,192,執行時間降到 1,613 秒,基因 F1 從 0.805 降到 0.792。

參考註解之外的候選

參考註解也可能漏掉基因或含錯誤的基因模型。團隊在貓、敘利亞倉鼠、雞與阿拉伯芥四個物種上,把每個模型的預測分成與 RefSeq 完全一致、重疊但結構不同、只有模型有、只有 RefSeq 有幾類,再用兩種證據檢驗。

AlphaFold3 結構信心:四個物種中,Carbon-A 獨有候選的 pTM 分布都高於對應的 RefSeq 獨有註解,差距也比其他模型明顯。

Iso-Seq 全長轉錄本:

指標Carbon-ARefSeq
整體支持率0.6190.623
雞0.6530.646
阿拉伯芥0.6980.685

報告提醒,支持率取決於取樣組織中有哪些基因在表現。整體 0.619 不代表只有 61.9% 的註解正確,0.159 也不代表只有 15.9% 的候選是真基因。

Carbon Annotation Database

團隊用同一個流程與設定處理 GenBank 的真核組裝,每個預測位點都連到組裝、分類單元、座標、股向、重建的 CDS、轉譯出的蛋白質與信心分數。

項目CADBRefSeq 訓練來源倍數
組裝數48,1672,05523.44
分類單元22,6172,04711.05
序列27.18 Tbp3.03 Tbp8.96
編碼位點或基因5.66 億3,498 萬16.19

GenBank 同一個分類單元可能有多個組裝,來自不同個體、品系或計畫,所以報告同時列出組裝數與分類單元數。報告把 CADB 定位為人工審訂參考註解的補充,主要用途有兩種:

官方部落格說,目前約完成目標 GenBank 集合的一半,三週後釋出下一批,之後也會透過 EMBL-EBI 提供。

限制

報告與部落格自己列出的限制:

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。