人民網
人民網>>科普中國

AI給細胞生物學研究開“外挂”

本報記者 張夢然
2026年09月20日08:11 | 來源:科技日報
訂閱已訂閱已收藏收藏小字號

圖片來源:AI生成

圖片來源:AI生成

顯微鏡下看一眼,只能知道細胞長什麼樣,但要真正弄清一個細胞在做什麼,得看它“打開”了哪些基因。如今,全球科學家已經積累了數億個細胞的基因數據,量太大,人腦已經處理不過來了。

為此,科學家開發了兩個人工智能(AI)模型來幫忙:第一個叫通用細胞嵌入(UCE),可把不同細胞放進同一個坐標系裡﹔第二個叫“TranscriptFormer”,直接學習了12個物種1.12億個細胞的基因表達數據。這兩個模型放在一起建立起“通用空間”,讓跨物種比較細胞變得容易得多,也為人類疾病研究和細胞治療帶來了新線索。

這一相關研究成果發表在《自然》和《科學》雜志上。項目的共同主要作者、美國斯坦福生物工程教授斯蒂芬·奎克說,他希望這兩篇論文能代表一個全新領域的開始,而后面,還有十年工作等著全球生物學家去做。

搞懂細胞“打開”了哪些基因

每個細胞都帶著同一套基因組,但不會把所有基因都打開來用。

胰腺裡的β細胞會打開胰島素相關基因,負責制造和釋放激素﹔B細胞會打開抗體相關基因,用來對抗疾病﹔皮膚裡的某類細胞,則可能打開和毛發、色素有關的基因。正因為打開的基因不一樣,細胞才分成不同種類。健康細胞和生病細胞不一樣,不同物種的細胞也各有各的表達模式。

這幾年,科學家構建了不少單細胞圖譜,把數萬個基因、數億個細胞的數據存在了數據庫裡。聽起來很壯觀,但它也帶來一個現實問題:這麼多信息,怎麼同時看懂?

奎克表示:“人類大腦不可能做到。而AI模型就是來幫我們做這件事的。”他和團隊計劃用算法處理復雜數據,相當於給研究者們多了一雙“外挂”眼睛。

先“建立坐標”再“完形填空”

兩個模型分工明確。

UCE先來建立坐標,它能把來自不同實驗室、不同組織,甚至不同物種的細胞,都放到同一個抽象的數學空間裡。奎克形容說那不是一個物理空間,而是一個可以衡量“相似還是不同”的坐標系。地球上所有生物的細胞都可以落到這個空間裡,彼此離得近,說明關系近﹔離得遠,說明差異大。這樣一來,原先零散拼不起來的圖譜,就有了統一的底圖。

第二步“TranscriptFormer”上場做完形填空。它的訓練方式很像ChatGPT。ChatGPT作為語言模型,會反復看一段缺了詞的文本,不斷猜缺什麼詞直到猜准﹔“TranscriptFormer”也一樣,隻不過它看的不是詞,而是基因表達值。它反復接觸大量“缺失某些基因數據”的細胞,學著推斷空缺的部分,慢慢就掌握了細胞內部基因協同工作的規律。

模型的訓練數據涵蓋多達12個物種,除人類和酵母外,還有小鼠、兔子、雞、斑馬魚、果蠅、非洲爪蛙、導致瘧疾的寄生虫、海膽、海綿,以及一種叫秀麗隱杆線虫的小蠕虫。從單細胞酵母到人類,演化跨度非常大。也正因為數據夠雜,模型才可能學到跨物種通用的細胞“語言”。

從最簡單的謎題,到想象中的細胞

這種模型有什麼具體用處?研究團隊先拿最簡單的海綿做例子。

海綿沒有神經元,但科學家一直好奇:它體內哪種細胞會和神經元的“祖先”最為接近?模型給出的答案是,一種叫choanocyte的細胞,和線虫、青蛙的神經元在表達空間上很接近。這可幫助研究者們理解神經元是怎麼演化出來的,也重新認識了choanocyte在海綿裡的作用。

有意思的是,海綿裡還有一種名叫neuroid的細胞,名字聽起來很像神經元,但模型發現它的基因表達更像青蛙的腺體,那麼,也許它真正參與的其實是消化。

而對於模型沒訓練過的新物種,只要給出基因表達數據,它也能大致認出有哪些細胞類型。團隊還發現,它能成功區分健康細胞和病變細胞。

更遠一點想,未來也許可用這個模型“想象”一些現在還不存在的功能性細胞,反過來指導細胞療法的設計。當然,奎克也強調,這不是讓AI直接替代生物學家,恰恰是給有經驗的研究者提供一個強大的發現工具,幫他們思考更復雜的問題。

美國國防高級研究計劃局、美國國家科學基金會,以及亞馬遜公司、英國葛蘭素史克公司等多家機構也參與了這一重大研究。對細胞生物學來說,這兩篇論文的真正意義,或許不只是又多了一個AI工具,而是讓細胞研究開始擁有一個可以跨物種、跨疾病反復使用的共同基座。

更多精彩內容,請下載科普中國客戶端。

返回人民網科普頻道

(責編:邢鄭、孫娜)

分享讓更多人看到

返回頂部