導讀: 7月28日,王俊接受了Nature和Science網站的專訪,暢談了他現在想將自己的一生都貢獻給一項新的“研究計劃”的原因,他想構建出一個人工智能健康監測系統,來識別人類個體基因組數據、生理性狀(表型)和生活方式之間的關系。
王俊(Jun Wang)是中國最著名的科學家之一。自從16年前在華大基因(BGI)成立之時加入到這一基因組測序大型機構以來,他參與完成了BGI一系列重大的研究成果。其中包括測序亞洲人、大熊貓和人類腸道微生物組的首個基因組。自2007年起王俊成為BGI的負責人。但在7月17日,這一研究機構對外宣布王俊將會辭去他在BGI擔任的首席執行官職務,轉而從事人類智能研究。
7月28日,王俊接受了Nature和Science網站的專訪,暢談了他現在想將自己的一生都貢獻給一項新的“研究計劃”的原因,他想構建出一個人工智能健康監測系統,來識別人類個體基因組數據、生理性狀(表型)和生活方式之間的關系,從而能夠為個體提供健康生活的建議,及預測和預防疾病。
Nature:你的人工智能計劃背后的理念是什么?
王俊:大體上,我只是想建立一個具有大量數據的人工智能系統。然后,這一系統能夠比我們更好地學習了解人類健康和人類生活。這一人工智能系統將嘗試為生命設置一個公式。生命是數字化的,就像一個電腦程序——如果你想知道這一編程的結果,基因導致表型的機制,由于太過復雜因此你需要一個人工智能系統來找出其中的一些規律。
這一人工智能系統主要是兩個部分組成。第一個是大型超級計算平臺。通過云計算和超級計算中心我們已經可以訪問這些平臺。這些平臺將運行或設計出一些算法來找出基因、生活方式和環境因子之間的關系,預測出表型。另一部分則是海量的數據。我們希望能夠獲得來自100萬個體的數據,我們希望這些數據是流動的,也就是人們可以在任何時間點更新他們的表型信息。其他的大型計算機公司例如Google有可能最終會這樣做,但我們想首先做到這一點。我們有處理海量數據的經驗。
Science:你將會關注人工智能的哪些方面?
王俊:人工智能是人們使用的一個有趣的詞匯。第一個目標是數字化100萬個體的“組學”數據,包括DNA、RNA、蛋白質和代謝組學,并追蹤他們的臨床和行為數據。這需要一些新網絡和利用機器學習,20年前我就已開始擺弄這些東西。
Nature:你需要100萬個基因組來做這個?
王俊:為了真正地了解由許多基因決定的復雜性狀,例如身高,將需要100萬個樣本。我們現在已有了10萬個樣本,但還不夠。但我不想以100萬個作為結束。接下來將會有1000萬,1億個。并且不只是基因組。我們將獲得許多方面的數據——基因組學、蛋白質組學、代謝組學和脂類組學。以及其他的“組學”數據,我們將納入你的生活信息,你的鍛煉情況,環境數據。所有這一切都將成為它的組成部分。每人我們將獲得一萬億字節,那么100萬人將是百億億字節。
從基因型到表型所有東西都可以數字化。為了讓人工智能系統能夠運作,我們必須使其數字化。相比于基因組學,我更關注數字化生命。這不是一個百萬基因組計劃,而是一個百萬數字化生命計劃。
Nature:最終的目標是什么?
王俊:最終的目標是開發出一個生態系統。這將是一個虛擬的村莊。當人們“待”在這一虛擬村莊中時,它將會向人們提供一些建議如何能夠生活得更健康和更長壽,包括建議他們應該吃些什么,應該進行怎樣的鍛煉。它可以在人們感到抑郁之前告知他們一些預警信號;當人們感到壓力時,它會告訴他們如何來釋放壓力。所有這些建議都是建立在包括遺傳構成和生活方式在內的各種因素基礎之上。個體、醫生、研究人員和制藥公司將成為它的組成部分。
即便人工智能系統不能找到這些答案,一些制藥公司或許能。這些數據將仍然是有價值的。
Nature:你將如何為這一計劃籌措資金?
王俊:我想要生成基于100萬份樣本的第一個原型我有可能要設法籌措100億元人民幣(16億美元)的資金。我還沒有真正地思考如何弄到這筆錢。如果你在做正確的事——如果你有一個虛擬村莊可以讓人們生活得更長壽、更健康——錢將會隨之而來。我將會在幾個商業模式上試水。每一個都將通過幾種途徑來設法讓人們追隨這一平臺。我不知道哪種將會成功。或許我們必須招募1000萬人來得到一個100萬人的完整數據集。但誰在乎。讓我們行動起來吧。
Science:是什么促成了這一決定?
王俊:有幾個原因。最大的原因是當我還是一名大學生時我就接受了人工智能培訓。對于我而言,生命科學和基因組學現在在處理來自數以萬計樣本的數據方面遇到了瓶頸,仍然沒有足夠地了解疾病的遺傳學。分析這些龐大的數據集需要一些新的工具。人工智能和機器學習可以處理大型數據,也可以為人們的健康做點事情。
Nature:這一計劃是你辭去華大基因首席執行官職務的唯一原因嗎?有一些傳言說,是因為你沒有成功讓公司上市而被迫辭職的。
王俊:人們猜測了很多的原因,這讓我覺得很煩。首次公開招股(IPO)的計劃正照著正確的路線進行。我辭去首席執行官職務的一個主要原因是,當前BGI正日益成為一個診斷學或研究服務模式,它現在相當的穩定。我想做的不只是這些。但BGI將仍然是這一新計劃的一個重要組成部分。
Science:你將如何讓人工智能系統融入到BGI的總體戰略中去?
王俊:人工智能系統只是分析數據的一種方法。BGI將參與其中,但我還將尋找一些戰略合作伙伴、大型信息數據公司和一些小數據公司。策略將會發生演變。目標是通過生成讓整個衛生保健系統能夠獲取的數據來服務于普通百姓。這將需要科學和服務。它或許最終會有一些商業模式就像老BGI一樣,將會有研究,也會是一個商業產品。
Nature:有人擔心這聽起來太過雄心勃勃,對此你想說什么?
王俊:我不知道。我只是做去。我經歷過很多事情。此前人們也說過我有一些瘋狂的想法——水稻基因組計劃或短讀取組裝熊貓基因組(這是利用小片段來進行下一代測序的一個有影響力的范例)。但你知道,結果都相當不錯。
這是我一輩子的研究計劃。在我退休之前,我想做到這一點。我現在39歲,因此我希望能夠在未來的20年里讓整件事發生。我有點緊張,但也感到很興奮,因為我知道我在做正確的事情。我是一個敢于冒險的人,我在用我所有的信譽下這個賭注。
Science:當你開始在BGI工作時,你曾想象到它會變成今天的樣子嗎?
王俊:我不能說我們設計了BGI變成今天的樣子。但我們在某個時間點會遵循戰略思維,并且它在演變。我是一個敢于冒險的人,我總是在瞄準一些更大、更具挑戰性的東西,一些可以改變世界的東西。BGI走到了今天,這是我離開的好時機。
近日,湖北省農業科學院果樹茶葉研究所聯合華中農業大學園藝林學學院,在柑橘風味品質形成機制研究中取得新進展。研究團隊鑒定出一個可同時調控蔗糖積累與檸檬酸代謝的關鍵基因模塊,為柑橘風味品質定向改良提供了新......
3月25日,市場監管總局政務服務平臺全新上線。平臺圍繞便利群眾和企業辦事需求完成全方位優化升級,以更規范的政務服務、更高效的辦事功能、更貼心的便民設計,實現“數據多跑路、群眾少跑腿”,顯著改善用戶體驗......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......
2026年全國兩會期間,數據領域相關話題成為眾多全國人大代表和全國政協委員關注的焦點。我們綜合各類媒體和平臺的公開報道,對2026年兩會中有關數據工作的建議提案進行了梳理,傾聽代表委員聲音,不斷提升數......