希望組面向全球釋放三代測序數據高效糾錯、組裝軟件NextDenovo最新版本V2.0-beta.1 (https://github.com/Nextomics/NextDenovo),并免費開放用于學術和其他非商業用途。據悉,本次希望組發布的最新版本NextDenovo是專為三代測序數據開發的糾錯、組裝軟件,不但解決了現有三代測序數據組裝工具資源占用大、運行時間長、組裝質量不穩定的瓶頸問題,還實現了單Contig一條染色體和超大型基因組組裝的突破,為利用三代數據組裝基因組掃清了組裝算法的障礙。
三代測序數據組裝已經成為基因組De novo的主流方案,其中Nanopore的讀長可達數百kb甚至超過2Mb,在解決染色體著絲粒/端粒區域、性染色體等基因組復雜區域以及復雜基因組組裝問題方面,具有更大的優勢[1]。前不久,加州大學圣克魯斯基因研究所等單位的研究人員利用Nanopore的ultra-long reads成功拼接出了首個人類X染色體基因組完成圖序列[2]。
但目前的組裝算法仍存在較多的瓶頸,使三代測序的優勢不能完全發揮。現有三代測序數據組裝軟件如:Falcon[3]、Canu[4]、Miniasm[5]、Wtdbg[6]等存在以下幾類問題:
1. 部分軟件不具備糾錯功能;2. 糾錯過程耗費大量時間和計算資源;3. 組裝出的基因組準確度不夠;4. 組裝出的基因組大小與預估有偏差。
針對以上問題希望組胡江團隊研發出專門用于三代測序數據糾錯、組裝的軟件——NextDenovo。其包含NextCorrect和NextGraph兩個模塊,依次進行測序數據的高效糾錯、組裝,在極大減少計算資源和運行時間的情況下,仍然能夠組裝出高質量基因組。基于NextDenovo,希望組已經實現了小基因組物種近完成圖和>10Gb基因組物種的組裝工作。
高效糾錯
NextDenovo原始數據糾錯模塊可對PacBio和Nanopore的三代測序原始數據進行糾錯。表1為NextDenovo與現有主流三代測序數據校正工具(Canu、Falcon和Racon[7]),對不同三代測序平臺(PacBio和Nanopore)數據的糾錯性能比較。NextDenovo能夠在極大減少運行時間的情況下,達到甚至高于與其他軟件的糾錯精度。
高效組裝NextDenovo組裝模塊是基于String graph算法,利用糾錯后的三代測序數據進行基因組高效組裝。之前的評測結果https://mp.weixin.qq.com/s/8P9KeTpGc5-hIpVy4T4XxQ表明利用相同的Nanopore數據,NextDenovo在組裝速度、結果連續性等指標均明顯優于Canu。
高準確度
Nanopore數據用NextDenovo組裝的結果再結合NextPolish直接進行2輪或多輪二代數據polish后,平均堿基準確度能達到99.99%以上(關于NextPolish的詳細評測結果見https://github.com/Nextomics/NextPolish/blob/master/doc/TEST1.pdf)。
NextDenovo組裝案例
在實際項目應用中,NextDenovo的表現非常搶眼,某禾本科植物Plant1基因組組裝Contig N50高達66.3Mb,某同源多倍體植物Plant2的Contig N50也達到了59.7Mb(表2)。與參考基因組比對的共線性圖幾乎呈一條對角線(圖3)。值得一提的是這兩個物種基因組都含有大量的重復序列,而NextDenovo的組裝版本鄰接性要遠高于其他版本。
NextDenovo的組裝案例
單Contig一條染色體
利用NextDenovo軟件對水稻93-11(Oryza sativa L. 2n=24)的273X深度ONT測序數據進行組裝。最終獲得的水稻93-11基因組僅包含18條 Contigs,Contig N50 高達29.43Mb。水稻93-11基因組的12對染色體中,至少有一半的單條染色體由單個Contig裝出。BUSCO評估顯示,在該組裝中可以找到約98.1%的完整基因元件,反映組裝結果真實可靠。進行基因組單堿基錯誤率的統計,該組裝基因組的單堿基準確率在99.99%以上。與其他組裝策略相比,利用Next系列軟件組裝的水稻93-11基因組質量明顯優于其他組裝結果[8]。
超大型基因組
超大型基因組大量高重復區域和動輒Tb級別的數據量對組裝算法是一個巨大挑戰。NextDenovo能夠很好的處理超大型基因組組裝問題,對一個預估基因組11.02Gb的超大型基因組進行組裝,NextDenovo組裝版本的基因組與預估大小非常接近約為10.42Gb,Contig N50達5.02Mb,明顯優于常規基因組組裝工具(表3)。
自成立以來,希望組致力于三代測序技術應用與服務。2017年,希望組搭建Oxford Nanopore測序平臺以來陸續開展ONT Ultra-long測序、低起始量建庫測序等前沿技術研發工作,并率先于2017年底推出ONT Ultra-long測序服務,目前已經完成近百個物種的ONT Ultra-long測序、組裝工作。該公司自主研發的基于ONT數據的系列組裝、糾錯算法軟件NextDenovo、NextPolish,在運行效率、組裝質量、適用范圍方面均優于現有組裝工具,實現了單Contig一條染色體和超大型基因組組裝的突破。在分析服務方面,希望組與華為云合作,將納米孔測序數據分析流程整合到云計算平臺上,實現急速基因組組裝與注釋,為全球客戶提供快速、高效的納米孔長讀長測序計算和存儲服務。在三代測序服務領域,希望組技術頂尖,算法領先,服務全面,目前已完成了數百個三代測序科研項目,在Nature genetics、Nature Communications、Molecular Cell、Developmental Cell等國際權威雜志合作發表多篇研究論文,累積影響因子超過380。