• <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 發布時間:2021-06-23 14:58 原文鏈接: RNAseq綜述(二)

    短讀長cDNA測序

    短讀長已經成了在整個轉錄組范圍內對基因進行檢測和定量的事實方法(de facto method),部分原因是這種方法比芯片成本更低,操作更方便,但是其主要原因還是因為這種方法能生成更全面,更高質量的數據,這種方法能夠 對整個轉錄組中的基因表達水平進行定量。使用Illumina短讀長測序平臺進行DGE分析的核心步驟包括:RNA提取、cDNA合成、接頭連接、PCR擴增、測序和數據分析(FIG1)。在這個過程中,存在打斷片段,片段長度選擇和基于磁珠的文庫純化這些操作,因此這種方法產生的cDNA片段通常都是在200bp以下。RNA-seq文庫的測序讀長分配到每個樣本上的話,每個樣本會測到平均20-30 million條讀長(reads)(也就是常說的20-30M條讀長),數據經過處理后,使用這些讀長對每個基因或轉錄本進行定量,最后再用統計學方法來統計基因的差異。短讀長RNA-seq方法很穩健,并且通過對短讀長測序技術的大范圍比較發現,這種技術在平臺內和平臺間的相關性很好。但是,在樣本制備和數據分析這兩個階段會引入一些干擾和偏倚。這種局限可能會影響通過實驗來解決特定生物學問題的能力,例如準確識別和量化多個異構體中的哪個來源于一個基因。對于研究那些非常長,高度可變的轉錄本異構的人來說,這種局限表現得尤為明顯,例如在人類轉錄組研究中;人類轉錄本的長度范圍是109bp到186kb,其中50%轉錄本長度大于2500bp。盡管短讀長RNA-seq可以對最長的轉錄本進行詳細的分析,但是涉及的實驗方法不能擴展到全轉錄組分析。其他的偏倚與局限來源于那些大量的計算方法,這些方法包括例如如何處理模糊或多個回貼的讀長(multi-mapped reads)。現在出現了一種合成長讀長(synthetic long reads)的新方法,這種方法可以實現全長的mRNA測序,并試圖解決其中的一些局限。這種方法使用了唯一分子標識符(unique molecular identifiers,UMI)來標記全長的cDNA,在制備短讀長RNA文庫之前,加入的UMI會隨著單個cDNA分子而進行復制。轉錄本異構體可以在高達4kd的contigs中重建,用于發現異構體和表達分析。但是,對于從根本上解決短讀長cDNA測序固有局限的最可能解決方案則是長讀長cDNA測序和dRNA-seq測序 。

    長讀長cDNA測序

    雖然Illumina測序目前是占主導地位的RNA-seq平臺,但PacBio和Oxford Nanopore(ONT)公司都提供了可供選擇的長讀長技術,能夠對完整的單個RNA分子進行單分子水平級的測序。通過消除短RNA-seq測序數據的組裝這一步,這些新方法克服了短讀長測序方法相關的一些問題。例如,減少了測序讀長回貼過程中的歧義,并且可以識別更長的轉錄本,這樣就能獲取更完整的異構體多樣性信息。這些方法還能降低許多短讀長RNA-seq計算工具中關于剪接連接的假陽性。

    PacBio的Iso-Seq技術可以讀取最高可達15kb的轉錄本的全長cDNA,這就有利于發現大量以前未注釋的轉錄本,并通過檢測物種的全長同源序列證實了早期的基因預測。在標準的Iso-Seq操作流程中,高質量的RNA被一個模板切換凝聚力轉錄酶(a template-switching reverse transcriptase)反轉錄為全長的cDNA。生成的cDNAs再經過PCR擴增,加入到PacBio的單分子實時(single-molecule, real-time)文庫制備系統中。制備好的短轉錄本序列可以很快地擴散到測序芯片的活性表面,但由于短轉錄本的測序存在偏倚,因此在對轉錄本進行測序時,建議選擇片段的長度是1到4kb,這樣就能在此范圍對長轉錄本和短轉錄本進行更加均勻地采樣。由于PacBio測序方法需要大量的模板,因此需要進行多輪PCR,不過這一操作還需要進行優化,從而降低擴增導至的偏倚。經過PCR的末端修復和PacBio SMRT接頭連接后,就可以進行長讀長測序了;通過修改測序芯片的上樣條件,就可以在這一步驟進一步控制測序片段長度。

    ONT cDNA測序方法也能產生全長的轉錄本讀長,甚至還能在單細胞水平上產生該讀長。模板轉錄逆轉錄酶也在這種方法中用于制備全長cDNA,制備好的cDNA可以選擇使用PCR來進行擴增,隨后在產物上加上接頭,形成測序文庫。直接cDNA測序會消除PCR偏倚,從而形成高質量的測序結果;但是,如果使用PCR來制備測序文庫的話,需要的RNA數量更少。ONT cDNA測序法尚未報道過在PacBio測序儀上觀察到的片段長度偏倚。

    這兩種長讀長cDNA方法都受到標準模板切換逆轉錄酶使用的限制,這種逆轉錄酶能用全長RNA以及截短的RNA來生成cDNA。逆轉錄酶可以將那些只含5?帽子結構的mRNA置換為cDNA,這樣的話,那些由于RNA降解,RNA剪接或不完全cDNA合成而生成的短轉錄本就不會被反轉錄為cDNA,從而提高數據質量。但是,有報道指出,逆轉錄酶會對ONT平臺的讀長產生不良影響。

    長讀長直接RNA測序

    前面我們提到了長讀長測序方法,這種測序方法與短讀長測序平臺一樣,它們都依賴于將mRNA轉換為cDNA。而最近Oxford Nanopore指出,他們的納米孔測序技術可以直接對RNA進行測序,也就是說,這種測序手段不需要常規測建庫過程中的的cDNA的合成和/或PCR擴增操作。這種方法稱為dRNA-seq,這種方法就消除了常規建庫過程中的偏倚,并且能夠保留表觀遺傳學信息。這種方法可以從RNA直接進行兩個接頭的連接來制備文庫。首先,帶有一個oligo(dT)懸臂的雙鏈核酸接頭退火并連接到RNA的多聚腺苷酸(PolyA)尾部,隨后就是可選(但不推薦的)的逆轉錄操作,這一步用于提高測序的通量。第二個連接操作就是添加測序接頭,這個測序接頭上已經提前安裝有驅動測序的馬達蛋白。文庫隨后進行MinION測序,其中RNA直接從3?poly(A)尾部向5?cap端進行測序。最初的研究表明,dRNA-seq的測序長度過超過1000bp,最大測序長度過超過10kb。與短讀長測序相比,這種長讀長測序的幾個優勢在于:長讀長測序可以提高對異構體的檢測,并且它們還可以用于下方代碼poly(A)尾巴的長度,這對于可變poly(A)分析( alternative poly(A) analysis)來說非常重要。Nanopolish-polya這個工具可以對那些用納米孔測序得到的數據進行分析,計算出poly(A)尾的長度,這就包括基因之間的長度,也包括轉錄亞型之間的長度。這種分析證實了,保留內含子的轉錄本比完全剪接的轉錄本具有略長的poly(A)尾巴。雖然dRNA-seq還處于起步階段,但是它具有檢測RNA堿基修飾的潛力,因此它的應用潛力巨大,尤其是能夠對表觀遺傳學轉錄進行新的分析。

    長讀長與短讀長技術的比較

    雖然長讀長技術在評估轉錄本方面比短讀長技術有一些明顯的優勢,但是長讀長技術也有一些明顯的局限。尤其是與短讀長技術相比,長讀長技術的測序通量更低,錯誤率更多。但長讀長技術的主要優勢在于,它們能夠捕獲更多的單個轉錄本,不過這依賴于高質量的RNA文庫。總體來說,這些局限影響了那些完全依賴于長讀長測序實驗的靈敏性(sensitivity)與特異性(specificity)。

    長讀長測序方法的主要局限就是當前的通量。在Illumina平臺上,運行單次的RNA-seq可以生成10E9-10E10條短讀長,但是在PacBio和ONT平臺上,一次RNA-seq則只能產生10E6-10E7條讀長。這種低通量限制了應用長讀長測序技術進行實驗的規模,并降低了對差異基因表達檢測的靈敏性。然而,并非所有的實驗都需要高深度測序。對于那些主要研究異構體的發現以及其特征的研究者們來說,測序長度比測序深度更重要。例如1百萬個PacBio環形一致性測序(circular consensus-sequencing, CCS)的讀長幾乎就可以保證產生那些大于1kb的高表達基因的檢測,ONT測序技術也是如此。因此,對于那些低到中等水平表達的基因來說,測序深度確實是一個主要問題。當進行同期功能基因組學分析(contemporary functional genomics analysis)大規模的DGE實驗時,這種低通量測序技術的局限就會表現得明顯。在這些研究中,必須對多個樣本組進行分析,每組就是由多個生物學重復構成的,這樣就能夠實現充分的統計功效來有確認那些在整個轉錄組水平上發生的精確變化。對于這種需求,長讀長技術不太可能取代短讀長技術,除非長讀長的測序讀長的生成量能提高2個數量級。隨著全長RNA-seq讀長數目的增加,轉錄本檢測的靈敏度將會增加到類似于Illumina平臺上的這種水平,并同時具有更高的特異性。與此同時,通過將Illumina 的短讀長RNA-Seq與PacBio的長讀長Iso-Seq結合(并且可能還與ONT方法結合),可以增加全長RefSeq注釋的異構體檢測的數量、靈敏性和特異性,同時保留轉錄本量化的質量。雖然長讀長RNA-seq方法目前的實驗成本較高,但它們可以檢測到短讀長方法遺漏的異構體,尤其是那些難以測序但與臨床相關的區域,例如高度多態的人類MHC或雄激素受體。

    長讀長測序平臺的第二個主要局限就是其更高的錯誤率,它比成熟的Illumina測序儀要高出一到兩個數量級。長讀長測序平臺上生成的數據還包含更多的插入-刪除錯誤。雖然這些錯誤與識別變化(variant calling)有關,但在RNA-seq中,每個堿基都被正確識別并非那么重要而長讀長測序的目標是要闡明轉錄本和異構體(While these error rates are of concern for variant calling, in RNA- seq it is less crucial that every base be called correctly, as the goal is only to disambiguate transcripts and isoforms)。這種錯誤率對于其應用來說確實是一個值得觀注的問題,現在正在解決這一問題。PacBio SMRT測序平臺上出現的隨機錯誤通常可以通過使用CCS增加測序深度來進行解決,在這種技術里,cDNA經過長度選擇和接頭進行環化后,每個分子就可以被多次測序,從而產生長度范圍是10-60kb的連續長讀長,并且包含許多原始cDNA的拷貝。這些長讀長經過數據分析后就被處理為單個cDNA子子讀長(subreads),這些子讀長被組合后就可以產生一致的序列。分子測序的次數越多,產生的錯誤率就越低;CCS已經被證明可以將錯誤率降低到與短讀長相當的水平,甚至更低。但是,將更多的這個平臺的測序能力用于重新讀取相同的分子,就又加劇了其測序通量的問題,因為可以讀取的唯一轉錄本變得更少了。

    長讀長RNA-seq方法的靈敏度還受到其他幾個因素的限制。首先,它們依賴于長RNA分子以全長轉錄本的形式進行測序,但是要達到這種情況并非總能實現,因為在樣品處理和RNA提取過程中RNA會發生降解或剪接。這種情況在短讀長RNA-seq中也存在(3?端的偏倚),但這種問題在短讀長中是可控的,對于全長轉錄組分析進行研究的研究者們來說,即使是低水平的RNA降解,也能限制長讀長的RNA-seq效果。因此,對于那些即將使用長讀長進行測序的研究者來說,需要仔細地對提取的RNA進行質控。其次,中位數的讀長長度會進一步受到文庫制備中的技術問題與偏倚的限制,例如有些cDNA合成的截斷或某些cDNA是由降解的mRNA合成的,最近開發的高效逆轉錄酶對此有所改進,這些酶有著更高的鏈特異性,甚至能夠產生更多的3?-5?轉錄本的覆蓋。雖然這些酶還未被廣泛使用,但是這些高效逆轉錄酶也提高了結構穩定的RNAs,例如tRNAs的覆蓋率,在oligo-dT和全轉錄組分析(WTA)方法中使用的逆轉錄酶很難處理這些結構穩定的RNAs。第三,長讀長測序平臺固有的偏倚(例如長文庫分子在測序芯片表面上的低擴散)會降低更長轉錄本的覆蓋率。

    長讀長方法(使用cDNA或dRNA-seq)解決了用于異構體分析的短讀長測序方法中的一個基本問題,即它們的讀長長度。長讀長方法可以生成從Poly(A)尾部到5?cap的跨異構體的全長轉錄本讀長。因此,這些方法使得分析轉錄本及其異構體成為可能,從而無需從短的讀長中重構它們或推斷它們的存在;每個測序的讀長僅僅代表了它的起始RNA分子。全長cDNA測序或dRNA-seq用于分析DGE的未來應用將依賴于PacBio和ONT技術的更高通量。長讀長RNA-seq分析正被研究者們迅速采用,并與深度短讀長RNA-seq數據結合起來,用于更全面的分析,這非常類似于基因組組裝所采取的混合方法。隨著時間的推移,長讀長和dRNA-seq方法可能會用于證明已經鑒定的基因和轉錄本的列表,即使在研究很透的生物中,對于基因和轉錄本的研究也還遠遠不夠。隨著方法的成熟,以及測序通量的增加,差異轉錄本分析將會成為常規方法。合成長讀長RNA-seq或其它技術的發展將對這個領域產生什么樣的影響,還有待觀察。然而從目前來看,Illumina短讀長RNA-seq依然占據了主導地位,在這篇綜述的剩下部分中我們將會集中討論短讀長測序。


  • <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 东京热 下载