• <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 發布時間:2021-07-01 15:50 原文鏈接: 三代測序數據漫談

    三代明星:PacBio及其序列數據


    再來看看江湖呼聲漸漲的三代測序技術。目前三代測序市場上,表現最為搶眼的莫過于以PacBio公司的SMRT和Oxford Nanopore Technologies為代表的納米孔單分子測序技術。與前兩代相比,三代測序最為核心的特點就是單分子測序,測序過程無需進行PCR擴增。


    PacBio SMRT技術其實也應用了邊合成邊測序的思想,并以SMRT芯片為測序載體。測序時,不需要對目標DNA進行PCR擴增,而是直接在目標片段兩端加上兩個發卡結構的接頭,形成一個連續的環狀結構。也因此,PacBio系統在讀長上顯示了極大的優勢。目前比較受市場熱捧的三代測序是PacBio的RSⅡ和2015年推出的Sequel。


    PacBio下機產生的序列文件以HDF5格式存儲。可以采用h5dump命令來查看H5文件內容。


    1. 查看堿基序列:

    h5dump –d /PulseData/BaseCalls/Basecall raw.h5 > Basecall.info ,文件內容如下:

    DATA {(0): 67, 71,67, 67, 65, 71, 67, 71, 65, 65, 84, 71, 71, 67, 84, 71, 67, (17): 71, 71, 71,71, 65, 65, 71, 67, 65, 71, 65, 65, 65, 84, 84, 65, 84, (34): 67, 67, 71, 84,65, 65, 65, 67, 84, 71, 84, 84, 71, 67, 84, 71, 67,

    該文件采用的ASCII碼的編碼方式存儲的堿基序列:A=> 65, C=>67, G=>71, T=>84。


    2. 查看堿基質量值:

    h5dump -d /PulseData/BaseCalls/QualityValue raw.h5 > Basecall.quality,

    文件內容如下,其堿基質量值采用與illumina技術一致:

    DATA {(0): 51, 44,42, 44, 24, 24, 51, 51, 51, 51, 50, 20, 20, 20, 50, 51, 51, (17): 48, 48, 48,47, 9, 9, 9, 51, 51, 46, 31, 31, 31, 31, 44, 51, 51, 30, (35): 30, 51, 51, 7,7, 7, 7, 51, 51, 44, 44, 44, 51, 51, 50, 27, 27, 26,


    長到天際:Nanopore及其序列數據


    Oxford Nanopore 公司2005年在英國牛津成立,其運用的納米孔測序技術使得DNA鏈在一個單通道中就能夠被解碼和識別,而不需要將長鏈打斷成小短鏈。由于實現了DNA聚合酶內在自身的延續性和反應速度,Nanopore讀長更長速度更快;同時由于能直接檢測每個堿基的特征性電流,因而能對修飾堿基進行測序,對于表觀遺傳學研究具有極高的價值;因此,這款長到天際的測序儀,非常有潛力橫掃當前測序格局。


    2014年春天推出U盤大小的便攜式MinION測序儀,儀器售價僅需$1000,據官網報道最長Reads可長達960 Kb,2014年10月推出平板大小的臺式測序儀PromethION,有48個flow cell,可以單獨運行也可以并行,2017年推出桌面式GridION X5測序儀。


    Nanopore目前還主要在測試和生產階段,尚未大規模應用,其應用主要體現在微生物等小基因組生物上。推出至今,其最亮眼的表現莫過于2014年西非埃博拉病毒爆發,MinION以最快的速度破譯病毒序列,名噪一時。隨著獨特的納米孔技術的成熟和完善,未來在即時檢測、太空應用、大眾檢測等方面會有很大的想象空間。


    Nanopore測序得到的序列文件的格式基礎也是HDF5(https://support.hdfgroup.org/HDF5/),下機產生后綴為Fast5的序列文檔。Fast5文件可經由Poretools軟件(http://poretools.readthedocs.io/en/latest/)轉換為Fastq文件或Fasta,然后進行后續數據分析。


    ① 應用Poretools將fast5轉換為fastq,示例見:

    http://poretools.readthedocs.io/en/latest/content/examples.html#poretools-fastq


    ② 應用Poretools將fast5轉換為fasta,示例見:

    http://poretools.readthedocs.io/en/latest/content/examples.html#poretools-fasta


    總結一下,在測序市場中,一代測序因其準確度高,仍作為突變檢測、單菌鑒定等的金標準而存在;以illumina HiSeq和MiSeq為代表的二代測序勢頭強勁,主打低成本和高通量,2017新機型NovaSeq更宣稱已將測序成本降至百美金;科研市場上三代測序最常見的莫過于PacBio,輔以冉冉上升的新星Nanopore等,主打長讀長策略,直擊二代測序碎片化序列的軟肋,在基因組de novo上表現不俗,錯誤率較高,但可被矯正。


    回到我們今天的主題---數據格式上,一代測序主要是讀取峰圖文件后轉化為Fasta格式;二代測序中illumina原始讀取數據為BCL,下游分析中轉化為Fastq格式;454下機序列為SFF格式,后續分析中轉化為Fna-Qual格式使用;Ion Torrent下機序列為WELLS格式,下游分析中轉化為Bam格式;三代測序的兩大主流系統PacBio和Nanopore,其下機數據都以HDF5格式為基礎,后續轉化為Fastq格式進行下游分析。


    不管一代、二代還是三代的數據分析中,原始下機數據都以二進制文件為主,原因無他,相比于文本文件,二進制文件在存儲上更為經濟集約。二進制文件本身是難于閱讀的,并且很難改動,所以,我們可以樂觀的認為,二進制文件造假的可能性是很低的。二進制的數據拿到之后,我們想要把數據轉換成正常人能看懂的格式,這時身為文本文件的Fastq就應運而生了,Fastq文件會被用于質控及比對等后續分析。


    總之,Fastq是當前最為主流認可的序列數據存儲格式,不管哪一代測序技術,什么樣的原始數據,都免不了要打上Fastq格式的烙印,Fastq文件的格式及使用已經成為高通量測序學習中當仁不讓的第一站。

     


  • <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 东京热 下载