PacBio SMRT技術其實也應用了邊合成邊測序的思想,并以SMRT芯片為測序載體。測序時,不需要對目標DNA進行PCR擴增,而是直接在目標片段兩端加上兩個發卡結構的接頭,形成一個連續的環狀結構。也因此,PacBio系統在讀長上顯示了極大的優勢。目前比較受市場熱捧的三代測序是PacBio的RSⅡ和2015年推出的Sequel。
PacBio下機產生的序列文件以HDF5格式存儲。可以采用h5dump命令來查看H5文件內容。
1. 查看堿基序列:
h5dump –d /PulseData/BaseCalls/Basecall raw.h5 > Basecall.info ,文件內容如下:
DATA {(0): 67, 71,67, 67, 65, 71, 67, 71, 65, 65, 84, 71, 71, 67, 84, 71, 67, (17): 71, 71, 71,71, 65, 65, 71, 67, 65, 71, 65, 65, 65, 84, 84, 65, 84, (34): 67, 67, 71, 84,65, 65, 65, 67, 84, 71, 84, 84, 71, 67, 84, 71, 67,
該文件采用的ASCII碼的編碼方式存儲的堿基序列:A=> 65, C=>67, G=>71, T=>84。
2. 查看堿基質量值:
h5dump -d /PulseData/BaseCalls/QualityValue raw.h5 > Basecall.quality,
文件內容如下,其堿基質量值采用與illumina技術一致:
DATA {(0): 51, 44,42, 44, 24, 24, 51, 51, 51, 51, 50, 20, 20, 20, 50, 51, 51, (17): 48, 48, 48,47, 9, 9, 9, 51, 51, 46, 31, 31, 31, 31, 44, 51, 51, 30, (35): 30, 51, 51, 7,7, 7, 7, 51, 51, 44, 44, 44, 51, 51, 50, 27, 27, 26,
2014年春天推出U盤大小的便攜式MinION測序儀,儀器售價僅需$1000,據官網報道最長Reads可長達960 Kb,2014年10月推出平板大小的臺式測序儀PromethION,有48個flow cell,可以單獨運行也可以并行,2017年推出桌面式GridION X5測序儀。
Nanopore目前還主要在測試和生產階段,尚未大規模應用,其應用主要體現在微生物等小基因組生物上。推出至今,其最亮眼的表現莫過于2014年西非埃博拉病毒爆發,MinION以最快的速度破譯病毒序列,名噪一時。隨著獨特的納米孔技術的成熟和完善,未來在即時檢測、太空應用、大眾檢測等方面會有很大的想象空間。
Nanopore測序得到的序列文件的格式基礎也是HDF5(https://support.hdfgroup.org/HDF5/),下機產生后綴為Fast5的序列文檔。Fast5文件可經由Poretools軟件(http://poretools.readthedocs.io/en/latest/)轉換為Fastq文件或Fasta,然后進行后續數據分析。
① 應用Poretools將fast5轉換為fastq,示例見:
http://poretools.readthedocs.io/en/latest/content/examples.html#poretools-fastq
② 應用Poretools將fast5轉換為fasta,示例見:
http://poretools.readthedocs.io/en/latest/content/examples.html#poretools-fasta
總結一下,在測序市場中,一代測序因其準確度高,仍作為突變檢測、單菌鑒定等的金標準而存在;以illumina HiSeq和MiSeq為代表的二代測序勢頭強勁,主打低成本和高通量,2017新機型NovaSeq更宣稱已將測序成本降至百美金;科研市場上三代測序最常見的莫過于PacBio,輔以冉冉上升的新星Nanopore等,主打長讀長策略,直擊二代測序碎片化序列的軟肋,在基因組de novo上表現不俗,錯誤率較高,但可被矯正。
回到我們今天的主題---數據格式上,一代測序主要是讀取峰圖文件后轉化為Fasta格式;二代測序中illumina原始讀取數據為BCL,下游分析中轉化為Fastq格式;454下機序列為SFF格式,后續分析中轉化為Fna-Qual格式使用;Ion Torrent下機序列為WELLS格式,下游分析中轉化為Bam格式;三代測序的兩大主流系統PacBio和Nanopore,其下機數據都以HDF5格式為基礎,后續轉化為Fastq格式進行下游分析。
不管一代、二代還是三代的數據分析中,原始下機數據都以二進制文件為主,原因無他,相比于文本文件,二進制文件在存儲上更為經濟集約。二進制文件本身是難于閱讀的,并且很難改動,所以,我們可以樂觀的認為,二進制文件造假的可能性是很低的。二進制的數據拿到之后,我們想要把數據轉換成正常人能看懂的格式,這時身為文本文件的Fastq就應運而生了,Fastq文件會被用于質控及比對等后續分析。
總之,Fastq是當前最為主流認可的序列數據存儲格式,不管哪一代測序技術,什么樣的原始數據,都免不了要打上Fastq格式的烙印,Fastq文件的格式及使用已經成為高通量測序學習中當仁不讓的第一站。