中國科學院上海藥物研究所研究員鄭明月團隊開發了一種由大型語言模型驅動的NMR數據提取工具NMRExtractor,能夠從海量開放獲取的文獻中自動提取實驗性核磁共振(NMR)數據,并構建出了迄今為止規模最大的開放式NMR數據庫NMRBank。5月28日,相關研究發表于《化學科學》。
NMR光譜是化學研究中強大且應用廣泛的技術之一,能夠提供分子環境的詳細信息,對結構和原子間相互作用非常敏感。在過去二十年中,研究人員開發了多個數據庫用于存儲分子的1H和13C NMR光譜,但這些數據庫的規模仍較為有限。
研究團隊提出的NMRExtractor,可自動從科學文獻中提取化合物名稱、NMR條件和1H/13C NMR化學位移等關鍵信息。基于該工具,研究團隊構建了NMRBank,其中包含225809條NMR數據記錄,每條記錄包括化合物的IUPAC名稱、SMILES描述符、1H/13C NMR化學位移、模型賦予的置信度評分,以及文章PMID和期刊名稱等元數據。分析結果顯示,NMRBank所覆蓋的化學空間顯著超越現有的公共NMR數據集。

研究團隊表示,該提取流程具備高度可擴展性,支持新研究論文的自動處理,使NMRBank可持續更新,不僅拓展了開放NMR數據的覆蓋范圍,也為基于人工智能的NMR預測及相關化學研究奠定了數據基礎。
相關論文信息:http://doi.org/10.1039/d4sc08802f