• <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 發布時間:2021-06-03 10:15 原文鏈接: 機器學習加速探索材料的開發

      設計空間幾何增長是材料設計中的一大挑戰。機器學習(ML)加速探索材料設計已經開始在的這一挑戰中發揮作用,并顯著提高了發現材料的效率。然而,這個流程暗含了密度泛函理論(DFT)產生的訓練集的統計上的偏見。并且,在使用高通量計算產生訓練集的時候,大量的計算會失敗。這種情況對于一些有趣的,例如含有自由基,或者金屬配位鍵的開殼層過渡金屬功能材料和催化過程尤為顯著。雖然這些材料非常吸引人,他們的復雜的電子結構和設計空間的幾何增長使得該類材料設計異常困難。

      在這篇Perspective中,Heather Kulik教授研究組描述了為改進傳統基于DFT和ML的材料設計的流程所做的工作。通過搭建ML模型預測多個密度泛函給出的結果差別,促進了特定材料的敏感性分析。對于高通量計算所產生的的數據,發展了一系列的測試來確保每個數據點的高可靠性。最后,開發一系列機器學習的模型并且使用它們預測計算的成功與否和計算的體系是否含有強關聯性,從而來決定是否需要對特定材料使用更加精確的電子結構方法進行計算。這些模型是邁向全自主化,不需要任何外在干預且穩定的,基于密度泛函理論的材料設計的第一步。

      圖1. 動態分類機的構架圖。抽取計算的中間結果作為卷積神經網絡的輸入,從而預測多個影響最終計算成功與否的因素。

      過渡金屬配合物的計算常常面臨失敗的風險:從幾何結構的角度考慮,最終優化的結構可能會有配位體脫離,第一配位層結構偏離的問題;從電子結構的角度考慮,因為DFT的最終波函數不保持S2,所以優化的波函數可能偏離我們想要的物理特性。一個計算中如果出現了這兩種問題的任意一種,這個計算就是失敗并且無效的。這些問題導致過渡金屬配合物的幾何優化計算的失敗率很高,在特定體系下甚至達到50%,導致了大量計算資源和時間的浪費。

      為了攻克這個問題,作者搭建了人工神經網絡(ANN)模型,通過過渡金屬配合物的化學構成和成鍵信息直接來預測這個結構的最終計算結果成功與否。研究發現這個靜態模型可以在與訓練練集相關的測試數據上表現的很好,有高于95%的準確率。這個靜態模型只使用一半的計算耗費探索絕大部分(88%)的設計空間。但是這個靜態模型的一個顯著問題是:它的表現在面對與訓練集統計上不相關的測試數據時會急劇下降。

      考慮到在計算的過程中會產生很多與電子結構信息相關的中間變量,作者搭建了基于卷積經網絡(CNN)的新模型。這個模型利用這些中間變量,動態的預測并且實時監測著每一個計算過程(圖1)。隨著計算的持續進行,這個動態分類機的準確率越來越高,遠遠超過之前的靜態模型。由于使用了DFT的中間變量作為輸入,這個動態模型的普適性強于靜態模型,對于與訓練集統計上不相關的測試數據也可以給出很好的表現。

      圖2. (左) 根據nHOMO[MP2]和C02判斷配合物是否具有強關聯性。(中)強關聯性分類機的流程圖。(右)不同分類方法表現的對比。

      過渡金屬配合物的另一個顯著問題是可能存在的強關聯性。這是由于它們幾近簡并的d軌道能量決定的。如果一個過渡金屬配合物擁有強關聯性,這往往意味著DFT不能對它給出令人信服的描述。在理論化學的發展中,人們構造了許多基于不同電子結構方法的強關聯效應診斷參數。但是,這些診斷參數之間的整體關聯性不強,對于同一個體系,這些診斷參數很可能會給出不同的答案(圖2,左上)。盡管如此,對于擁有極大或極小診斷參數的體系,所有的診斷參數卻可以給出相似的答案(圖2,左下)。因此,即使不能給所有的數據都令人信服的分類,我們依然可以很確信的對這些擁有診斷參數極值的體系加上標簽(label)。

      基于這個現象,作者搭建了一個半監督分類機(VAT):它既考慮到了這些有共同極值體系的標簽,又考慮到了絕大部分無標簽體系在整個診斷參數空間中的分布。在此過程中,發現基于波函數方法的診斷參數的計算量大卻比較精確,于是作者搭建了一個基于DFT診斷參數和體系幾何構性的核脊回歸(KRR)模型來預測這些基于波函數方法的診斷參數。最終,將這兩個模型結合在一起,構建了一個在DFT消耗下的強關聯性分類機(圖2,中)。研究發現,這個分類機相比較傳統的無監督學習和化學上推薦的二分法,更加能夠有效的區分有無強關聯效應的體系(圖2,右)。

      最后,使用類似的機器學習模型,對大規模(十萬個以上分子)高通量篩選中的電子強關聯效應進行快速識別。這個模型能夠在廣闊的設計空間中迅速的找到“DFT安全島”,將材料設計的重點放在這些有著較高DFT可信度的區域。

      綜上,作者總結了其研究組將機器學習分類機與高通量計算化學結合的幾個工作。這些模型可以更加高效、中立、準確的產生基于DFT的數據,使得材料設計向全自主化,不需要任何外在干預且穩定的方向更近了一步。


  • <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 东京热 下载