非週期、複雜與前沿結構

材料資訊學(materials informatics)

在歷史的大部分時間裡,找到更好的材料意味著實驗室裡緩慢的試誤——混合、加熱、測試、重複,一做就是好幾年。材料資訊學問的是另一個問題:如果我們把所有那些實驗與計算累積下來的結果當作「數據」,讓電腦去學習藏在其中的模式,會如何?它是把數據科學、統計與機器學習應用於材料——挖掘龐大的結構與性質資料庫,找出關係、預測未測材料的性質,並建議下一步該做什麼。它是與結構預測那種「從物理計算」路徑相對的「從數據學習」夥伴。

引擎是找模式的機器學習模型,燃料則是資料庫。過去十年,一些計畫計算了數十萬種化合物的性質,並蒐集進開放的儲存庫(Materials Project、OQMD、AFLOW 等)——這正是材料基因組計畫那個想法的實際實現:一個可搜尋的材料數據「基因組」能加速發現。模型在這些數據上受訓:你用數值的「描述子」或「特徵」來描述每種材料(它的組成、以數值編碼的結構、它的鍵結),模型就學會從那些特徵到某個性質的映射——硬度、能隙、熔點、甚至是否穩定。訓練好之後,它能在幾毫秒內為一個全新的候選估計那個性質,遠比實驗或完整的量子計算都快,讓你能篩選數百萬種可能、標出少數值得真正研究的。

材料資訊學之所以重要,是因為它大幅加速了在浩瀚可能材料空間中的搜尋,而且它恰好在結構預測昂貴之處表現出色——提供快速、便宜的性質估計,來為候選排定優先序。不過要坦白說明它是什麼、不是什麼。機器學習模型是在對它的訓練數據中的模式做內插;它的好壞取決於那些數據,而當被要求外推到它從未見過的全新化學時,它通常會失敗。它找到的是相關,而相關不總是因果,且它通常無法解釋預測背後的物理。今日的最佳做法是把它與基於物理的計算及實驗配對——用資訊學快速縮小範圍,用第一原理與實驗室來驗證——而非單獨信任模型。

為尋找新的電池正極,一個在 Materials Project 資料庫上訓練的模型,一個下午就估出數萬種假想鋰化合物的電壓與穩定性。它把它們排序,只有排在最前面的數十種被交給昂貴的量子計算、然後送進實驗室——一個把數年的盲目試誤變成數週有的放矢工作的漏斗。

材料資訊學:從大型資料庫學習結構-性質模式,快速篩選數百萬候選——材料基因組的理念。

模型的好壞取決於它的訓練數據,而且它做的是內插而非外推——面對真正新的化學時常常失敗,找到的是相關而非因果,也無法解釋物理。最好用來為基於物理的計算與實驗排定候選優先序,而不是取代它們。

又稱
materials data sciencemachine learning for materialsthe Materials Genome approach材料數據科學材料基因組