機器學習於陶瓷(machine learning for ceramics)
第一原理計算從物理定律預測一種陶瓷。機器學習走相反的路:它從數據學習。餵給模型數千個已知的組成或製程紀錄,每一個都標註了它所產生的性質,模型便學會連接兩者的模式——這樣當你交給它一個它從未見過的新配方時,它就能預測性質,而無須任何人去解背後的物理。這是大規模的模式比對,被變成一種工具,用來猜下一個該做哪種陶瓷。
流程說起來很簡單。第一,把每種材料表示成一串數字,也就是它的特徵:組成的描述子(平均原子半徑、電負度、價數)、結構的、以及製程的(燒結溫度、時間、氣氛)。第二,用一組「特徵配對量測性質」的資料集,訓練一個模型——隨機森林、高斯過程、或神經網路。第三,用訓練好的模型去預測並排序尚未嘗試的候選,再讓主動學習或貝葉斯最佳化挑出資訊量最大的那一個實驗來做,把迴圈閉合。這在物理糾纏到無法直接計算之處特別有力:高熵陶瓷那天文數字般龐大的組成空間,或從燒成排程到最終密度與晶粒尺寸那種雜亂、經驗性的關聯。
機器學習於陶瓷之所以重要,是因為它能加速發現、最佳化那些沒有方程式能好好描述的製程排程、並讀取顯微組織影像來預測性質。但要一絲不苟地老實:模型的好壞取決於它的數據,而陶瓷數據稀少、有雜訊、偏向已被嘗試過的東西、且回報方式參差不一。模型在它受訓的空間內能內插,但一旦越界就外推得很糟,而且它不懂物理——它會欣然輸出一個自信卻荒謬的預測。垃圾進、垃圾出。機器學習是一盞探照燈,但仍需要領域知識來瞄準它、需要實驗來確認它找到的東西。
為了找出熱傳導低的高熵碳化物,一個團隊用已量測的數百個組成訓練模型,讓它為數百萬種尚未嘗試的五金屬混合排序,只合成它標出的最頂尖那幾個,再把結果餵回去讓模型變得更準——在數週而非數年內就逼近一個好候選。
從數據學會模式,為尚未嘗試的數百萬種排序,只測最好的,再閉合迴圈。
模型不可能比它的訓練資料懂得更多。陶瓷資料集又小、偏向已被探索過的配方、回報又不一致,所以一個自信的機器學習預測若落在該範圍之外,可能大錯特錯。