計算與電腦模擬方法
藥物設計中的機器學習
藥物設計中的機器學習,意味著讓演算法從過往實驗中學習規律,而不是靠人手寫規則。把成千上萬個已測得效價、溶解度或毒性的分子展示給模型,它就學會為新分子預測這些性質,正如孩子是透過大量示例而非定義來認識貓的。
實際操作中,分子先被轉化為數字,方式包括分子描述符、指紋,或從原子和鍵的原始圖譜中學到的表示。隨後訓練一個模型,從簡單迴歸到隨機森林再到深度神經網路,把這些輸入映射到某個被測量的終點,例如結合親和力或代謝穩定性。訓練完成後,它能廉價地為未測試分子打分,幫助化學家排定該合成哪些。
其許諾在於速度與規模,但陷阱很嚴重且容易被忽視。模型可能死記硬背訓練集,而在真正全新的化學上失效;可能被數據中隱藏的偏差所蒙蔽;並且對自己為何如此預測幾乎給不出解釋。誠實的使用要求在留出的化合物上進行嚴格驗證、對適用域保持警覺,並把預測當作排序的輔助而非確鑿真相。
要提防數據洩漏,即測試集的資訊滲入了訓練,從而誇大了表觀的準確度。一個在紙面上看似出色的模型,對真正新穎的分子可能毫無用處。
又稱
另見