计算与计算机模拟方法

药物设计中的机器学习

药物设计中的机器学习,意味着让算法从过往实验中学习规律,而不是靠人手写规则。把成千上万个已测得效价、溶解度或毒性的分子展示给模型,它就学会为新分子预测这些性质,正如孩子是通过大量示例而非定义来认识猫的。

实际操作中,分子先被转化为数字,方式包括分子描述符、指纹,或从原子和键的原始图谱中学到的表示。随后训练一个模型,从简单回归到随机森林再到深度神经网络,把这些输入映射到某个被测量的终点,例如结合亲和力或代谢稳定性。训练完成后,它能廉价地为未测试分子打分,帮助化学家排定该合成哪些。

其许诺在于速度与规模,但陷阱很严重且容易被忽视。模型可能死记硬背训练集,而在真正全新的化学上失效;可能被数据中隐藏的偏差所蒙蔽;并且对自己为何如此预测几乎给不出解释。诚实的使用要求在留出的化合物上进行严格验证、对适用域保持警觉,并把预测当作排序的辅助而非确凿真相。

要提防数据泄漏,即测试集的信息渗入了训练,从而夸大了表观的准确度。一个在纸面上看似出色的模型,对真正新颖的分子可能毫无用处。

又称
ML in drug discovery药物发现中的机器学习藥物發現中的機器學習