计算与计算机模拟方法

化学信息学

化学信息学是一门教计算机把分子当作数据来处理的技艺,就像生物信息学处理基因和序列那样。任何模型在排序或预测之前,总得有人来存储数以百万计的结构、对它们进行检索、比较,并清洗杂乱的数据,而这套底层管道正是化学信息学。

它的基本构件包括:把分子写成文本或编码的方法,例如用单个字符串描述结构的线性表示法;以及计算分子描述符和分子指纹、度量分子间相似性、检测重复、标准化电荷和互变异构体、并把化合物库组织起来以便快速检索的各种方法。正是这些基础才使虚拟筛选、QSAR 和机器学习成为可能。

尽管听上去像单纯的记账,优秀的化学信息学却是可靠分析与误导性分析之间的分水岭。一些细微问题,例如同一分子被写成两种不同形式、盐型不一致,或活性数值来自互不可比的实验,都可能悄无声息地污染模型。计算药物发现中很大一部分真正的工作,正是化学信息学所提供的那种细致而不起眼的数据清理。

在这里,垃圾进、垃圾出的道理体现得淋漓尽致:机器学习模型的可信度,完全取决于喂给它的、经过清理的化学与实验数据。

又称
chemoinformatics化学信息处理化學資訊處理