计算与计算机模拟方法

分子指纹

分子指纹是一长串由 1 和 0 组成的字符串,用来编码一个分子含有哪些结构特征,就像一份核对清单,分子若具备某一特定片段,相应的格子就被打勾。正如人的指纹用一个紧凑的纹路概括了身份,分子指纹用一个紧凑的比特串概括了结构。

不同的指纹方案选取不同的特征。有些方案针对一部固定的化学模式词典,为其中每个子结构打一个勾。另一些方案,例如环形指纹,会枚举每个原子周围在给定半径范围内的原子环境,并把它们散列成比特位。无论哪种方式,结果都是一个向量,计算机可以极快地对其进行比较,即便面对数以百万计的分子也是如此。

它们的主要用途是度量相似性:两个分子若其指纹共享许多置位的比特,就被判定为结构相似,通常用一个相似性系数来量化。这驱动了相似性检索、化合物库的聚类,以及通往机器学习的一条路径。需要注意的是:指纹相似性是化学相似度的替代指标,而非生物活性的指标,因此两个分子在指纹上看似相似,行为却可能大相径庭,这又回到了活性悬崖问题。

塔尼莫托系数是衡量指纹相似性的经典指标,它把共享的比特数与总比特数相比;数值接近 1 表示结构高度相似。

又称
structural fingerprint结构指纹結構指紋