計算與電腦模擬方法

分子指紋

分子指紋是一長串由 1 和 0 組成的字串,用來編碼一個分子含有哪些結構特徵,就像一份核對清單,分子若具備某一特定片段,相應的格子就被打勾。正如人的指紋用一個緊湊的紋路概括了身份,分子指紋用一個緊湊的位元串概括了結構。

不同的指紋方案選取不同的特徵。有些方案針對一部固定的化學模式詞典,為其中每個子結構打一個勾。另一些方案,例如環形指紋,會枚舉每個原子周圍在給定半徑範圍內的原子環境,並把它們雜湊成位元。無論哪種方式,結果都是一個向量,電腦可以極快地對其進行比較,即便面對數以百萬計的分子也是如此。

它們的主要用途是度量相似性:兩個分子若其指紋共享許多置位的位元,就被判定為結構相似,通常用一個相似性係數來量化。這驅動了相似性檢索、化合物庫的聚類,以及通往機器學習的一條路徑。需要注意的是:指紋相似性是化學相似度的替代指標,而非生物活性的指標,因此兩個分子在指紋上看似相似,行為卻可能大相逕庭,這又回到了活性懸崖問題。

塔尼莫托係數是衡量指紋相似性的經典指標,它把共享的位元數與總位元數相比;數值接近 1 表示結構高度相似。

又稱
structural fingerprint结构指纹結構指紋