計算與電腦模擬方法
化學資訊學
化學資訊學是一門教電腦把分子當作數據來處理的技藝,就像生物資訊學處理基因和序列那樣。任何模型在排序或預測之前,總得有人來儲存數以百萬計的結構、對它們進行檢索、比較,並清洗雜亂的數據,而這套底層管道正是化學資訊學。
它的基本構件包括:把分子寫成文字或編碼的方法,例如用單個字串描述結構的線性表示法;以及計算分子描述符和分子指紋、度量分子間相似性、偵測重複、標準化電荷和互變異構體、並把化合物庫組織起來以便快速檢索的各種方法。正是這些基礎才使虛擬篩選、QSAR 和機器學習成為可能。
儘管聽上去像單純的記帳,優秀的化學資訊學卻是可靠分析與誤導性分析之間的分水嶺。一些細微問題,例如同一分子被寫成兩種不同形式、鹽型不一致,或活性數值來自互不可比的實驗,都可能悄無聲息地污染模型。計算藥物發現中很大一部分真正的工作,正是化學資訊學所提供的那種細緻而不起眼的數據清理。
在這裡,垃圾進、垃圾出的道理體現得淋漓盡致:機器學習模型的可信度,完全取決於餵給它的、經過清理的化學與實驗數據。
又稱
另見