返回
Relating Model Performance to Embedding Distributions in Molecular Machine Learning
DOI:10.1021/acs.jcim.6c00218.png)
摘要
En 中文
选择有效的分子表示仍然是分子机器学习中的核心挑战,通常通过昂贵的试错方法解决。尽管模型选择通常仅由预测性能指导,但分析训练模型之间的关系可以揭示性能指标所忽略的额外结构。在模型相似性度量方面,表示对齐技术(如中心核对齐CKA)为比较模型提供了超越预测性能的原则性框架。本研究表明,表示对齐与模型间的性能差异存在根本联系。对于线性回归,我们从理论上证明了对齐对可实现的性能差距设置了上限。这一结果预测了一个排除区域,其中高度对齐的模型不会表现出大的性能差异,这一现象我们在661个分类数据集上进行了实证验证。为了使这些见解具有可操作性,我们引入了平均最小类别距离(MMCD),这是一种简单直观的数据集级统计量,可预测数据集在表示对齐-性能差异空间中的位置。在23种分子表示和10个代表性数据集上,我们发现产生高度对齐模型的训练数据集倾向于具有较低的MMCD,表明表示对齐强烈受到数据集特定结构的影响。总体而言,我们的结果表明,当表示对齐较低时,探索替代表示更有可能提高性能;相反,当表示对齐较高时,通过增加训练数据规模来提升性能更为有效。
Keyword:
model alignment
molecular representations
performance differences
representational similarity
training data size
期刊
IF:
5.3
论文数:
9.1K
被引数:
4.0W
机构
引用论文
A BOILED-Egg To Predict Gastrointestinal Absorption and Brain Penetration of Small Molecules煮鸡蛋预测小分子的胃肠道吸收和大脑渗透
CHEMMEDCHEM
IF3.4
Effectiveness of molecular fingerprints for exploring the chemical space of natural products分子指纹探索天然产物化学空间的有效性
E-GuARD: expert-guided augmentation for the robust detection of compounds interfering with biological assaysE-GuARD:专家引导增强方法,用于检测干扰生物分析的化合物
Training data composition determines machine learning generalization and biological rule discovery训练数据组成决定了机器学习泛化与生物规律发现

