返回
Machine learning workflows beyond linear models in low-data regimes
DOI:10.1039/d5sc00996k.png)
摘要
En 中文
数据驱动的方法正通过为化学家提供加速发现和促进可持续性的数字工具,从而改变化学研究。在此背景下,非线性机器学习算法是该领域最具颠覆性的技术之一,并已被证明在处理大数据集方面是有效的。然而,在数据有限的情况下,线性回归因其简单性和鲁棒性而传统上占据主导地位,而非线性模型则因可解释性和过拟合相关的担忧而受到质疑。本研究中,我们介绍了易于使用、自动化的工作流设计,旨在克服这些挑战。这些框架通过贝叶斯超参数优化来缓解过拟合,其包含一个考虑了插值和插外推中过拟合的客观函数。在包含18到44个数据点的八个不同化学数据集上的基准测试表明,当适当调整和正则化时,非线性模型可以与线性回归表现相当甚至超越其性能。此外,可解释性评估和从头预测显示,非线性模型与线性模型类似,能够捕捉潜在的化学关系。最终,所提出的自动化非线性工作流有望成为化学家在低数据场景下研究问题时的宝贵工具,与传统线性模型相辅相成。
Keyword:
SELECTIVITY
期刊
IF:
7.4
论文数:
1.7W
被引数:
9.3W
机构
引用论文
Unravelling mechanistic features of organocatalysis with in situ modifications at the secondary sphere
NATURE CHEMISTRY
IF20.2
Applying statistical modeling strategies to sparse datasets in synthetic chemistry将统计建模策略应用于合成化学中的稀疏数据集
SCIENCE ADVANCES
IF12.5

