返回
Model-Aware Automatic Benchmark Generation with Self-Error Instructions for Data-Driven Models
DOI:10.3390/make7040148.png)
摘要
En 中文
领域特定的机器学习基准数量不断增加,推动了方法论上的进步,但实际部署需要不同的评估方法。为解决这一需求,提出了模型感知合成基准,旨在强调现有模型的失效模式。然而,评估已经表现良好的模型是一个重大挑战,因为模型出现错误的高质量数据点数量有限,难以获得统计上可靠的估计。为弥补这一差距,我们提出了一个两步基准构建过程:(i) 使用遗传算法扩充数据驱动模型预测质量较差的数据点;(ii) 使用生成模型近似这些点的分布。我们为这种基准构建建立了一般性表述,可适用于非经典机器学习模型。我们的实验研究表明,该方法能够实现对数据驱动模型在回归和分类问题上的准确评估。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
M
IF:
6
论文数:
819
被引数:
1.8K
机构
引用论文
Shi, Q.; Tang, M.; Narasimhan, K.; Yao, S. Can Language Models Solve Olympiad Programming? arXiv 2024, arXiv:2404.10952. [Google Scholar] [CrossRef]Shi, Q.; Tang, M.; Narasimhan, K.; Yao, S. 语言模型能否解决奥林匹克编程问题?arXiv 2024, arXiv:2404.10952. [Google Scholar] [CrossRef]
Liu, Y.; Khandagale, S.; White, C.; Neiswanger, W. Synthetic benchmarks for scientific research in explainable machine learning. arXiv 2021, arXiv:2106.12543. [Google Scholar] [CrossRef]刘, Y.; Khandagale, S.; White, C.; Neiswanger, W. 科学研究中可解释机器学习的合成基准。arXiv 2021, arXiv:2106.12543. [Google Scholar] [CrossRef]
Benchmarking machine learning methods for synthetic lethality prediction in cancer
NATURE COMMUNICATIONS
IF15.7
Mahdavi, H.; Hashemi, A.; Daliri, M.; Mohammadipour, P.; Farhadi, A.; Malek, S.; Yazdanifard, Y.; Khasahmadi, A.; Honavar, V. Brains vs. bytes: Evaluating llm proficiency in olympiad mathematics. arXiv 2025, arXiv:2504.01995. [Google Scholar] [CrossRef]Mahdavi, H.; Hashemi, A.; Daliri, M.; Mohammadipour, P.; Farhadi, A.; Malek, S.; Yazdanifard, Y.; Khasahmadi, A.; Honavar, V. 大脑 vs. 字节:评估大型语言模型在奥林匹克数学中的能力。arXiv 2025, arXiv:2504.01995. [Google Scholar] [CrossRef]
Xia, C.S.; Deng, Y.; Zhang, L. Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM. arXiv 2024, arXiv:2403.19114. [Google Scholar] [CrossRef]夏春生; 邓宇; 张磊. 顶尖排行榜排名 = 顶尖编程能力,总是如此吗?EvoEval: 通过大语言模型演化编程基准. arXiv 2024, arXiv:2403.19114. [Google Scholar] [CrossRef]
Mendes, P.; Romano, P.; Garlan, D. Error-driven uncertainty aware training. arXiv 2024, arXiv:2405.01205. [Google Scholar] [CrossRef]Mendes, P.; Romano, P.; Garlan, D. 错误驱动的具有不确定性感知的训练。arXiv 2024, arXiv:2405.01205. [Google Scholar] [CrossRef]
Maheshwari, G.; Ivanov, D.; Haddad, K.E. Efficacy of synthetic data as a benchmark. arXiv 2024, arXiv:2409.11968. [Google Scholar] [CrossRef]Maheshwari, G.; Ivanov, D.; Haddad, K.E. 合成数据作为基准的有效性。arXiv 2024, arXiv:2409.11968. [Google Scholar] [CrossRef]

