返回
DBCore: decision boundaries for coreset selection
DOI:10.1016/j.patcog.2026.114374.png)
摘要
En 中文
核心集选择用于分类通常依赖于评估单个样本的难度或重要性,导致样本级或范围级的选择,但这可能会忽略对模型决策边界的集体影响。认识到核心集所具有的代表性与其上模型可以形成的决策边界紧密相关,我们提出了一种直接优化所选核心集形成的决策边界(DB)的新方法。具体而言,我们提出问题:如何集体选择样本以创建一个全局平滑且局部详细的DB,确保对原始数据集的最大泛化能力和抗噪性?为此,我们定义了两个关键目标:(1)全局形状保持——所选核心集应形成原始DB的平滑版本,保留其整体结构并防止过拟合;(2)局部细节保持——虽然平滑可以防止过拟合,但过度平滑有丢失关键细节的风险。因此,选择还必须保留原始DB附近的关键点以捕捉局部复杂性。我们将这些目标表述为一个具有线性约束的凸二次优化问题,并高效地求解它。广泛的评估表明,与现有的核心集选择策略相比,我们的方法具有一致且显著的优越性。源代码可在 https://github.com/diqichen91/DBCore.git 获取。
Keyword:
Coreset selection
Decision boundary reconstruction
Quadratic programming

