返回
RadlER: Deduplicated Sampling On-Demand
DOI:10.14778/3750601.3750661.png)
摘要
En 中文
数据从业者通常需要对他们的数据集进行采样,以产生用于下游任务的代表性子集。然而,现实世界的数据集经常包含重复项,其存在会偏置采样并影响生成子集的质量,进而影响下游任务的结果。因此,去重至关重要,但要在整个数据集上执行去重再运行采样,可能在时间和资源方面成本过高。因此,我们最近引入了RadlER,一种按需执行去重采样的解决方案,即根据某些子群体的目标分布,逐步产生干净数据集的样本,仅集中清理需要出现在样本中的实体。在本演示中,我们将交互式地展示RadlER如何支持从业者在其数据科学工作流程中,帮助他们节省大量时间和资源。
期刊
P
IF:
3.3
论文数:
563
被引数:
1.2W

