arrow
返回

GARF+: self-supervised and interpretable data cleaning with sequence generative adversarial networks

delete2025-09-16
delete0
PRE
AI
J
Jinfeng Peng
H
H.B. Cui *
D
Derong Shen
N
Nan Tang
Y
Yue Kou
T
Tiezheng Nie
H
Hang Cui
G
Ge Yu
DOI:10.1007/s00778-025-00941-9delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
数据清洗一直是数据研究领域中的一个挑战性问题。随着数据量的指数级增长,手动清洗变得越来越不切实际。尽管在自动化数据清洗方面付出了巨大努力,但显著的人工努力仍然是必要的,无论是为了提供先验知识以生成规则,还是为了标注数据以训练模型。在本文中,我们研究了自监督和可解释的数据清洗问题,该问题能够自动从脏数据中提取可解释的数据修复规则。我们提出了一种基于序列生成对抗网络(SeqGAN)的新型框架,即Garf+。Garf+的一个关键目标是捕获数据修复规则(例如,“Dothan”市可以唯一确定县名为“Houston”)。Garf+采用一个由生成器G和判别器D组成的SeqGAN,通过训练G来学习依赖关系(例如,将“Dothan”市作为输入时,G推断县名应为“Houston”)。训练完成后,生成器G可用于生成数据修复规则,但这些生成的规则可能包含错误规则,尤其是在从脏数据中学习时。为了缓解这一问题,Garf+进一步使用另一个判别器D'更新所学关系,以迭代地提高规则和数据的质量。通过结合逻辑方法和基于学习的方法,Garf+实现了可解释的数据清洗,而无需依赖先验知识或标注训练数据。此外,Garf+探索了开源大语言模型(LLMs)在数据清洗中的潜力。通过微调,LLMs能够有效吸收通用知识和领域特定信息。Garf+将LLMs集成为一个知识增强模块,以支持规则生成和数据修复过程。在真实世界和合成数据集上的广泛实验证明了Garf+的有效性,包括其原始方法(Garf)以及为应对各种场景设计的两种变体。Garf+通过自主地从脏数据集中学习且无需人工监督,在各类数据集上均以高精度和高召回率超越了当前最先进的方法。
Keyword:
Data repair
Generative adversarial network
Large language model

期刊

T
The VLDB Journal
IF:
0
论文数:
36
被引数:
0

机构

U
University of Illinois Urbana-Champaign
学者数:
2.4W
论文数: 2.0W
被引数: 35
C
China and College of Electronic Engineering
学者数:
6
论文数: 1
被引数: 0
引用论文

引用论文

暂无论文信息