返回
False Discovery Estimation in Record Linkage
DOI:10.1002/sim.70292.png)
摘要
En 中文
整合多源数据能够以低成本拓展研究机会。然而,由于数据收集流程各异且存在隐私限制,无法获取唯一标识符。记录链接(RL)算法通过基于部分标识变量进行概率性链接来解决这个问题。由于这些变量缺乏完美整合信息的强度,RL程序会产生一个不完美的链接记录集合。因此,评估RL中的错误发现比例(FDP)对于确保后续分析的可靠性至关重要。本文介绍了一种针对两个重叠数据集的RL中FDP估计的新方法。我们从其估计的经验分布中合成数据,并将其与真实数据一起用于链接过程。由于合成记录无法与真实实体形成链接,它们提供了一种估计错误链接对数量的方法。值得注意的是,该方法适用于所有RL技术,以及链接和非链接分布相似的各类场景——这在复杂任务中很典型,特别是在鉴别性较差的链接变量和多个记录共享相似信息但代表不同实体的情况下。通过识别RL中的FDP并选择合适的模型参数,我们的方法能够评估并提高链接数据的可靠性。我们使用既定的RL算法和基准数据应用评估其性能,随后将其部署用于链接荷兰围产期登记处的兄弟姐妹数据,而此前该登记处RL应用的可靠性从未得到确认。通过这一应用,我们强调了在研究医疗记录中的母子动态时考虑链接错误的重要性。
Keyword:
false discovery proportion
linkage error
record linkage
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
S
IF:
1.8
论文数:
318
被引数:
3.4W

