返回
The sampling threat when mining generalizable inter-library usage patterns
DOI:10.1016/j.scico.2025.103393.png)
摘要
En 中文
软件工程中的工具支持通常依赖于从其他用户的代码中挖掘出的关系、规律、模式或规则。示例包括用于缺陷预测、代码推荐和代码自动补全的方法。挖掘通常在代码样本上进行,而不是在整个可用的软件项目上进行。虽然抽样对于扩展数据分析至关重要,但它可能会影响挖掘出的模式的泛化能力。本文关注于针对特定库和框架过滤的软件项目的抽样,以及挖掘连接不同库的模式。我们称这些模式为跨库模式。我们观察到,将样本限制在特定库内可能会阻碍跨库模式的泛化,从而对其使用或解释构成威胁。通过模拟和真实案例研究,我们展示了不同抽样方法下的这一威胁。我们的模拟表明,只有当抽样涉及模式蕴含中涉及的库的并集时,该蕴含才能良好地泛化。此外,我们表明,使用GitHub搜索API采样的真实经验数据并不像我们的模拟所预期的那样表现。这识别出一个潜在威胁,这对于许多使用GitHub搜索API来研究跨库模式的研究具有重要意义。
Keyword:
Sampling
Usage patterns
Inter-library
Dataset
Data mining
期刊
S
IF:
1.4
论文数:
50
被引数:
1.6K
机构
引用论文
API Usage Recommendation Via Multi-View Heterogeneous Graph Representation Learning基于多视图异构图表示学习的API使用推荐

