返回
Learning to detect hardcoded secrets
DOI:10.1007/s10664-026-10929-w.png)
摘要
En 中文
已开发多种工具用于在源代码中揭示秘密和凭证。然而,它们通常依赖预定义规则,导致误报率较高。我们深入研究了不同AI模型在秘密检测中的性能。在非生成式模型中,我们发现特征集的选择对秘密检测性能影响很大。这些模型在使用上下文特征(即秘密值周围的代码)时表现最佳。特别是,CodeBERT优于其他模型,其MCC和F1分数分别为88%和89%。当我们将模型应用于未见过的秘密数据集时,表现最佳的模型是随机森林和CodeBERT,其MCC分数约为65%。在生成式模型中,我们观察到中等性能(最高MCC为63%)和高误报率。对错误预测的调查发现,许多错误发生在测试路径文件中,且LLMs倾向于谨慎处理,标记潜在秘密以促进安全编码实践。我们注意到,提示工程显著减少了误报,但人工干预仍属必要。
Keyword:
Hardcoded secrets
Credential leakage
AI for security
期刊
IF:
3.6
论文数:
2.0K
被引数:
5.3K
机构
引用论文
The advantages of the Matthews correlation coefficient (MCC) over F1 score and accuracy in binary classification evaluation在二元分类评估中,马修斯相关系数 (MCC) 相对于F1得分和准确性的优势
BMC GENOMICS
IF3.7
没有更多内容

