返回
Feature Engineering for Phishing Website Detection Using Machine Learning: A Systematic Review
DOI:10.1109/ACCESS.2025.3630334.png)
摘要
En 中文
钓鱼网站检测已被广泛研究,但现有综述大多关注检测算法或通用网络安全方法,仅简要讨论特征工程。本研究系统文献综述通过分析近期关于机器学习在钓鱼URL检测中特征工程的研究来弥补这一差距。该综述对特征类型进行分类,如URL/词汇特征、HTML/内容特征、域名特征、行为特征,以及新兴的衍生和混合特征,并考察了特征选择和降维技术的应用。研究发现,尽管对基于内容和复合方法以提高鲁棒性的兴趣日益增长,但URL/词汇特征因其简单性和广泛应用而持续被依赖。关键挑战包括适应不断演变的钓鱼策略、处理数据集局限性、缓解高维性以及平衡计算效率与检测精度。该综述还识别出先前工作中未充分探索的机会,例如利用可解释AI方法(如SHAP、LIME)来验证和优化特征集,扩展跨语言和抗对抗性特征,以及开发适用于实时或资源受限环境的轻量级解决方案。本研究通过整合并评述特征工程的作用,为推进钓鱼检测研究提供了有针对性的路线图,强调了其在创建更准确、自适应和高效的检测系统中的关键作用。
Keyword:
Feature engineering
phishing website detection
machine learning
systematic review
cybersecurity
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

