返回
Diagnosing Human-Object Interaction Detectors
DOI:10.1007/s11263-025-02369-8.png)
摘要
En 中文
我们见证了人类-物体交互(HOI)检测领域的显著进展。然而,仅依赖mAP(平均精确度均值)得分作为总结性指标,无法充分揭示模型性能的细微差别(例如,为何一个模型优于另一个模型),这可能阻碍该领域的进一步创新。为解决此问题,本文引入了一个诊断工具箱,以提供HOI检测模型的详细定量分解,该工具箱借鉴了目标检测诊断工具的成功经验。我们首先对HOI检测流程进行了全面调查。通过定义一组错误并使用“先知”(oracles)修正每个错误,我们基于修正错误所带来的mAP提升,定量分析了不同错误的重要性。接着,我们研究了HOI检测的两个关键子任务:人-物对定位和交互分类。对于对定位任务,我们计算了真实人-物对的覆盖范围,并评估了定位结果中的噪声程度。对于分类任务,我们衡量了模型区分正负检测结果的能力,以及在人-物对正确定位时对实际交互进行分类的能力。我们分析了八种当前最先进(state-of-the-art)的HOI检测模型,提供了有价值的诊断见解以指导未来研究。例如,我们的诊断显示,当前最先进的模型RLIPv2之所以优于其他模型,主要是因为其在多标签交互分类准确率方面取得了显著提升。本工具箱适用于各种方法和数据集,并可从https://neu-vi.github.io/Diag-HOI/获取。
Keyword:
Error Diagnosis
Human-object interaction Detection
Visual Relationship Understanding
Object Detection
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
暂无机构信息
引用论文
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉

