返回
Visual-Geometric Collaborative Guidance for Affordance Learning
DOI:10.1007/s11263-026-02950-9.png)
摘要
En 中文
通过建模图像中人体部位与局部物体区域之间的接触关系,可以揭示人类-物体交互背后的潜在线索,从而缓解由可能动作的模糊性引起的能力学习不确定性。然而,现有方法通常遵循“接触区域分割-迁移”范式,仅依赖外观级映射,忽略了人类-物体交互的语义和几何一致性。因此,当面对物体显著变化或身体部位间多样化的协作关系时,模型感知和预测能力会下降。为此,我们提出了一种视觉-几何协作引导的能力学习网络,联合利用视觉和几何线索来建模人类-物体交互中的复杂关系及接触特征表示。特别地,设计了一个语义-姿态启发式感知模块,利用语义和几何线索引导网络聚焦于交互相关区域,在不同交互场景下改善接触区域感知。同时,引入几何-外观对齐迁移模块,联合对齐外观和结构相似的区域,消除因类内对应模糊性带来的迁移困难。此外,我们构建了一个更大且更多样的接触与物体-部件能力数据集,包含55,047张图像,覆盖61类物体和35类能力,使模型在复杂交互场景下的感知和预测能力得到更全面的评估。实验结果表明,我们的方法在客观指标和视觉质量方面优于代表性模型。项目:github.com/lhc1224/VCR-Net。
Keyword:
Embodied AI
Affordance Learning
Human-object Interaction
Benchmark
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W

