arrow
返回

Visual-Geometric Collaborative Guidance for Affordance Learning

delete2026-07-22
delete0
PRE
AI
H
Hongchen Luo *
W
Wei Zhai
王骄 (Jiao Wang)
Y
Yang Cao
Z
Zheng-Jun Zha
DOI:10.1007/s11263-026-02950-9delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
通过建模图像中人体部位与局部物体区域之间的接触关系,可以揭示人类-物体交互背后的潜在线索,从而缓解由可能动作的模糊性引起的能力学习不确定性。然而,现有方法通常遵循“接触区域分割-迁移”范式,仅依赖外观级映射,忽略了人类-物体交互的语义和几何一致性。因此,当面对物体显著变化或身体部位间多样化的协作关系时,模型感知和预测能力会下降。为此,我们提出了一种视觉-几何协作引导的能力学习网络,联合利用视觉和几何线索来建模人类-物体交互中的复杂关系及接触特征表示。特别地,设计了一个语义-姿态启发式感知模块,利用语义和几何线索引导网络聚焦于交互相关区域,在不同交互场景下改善接触区域感知。同时,引入几何-外观对齐迁移模块,联合对齐外观和结构相似的区域,消除因类内对应模糊性带来的迁移困难。此外,我们构建了一个更大且更多样的接触与物体-部件能力数据集,包含55,047张图像,覆盖61类物体和35类能力,使模型在复杂交互场景下的感知和预测能力得到更全面的评估。实验结果表明,我们的方法在客观指标和视觉质量方面优于代表性模型。项目:github.com/lhc1224/VCR-Net。
Keyword:
Embodied AI
Affordance Learning
Human-object Interaction
Benchmark

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

N
Northeastern University
学者数:
2.5W
论文数: 1.6W
被引数: 3.0W
U
University of Science and Technology of China
学者数:
1.7W
论文数: 6.0K
被引数: 11.3W
引用论文

引用论文

SMPLer-X: Scaling Up Expressive Human Pose and Shape EstimationSmpler-x:扩展富有表现力的人体姿态和形状估计
err2023-01-01
err0
PREAI
errCai,Zhongang; Liu,Ziwei; Loy,Chen Change; Mei,Haiyi; Pang,Hui En; Sun,Qingping; Wei,Chen; Yang,Lei; Yanjun,Wang; Yin,Wanqi; Zeng,Ailing; Zhang,Lei; Zhang,Mingyuan
err分享
err收藏
Demo2Vec: Reasoning Object Affordances from Online Videos
err2018-06-01
err0
PREAI
errKuan Fang; Te-Lin Wu; Daniel Yang; Silvio Savarese; Joseph J. Lim
err分享
err收藏
Components of bottom-up gaze allocation in natural images
err2005-08-01
err0
errOAAI
errRobert J. Peters; Asha Iyer; Laurent Itti; Christof Koch
err分享
err收藏
UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation
err2025-05-19
err0
PREAI
errTang,Yihe; Huang,Wenlong; Wang,Yingke; Li,Chengshu; Yuan,Roy; Zhang,Ruohan; Wu,Jiajun; Fei-Fei,Li
err分享
err收藏
err分享
err收藏
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉
err2017-02-06
err3.1K
errOAAI
errKrishna, Ranjay; Zhu, Yuke; Groth, Oliver; Johnson, Justin; Hata, Kenji; Kravitz, Joshua; Chen, Stephanie; Kalantidis, Yannis; Li, Li-Jia; Shamma, David A.; Bernstein, Michael S.; Li Fei-Fei
err分享
err收藏
学者 查看更多内容