arrow
Return

Grouped top-down reasoning with hierarchical window transformer for visual grounding

delete2025-06-05
delete0
PRE
AI
L
Liuwu Li
Z
Zhuoming Zheng
Y
Yuqi Bu
C
Cantao Wu
S
Shubin Huang
Q
Qingbao Huang
Y
Yi Cai
DOI:10.1016/j.ipm.2025.104222delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• We propose GTD-HWT, a variant transformer incorporating multi-scale inputs that balances computational efficiency and model performance in visual grounding. • We design a hierarchical reconstruction strategy and dual attention mechanism for efficient cross-scale semantic reasoning from coarse to fine-grained features. • Extensive experiments demonstrate our model outperforms existing methods and achieves comparable results to MLLMs under pre-training paradigm.

Journal

I
Information Processing and Management
IF:
6.9
Papers:
5.2K
Citations:
1.4W

Organization

No organization information available