Return
Grouped top-down reasoning with hierarchical window transformer for visual grounding
DOI:10.1016/j.ipm.2025.104222.png)
Abstract
En 中文
• We propose GTD-HWT, a variant transformer incorporating multi-scale inputs that balances computational efficiency and model performance in visual grounding. • We design a hierarchical reconstruction strategy and dual attention mechanism for efficient cross-scale semantic reasoning from coarse to fine-grained features. • Extensive experiments demonstrate our model outperforms existing methods and achieves comparable results to MLLMs under pre-training paradigm.
Journal
I
IF:
6.9
Papers:
5.2K
Citations:
1.4W
Organization
No organization information available

