Return
Generating vision-language navigation instructions incorporated fine-grained alignment annotations
DOI:10.1016/j.inffus.2025.104107.png)
Abstract
En 中文
• A framework generating VLN instructions with fine-grained cross-modal alignment. • FCA-R2R, the first large-scale VLN dataset annotated with fine-grained alignment. • FCA-R2R significantly improves VLN agent performance.
Journal
IF:
15.5
Papers:
4.1K
Citations:
2.7W

