arrow
Return

Generating vision-language navigation instructions incorporated fine-grained alignment annotations

delete2025-12-30
delete0
PRE
AI
Y
Yibo Cui
L
Liang Xie
Y
Yu Zhao
J
Jiawei Sun
E
Erwei Yin
DOI:10.1016/j.inffus.2025.104107delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• A framework generating VLN instructions with fine-grained cross-modal alignment. • FCA-R2R, the first large-scale VLN dataset annotated with fine-grained alignment. • FCA-R2R significantly improves VLN agent performance.

Journal

Information Fusion cover
Information Fusion
IF:
15.5
Papers:
4.1K
Citations:
2.7W

Organization

C
Chinese Academy of Military Science
Scholars:
33
Papers: 14
Citations: 0
T