arrow
返回

ROARS: A Cloud-Based Resolution-Native Framework for Large-Scale Remote Sensing Multimodal Analysis

delete2026-08-05
delete0
PRE
AI
J
Jingrui Zhang
梁风 封面图
梁风 (Feng Liang)
Y
Yong Zhang
Z
Zixuan Shangguan
Z
Zhida Li
X
Xiaoyi Fan
V
Victor C. M. Leung
G
Guanbin Li
X
Xiping Hu
DOI:10.1109/tcc.2026.3721293delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
遥感(RS)分析范式向基于云的大规模计算转变,对能够解释PB级、高分辨率异构图像的智能方法提出了需求。多模态大型语言模型(MLLMs)已作为此类数据密集型任务的变革性解决方案出现,在开放集感知和高层次语义推理方面提供了前所未有的能力。然而,将通用MLLM架构直接应用于RS领域面临重大挑战:固定分辨率视觉编码器的约束导致小物体的严重信息损失,而依赖单层特征融合则忽略了保存在中间层中的关键空间线索。为解决这些挑战,我们提出ROARS:一种基于云的原生分辨率框架,用于大规模遥感多模态分析,旨在实现高保真度解释。首先,我们引入了一种原生分辨率视觉编码器,专门处理任意宽高比和尺度的图像,无需下采样,从而严格保留像素级细节。其次,我们设计了一种基于快捷通道的融合机制,通过注入多级视觉特征来弥合语义差距。此外,为增强全局上下文理解,我们整合了多粒度标记池化策略,提供细粒度和粗粒度的视觉表示。在VRSBench上的大量实验表明,我们的框架显著优于现有最优方法,尤其在细粒度物体感知和复杂空间推理方面。这些结果验证了所提方法作为下一代基于云的RS解释系统的鲁棒且高效的核心组件。
Keyword:
Remote Sensing
Native Resolution
Multimodal Large Language Model
Vision-Language Information Fusion

期刊

I
IEEE Transactions on Cloud Computing
IF:
5
论文数:
1.8K
被引数:
4.3K

机构

S
sun yat-sen university
学者数:
1.2K
论文数: 366
被引数: 0
S
Shenzhen MSU-BIT University
学者数:
62
论文数: 30
被引数: 0
引用论文

引用论文

暂无论文信息