arrow
返回

Parameter-efficient fine-tuning for language-driven robotic grasping tasks

delete2026-06-17
delete0
PRE
AI
J
Jiangtao Xu
T
Tao Zhang *
H
Haitao Xu
DOI:10.1016/j.robot.2026.105588delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着预训练多模态模型的兴起,语言驱动的机器人抓取取得了显著进展。然而,在资源受限的机器人平台上,如何高效地适应这些大模型以弥合下游任务中的领域差异,同时避免全微调的高昂成本,仍是一个关键挑战。因此,本文提出了一种新颖的RMF适配器用于参数高效微调。首先,设计的RC和RL模块用于实现单模态领域自适应,缓解预训练模型在下游抓取任务中面临的领域偏移问题。其次,为解决现有适配器方法在跨模态特征交互方面的不足,提出了MTF模块以增强视觉和语言特征的深度融合及语义对齐,从而提升模型基于语言指令生成抓取策略的能力。我们在三个公开数据集Grasp-Anything++、LRGD和Jacquard-V2上进行了系统性实验。实验结果表明,RMF适配器在已见和未见场景的抓取成功率方面均超越了当前最先进的PEFT方法,并在模型效率方面展现出显著优势。本研究为在资源受限硬件上部署大型多模态模型提供了一条有效的实践路径,实现了性能与效率的平衡。
Keyword:
Parameter-efficient fine-tuning
Robotic grasping
Adapter
Cross-modal interaction
Pre-trained model

期刊

Robotics and Autonomous Systems 封面图
Robotics and Autonomous Systems
IF:
5.2
论文数:
765
被引数:
1.0W

机构

T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
C
chinese academy of sciences
学者数:
56.7W
论文数: 45.0W
被引数: 704
引用论文

引用论文

Integrating With Multimodal Information for Enhancing Robotic Grasping With Vision-Language Models
err2025-01-01
err0
PREAI
errZhao,Zhou; Zheng,Dongyuan; Chen,Yizi; Luo,Jing; Wang,Yanjun; Huang,Panfeng; Yang,Chenguang
err分享
err收藏
Cross-modal adapter for vision-language retrieval用于视觉语言检索的跨模式适配器
err2025-03-01
err0
PREAI
errJiang, Haojun; Zhang, Jianke; Huang, Rui; Ge, Chunjiang; Ni, Zanlin; Song, Shiji; Huang, Gao
err分享
err收藏
err分享
err收藏
学者 查看更多内容