返回
Parameter-efficient fine-tuning for language-driven robotic grasping tasks
DOI:10.1016/j.robot.2026.105588.png)
摘要
En 中文
随着预训练多模态模型的兴起,语言驱动的机器人抓取取得了显著进展。然而,在资源受限的机器人平台上,如何高效地适应这些大模型以弥合下游任务中的领域差异,同时避免全微调的高昂成本,仍是一个关键挑战。因此,本文提出了一种新颖的RMF适配器用于参数高效微调。首先,设计的RC和RL模块用于实现单模态领域自适应,缓解预训练模型在下游抓取任务中面临的领域偏移问题。其次,为解决现有适配器方法在跨模态特征交互方面的不足,提出了MTF模块以增强视觉和语言特征的深度融合及语义对齐,从而提升模型基于语言指令生成抓取策略的能力。我们在三个公开数据集Grasp-Anything++、LRGD和Jacquard-V2上进行了系统性实验。实验结果表明,RMF适配器在已见和未见场景的抓取成功率方面均超越了当前最先进的PEFT方法,并在模型效率方面展现出显著优势。本研究为在资源受限硬件上部署大型多模态模型提供了一条有效的实践路径,实现了性能与效率的平衡。
Keyword:
Parameter-efficient fine-tuning
Robotic grasping
Adapter
Cross-modal interaction
Pre-trained model
期刊
IF:
5.2
论文数:
765
被引数:
1.0W
机构
引用论文
Bcgn: BLIP-based cross-modal grasping network for language-conditioned robotic graspingBcgn:基于BLIP的跨模态抓取网络,用于语言条件下的机器人抓取
Multimedia Systems
IF3.1
Trans-SAM: Transfer Segment Anything Model to medical image segmentation with Parameter-Efficient Fine-TuningTrans-SAM:通过参数高效微调将Segment Anything Model迁移到医学图像分割领域

