arrow
返回

Language-Driven Multi-Task Manipulation With Action-Mask-Enhanced Multimodal Learning

delete2026-03-13
delete0
PRE
AI
N
Ningquan Gu
Y
Yuquan Li
K
Kazuhiro Kosuge
M
Mitsuhiro Hayashibe
DOI:10.1109/LRA.2026.3674003delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
针对长时域多任务机器人操作,分层方法提供了一种有效途径,将高层基于语言的任务规划与低层基于视觉-语言的子任务执行相结合。我们提出了一种框架,整合了两阶段任务规划器与一个融合显式动作掩码策略的多模态低层动作规划器。在高层,视觉-语言模型(VLM)首先从观察中感知物体和场景信息,然后大型语言模型(LLM)结合任务库和人类指令进行推理,生成文本任务计划。这一两阶段设计缓解了感知与规划间的模态偏差。在低层,一个非对称多模态编码器(SigLIP2结合权重分解低秩适配DoRA处理文本,多视角ResNets处理视觉)输入到基于动作分块与Transformer(ACT)的策略中,该策略通过温度缩放空间注意力和双向交叉注意力增强语言-视觉融合。我们进一步引入显式动作掩码策略,联合预测动作及其有效性,实现实时子任务终止检测和多子任务间的鲁棒切换,无需额外推理开销。称重和多物体操作任务的实验验证了性能,消融研究确认了各组件的贡献。非分布条件下的一般化实验凸显了优势与局限。在新场景下部署于独特双臂机器人平台验证了可迁移性。
Keyword:
Hierarchical planning
vision-language-action models
imitation learning
bimanual manipulation

期刊

I
IEEE Robotics and Automation Letters
IF:
5.3
论文数:
1.9K
被引数:
3.9W

机构

T
tohoku university
学者数:
4.3W
论文数: 3.6W
被引数: 31
T
the university of hong kong
学者数:
1.0K
论文数: 511
被引数: 0
H
huazhong university of science and technology
学者数:
2.7W
论文数: 8.1K
被引数: 5
学者 查看更多机构
引用论文

引用论文

TactileAloha: Learning Bimanual Manipulation With Tactile Sensing
err2025-08-01
err0
PREAI
errGu,Ningquan; Kosuge,Kazuhiro; Hayashibe,Mitsuhiro
err分享
err收藏
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
err2023-07-10
err0
errOAAI
errTony Zhao; Vikash Kumar; Sergey Levine; Chelsea Finn
err分享
err收藏
Vision-Language Interpreter for Robot Task Planning机器人任务规划中的视觉-语言解释器
err2024-05-13
err0
errOAAI
errKeisuke Shirai; Cristian C. Beltran-Hernandez; Masashi Hamaya; Atsushi Hashimoto; Shohei Tanaka; Kento Kawaharazuka; Kazutoshi Tanaka; Yoshitaka Ushiku; Shinsuke Mori
err分享
err收藏
MTL-LoRA: Low-Rank Adaptation for Multi-Task Learning
err
err0
PREAI
errYang,Yaming; Muhtar,Dilxat; Shen,Yelong; Zhan,Yuefeng; Liu,Jianfeng; Wang,Yujing; Sun,Hao; Deng,Weiwei; Sun,Feng; Zhang,Qi; Chen,Weizhu; Tong,Yunhai
err分享
err收藏
Yell At Your Robot: Improving On-the-Fly from Language Corrections对您的机器人喊话:通过语言修正进行即时改进
err2024-07-15
err0
PREAI
errLucy Shi; Zheyuan Hu; Tony Zhao; Archit Sharma; Karl Pertsch; Jianlan Luo; Sergey Levine; Chelsea Finn
err分享
err收藏
Diffusion policy: Visuomotor policy learning via action diffusion扩散政策: 通过行动扩散进行视觉运动政策学习
err2024-10-11
err2
errOAAI
errChi, Cheng; Xu, Zhenjia; Feng, Siyuan; Cousineau, Eric; Du, Yilun; Burchfiel, Benjamin; Tedrake, Russ; Song, Shuran
err分享
err收藏
Overcoming catastrophic forgetting in neural networks克服神经网络中的灾难性遗忘
err2017-03-14
err3.7K
errOAAI
errKirkpatricka, James; Pascanu, Razvan; Rabinowitz, Neil; Veness, Joel; Desjardins, Guillaume; Rusu, Andrei A.; Milan, Kieran; Quan, John; Ramalho, Tiago; Grabska-Barwinska, Agnieszka; Hassabis, Demis; Clopath, Claudia; Kumaran, Dharshan; Hadsell, Raia
err分享
err收藏
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
err2025-06-10
err0
PREAI
errZhang,Zefeng; Tang,Hengzhu; Sheng,Jiawei; Zhang,Zhenyu; Ren,Yiming; Li,Zhenyang; Yin,Dawei; Ma,Duohe; Liu,Tingwen
err分享
err收藏
没有更多内容