返回
Language-Driven Multi-Task Manipulation With Action-Mask-Enhanced Multimodal Learning
DOI:10.1109/LRA.2026.3674003.png)
摘要
En 中文
针对长时域多任务机器人操作,分层方法提供了一种有效途径,将高层基于语言的任务规划与低层基于视觉-语言的子任务执行相结合。我们提出了一种框架,整合了两阶段任务规划器与一个融合显式动作掩码策略的多模态低层动作规划器。在高层,视觉-语言模型(VLM)首先从观察中感知物体和场景信息,然后大型语言模型(LLM)结合任务库和人类指令进行推理,生成文本任务计划。这一两阶段设计缓解了感知与规划间的模态偏差。在低层,一个非对称多模态编码器(SigLIP2结合权重分解低秩适配DoRA处理文本,多视角ResNets处理视觉)输入到基于动作分块与Transformer(ACT)的策略中,该策略通过温度缩放空间注意力和双向交叉注意力增强语言-视觉融合。我们进一步引入显式动作掩码策略,联合预测动作及其有效性,实现实时子任务终止检测和多子任务间的鲁棒切换,无需额外推理开销。称重和多物体操作任务的实验验证了性能,消融研究确认了各组件的贡献。非分布条件下的一般化实验凸显了优势与局限。在新场景下部署于独特双臂机器人平台验证了可迁移性。
Keyword:
Hierarchical planning
vision-language-action models
imitation learning
bimanual manipulation
期刊
I
IF:
5.3
论文数:
1.9K
被引数:
3.9W
机构
引用论文
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
没有更多内容

