返回
Staged Modulation Diffusion Policy With Complementary Visual Fusion for Robotic Workpiece Assembly
DOI:10.1109/tii.2026.3686836.png)
摘要
En 中文
高精度机器人装配在智能制造中仍是一项挑战。现有的基于视觉的方法通常从大规模图像语料库中学习预定义轨迹,但在执行过程中未能充分利用任务相关的视觉线索,限制了部署。我们提出了一种基于扩散的端到端装配策略,能够执行冗余感知的跨尺度融合,并为动作生成提供阶段依赖的条件。具体而言,我们引入了一种双向注意力互补视觉融合模块,用于对齐跨尺度观测并产生冗余减少的尺度一致性特征。随后,我们引入了一种双流自适应调制模块,能够实现时间-状态相关的路由,并在去噪过程中逐步将重点从场景级稳定转向接触级细化。通过结合互补视觉融合与自适应调制条件去噪,我们开发了一种分阶段调制扩散策略,用于端到端动作生成,产生时序一致且几何精确的动作。在五个实际任务上的实验表明,与代表性基线相比,该方法实现了持续改进,在三个代表性装配基准测试中,整体任务成功率平均提升41.10%,精确装配率平均提升63.16%。
Keyword:
Perception–action coupling
probabilistic inference
robotic assembly
visual servoing
期刊
IF:
9.9
论文数:
8.6K
被引数:
6.0W
机构
引用论文
VLA-Grasp: a vision-language-action modeling with cross-modality fusion for task-oriented graspingVLA-Grasp:一种面向任务抓取的视觉-语言-动作建模方法,采用跨模态融合技术
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation层次扩散策略用于具备运动学感知的多任务机器人操作
Jin, Z.; Qiu, Y.; Zhang, K.; Li, H.; Luo, W. MB-TaylorFormer V2: Improved Multi-branch Linear Transformer Expanded by Taylor Formula for Image Restoration. arXiv 2025, arXiv:2501.04486. [Google Scholar] [CrossRef] [PubMed]金, Z.; 邱, Y.; 张, K.; 李, H.; 罗W. MB-TaylorFormer V2:基于泰勒公式扩展的多分支线性变换器用于图像修复的改进. arXiv 2025, arXiv:2501.04486. [谷歌学术] [ CrossRef ] [PubMed]

