arrow
返回

Staged Modulation Diffusion Policy With Complementary Visual Fusion for Robotic Workpiece Assembly

delete2026-05-12
delete0
PRE
AI
J
Jiahao Zhao
王耀南 封面图
王耀南 (Yaonan Wang)
Z
Zijie Wu
M
Mingtao Feng
R
Renjie Ding
张辉 封面图
张辉 (Hui Zhang)
DOI:10.1109/tii.2026.3686836delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
高精度机器人装配在智能制造中仍是一项挑战。现有的基于视觉的方法通常从大规模图像语料库中学习预定义轨迹,但在执行过程中未能充分利用任务相关的视觉线索,限制了部署。我们提出了一种基于扩散的端到端装配策略,能够执行冗余感知的跨尺度融合,并为动作生成提供阶段依赖的条件。具体而言,我们引入了一种双向注意力互补视觉融合模块,用于对齐跨尺度观测并产生冗余减少的尺度一致性特征。随后,我们引入了一种双流自适应调制模块,能够实现时间-状态相关的路由,并在去噪过程中逐步将重点从场景级稳定转向接触级细化。通过结合互补视觉融合与自适应调制条件去噪,我们开发了一种分阶段调制扩散策略,用于端到端动作生成,产生时序一致且几何精确的动作。在五个实际任务上的实验表明,与代表性基线相比,该方法实现了持续改进,在三个代表性装配基准测试中,整体任务成功率平均提升41.10%,精确装配率平均提升63.16%。
Keyword:
Perception–action coupling
probabilistic inference
robotic assembly
visual servoing

期刊

IEEE Transactions on Industrial Informatics 封面图
IEEE Transactions on Industrial Informatics
IF:
9.9
论文数:
8.6K
被引数:
6.0W

机构

X
xidian university
学者数:
6.6K
论文数: 2.2K
被引数: 0
H
hunan university
学者数:
4.5W
论文数: 3.3W
被引数: 70
引用论文

引用论文

Multiple View Geometry in Computer Vision
err
IF0
err2011-01-25
err0
PREAI
errRichard Hartley; Andrew Zisserman
err分享
err收藏
Look Closer: Bridging Egocentric and Third-Person Views With Transformers for Robotic Manipulation
err2022-04-01
err0
errOAAI
errRishabh Jangir; Nicklas Hansen; Sambaran Ghosal; Mohit Jain; Xiaolong Wang
err分享
err收藏
Deep Dense Multi-Scale Network for Snow Removal Using Semantic and Depth Priors
err2021-01-01
err71
errOAAI
errZhang, Kaihao; Li, Rongqing; Yu, Yanjiang; Luo, Wenhan; Li, Changsheng
err分享
err收藏
err分享
err收藏
Adversarial Spatio-Temporal Learning for Video Deblurring用于视频去模糊的对抗性时空学习
err2019-01-01
err128
errOAAI
errZhang, Kaihao; Luo, Wenhan; Zhong, Yiran; Ma, Lin; Liu, Wei; Li, Hongdong
err分享
err收藏
学者 查看更多内容