返回
AIPNet: Action-Instance Progressive Learning Network for Instrument-Tissue Interaction Detection
DOI:10.1109/JBHI.2025.3575791.png)
摘要
En 中文
器械-组织交互检测是一种旨在通过视频理解手术场景的任务,在构建计算机辅助手术系统中具有极其重要的意义。该任务现有的方法包含两个阶段:实例检测和交互预测。这种顺序且独立的模型结构限制了其有效性和效率,使得难以在手术机器人平台上部署。本文提出了一种端到端的动作-实例渐进学习网络(AIPNet)用于该任务。该模型按三步运行:动作检测、实例检测和动作类别细化。模型从粗尺度候选框开始,逐步将其细化为粗粒度动作,随后这些动作作为实例检测的候选框。通过后期融合,利用实例特征进一步优化动作预测结果。这些渐进学习过程提升了端到端模型的性能。此外,我们引入动态候选框生成器(DPG)为每个视频帧创建动态自适应可学习的候选框。为解决该多任务模型的训练难题,引入了语义监督训练以转移先验语言知识,并提出了一种训练标签策略,用于生成无关的器械-组织对标签以增强监督。在PhacoQ和CholecQ数据集上的实验结果表明,所提出的方法相比当前最优模型,在准确率和处理速度方面均实现了更优的性能。
Keyword:
Instrument-tissue interaction detection
progressive learning
surgical scene understanding

