多模态内容理解跨模态感知与语义对齐多模态大模型视觉语言模型视频理解视觉问答跨媒体检索三维场景理解与生成智能体与具身交互具身智能视觉-语言-动作模型智能体导航任务规划物理常识建模长期记忆机制跨媒体可信智能智能系统安全性计算机网络、Python程序设计、移动应用开发、数据结构等跨媒体智能视觉语言导航具身智能与可信人工智能多模态大模型驱动的视觉-语言理解跨模态推理与智能体交互开放域下长时视频跨模态可信问答技术【代表性论著】视觉引导动作:增强3D人体运动预测生成式医学视觉问答的细粒度自适应视觉提示连续视觉语言导航的记忆观察协同系统cross-modal pre-trainingmedical report generation视频问答3D密集描述:3D场景中物体的定位与描述医学人工智能多模态学习[9] T. YuJ. YuZ. YuQ. HuangQ. Tian[10] T. YuD. Tao3D环境交互导航3D注视一致性人脸匿名化[13] Y Lin, W Xia, T Yu*意图驱动的双分支多模态三维人体运动预测[14] Z Dong, T Yu*语义增强多视角提示文本到3D生成[15] S Fu, Y Wu, T Yu*航点预测跨模态对齐连续环境多假设门控Transformer的三维人体姿态估计半监督RGB-D手势识别医学图像报告生成中图像和文本在单一嵌入空间的绑定技术[20] Y. ZhanT. Yu视觉关系检测复杂网络视频理解问答【授权专利及转化】多层次跨媒体融合的视觉语言导航方法基于细粒度视觉提示的医学视觉问答推理计算机视觉人类运动预测视觉语言理解三维视觉可信人工智能