Return
Multi-Level Collaborative Optimization for Multi-Modal Media Manipulation Detection and Grounding
DOI:10.1016/j.inffus.2026.104773.png)
Abstract
En 中文
• A new task-collaboration view is proposed for multimodal media forensics.
• A three-level collaboration path links features, semantics, and decisions.
• Shared semantic weighting guides detection and grounding to consistent evidence.
• Decision-aware refinement suppresses noisy visual grounding responses.
Keywords:
Multi-modal learning
Media manipulation
Deepfake detection
Task collaboration
Semantic consistency
Journal
IF:
15.5
Papers:
4.2K
Citations:
2.7W
Organization
Cited Papers
No cited papers available

