返回
From fuzzy intent to executable visual workflows: A multi-model orchestration approach
DOI:10.1016/j.eswa.2026.133549.png)
摘要
En 中文
用户常使用模糊的自然语言表达视觉任务,而系统执行需要明确的、结构化的处理流程,导致模糊意图与可执行工作流之间存在显著差距。为解决此问题,本文提出了一种面向中等计算设备的意图驱动多模型编排框架。该框架不引入新的基础模型,而是从系统层面出发,将检测、分割、跟踪和变化检测等视觉能力抽象为最小功能单元(MFUs)。大语言模型负责意图解析和任务分解,而明确的任务图则支持异构模型的组织、调度和执行。所提方法无需端到端训练,支持即插即用集成、轻量化设计和灵活部署,能够有效执行模糊视觉任务。在视觉-语义不确定性不同条件下进行实验,结果表明所提方法在任务成功率、推理效率和系统可解释性方面表现优异,同时适用于轻量化部署和跨场景迁移。
Keyword:
Multi-model orchestration
Fuzzy question answering
Multi-modal intelligence
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
引用论文
暂无论文信息

