arrow
返回

From fuzzy intent to executable visual workflows: A multi-model orchestration approach

delete2026-07-01
delete0
PRE
AI
Y
Yuan‐Cheng Huang
L
Li, Hang *
D
Dongdong Lu
F
Fei Li
Z
Zhe Zhang
W
Wenjia Xu
DOI:10.1016/j.eswa.2026.133549delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
用户常使用模糊的自然语言表达视觉任务,而系统执行需要明确的、结构化的处理流程,导致模糊意图与可执行工作流之间存在显著差距。为解决此问题,本文提出了一种面向中等计算设备的意图驱动多模型编排框架。该框架不引入新的基础模型,而是从系统层面出发,将检测、分割、跟踪和变化检测等视觉能力抽象为最小功能单元(MFUs)。大语言模型负责意图解析和任务分解,而明确的任务图则支持异构模型的组织、调度和执行。所提方法无需端到端训练,支持即插即用集成、轻量化设计和灵活部署,能够有效执行模糊视觉任务。在视觉-语义不确定性不同条件下进行实验,结果表明所提方法在任务成功率、推理效率和系统可解释性方面表现优异,同时适用于轻量化部署和跨场景迁移。
Keyword:
Multi-model orchestration
Fuzzy question answering
Multi-modal intelligence

期刊

Expert Systems with Applications 封面图
Expert Systems with Applications
IF:
7.5
论文数:
3.0W
被引数:
10.2W

机构

A
aerospace information technology university
学者数:
20
论文数: 16
被引数: 0
引用论文

引用论文

暂无论文信息