返回
Interactive Visual Assessment for Text-to-Image Generation Models
DOI:10.1109/TVCG.2026.3658714.png)
摘要
En 中文
视觉生成模型在计算机图形学应用中取得了显著进展,但在实际部署中仍面临重大挑战。当前视觉生成任务的评估方法通常遵循孤立的三阶段框架:测试输入收集、模型输出生成和用户评估。这些方法存在固定覆盖范围、难度演变和数据泄露风险等问题,限制了其全面评估日益复杂的生成模型的有效性。为解决这些局限性,我们提出DyEval,一个基于LLM的动态交互式视觉评估框架,该框架促进人与生成模型在文本到图像系统中的协作评估。DyEval具有直观的视觉界面,使用户能够交互式地探索和分析模型行为,同时根据反馈自适应地生成分层、细粒度和多样化的文本输入,以持续探测模型的能力边界。此外,为向用户提供可解释的分析以进一步改进测试模型,我们开发了一个上下文反思模块,该模块挖掘测试输入的失败触发因素并反映模型的潜在失败模式,利用LLM的逻辑推理能力支持深入分析。定性和定量实验表明,DyEval能有效帮助用户比传统方法多识别高达2.56倍的生成失败案例,并揭示复杂且罕见的失败模式,如代词生成问题和特定文化背景生成问题。我们的框架为改进生成模型提供了有价值的见解,并对推动视觉生成系统在各个领域的可靠性和能力提升具有广泛意义。
Keyword:
Visual assessment
dynamic testing
large language model
in-context learning
human-computer interaction
期刊
IF:
6.5
论文数:
346
被引数:
2.2W
机构
引用论文
HRS-Bench: Holistic, Reliable and Scalable Benchmark for Text-to-Image ModelsHRS-Bench:面向文本到图像模型的全局、可靠且可扩展的基准评测
Qualitative failures of image generation models and their application in detecting deepfakes图像生成模型的定性失效及其在深度伪造检测中的应用
TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question AnsweringTIFA: 基于问答的准确且可解释的文本到图像忠实度评估

