arrow
返回

Automatic Text Box Placement for Supporting Typographic Design

delete2026-01-01
delete0
PRE
AI
J
Jun Muraoka *
D
Daichi Haraguchi
N
Naoto Inoue
W
Wataru Shimoda
K
Kota Yamaguchi
S
Seiichi Uchida
DOI:10.1007/978-3-032-09368-4_11delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在广告和网页布局设计中,平衡视觉吸引力和沟通效率至关重要。本研究考察了不完整布局中的自动文本框放置,比较了基于标准Transformer的方法、小型视觉语言模型(Phi3.5-vision)、大型预训练VLM(Gemini)以及能处理多张图像的扩展Transformer。在Crello数据集上的评估显示,标准Transformer模型通常优于VLM模型,尤其是在整合更丰富的外观信息时。然而,所有方法在处理极小文本或密集布局时均面临挑战。这些发现突显了任务特定架构的优势,并指出了自动布局设计进一步改进的方向。
Keyword:
Document layout analysis
Structured document generation

期刊

D
DOCUMENT ANALYSIS AND RECOGNITION - ICDAR 2025 WORKSHOPS, PT I
IF:
0
论文数:
22
被引数:
0

机构

K
kyushu university
学者数:
4.8K
论文数: 1.7K
被引数: 0
引用论文

引用论文

Towards Flexible Multi-modal Document Models
err2023-06-01
err0
PREAI
errInoue,Naoto; Kikuchi,Kotaro; Simo-Serra,Edgar; Otani,Mayu; Yamaguchi,Kota
err分享
err收藏
LayoutVAE: Stochastic Scene Layout Generation From a Label Set
err2019-10-01
err0
errOAAI
errAkash Abdu Jyothi; Thibaut Durand; Jiawei He; Leonid Sigal; Greg Mori
err分享
err收藏
err分享
err收藏
err分享
err收藏
Relation-Aware Diffusion Model for Controllable Poster Layout Generation
err2023-10-21
err0
errOAAI
errFengheng Li; An Liu; Wei Feng; Honghe Zhu; Yaoyu Li; Zheng Zhang; Jingjing Lv; Xin Zhu; Junjie Shen; Zhangang Lin; Jingping Shao
err分享
err收藏
没有更多内容