arrow
返回

CoMa: Contextual Massing Generation with Vision-Language Models

delete2026-09-18
delete0
delete
OA
AI
E
Evgenii Maslov *
A
Alexandra Vabnits
V
Vladimir Vorona
A
Anastasia Antsiferova *
V
Valentin Khrulkov
A
Anastasia Volkova
A
Anton Gusarov
A
Andrey Kuznetsov
I
Ivan Oseledets
DOI:10.3390/smartcities9090153delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于语境的建筑体量设计是一项重要的早期设计任务:给定建筑用地,生成的体量不仅应适应目标地块,还需与周围城市肌理的规模、密度和形态相关联。该任务具有自然的多模态特性,因为目标输出需保持结构化且可编辑,而周围环境(包括其他建筑或道路)可表示为矢量几何、地图图像或三维视图。本文研究了使用视觉-语言模型(VLMs)进行语境体量生成,并分析了其在训练和推理过程中针对不同语境模态的性能。我们构建了一个包含12,845个墨尔本体量的实验数据集,包含地块轮廓、结构化3D几何、邻近建筑、俯视图以及多视角3D语境图像。我们还引入了一种学习到的语境相关性度量,用于评估生成的体量是否在形态上与周围环境相容。使用Qwen3-VL模型,我们比较了无语境、单模态语境和多模态语境的训练策略,并在受控的模态组合和语境量下评估了推理性能。结果表明,模型规模显著影响生成质量,多模态训练提升了各模态的利用效率,而多模态推理提供的语境信号强于孤立语境输入。
Keyword:
building massing
vision-language models
multimodality
generative artificial intelligence
supervised fine-tuning

期刊

Smart Cities 封面图
Smart Cities
IF:
5.5
论文数:
954
被引数:
3.0K

机构

I
Innopolis University
学者数:
305
论文数: 246
被引数: 139
A
artificial intelligence research institute
学者数:
48
论文数: 26
被引数: 0
I
itmo university
学者数:
836
论文数: 291
被引数: 0
学者 查看更多机构
引用论文

引用论文

暂无论文信息