返回
CoMa: Contextual Massing Generation with Vision-Language Models
DOI:10.3390/smartcities9090153.png)
摘要
En 中文
基于语境的建筑体量设计是一项重要的早期设计任务:给定建筑用地,生成的体量不仅应适应目标地块,还需与周围城市肌理的规模、密度和形态相关联。该任务具有自然的多模态特性,因为目标输出需保持结构化且可编辑,而周围环境(包括其他建筑或道路)可表示为矢量几何、地图图像或三维视图。本文研究了使用视觉-语言模型(VLMs)进行语境体量生成,并分析了其在训练和推理过程中针对不同语境模态的性能。我们构建了一个包含12,845个墨尔本体量的实验数据集,包含地块轮廓、结构化3D几何、邻近建筑、俯视图以及多视角3D语境图像。我们还引入了一种学习到的语境相关性度量,用于评估生成的体量是否在形态上与周围环境相容。使用Qwen3-VL模型,我们比较了无语境、单模态语境和多模态语境的训练策略,并在受控的模态组合和语境量下评估了推理性能。结果表明,模型规模显著影响生成质量,多模态训练提升了各模态的利用效率,而多模态推理提供的语境信号强于孤立语境输入。
Keyword:
building massing
vision-language models
multimodality
generative artificial intelligence
supervised fine-tuning
期刊
IF:
5.5
论文数:
954
被引数:
3.0K
机构
引用论文
暂无论文信息

