返回
Improved latent diffusion-based IC-DGAN framework for high-resolution multi-feature and expression manipulation
DOI:10.1016/j.neunet.2025.108199.png)
摘要
En 中文
面部表情和多特征操控在媒体娱乐、生物识别法证等应用中发挥着关键作用。然而,现有方法面临语义不一致、姿态和光照变化敏感以及高计算需求等重大挑战。为解决这些问题,本研究提出了一种改进的基于潜在扩散的深度生成对抗网络(IC-DGAN)框架,该框架整合了多个生成器和判别器、K-means聚类以及构建性预训练,以实现精确的语义多特征和面部表情操控。该框架利用尺度不变特征变换(SIFT)和潜在扩散模型自主解耦和操控面部属性,实现跨多级的同步分解,并生成高分辨率、逼真的肖像。通过将面部肖像映射回潜在空间,IC-DGAN能够进行稳健的属性编辑(包括年龄、性别和表情),同时最小化视觉失真。在CelebA-HQ、CAS-PEAL和RafD等基准数据集上的全面评估表明,IC-DGAN优于现有先进方法,减少了12.3%的非预期肖像变化,提升了8.7%的操控精度,并实现了25.94的Fréchet Inception Distance(FID)——显著超越现有基准。这些结果凸显了该框架在高保真面部编辑领域的潜力,为解决长期存在的挑战提供了稳健的解决方案。
Keyword:
Deep generative adversarial networks
Facial attribute manipulation
Latent diffusion model
Multi-feature expression synthesis
Latent transformation
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
6.3
论文数:
8.2K
被引数:
3.0W
机构
引用论文
Sobhana, M., Durga, M.M.M., Kishore, M.J., Reddy, E.E., Chaitanya, V., 2023. Text guided generation and manipulation of human face images using StyleGAN. Presented at the proceedings of the 2023 2nd international conference on augmented intelligence and sustainable systems, ICAISS 2023, pp. 1040–1049. https://doi.org/10.1109/ICAISS58487.2023.10250640Sobhana, M., Durga, M.M.M., Kishore, M.J., Reddy, E.E., Chaitanya, V., 2023. 基于StyleGAN的文本引导生成和编辑人脸图像。发表于2023年第二届增强智能与可持续系统国际会议论文集,ICAISS 2023,第1040-1049页。https://doi.org/10.1109/ICAISS58487.2023.10250640
A multi-level fusion-based framework for multimodal fake news classification using semantic feature extraction基于多级融合框架的多模态虚假新闻分类,使用语义特征提取

