返回
On contradictions between model interpretability and inversion attacks
DOI:10.1007/s40747-026-02294-4.png)
摘要
En 中文
为促进人工智能(AI)模型的可解释性,特征可视化方法,包括激活最大化,通过可视化特定神经元的表现来帮助人们理解难以处理的深度神经网络的工作原理。同时,通过模型的输出重建输入,或通过简单访问模型重建训练数据等看似难以置信的想法,实际上确实是可行的。事实上,为了探索AI模型中的隐私泄露问题,模型逆技术旨在通过黑盒或白盒访问AI模型来重建私有数据。特征可视化和模型逆共享一个非常相似的框架,在我们看来,该框架具有被用于有益和有害意图的巨大潜力。在本文中,我们将统一将此类反向重建数据的操作称为特征逆。我们将通过综合分析模型逆和特征可视化,来演示特征逆,这两者通常对模型训练者是矛盾的,因为特征可视化增强了AI模型的解释性,而模型逆威胁隐私。
Keyword:
Model interpretability
Privacy leakage
Activation maximization
Feature visualization
Model inversion attack

