返回
Cross-modal progressive modeling for neuro-visual representation learning
DOI:10.1016/j.neucom.2026.133450.png)
摘要
En 中文
从头皮信号进行神经解码需要模型能够尊重空间、时间和频谱结构,同时利用强大的视觉先验。在本文中,我们引入CFT-NET用于解耦的神经视觉表示,并结合一个渐进式视觉-语义适应(PVSA)框架,该框架在对比目标下将EEG嵌入对齐到预训练的视觉骨干网络,随后进行成对匹配。CFT-NET集成了频率分离权重(FSW)、空间上下文聚合(SCA)和自适应时域滤波(ATF),以显式提取频谱、空间和时间因素。PVSA由一个实例引导的视觉编码器和一个视觉引导的语义解码器组成,两者通过交叉注意力连接,能够实现细粒度的神经-图像交互。在THINGS-EEG和THINGS-MEG数据集上,该方法在受试者依赖和受试者无关的零样本分类中均一致优于现有最先进的基础模型。通过将模型架构与视觉认知原理对齐,并将其与强大的视觉先验相结合,我们的方法缩小了神经活动与视觉认知之间的差距,提供了一种新颖的跨模态神经解码方法,其性能可与近期最先进的基础模型相媲美。
Keyword:
neural decoding
cross-modal representation
EEG
visual priors
progressive adaptation
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
A New Framework Combining Diffusion Models and the Convolution Classifier for Generating Images from EEG Signals结合扩散模型和卷积分类器的用于从EEG信号生成图像的新框架

