返回
An fMRI visual neural encoding method with multimodal large language model
DOI:10.1016/j.knosys.2025.114049.png)
摘要
En 中文
• 总的来说,我们的贡献主要分为三个方面:
• 据我们所知,我们建立了首个结合MLLM与fMRI视觉神经编码的多模态框架,引入了一种针对神经编码任务特别优化的系统性三阶段训练范式。
• 基于Vicuna架构,我们开发了一个80亿参数的基础模型,该模型在参数效率和任务性能方面均展现出双重优势。具体而言,我们的方法在Algonauts 2023中取得第5名,为大尺度视觉编码处理确立了新的基准。
• 去除分析表明,引入MLLM模块可带来2.87%的性能增益。通过我们的多阶段训练范式,我们仅通过参数高效微调(PEFT)微调1.33%的参数(Q-former),实现了2.61%的性能提升,从而在计算效率与性能增强之间取得了平衡。
期刊
K
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
暂无机构信息
引用论文
Coal resources under carbon peak: Segmentation of massive laser point clouds for coal mining in underground dusty environments using integrated graph deep learning model碳峰值下的煤炭资源: 基于集成图深度学习模型的地下尘土环境下煤炭开采的海量激光点云分割
ENERGY
IF9.4
Deep recurrent neural network reveals a hierarchy of process memory during dynamic natural vision
HUMAN BRAIN MAPPING
IF3.3
Variational autoencoder: An unsupervised model for encoding and decoding fMRI activity in visual cortex
NeuroImage
IF0
Generic decoding of seen and imagined objects using hierarchical visual features
NATURE COMMUNICATIONS
IF15.7
Detection of Foreign Objects Intrusion Into Transmission Lines Using Diverse Generation Model基于多样化生成模型的输电线路异物入侵检测

