返回
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
DOI:10.1109/TASLPRO.2025.3639717.png)
摘要
En 中文
近期说话人验证(SV)系统呈现出采用更深层次说话人嵌入提取器的趋势。尽管更深层、更大的神经网络能显著提升性能,但其巨大的内存需求阻碍了在消费级GPU上的训练。MLSys社区已探索多种内存高效训练技术,包括可逆网络和优化器状态量化,旨在减少激活值和优化器内存使用。然而,这些通用技术很少被适配或系统性地分析用于基于时频表示的SV模型。本文重新审视这两个经典方向,并提出一种针对资源受限条件下深度说话人嵌入学习的联合内存高效训练策略。具体而言,我们(1)设计了两种适用于SV的可逆架构,包括一种基于重塑的可逆下采样机制(Type II RevNets)以增强各层间的可逆性,以及(2)提出了一种动态树结构8位量化方案用于优化器状态,能在重尾参数分布下保持数值稳定性。所提出的联合可逆-量化优化器框架相较于原始系统,最高可实现16.2倍的内存节省,同时保持近乎相同的参数和性能。在VoxCeleb上的大量实验表明,我们的方法能够在不牺牲性能的前提下,仅使用1或2块消费级GPU训练深度ResNet和DF-ResNet模型。
Keyword:
Training
Graphics processing units
Memory management
Resource management
Neural networks
Quantization (signal)
Feature extraction
Network architecture
Costs
System performance
Memory-efficient training
reversible neural network
optimizer state quantization
speaker verification (SV)
期刊
I
IF:
0
论文数:
151
被引数:
0
机构
引用论文
HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units休伯特: 通过隐藏单元的掩蔽预测进行自我监督的语音表示学习

