arrow
返回

Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification

delete2026-01-01
delete0
PRE
AI
B
Bei Liu
Y
Yanmin Qian *
DOI:10.1109/TASLPRO.2025.3639717delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近期说话人验证(SV)系统呈现出采用更深层次说话人嵌入提取器的趋势。尽管更深层、更大的神经网络能显著提升性能,但其巨大的内存需求阻碍了在消费级GPU上的训练。MLSys社区已探索多种内存高效训练技术,包括可逆网络和优化器状态量化,旨在减少激活值和优化器内存使用。然而,这些通用技术很少被适配或系统性地分析用于基于时频表示的SV模型。本文重新审视这两个经典方向,并提出一种针对资源受限条件下深度说话人嵌入学习的联合内存高效训练策略。具体而言,我们(1)设计了两种适用于SV的可逆架构,包括一种基于重塑的可逆下采样机制(Type II RevNets)以增强各层间的可逆性,以及(2)提出了一种动态树结构8位量化方案用于优化器状态,能在重尾参数分布下保持数值稳定性。所提出的联合可逆-量化优化器框架相较于原始系统,最高可实现16.2倍的内存节省,同时保持近乎相同的参数和性能。在VoxCeleb上的大量实验表明,我们的方法能够在不牺牲性能的前提下,仅使用1或2块消费级GPU训练深度ResNet和DF-ResNet模型。
Keyword:
Training
Graphics processing units
Memory management
Resource management
Neural networks
Quantization (signal)
Feature extraction
Network architecture
Costs
System performance
Memory-efficient training
reversible neural network
optimizer state quantization
speaker verification (SV)

期刊

I
IEEE Transactions on Audio Speech and Language Processing
IF:
0
论文数:
151
被引数:
0

机构

S
shanghai jiao tong university
学者数:
15.7W
论文数: 11.7W
被引数: 159
引用论文

引用论文

Speaker Recognition for Multi-speaker Conversations Using X-vectors
err2019-05-01
err0
PREAI
errDavid Snyder; Daniel Garcia-Romero; Gregory Sell; Alan McCree; Daniel Povey; Sanjeev Khudanpur
err分享
err收藏
Self Multi-Head Attention for Speaker Recognition
err2019-09-15
err0
errOAAI
errMiquel India; Pooyan Safari; Javier Hernando
err分享
err收藏
err分享
err收藏
Self-Attentive Speaker Embeddings for Text-Independent Speaker Verification
err2018-09-02
err0
PREAI
errYingke Zhu; Tom Ko; David Snyder; Brian Mak; Daniel Povey
err分享
err收藏
学者 查看更多内容