返回
SVA: Towards Speech-Enabled Vision-Language-Action Model
DOI:10.1016/j.patcog.2025.112915.png)
摘要
En 中文
• 介绍了SVA,一种用于机器人的语音驱动视觉-语言-动作模型。
• 结合语音、视觉和本体感觉,实现实时机器人控制。
• 介绍了一种轻量级动作专家网络,用于高效的动作生成。
• 在CALVIN基准测试中,零样本泛化性能优于基线模型。
• 能够以高鲁棒性和准确性处理语言丰富的指令。
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
CochleaNet: A robust language-independent audio-visual model for real-time speech enhancementCochleaNet: 用于实时语音增强的鲁棒的独立于语言的视听模型
INFORMATION FUSION
IF15.5
Online Signature Verification based on the Lagrange formulation with 2D and 3D robotic models基于2D和3D机器人模型的拉格朗日公式的在线签名验证
PATTERN RECOGNITION
IF7.6
Instruction-guided fusion of multi-layer visual features in Large Vision-Language Models指令引导的多层视觉特征融合在大视觉语言模型中的应用
Pattern Recognition
IF7.6
Hierarchical Reinforcement Learning With Universal Policies for Multistep Robotic Manipulation具有通用策略的分层强化学习,用于多步机器人操纵

