arrow
返回

SVA: Towards Speech-Enabled Vision-Language-Action Model

delete2025-12-13
delete0
PRE
AI
L
Lingxiao Li
J
Jiacheng Fan
X
Xiao‐Hui Ni
S
Su‐Juan Qin
W
Wenmin Li
F
Fei Gao
DOI:10.1016/j.patcog.2025.112915delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 介绍了SVA,一种用于机器人的语音驱动视觉-语言-动作模型。 • 结合语音、视觉和本体感觉,实现实时机器人控制。 • 介绍了一种轻量级动作专家网络,用于高效的动作生成。 • 在CALVIN基准测试中,零样本泛化性能优于基线模型。 • 能够以高鲁棒性和准确性处理语言丰富的指令。

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

B
Beijing University of Posts and Telecommunications
学者数:
2.6K
论文数: 1.2K
被引数: 4.2K
引用论文

引用论文

A Comprehensive Overview of Large Language Models大型语言模型的全面概述
err2025-08-19
err0
errOAAI
errHumza Naveed; Asad Ullah Khan; Shi Qiu; Muhammad Saqib; Saeed Anwar; Muhammad Usman; Naveed Akhtar; Nick Barnes; Ajmal Mian
err分享
err收藏
err分享
err收藏
err分享
err收藏
err分享
err收藏
学者 查看更多内容