跳转至

进阶 AI 应用

适用配置

AI Perception Pack · 视觉语音盒子与多模态应用模块

MULTIMODAL AI PACK

视觉语音盒子与多模态联动

进阶 AI 应用以 RDK S100/S100P 为核心,通常组合 USB 相机、麦克风和扬声器形成视觉语音盒子。实际部署时建议把视觉、语音和上层逻辑集中运行在算力大脑侧。

  • 核心平台:RDK S100/S100P
  • 外设组合:USB 相机 + 麦克风 + 扬声器
  • 典型用途:画面理解、语音问答、语音播报与多模态演示

视觉语音盒子

AI Perception Pack 可基于 RDK S100/S100P 组合摄像头、麦克风和扬声器,搭建视觉语音盒子,用于画面采集、语音识别、语音播报和基础交互展示。该应用建议按需启动,不要并入运控小脑的基础自启动链路。

适用说明

本页仅保留视觉语音盒子的最小落地信息,重点用于现场部署与调试:

  • 看:通过 USB 摄像头获取画面输入。
  • 听:通过 USB 麦克风或语音模块采集语音。
  • 说:通过扬声器进行语音播报。
  • 连:通过 ROS 2 话题把视觉、语音和上层逻辑串起来。

硬件条件

项目 要求
智能计算平台 RDK S100/S100P
摄像头 USB 相机 / UVC 相机
音频设备 USB 麦克风,或 USB 语音设备 + 扬声器
显示设备 HDMI 显示器(调试时建议连接)
系统 Ubuntu 22.04
ROS 环境 ROS 2 Humble + TogetheROS.Bot
网络 首次安装软件包、下载 TTS 模型时需要联网

RDK S100/S100P 作为 AI Perception Pack 的视觉语音交互计算平台。机器人现场交付时,建议将视觉语音盒子运行在算力大脑侧,与运控小脑保持职责分离。

环境配置

加载 TROS 环境:

source /opt/tros/humble/setup.bash

安装常用检查工具与语音组件:

sudo apt update
sudo apt install v4l-utils ffmpeg
sudo apt install tros-humble-sensevoice-ros2
sudo apt install tros-humble-hobot-tts

首次使用 TTS 时下载模型:

wget http://archive.d-robotics.cc/tts-model/tts_model.tar.gz
sudo tar -xf tts_model.tar.gz -C /opt/tros/${TROS_DISTRO}/lib/hobot_tts/

设备检查

先检查摄像头是否被系统识别:

ls /dev/video*
v4l2-ctl --list-devices

若要快速查看图像输入,可执行:

ffplay -f video4linux2 -i /dev/video0

再检查音频设备:

ls /dev/snd/
arecord -l
aplay -l

若设备号与预期不一致,应先确认 USB 摄像头和 USB 语音设备的实际编号,再继续后续启动。

启动语音识别

SenseVoice 用于麦克风语音采集、命令词识别和 ASR 文本输出。

source /opt/tros/humble/setup.bash
ros2 launch sensevoice_ros2 sensevoice_ros2.launch.py micphone_name:="plughw:0,0"

音频设备号

plughw:0,0 只是示例。实际设备号应根据当前 USB 语音设备调整。

查看识别结果:

ros2 topic echo /asr_text

启动语音合成

新开一个终端:

source /opt/tros/humble/setup.bash
export GLOG_minloglevel=1
ros2 run hobot_tts hobot_tts

若 USB 播放设备不是默认设备,可显式指定,例如:

ros2 run hobot_tts hobot_tts --ros-args -p playback_device:="plughw:1,1"

再开一个终端发送测试文本:

source /opt/tros/humble/setup.bash
ros2 topic pub --once /tts_text std_msgs/msg/String "{data: 'Origin Kudada 视觉语音盒子已启动'}"

扬声器能够正常播报,即表示 TTS 链路工作正常。

组合方式

USB 摄像头
  ↓
视觉输入 / 图像处理

麦克风
  ↓
SenseVoice / ASR
  ↓  /asr_text
上层交互逻辑
  ↓  /tts_text
hobot_tts
  ↓
扬声器

部署时,建议把视觉输入、语音识别、语音播报都运行在 RDK S100/S100P 上;运动控制仍由运控小脑负责。若需要把视觉语音盒子的结果接入机器人动作控制,建议通过 ROS 2 话题、控制接口或既有任务逻辑做间接联动,而不是直接替代基础运控程序。

详情链接