进阶 AI 应用
适用配置
AI Perception Pack · 视觉语音盒子与多模态应用模块
MULTIMODAL AI PACK
视觉语音盒子与多模态联动
进阶 AI 应用以 RDK S100/S100P 为核心,通常组合 USB 相机、麦克风和扬声器形成视觉语音盒子。实际部署时建议把视觉、语音和上层逻辑集中运行在算力大脑侧。
- 核心平台:RDK S100/S100P
- 外设组合:USB 相机 + 麦克风 + 扬声器
- 典型用途:画面理解、语音问答、语音播报与多模态演示
视觉语音盒子
AI Perception Pack 可基于 RDK S100/S100P 组合摄像头、麦克风和扬声器,搭建视觉语音盒子,用于画面采集、语音识别、语音播报和基础交互展示。该应用建议按需启动,不要并入运控小脑的基础自启动链路。
适用说明
本页仅保留视觉语音盒子的最小落地信息,重点用于现场部署与调试:
- 看:通过 USB 摄像头获取画面输入。
- 听:通过 USB 麦克风或语音模块采集语音。
- 说:通过扬声器进行语音播报。
- 连:通过 ROS 2 话题把视觉、语音和上层逻辑串起来。
硬件条件
| 项目 | 要求 |
|---|---|
| 智能计算平台 | RDK S100/S100P |
| 摄像头 | USB 相机 / UVC 相机 |
| 音频设备 | USB 麦克风,或 USB 语音设备 + 扬声器 |
| 显示设备 | HDMI 显示器(调试时建议连接) |
| 系统 | Ubuntu 22.04 |
| ROS 环境 | ROS 2 Humble + TogetheROS.Bot |
| 网络 | 首次安装软件包、下载 TTS 模型时需要联网 |
RDK S100/S100P 作为 AI Perception Pack 的视觉语音交互计算平台。机器人现场交付时,建议将视觉语音盒子运行在算力大脑侧,与运控小脑保持职责分离。
环境配置
加载 TROS 环境:
安装常用检查工具与语音组件:
sudo apt update
sudo apt install v4l-utils ffmpeg
sudo apt install tros-humble-sensevoice-ros2
sudo apt install tros-humble-hobot-tts
首次使用 TTS 时下载模型:
wget http://archive.d-robotics.cc/tts-model/tts_model.tar.gz
sudo tar -xf tts_model.tar.gz -C /opt/tros/${TROS_DISTRO}/lib/hobot_tts/
设备检查
先检查摄像头是否被系统识别:
若要快速查看图像输入,可执行:
再检查音频设备:
若设备号与预期不一致,应先确认 USB 摄像头和 USB 语音设备的实际编号,再继续后续启动。
启动语音识别
SenseVoice 用于麦克风语音采集、命令词识别和 ASR 文本输出。
source /opt/tros/humble/setup.bash
ros2 launch sensevoice_ros2 sensevoice_ros2.launch.py micphone_name:="plughw:0,0"
音频设备号
plughw:0,0 只是示例。实际设备号应根据当前 USB 语音设备调整。
查看识别结果:
启动语音合成
新开一个终端:
若 USB 播放设备不是默认设备,可显式指定,例如:
再开一个终端发送测试文本:
source /opt/tros/humble/setup.bash
ros2 topic pub --once /tts_text std_msgs/msg/String "{data: 'Origin Kudada 视觉语音盒子已启动'}"
扬声器能够正常播报,即表示 TTS 链路工作正常。
组合方式
部署时,建议把视觉输入、语音识别、语音播报都运行在 RDK S100/S100P 上;运动控制仍由运控小脑负责。若需要把视觉语音盒子的结果接入机器人动作控制,建议通过 ROS 2 话题、控制接口或既有任务逻辑做间接联动,而不是直接替代基础运控程序。