基于树莓派的语音轮椅导航
基于树莓派3的卷积神经网络用于残障患者电动轮椅导航设计
摘要
肢体残疾患者,如失去手臂、手或瘫痪者,在移动时会遇到困难,需要他人或辅助设备帮助其行动。电动轮椅是肢体残疾患者常用于辅助活动的工具之一。本文的主要目的是设计一种可由语音指令控制的轮椅,适用于肢体残疾患者,采用卷积神经网络方法(CNN)识别语音指令,并在树莓派3上实现。录制的声音数据被转换为频谱图后输入卷积神经网络。该方法在语音指令识别中表现良好,准确率超过90%。轮椅导航包含五种不同的语音指令:前进、后退、左转、右转和停止。初步实验结果表明,所设计的电动轮椅能够通过语音指令实现移动。
关键词
身体残疾,轮椅,语音指令,卷积神经网络,树莓派3
引言
患有手臂和手部疾病的患者在使用轮椅时存在困难。这种情况的发生是因为他们的手无法正常操作和朝任何方向移动轮椅[1]。在先前的研究中,许多文章讨论了引入语音指令用于轮椅导航。然而,其准确率并不理想。因此,需要一种更精确的方法。一种有前景的方法是卷积神经网络。本文重点研究卷积神经网络在轮椅导航系统中的应用。本文的主要贡献在于将CNN的实现嵌入树莓派3,以解释用户的语音指令。
这款智能电动轮椅在未来社会中具有重要作用。基于这一情况,采用语音识别技术的电动轮椅能够更好地引导轮椅并规划运动,从而方便患者的生活。在所提出的系统中,语音识别系统作为用户界面用于操作该系统。特别无法行走、残疾或瘫痪而必须依靠轮椅进行日常活动的患者,仅通过语音指令即可操控轮椅。通过电动轮椅控制系统,人们将变得更加便捷和独立。该电动轮椅控制系统采用语音识别系统来触发和控制其所有动作[2]。重点在于通过引入某些可能的改进来提升轮椅功能,以体现其优越性[3]。
系统概述 语音命令与轮椅反应
在本研究中,我们设置通过麦克风采集音频输入信号来控制轮椅移动。语音命令包含五个输入和五个响应指令。尽管我们仅使用了五个命令,但采集了不同音调(高、中、低)的样本,以便轮椅能够识别各种语调的声音。这五个命令是前进、后退、右、左和停止[4]。
Sox - 音频交换
Sox - 音频交换是一个跨平台命令行,可以将各种音频/音频格式转换为其他格式。Sox - 音频交换还可以在多个平台上播放和录制音频文件。在转换音频之前首先要做的,是使用从应用商店下载的录音机Pro应用程序,通过麦克风录制声音。采样率设置为16000赫兹,比特率为128千比特/秒,采用单声道。然后对录制的声音文件进行处理:使用Sox - 音频交换向前剪辑0.1秒,后修剪0.1秒,填充音频文件2秒,再截取为1秒。这样做的目的是使所有录音具有相同的长度。
梅尔频率倒谱系数 (MFCC)
梅尔频率倒谱系数(MFCC)是一种用于执行特征提取的方法,该过程是将声音信号转换为基于带宽变化的多个参数[5], 。由于声音以赫兹(Hz)为单位进行测量,而主观音调则在梅尔刻度上进行测量。梅尔频率分为两部分:低于1000赫兹的低频线性频率和高于1000赫兹的高频对数频率[6]。以下公式表示梅尔刻度与频率(赫兹)之间的关系。
$$
Mel(f)= 2595 \times \log_{10}\left(1 + \frac{f}{700}\right)
$$
其中 $ Mel(f) $ 是梅尔刻度的函数,$ f $ 为频率。同时,包裹过程使用以下公式。
$$
X_i = \log_{10}\left(\sum_{n-1} |X(k)| H_i(k)\right)
$$
$ i= $ 个滤波器,$ H(k_i) $ 是频率 $ k $ 的滤波器值。
该滤波器用于捕捉声音信号的语音特征,这些声音信号被转换为频谱图图像,以便更易于可视化[7]。
卷积神经网络
卷积神经网络(CNN)是一种常用于图像数据的神经网络。CNN可用于检测和识别图像中的物体[8]。CNN与普通神经网络差别不大,它由具有权重、偏置和激活函数的神经元组成。由于CNN具有网络层级,因此属于深度神经网络类型,并广泛应用于图像数据处理。CNN包含两种方法:一种是使用前馈进行分类,另一种是使用反向传播进行学习阶段。CNN的工作方式与多层感知机(MLP)类似,但CNN中的每个神经元以二维形式表示,而MLP中的每个神经元仅为一维。
方法 特征提取
语音识别系统包含三个主要的可视化模块,即特征提取、特征优化和特征匹配[9]。本文报道的研究工作旨在通过使用MFCC特征提取和卷积神经网络进行联合语音的引入,以匹配声音特征,并将其应用于电动轮椅,辅助身体残疾人士的行动。每条语音命令有20个不同的样本,采样率均为16000赫兹,且大小相同。
使用卷积算子对输入信号进行滤波,并提取一些额外的图像特征[11]。包含5个输入,即右、左转、前进、后退和停止。我们使用了三个卷积层和三个池化层,每层均有32个滤波器,3×3窗口,步幅为=1 ,并采用相同填充。输出包含5个,如图4所示。
框图和硬件设计
系统的框图和硬件如图5所示。
轮椅导航系统模块,(b) 电动轮椅导航设计
在通过语音命令设计电动轮椅的过程中,涉及若干主要模块以及所使用的设备和材料。它们是:
1. 电源
2. 语音模块/麦克风
3. 带驱动器的直流电机
4. 树莓派
5. 轮椅
6. 工具包
结果与讨论
从结果来看,使用梅尔频率倒谱系数(MFCC)方法进行语音识别,再将其输入卷积神经网络(CNN),具有较高的准确率,因此产生的误差非常小。测试分为两种方式进行:第一种使用人工神经网络(ANN)方法,第二种使用卷积神经网络进行测试。结果图形如图6所示。
人工神经网络,(b) 卷积神经网络)
根据上述图表上图,然后在表1中将解释轮椅反应实验的结果。
| 语音指令 | 电机1 (右) | 电机2 (左) | 反应 |
|---|---|---|---|
| 前进 | 1 | 1 | 两个电机都开启且轮椅正在前进。 |
| 后退 | 1 | 1 | 两个电机都开启,但处于相反方向,因此轮椅正在后退。 |
| Left | 1 | 0 | 右电机处于开启状态,且电机处于关闭状态,轮椅左转。 |
| 右 | 0 | 1 | 左电机处于开启状态,且右电机处于开启状态,轮椅正在向右旋转。 |
| Stop | 0 | 0 | 所有电机均处于关闭状态,因此轮椅停止。 |
结论
在本研究中,我们开发了一种配备声音模块的轮椅。该轮椅专为身体残疾人士设计,使其能够更轻松地移动轮椅而无需消耗大量体力。我们采用电机作为驱动器,使用麦克风模块来激活声音,并以树莓派作为系统控制。结论是,该电动轮椅能够根据用户语音识别指令运行,准确率超过90%。然而,该轮椅存在一个缺点,即其性能依赖于作为电压源的电池容量。
更多推荐
所有评论(0)