教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 互联网资料 >

基于深度学习神经网络的孤立词语音识别的研究

来源:网络收集 时间:2026-09-12
导读: 为了提高语音识别系统性能,研究提出将自编码器深度学习神经网络应用于语音识别中。该网络结构引入贪婪逐层预训练学习算法,通过预训练和微调两个步骤,提取出待识别语音信号的本质特征,克服传统多层人工神经网络模型在训练时存在易陷入局部极小值且需要大量标

为了提高语音识别系统性能,研究提出将自编码器深度学习神经网络应用于语音识别中。该网络结构引入贪婪逐层预训练学习算法,通过预训练和微调两个步骤,提取出待识别语音信号的本质特征,克服传统多层人工神经网络模型在训练时存在易陷入局部极小值且需要大量标签数据的问题。然后经过规整网络,将任意长度帧的语音特征参数规整到某一特定帧,输入到分类器中进行语音识别。对反向传播神经网络和自编码神经网络分别进行了仿真实验…

优先出版

计 算 机 应 用 研 究

第32卷

基于深度学习神经网络的孤立词语音识别的研究

王山海,景新幸,杨海燕

(桂林电子科技大学 信息与通信学院,广西 桂林 541004)

摘 要:为了提高语音识别系统性能,研究提出将自编码器深度学习神经网络应用于语音识别中。该网络结构引入贪婪逐层预训练学习算法,通过预训练和微调两个步骤,提取出待识别语音信号的本质特征,克服传统多层人工神经网络模型在训练时存在易陷入局部极小值且需要大量标签数据的问题。然后经过规整网络,将任意长度帧的语音特征参数规整到某一特定帧,输入到分类器中进行语音识别。对反向传播神经网络和自编码神经网络分别进行了仿真实验,结果表明深度学习神经网络识别准确度较传统神经网络提升了26.1%,是一种优良的语音识别模型。 关键词:语音识别;人工神经网络;深度学习;自编码器;规整网络 中图分类号:TN912

*

Study of isolated speech recognition based on deep learning neural networks

WANG Shan-hai, JING Xin-xing, YANG Hai-yan

(School of Information & Communication, Guilin University of Electronic Technology, Guilin Guangxi 541004, China) Abstract: To improve the performance of the conventional speech recognition system, the research introduced the autoencoder deep learning neural networks which was applied to speech recognition. The neural networks based on deep learning introduced greedy layer-wise learning algorithm by pretraining and fine-tuning. It could extract the essential features of speech signal which was needed to recognition. It could overcome the shortcomings of the conventional multilayer artificial neural networks which easily trapped into local optimum when training the model. And they need a large number of labeled data. Then the structured alignment networks could align arbitrary frames of features to fixed frames. And these features were input to a classifier to speech recognition. This paper did some experiment with back propagation neural networks and autoencoder neural networks respectively. The results illustrate that the deep learning neural networks can outperform the conventional neural networks by 26. 1% in accuracy. It is an excellent speech recognition model.

Key Words: speech recognition; artificial neural networks; deep learning; autoencoder; alignment networks

语音识别是为了让计算机理解人类语言的命令,达到人机交互智能化的目的。随着计算机技术的不断发展和广泛应用,语音识别技术得到了迅速发展,语音识别的研究越来越受到人们的关注。

目前常用的识别方法主要有:动态时间规整(Dynamic Time Warping, DTW)方法、 矢量量化(Vector Quantization, VQ)方法和隐马尔科夫模型(Hidden Markov Model, HMM)方法。二十世纪八十年代末期,人工神经网络(Artificial Neural Networks, ANN)的研究逐渐兴起,它是一种分布式并行信息处理系统,实验表明这种方法比较适合于语言信号处理

[1]。但随着研究的深入,传统神网络本身的局限性也逐步暴露

用于多层神经网络,可以为各层神经网络提供较好的初始权值及偏置,使得网络能够很快地收敛于合理的极值点。从而可以解决传统神经网络的不足。

1 人工神经网络

1.1 神经网络简介

人工神经网络(ANN)是由大量简单的处理单元--神经元按照某种方式联结而成的自适应的非线性系统。这种网络具有与人脑相似的学习记忆、知识概括和信息特征抽取能力。

神经元的结构如图1所示。神经网络的输入输出关系可以用下列式子表示,

出来,如:易陷入局部极小值问题、需要大量标记数据等。 Hinton和他的学生在《科学》杂志上2006年发表了一篇文章,提出了深度学习的概念。从此,深度学习的研究在语言、图像、信息检索等领域逐步开展起来。将深度学习算法运

--------------------------------

[2]

u wjixj i ij 1

N

(1) (2)

yi f(ui)

其中,wji 代表神经元i与神经元j之间连接的强度,被称

基金项目:广西区自然科学基金(2012GXNSFAA053221);广西千亿元产业产学研用合作项目(合作开发项目)(信科院0168)

作者简介:王山海(1982-),男,河南长垣人,硕士研究生,主要研究方向为语音信号处理(shanniu728@http://www.77cn.com.cn);景新幸(1960-),男,博士,教授,主要研究方向为语音信号处理、非线性电路、集成电路设计;杨海燕(1975-),女(通信作者),硕士,副教授,主要研究方向为语音信号处理.

为了提高语音识别系统性能,研究提出将自编码器深度学习神经网络应用于语音识别中。该网络结构引入贪婪逐层预训练学习算法,通过预训练和微调两个步骤,提取出待识别语音信号的本质特征,克服传统多层人工神经网络模型在训练时存在易陷入局部极小值且需要大量标签数据的问题。然后经过规整网络,将任意长度帧的语音特征参数规整到某一特定帧,输入到分类器中进行语音识别。对反向传播神经网络和自编码神经网络分别进行了仿真实验…

文章预览已结束

获取全文请访问 http://www.77cn.com.cn/article/02-2015-08-017.html

…… 此处隐藏:1554字,全部文档内容请下载后查看。喜欢就下载吧 ……
基于深度学习神经网络的孤立词语音识别的研究.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/1933524.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)