摘要
本发明涉及语音识别技术领域,具体涉及一种用于卡片学习机的语音识别方法及系统,方法包括:采集儿童在多种语速、语调和口音下的读演讲和自发言语的语音数据,对语音数据进行预处理,并进行分帧处理,采用Hamming窗函数进行加窗,通过语速扰动进行数据增强,生成不同语速的音频版本,对增强后的语音数据提取梅尔频率倒谱系数特征,并结合一阶和二阶差分特征,生成特征向量,并执行倒谱均值方差归一化处理,构建基于深度学习的语音识别模型,对语音识别模型进行判别式训练进行优化,使用优化后的模型进行语音识别解码,并输出文本识别结果和发音纠正建议。通过本发明,可以提升智能卡片学习机在多语言环境下的实用性与用户体验。