语音识别技术的关键技术
更多
语音识别(Automatic Speech Recognition, ASR)技术的关键技术主要包含以下几个核心环节:
-
声学特征提取 (Feature Extraction):
- 目的: 将原始语音信号(时域波形)转换为更适合计算机处理的、包含关键声学信息的特征向量序列。
- 关键技术:
- 预加重: 提升高频分量,补偿语音信号频谱的自然衰减。
- 分帧加窗: 将连续的语音信号分割成短时帧(通常20-40ms),并对每帧进行加窗(如汉明窗、汉宁窗)以减少边缘效应。
- 傅里叶变换: 将时域帧信号转换为频域信号(频谱)。
- 梅尔频率倒谱系数: 将频谱映射到更符合人耳听觉特性的梅尔刻度上,再进行离散余弦变换,得到包含声道信息的低维特征向量。这是目前最主流的特征。
- 滤波器组特征: 将频谱通过一组梅尔滤波器,计算每个滤波器的能量并取对数。更接近梅尔倒谱的输入层。
- 其他特征: 感知线性预测、波形自回归特征等。
-
声学模型 (Acoustic Model):
- 目的: 建模声学特征与基本语音单元(如音素、状态、字)之间的映射关系。它是核心模型之一。
- 关键技术演进与当前主流:
- 深度神经网络: 已成为绝对主流。常见结构包括:
- 深层前馈神经网络: 基础结构。
- 递归神经网络: 特别是长短期记忆网络和门控循环单元,能有效建模语音信号的时序依赖关系。
- 卷积神经网络: 能学习时频域上的局部相关性和平移不变性。
- 端到端模型: 如连接时序分类、基于注意力机制、RNN-T等模型,旨在直接学习语音特征序列到词或子词序列的映射,简化传统声学模型和语言模型的分工。
- 建模单元: 常用音素、中文音节、字或子词单元。
- 深度神经网络: 已成为绝对主流。常见结构包括:
- 传统技术(现今较少单独使用): 基于高斯混合模型-隐马尔可夫模型(GMM-HMM)的声学模型。
-
语言模型 (Language Model):
- 目的: 建模词序列中词汇出现的联合概率分布,捕捉语言的语法、语义和上下文规律(如哪些词更可能接在哪些词后面),解决发音相似词的歧义问题(同音词)。
- 关键技术:
- n-gram 模型: 基于统计,计算连续n个词出现的概率。简单有效,计算效率高。
- 神经网络语言模型:
- RNNLM: 循环神经网络语言模型,能建模长距离依赖。
- Transformer LM: 基于自注意力机制,并行性好,建模能力强大,已成为当前主流。
- 核心作用: 通过联合解码,帮助声学模型选择最符合语言习惯的词汇序列(例如,“手机”比“手鸡”更合理)。
-
解码器 (Decoder):
- 目的: 整合声学模型和语言模型的信息,在庞大的搜索空间(所有可能的词序列组合)中,快速高效地搜索出最可能的词序列作为识别结果。
- 关键技术:
- 动态解码算法: 核心是维特比算法或加权有限状态转换器,结合声学模型似然度和语言模型概率进行搜索。
- 束搜索: 在每一步只保留最有可能的若干条路径,极大降低计算量,广泛应用。
- 加权有限状态转换器: 能高效表示和操作声学模型、发音词典、语言模型组成的网络,用于复杂系统的解码。
-
发音词典 (Pronunciation Lexicon):
- 目的: 提供词汇(词或字)到其基本语音单元序列(音素、音节等)的映射关系。它是连接声学模型(处理声学单元)和语言模型/解码器(处理词汇)的桥梁。
- 要求: 词汇覆盖度广,发音准确(尤其是多音字),并常包含词频信息。中文需要良好的分词。
-
后处理与模型优化:
- 目的: 进一步提升识别准确率、流畅度和自然度。
- 关键技术:
- 文本规范化/顺滑: 将识别的“字面词”转换为更自然流畅的文本(例如,数字读法转换:“2024” -> “二零二四” 或 “两千零二十四”,根据场景)。
- 口语化现象处理: 处理重复词、犹豫词(“呃”、“啊”)、不完整句等。
- 标点符号预测: 根据停顿、语调及语义预测合适的标点符号。
- 说话人自适应: 针对特定说话人的语音特点微调模型,提高对该说话人的识别率。
- 环境鲁棒性增强: 提高模型在噪声、混响、不同麦克风等复杂声学环境下的表现。
- 模型压缩与加速: 如量化、剪枝、知识蒸馏等,使模型能在资源受限设备上实时运行。
总结:
现代语音识别系统是声学模型(当前主要是深度神经网络/端到端模型)、语言模型(当前主要是神经网络模型,尤其是Transformer) 和高效解码器(如束搜索)三大核心技术的有机结合。发音词典是关键的连接纽带。声学特征提取(如MFCC/FBank) 是重要前处理步骤。后处理技术用于精修输出结果并提高用户体验。大规模训练数据和强大的计算能力是支撑这些技术发展的基石。端到端学习是当前研究的重点方向之一,旨在简化流程并更直接地优化最终目标。
明白VPP关键技术有哪些
随着人工智能技术的不断发展,越来越多的行业开始使用人工智能技术,这也使得智能虚拟代理技术得到了广泛的应用。为了能够深入了解智能虚拟代理
2021-08-31 07:28:16
7天热门专题
换一换
换一换
- 如何分清usb-c和type-c的区别
- 中国芯片现状怎样?芯片发展分析
- vga接口接线图及vga接口定义
- 芯片的工作原理是什么?
- 华为harmonyos是什么意思,看懂鸿蒙OS系统!
- 什么是蓝牙?它的主要作用是什么?
- ssd是什么意思
- 汽车电子包含哪些领域?
- TWS蓝牙耳机是什么意思?你真的了解吗
- 什么是单片机?有什么用?
- 升压电路图汇总解析
- plc的工作原理是什么?
- 再次免费公开一肖一吗
- 充电桩一般是如何收费的?有哪些收费标准?
- ADC是什么?高精度ADC是什么意思?
- dtmb信号覆盖城市查询
- EDA是什么?有什么作用?
- 中科院研发成功2nm光刻机
- 苹果手机哪几个支持无线充电的?
- type-c四根线接法图解
- 华为芯片为什么受制于美国?
- 怎样挑选路由器?
- 元宇宙概念股龙头一览
- 锂电池和铅酸电池哪个好?
- 如何进行编码器的正确接线?接线方法介绍
- 什么是场效应管?它的作用是什么?
- 虚短与虚断的概念介绍及区别
- 晶振的作用是什么?
- 大疆无人机的价格贵吗?大约在什么价位?
- amoled屏幕和oled区别
- 苹果nfc功能怎么复制门禁卡
- 单片机和嵌入式的区别是什么
- 复位电路的原理及作用
- BLDC电机技术分析
- dsp是什么意思?有什么作用?
- 苹果无线充电器怎么使用?
- iphone13promax电池容量是多少毫安
- 芯片的组成材料有什么
- 特斯拉充电桩充电是如何收费的?收费标准是什么?
- 直流电机驱动电路及原理图
- 传感器常见类型有哪些?
- 自举电路图
- 苹果笔记本macbookpro18款与19款区别
- 通讯隔离作用
- 新斯的指纹芯片供哪些客户
- 伺服电机是如何进行工作的?它的原理是什么?
- 无人机价钱多少?为什么说无人机烧钱?
- 以太网VPN技术概述
- 手机nfc功能打开好还是关闭好
- 十大公认音质好的无线蓝牙耳机