§4.3 音频信号处理


1. 音频信号的特征
•音频(Audio)信号可分为两类:语音信号和非语音信号。
语音信号:语言物质的载体,人类信息交流所特有的形式。
非语音信号:不具有复杂的语义语法信息,识别简单。
•根据物理学原理,声音是一种在时间和幅度上都是连续的波形,是一种模拟信号。
模拟音频信号有三个重要参数:
幅度:从信号的基线到当前波峰的距离。
周期:信号在两个峰点或谷底之间的相对时间。
频率:每秒钟波峰所发生的数目。单位是赫兹(Hz)或千赫兹 (kHz)。
周期和频率之间的关系是互为倒数。

人耳能识别的声音频率范围大约在20Hz~20kHz,通常称为音频信号。

2. 音频的数字化过程
模拟音频信号的数字化过程需要三个步骤:采样、量化和编码
•采样:按一定的时间间隔将声音波形在时间轴(即横轴)上进行分割,把时间和幅度上都是连续的模拟信号转化成时间上离散、幅度连续的信号。
•量化:对声波波形幅度的数字化表示。量化把采样后在幅度轴上连续取值(模拟量)的每一个样本转换为离散值(数字量)表示。
•编码:按照一定的格式把经过采样和量化后得到的离散数据记录下来。


在计算机多媒体音频处理中,标准的采样频率为:
11.025kHz(语音效果)、22.05kHz(音乐效果)、44.1kHz(高保真效果)
☆数字化音频文件的存储容量计算
Ø采样频率、量化位数、声道数的值越大,形成的数字音频文件也就越大。数字音频文件的存储量以字节为单位,模拟波形声音被数字化后音频文件的存储量为:
存储量(字节)=采样频率(Hz)×量化位数/8×声道数×时间(秒)
[例] 采样频率为44.1kHz,16位量化的双声道立体声,求10秒钟数字化音频的数据量约为多少?
解:音频文件的容量
= (44100×16bit×2双声道×10秒÷8byte/1024/1024
= 1.682281M)
≈1.68MB
3. 数字音频的文件格式
所谓格式,可以理解为数码信息的组织方式。一段模拟音频经过数字化处理后,所产生的数码信息可以用各种编码格式编排,而形成一个个音频格式文件。
常用声音文件格式: 1.WAV格式; 2.MPEG音频文件——MP3; 3.其他格式:CD-DA,WMA,RM,AIFF。
4. 语音识别与语音识别技术
语音信号处理的应用极为广泛,其中的主要技术包括语音编码、语音合成、语音识别和语音增强等。
语音识别技术(Automatic Speech Recognition)是指将人说话的语音信号转换为可被计算机识别的文字信息,从而识别说话人的语音指令以及文字内容的技术。
语音合成又称文语转换技术,是指将任意文字信息实时转化为标准流畅的语音朗读出来。
目前已经有多个应用场景使用是因信号处理技术,如汽车上的语音服务,手机上的语音输入等。百度语音识别服务支持天气、地图、航班查询等35个领域的语义解析,可以识别用户的意图并提取用户表述中的关键内容,进行多意图解析,从而理解用户需求。


5. 利用百度API实现语音识别
百度云平台是一个功能非常强大的开放平台,平台提供了许多开放的 API接口给用户。百度语音识别为开发者提供免费的语音服务,通过场景识别优化,为车载导航,智能家居和社交聊天等领域提供语音解决方案,准确率达到90%以上.
百度语音识别通过API的方式给开发者提供一个通用的接口,通过上传录音文件,可将语音转换成文本。
要使用百度的语音识别功能,需要如下步骤:
1、需要先注册百度云的账号,然后登录AI开放平台,https://ai.baidu.com/tech/speech)
2、在控制台中创建应用,获取到API Key和Secret Key。
应用将调用API服务的基本操作单元,基于应用创建成功后获取的APIKey及 SecretKey,进行接口调用操作及相关配置。

语音识别技术和语音合成技术是实现人机语音通信,建立一个有听和讲能力的口语系统所必需的两项关键技术。
一、语音识别技术
语音识别技术是将人类的语音中的词汇内容转换为计算机可读的输入,例如按键、二进制编码或者字符序列,它所涉及的领域包括:信号处理、模式识别、概率论和信息论、发声机理和听觉机理、人工智能等等。
1920年代生产的"Radio Rex"玩具狗可能是最早的语音识别器,当这只狗的名字被呼唤的时候,它能够从底座上弹出来。最早的基于电子计算机的语音识别系统是由AT&T贝尔实验室开发的Audrey语音识别系统,它能够识别10个英文数字。其识别方法是跟踪语音中的共振峰。该系统得到了98%的正确率。到1950年代末,伦敦学院(College of London)的Denes已经将语法概率加入语音识别中。
语音识别技术的应用包括语音拨号、语音导航、室内设备控制、语音文档检索、简单的听写数据录入等。语音识别技术与其他自然语言处理技术如机器翻译及语音合成技术相结合,可以构建出更加复杂的应用,例如语音到语音的翻译。

目前智能手机上的语音识别技术除了能进行语音拨号之外,还可以进行语音转文字、翻译等工作。例如iPhone上的Dragon Dictation的应用程序可以让用户通过语音记笔记和发送电子邮件、更新Twitter;黑莓上也有类似功能的应用,如Dragon for Email;Android手机自带的语音识别软件可以帮助用户通过语音发送短信。
二、语音合成技术
语音合成技术是指通过机械的、电子的方法产生人造语音的技术。这种技术能将任意文字信息实时转化为标准流畅的语音朗读出来,使得机器能像人一样说话。它涉及了声学、语言学、数字信号处理、计算机科学等多个学科技术。
语音合成技术的研究已有两百多年的历史,但真正具有实用意义的近代语音合成技术是随着计算机技术和数字信号处理技术的发展而发展起来的,主要是让计算机能够产生高清晰度、高自然度的连续语音。在语音合成技术的发展过程中,早期的研究主要是采用参数合成方法,后来随着计算机技术的发展又出现了波形拼接的合成方法。


