§4.4 数字图像处理


1. 数字图像的表示
现代图像既包括可见图像,也包括不可见光范围内借助于适当转换装置转换成人眼可见的图像(如红外成像技术),还包括视觉无法观察的其他物理图像和空间物体图像,以及由数学函数和离散数据所描述的连续或离散图像。

数字图像的表示
二维数字图像一般用矩阵形式来表示,把数字图像表示成矩阵的优点在于能应用矩阵理论对图像进行分析处理。对一幅图像采样时,若每行(横向)像素n个,每列(纵向)像素m个,则图像大小为m×n个图像,从而构成一个m×n实数矩阵。

2. 黑白图像、灰度图像与彩色图像
黑白图像是指图像的每个像素只能是黑或者白,没有中间的过渡,故又称为二值图像。

灰度图像是指每个像素的信息由一个量化的灰度级来描述的图像。灰度图像没有彩色信息(无色调的灰度),只有亮度信息。

5bit、4bit、3bit、2bit不同灰度级别的图像效果
彩色图像是指除亮度信息外,还包含颜色信息的图像,即有色调的彩色图像。彩色图像的表示与所用的颜色空间有关。在RGB颜色模型中,自然界的可见颜色都可以用三种基色按一定比例混合得到,反之人一种颜色也可以分解为三种基色,即红(Red),绿(Green),蓝(Blue),每种颜色在0~255中取值,(0最暗,255最亮)

3. 颜色模型
在进行图像处理时,常常会涉及到用几种不同色彩模型(或颜色模型)来表示图像的颜色。使用色彩模型的目的是尽可能多地及有效地描述各种颜色,以便需要时能方便地加以选择。各个应用领域一般使用不同的色彩模型。
RGB颜色模型:计算机显示,图像由红R、绿G、蓝B三个灰度(或亮度)矩阵组成,基色是互为独立的单色,任一基色都不能由其他两种基色混合产生。自然界常见的各种颜色,都可以由红(Red)、绿(Green)、蓝(Blue)三种颜色光按不同比例相配而成
YUV颜色模型: 彩色电视信号
HSI颜色模型:颜色处理和识别的视觉系统等
CMYK颜色模型:专用于彩色印刷。它是通过对青(C)、洋红(M)、黄(Y)、黑(K)四个颜色变化以及它们相互之间的叠加来得到各种颜色的,CMYK即是代表青、洋红、黄、黑四种印刷专用的油墨颜色,也是Photoshop软件中四个通道的颜色。具体到印刷上,是通过控制青、洋红、黄、黑四色油墨在纸张上的相叠印刷来产生色彩的,它的颜色种数少于RGB色。

4. 图像的数字化过程
图像的数字化过程分为采样、量化与编码三个步骤
图像采样就是将二维空间上连续的图像用许多等距的水平线与竖直线分割成网状的过程。
| 被分割的图像若水平方向有M个间隔,垂直方向上有N个间隔,则一幅图像画面就被表示成M×N个离散像素点构成的集合,M×N表示图像的分辨率。 |
在数字设备上,数字图像的采样通常是由光电转换器件完成,即将大量的光电转换单元以阵列形式排列,它可将所获得的光线强度转换成与其成正比的电压值。具有这种光敏感特性的元件称为电荷耦合器件(CCD)。上千万个CCD单元封装为二维阵列,每一个CCD单元对应着一个图像的像素点,这样就获得一个二维数字图像。

图像量化实际就是将图像采样后的样本值的范围分为有限多个区域,把落入某区域中的所有样本值用同一值表示。
与音频量化类似,我们把在图像量化时所确定的离散取值的个数称为量化等级,它实际表示的是图像所具有的颜色总数或灰度值,为得到量化等级所需的二进制位数称为量化字长(也称颜色深度),如用8位、16位、24位来表示。这样,图像可表示的量化等级(颜色数或灰度值)就为2的幂次方,即28、216、224种颜色。由此可知,量化字长越大,所得到的量化级数也就越多,则越能真实地反映原有图像的颜色。

数字图像存储容量的计算
用字节表示图像文件大小时,一幅未经压缩数字图像的数据量大小计算如下:
图像数据量大小(字节)=
图像水平方向的像素数×垂直方向的像素数×图像深度(颜色深度)÷8
【例】若照片大小为6吋(6×4),分辨率为300dpi,则该照片包含的像素数量大小为( )。
解: =6*300*4*300=2160000
【例】 一幅分辨率为640*480彩色RGB图像,每个通道颜色用8bit表示,则该图像所占的存储空间为( )。
解: =640*480*8bit*3/8/1024=900KB
【例】一幅 640×480 的 256 色图像存储容量为多少?
解: =640×480×8/8 = 307200 字节 注意:256=28
注意图形与图像的区别!!

5. 图像的压缩与编码
数字化后得到的图像数据量十分巨大,必须采用编码压缩技术压缩图像数据信息,它是实现图像传输与存储的关键。
(1)图像信息为什么能压缩
连续多帧画面在很大程度上是相似的,而这些相似的信息(或称作冗余信息)为数据的压缩提供了基础。

(2)数据压缩与编码分类
数据压缩方法有许多种,根据解码后数据与原始数据是否完全一致可以分为两大类:有损压缩和无损压缩。
在无损压缩中,数据在压缩或解压缩过程中不会改变或损失,解压缩产生的数据是对原始对象的完整复制。
有损压缩是指使用压缩后的数据进行重构,重构后的数据与原来的数据有所不同,但不会使人对原始资料表达的信息造成误解。
通常声音、图像与视频的数据压缩都采用有损压缩. 有损数据压缩方法通常需要在压缩速度、压缩数据大小以及质量损失这三者之间进行取舍平衡。

图像文件常见格式
1.BMP:Windows软件推荐使用的一种格式。
2.JPEG:JPEG使用一种有损压缩算法,它用有损压缩方式去除冗余的图像数据,在获得极高的压缩率的同时能展现十分丰富生动的图像。
3.GIF:为了制定彩色图像传输协议而开发的图像格式文件。
4.PSD:Adobe公司的图像处理软件Photoshop的专用格式。
5.TIFF:标记图像文件格式,是为扫描仪和桌面出版系统研制开发的较为通用的图像文件格式。
6.PNG:一种新兴的网络图像格式。
7.其他格式:Office组件专用的WMF剪贴画文件格式(*.wmf);AutoCAD中使用的绘图互换格式DXF(*.dxf)和Zsoft公司推出的PCX文件格式(*.pcx)等。

6. 图像识别中的深度学习
图像识别:利用计算机对图像进行处理、分析和理解,以识别各种不同模式的目标和对象的技术,它是人工智能的重要方面。
深度学习(基于神经网络)与传统图像识别模式识别方法的最大不同在与它所采用的特征是从大数据中自动学习到的,而非手工设计的。好的特征可以提高模式识别系统的性能。


讨论1:操作系统Windows 7自带的画图软件生产的是位图还是矢量图?
讨论2:计算机显示器的屏幕分辨率与图像分辨率的区别?


