经典音频技术介绍:从声波到数字音频
音频是数字世界中最古老也最贴近人类的媒体形态。无论是打电话、听音乐、语音助手还是车载语音交互,背后都有一套完整的声音数字化技术体系。本文从物理学出发,系统梳理数字音频的核心概念、技术指标与常见格式。
1. 声音的本质
声音是物体振动通过介质(空气、水、固体)传播的机械纵波。它有三个基本物理属性:
| 物理属性 | 单位 | 听感对应 |
|---|---|---|
| 频率 | Hz(赫兹) | 音调高低 |
| 振幅 | dB(分贝) | 响度大小 |
| 相位 | 弧度/度 | 音色与空间感 |
人耳可听范围约为 20Hz ~ 20kHz。低于 20Hz 为次声波,高于 20kHz 为超声波。语音的主要能量集中在 300Hz ~ 3400Hz,这也是电话系统长期采用窄带传输的原因。
2. 声音的数字化:模拟 → 数字
要让计算机处理声音,必须把连续变化的声波(模拟信号)转成离散的数字序列。这个过程称为 ADC(模数转换),包含三个关键步骤:
声波 → 采样(Sampling) → 量化(Quantization) → 编码(Coding) → PCM 数据
2.1 采样(Sampling)
按固定时间间隔采集声波的瞬时幅度值。
- 采样率(Sample Rate):每秒采样的次数,单位 Hz。
- 依据奈奎斯特采样定理:采样率必须大于信号最高频率的 2 倍,才能无失真重建原信号。
- 常见采样率:
- 8kHz:电话(窄带语音)
- 16kHz:宽带语音、语音识别(人耳听感较好的语音下限)
- 44.1kHz:CD 音乐
- 48kHz:DVD/电影
- 96kHz / 192kHz:高解析度音频(Hi-Res)
2.2 量化(Quantization)
把每个采样点的幅度值用有限位的二进制数表示,位数即位深/位宽(Bit Depth):
| 位深 | 动态范围 | 典型应用 |
|---|---|---|
| 8 bit | 约 48 dB | 早期语音、对讲 |
| 16 bit | 约 96 dB | CD、标准 PCM |
| 24 bit | 约 144 dB | 录音室制作、Hi-Res |
位深越高,幅度分级越细,噪声与失真越小。
2.3 编码(Coding)
将量化后的数值按序排列,形成线性脉冲编码调制数据,即 PCM(Pulse Code Modulation)。PCM 是最基本的数字音频格式,后续所有压缩格式都建立在 PCM 之上。
2.4 声道(Channels)
- 单声道(Mono):1 个声道,语音场景常用
- 双声道(Stereo):左右 2 个声道,立体声
- 多声道:5.1 / 7.1 / 全景声(Atmos)等,用于影院、游戏
2.5 数据量计算
PCM 数据量(字节/秒)= 采样率 × 位深/8 × 声道数。
例如 CD 音质(44.1kHz × 16bit × 2ch):
44 100 × 16 / 8 × 2 = 176 400 字节/s ≈ 172 KB/s,一分钟约 10 MB。
这正是未压缩音频体积大的原因,也是各类压缩编码存在的意义。
3. 音频编码与常见格式
3.1 无损压缩
在不丢失任何信息的前提下减小体积:
| 格式 | 特点 |
|---|---|
| WAV(PCM) | 未压缩,体积大,通用性极强 |
| FLAC | 无损压缩,压缩率约 50%~60%,Hi-Res 标配 |
| ALAC | Apple 无损格式 |
| APE | Monkey's Audio,压缩率略高于 FLAC |
3.2 有损压缩
利用心理声学模型(掩蔽效应:强声会掩蔽临近的弱声,人耳听不见的部分可丢弃)大幅压缩:
| 格式 | 码率典型值 | 特点 |
|---|---|---|
| MP3 | 128~320 kbps | 最经典的格式,普及度最高 |
| AAC | 96~256 kbps | MP3 的继任者,同码率音质更好,视频/流媒体标准 |
| OGG Vorbis | 128~256 kbps | 开源格式,游戏常用 |
| OPUS | 6~510 kbps | 极低延迟,VoIP / 实时通信首选,对语音优化极佳 |
码率(Bit Rate):每秒音频数据量,单位 kbps。码率越高音质越好、体积越大。
3.3 音频编码层次总结
PCM(原始)
├── 无损压缩:FLAC / ALAC / APE
└── 有损压缩:MP3 / AAC / OGG / OPUS ...
4. 音频应用的基本流程
一个典型音频产品涉及两套流程:
4.1 播放链路
音频文件/流 → 解封装 → 解码器 → PCM → 混音/音效处理 → 播放设备
4.2 采集链路
麦克风 → ADC → PCM →(可选)编码压缩 → 存储/传输
以 OpenHarmony 轻量系统为例,采集链路对应 audio_lite 组件的 AudioCapturer 接口:配置 AudioCapturerInfo(采样率、声道数、位宽、码率、编码格式)→ Start() → Read() 循环取数 → Stop()/Release()。
5. 音频质量主观评估要点
- 采样率决定频率上限(高音细节)
- 位深决定动态范围(背景噪声底)
- 码率决定有损压缩后保留的信息量
- 设备(麦克风/扬声器/DAC)与声学环境决定物理上限——瓶颈往往在终端硬件
6. 结语
从 1876 年贝尔的电话到今天的 Hi-Res 无损音乐与实时语音通话,音频技术两百年的演进,本质上都是在"信息量"与"带宽/存储"之间做取舍:采样与量化决定信息上限,编码技术决定如何更高效地携带信息。理解了 PCM、采样率、位深与码率这四根支柱,就掌握了理解一切音频技术的钥匙。
更多推荐
所有评论(0)