本课定位
51~54课我们学习了连续时域的傅里叶级数、连续傅里叶变换。但计算机无法处理无限、连续的模拟信号:
- 图像:像素是离散坐标,只有有限个采样点;
- 音频:声卡按固定间隔采样,输出离散数字;
- 扩散模型、时序数据集:全部是数字化离散数值。
连续积分无法直接写代码运算,因此诞生离散傅里叶变换DFT:把有限长度离散采样序列,映射为有限长度离散频域序列,完全适配计算机数字运算,是Python、C++处理图像音频的核心底层算法。
本课衔接连续傅里叶变换,完整推导DFT正/逆变换公式,对比连续与离散的核心差异,配套AI工程代码逻辑讲解。
前置知识回顾
- 连续傅里叶正/逆变换(54课);
- 复数、欧拉公式、复指数运算;
- 有限序列、采样基础概念。
一、从连续信号到计算机离散采样
- 采样定义
模拟连续信号 f(t),按固定采样间隔 T_s 截取有限个点,得到离散序列:
f[n] = f(nT_s),\quad n=0,1,2,…,N-1
- N:总采样点数(图像单通道像素数量、音频单帧采样点)
- n:离散时域序号(整数,无单位)
- T_s:采样间隔,采样频率 f_s=\dfrac{1}{T_s}
- 连续傅里叶变换的离散化改造
连续变换是无穷积分 \displaystyle \int_{-\infty}^{+\infty},计算机只能处理有限N个点:
- 积分→有限项求和;
- 无限连续频率→N个离散频率分量;
- 无限时域区间→长度为N的有限序列。
经过离散化、有限截断,最终得到DFT完整公式。
二、DFT 正变换、逆变换完整公式
设有限长离散时域序列 f[n],n=0,1,…,N-1
- DFT正变换(离散时域 → 离散频域)
F[k] = \text{DFT}{f[n]} = \sum_{n=0}^{N-1} f[n] \cdot W_N^{kn},\quad k=0,1,…,N-1
旋转因子定义(DFT核心单元)
W_N = e^{-i\frac{2\pi}{N}} = \cos\frac{2\pi}{N} - i\sin\frac{2\pi}{N}
- n:时域采样序号
- k:频域频率序号,共N组离散频率
- F[k]:离散频谱,复数,模代表频率分量幅值,辐角代表相位
- IDFT 逆离散傅里叶变换(离散频域 → 还原离散时域)
f[n] = \text{IDFT}{F[k]} = \frac{1}{N}\sum_{k=0}^{N-1} F[k] \cdot W_N^{-kn},\quad n=0,1,…,N-1
逆变换作用:修改频谱(降噪、压缩)后,还原出处理后的数字图像/音频。
三、连续傅里叶变换 vs DFT 核心对照表
对比维度 连续傅里叶变换(CFT) 离散傅里叶变换(DFT)
输入信号 无限长、连续模拟信号 长度N、有限离散数字序列
运算形式 无穷积分 有限项求和
频率分布 连续不间断频率 N个离散频率点
适用载体 理论数学、模拟物理信号 计算机、数字图像、数字音频、AI数据集
能否直接编码 无法写代码实现 可直接用循环、矩阵运算编程实现
四、DFT频谱物理含义(数字AI数据专用)
总采样点数N,k=0,1,…,N-1
- k=0:直流分量,对应图像平均亮度、音频整体音量基线;
- 小数值k(1\ll k \ll N/2):低频分量,对应图像轮廓、音频基础音调;
- k=N/2:最高有效采样频率(奈奎斯特频率);
- 大数值k(N/2<k<N):等效负频率,对应高频细节、纹理、噪声。
AI工程关键规则
仅 0 \le k \le N/2 包含独立有效频率信息,后半段频谱是前半段共轭对称,实值图像/音频天然满足该特性,存储时可直接舍弃一半频谱,节省内存。
五、DFT基础核心性质(代码运算必备)
- 线性叠加性质
\text{DFT}{a\cdot f_1[n]+b\cdot f_2[n]}=aF_1[k]+bF_2[k]
AI用途:图像叠加、噪声与原图分离频域运算。
- 循环移位性质
时域序列循环平移m个点,DFT频谱仅增加相位偏移,幅值不变。
AI用途:图像平移、音频时间偏移不改变纹理、音色特征。
- 共轭对称性(实信号专属)
若时域f[n]全部为实数(像素、音频采样值都是实数),则:
F[N-k]=\overline{F[k]}
频谱后半段是前半段复数共轭,幅值完全相等,大幅降低存储与计算量。
六、DFT AI全场景落地应用
应用1:数字图像频域处理(OpenCV底层算法)
灰度图像像素矩阵是二维离散序列,二维DFT将像素矩阵转为二维离散频谱:
- 图像降噪:将高频大k频谱置零,消除颗粒噪点;
- 图像压缩:舍弃幅值极小的高频频谱,减少图片存储体积;
- 边缘提取:过滤低频轮廓分量,保留高频边缘频谱。
应用2:数字音频特征提取(语音大模型、AI语音合成)
声卡输出离散音频采样点,DFT快速计算每帧音频频谱,分离人声低频基频与环境高频噪声,作为语音识别模型输入特征。
应用3:扩散模型数字噪声频域分解
扩散模型使用数字化高斯噪声序列,DFT拆分噪声高低频分量;前向扩散不断叠加高频噪声,反向生成过程通过频域滤波剔除多余高频噪声,还原清晰图像。
应用4:工业离散时序AI预测
传感器定时采集设备振动、温度离散数据,DFT提取隐藏周期波动特征,提升故障预测、时序拟合模型精度。
七、实战极简示例(N=4短序列DFT计算)
时域序列 f[n] = [1,0,1,0],\ N=4
旋转因子 W_4=e^{-i\pi/2}=-i
代入DFT求和公式依次计算 F[0],F[1],F[2],F[3],利用共轭对称可直接简化后半段计算,完整展示计算机离散求和运算逻辑。
八、本课核心总结
- DFT是连续傅里叶变换的离散有限化版本,适配计算机只能处理有限离散数字的硬件特性;
- DFT采用有限求和代替无穷积分,输出N点离散频谱,可直接编程实现;
- 实值图像、音频序列频谱满足共轭对称,仅前半段频谱包含独立信息,可压缩存储;
- DFT是OpenCV、音频处理库、扩散模型频域运算底层核心算法,所有数字AI信号处理都依赖DFT;
- 连续傅里叶工具链用于理论推导,DFT用于工程代码落地,二者相辅相成。
本课金句
连续积分转为有限求和,离散DFT打通数学理论与计算机代码;
数字图像、音频、扩散噪声全部依靠DFT完成频域分解与滤波处理。
下节课预告
第56课:快速傅里叶变换FFT,DFT计算复杂度高,FFT通过分治递归拆分,大幅降低运算量,是工程实际使用的高效频域算法。