☰
AI大模型与数学·第55课 离散傅里叶变换DFT:计算机数字信号专属频域工具,图像/音频代码实现底层数学
2026/9/27 15:37:01 网站建设 项目流程

本课定位

51~54课我们学习了连续时域的傅里叶级数、连续傅里叶变换。但计算机无法处理无限、连续的模拟信号:

  1. 图像:像素是离散坐标,只有有限个采样点;
  2. 音频:声卡按固定间隔采样,输出离散数字;
  3. 扩散模型、时序数据集:全部是数字化离散数值。

连续积分无法直接写代码运算,因此诞生离散傅里叶变换DFT:把有限长度离散采样序列,映射为有限长度离散频域序列,完全适配计算机数字运算,是Python、C++处理图像音频的核心底层算法。

本课衔接连续傅里叶变换,完整推导DFT正/逆变换公式,对比连续与离散的核心差异,配套AI工程代码逻辑讲解。

前置知识回顾

  1. 连续傅里叶正/逆变换(54课);
  2. 复数、欧拉公式、复指数运算;
  3. 有限序列、采样基础概念。

一、从连续信号到计算机离散采样

  1. 采样定义

模拟连续信号 f(t),按固定采样间隔 T_s 截取有限个点,得到离散序列:
f[n] = f(nT_s),\quad n=0,1,2,…,N-1

  • N:总采样点数(图像单通道像素数量、音频单帧采样点)
  • n:离散时域序号(整数,无单位)
  • T_s:采样间隔,采样频率 f_s=\dfrac{1}{T_s}
  1. 连续傅里叶变换的离散化改造

连续变换是无穷积分 \displaystyle \int_{-\infty}^{+\infty},计算机只能处理有限N个点:

  1. 积分→有限项求和;
  2. 无限连续频率→N个离散频率分量;
  3. 无限时域区间→长度为N的有限序列。

经过离散化、有限截断,最终得到DFT完整公式。

二、DFT 正变换、逆变换完整公式

设有限长离散时域序列 f[n],n=0,1,…,N-1

  1. DFT正变换(离散时域 → 离散频域)

F[k] = \text{DFT}{f[n]} = \sum_{n=0}^{N-1} f[n] \cdot W_N^{kn},\quad k=0,1,…,N-1

旋转因子定义(DFT核心单元)

W_N = e^{-i\frac{2\pi}{N}} = \cos\frac{2\pi}{N} - i\sin\frac{2\pi}{N}

  • n:时域采样序号
  • k:频域频率序号,共N组离散频率
  • F[k]:离散频谱,复数,模代表频率分量幅值,辐角代表相位
  1. IDFT 逆离散傅里叶变换(离散频域 → 还原离散时域)

f[n] = \text{IDFT}{F[k]} = \frac{1}{N}\sum_{k=0}^{N-1} F[k] \cdot W_N^{-kn},\quad n=0,1,…,N-1

逆变换作用:修改频谱(降噪、压缩)后,还原出处理后的数字图像/音频。

三、连续傅里叶变换 vs DFT 核心对照表

对比维度 连续傅里叶变换(CFT) 离散傅里叶变换(DFT)
输入信号 无限长、连续模拟信号 长度N、有限离散数字序列
运算形式 无穷积分 有限项求和
频率分布 连续不间断频率 N个离散频率点
适用载体 理论数学、模拟物理信号 计算机、数字图像、数字音频、AI数据集
能否直接编码 无法写代码实现 可直接用循环、矩阵运算编程实现

四、DFT频谱物理含义(数字AI数据专用)

总采样点数N,k=0,1,…,N-1

  1. k=0:直流分量,对应图像平均亮度、音频整体音量基线;
  2. 小数值k(1\ll k \ll N/2):低频分量,对应图像轮廓、音频基础音调;
  3. k=N/2:最高有效采样频率(奈奎斯特频率);
  4. 大数值k(N/2<k<N):等效负频率,对应高频细节、纹理、噪声。

AI工程关键规则

仅 0 \le k \le N/2 包含独立有效频率信息,后半段频谱是前半段共轭对称,实值图像/音频天然满足该特性,存储时可直接舍弃一半频谱,节省内存。

五、DFT基础核心性质(代码运算必备)

  1. 线性叠加性质

\text{DFT}{a\cdot f_1[n]+b\cdot f_2[n]}=aF_1[k]+bF_2[k]
AI用途:图像叠加、噪声与原图分离频域运算。

  1. 循环移位性质

时域序列循环平移m个点,DFT频谱仅增加相位偏移,幅值不变。
AI用途:图像平移、音频时间偏移不改变纹理、音色特征。

  1. 共轭对称性(实信号专属)

若时域f[n]全部为实数(像素、音频采样值都是实数),则:
F[N-k]=\overline{F[k]}
频谱后半段是前半段复数共轭,幅值完全相等,大幅降低存储与计算量。

六、DFT AI全场景落地应用

应用1:数字图像频域处理(OpenCV底层算法)

灰度图像像素矩阵是二维离散序列,二维DFT将像素矩阵转为二维离散频谱:

  • 图像降噪:将高频大k频谱置零,消除颗粒噪点;
  • 图像压缩:舍弃幅值极小的高频频谱,减少图片存储体积;
  • 边缘提取:过滤低频轮廓分量,保留高频边缘频谱。

应用2:数字音频特征提取(语音大模型、AI语音合成)

声卡输出离散音频采样点,DFT快速计算每帧音频频谱,分离人声低频基频与环境高频噪声,作为语音识别模型输入特征。

应用3:扩散模型数字噪声频域分解

扩散模型使用数字化高斯噪声序列,DFT拆分噪声高低频分量;前向扩散不断叠加高频噪声,反向生成过程通过频域滤波剔除多余高频噪声,还原清晰图像。

应用4:工业离散时序AI预测

传感器定时采集设备振动、温度离散数据,DFT提取隐藏周期波动特征,提升故障预测、时序拟合模型精度。

七、实战极简示例(N=4短序列DFT计算)

时域序列 f[n] = [1,0,1,0],\ N=4
旋转因子 W_4=e^{-i\pi/2}=-i
代入DFT求和公式依次计算 F[0],F[1],F[2],F[3],利用共轭对称可直接简化后半段计算,完整展示计算机离散求和运算逻辑。

八、本课核心总结

  1. DFT是连续傅里叶变换的离散有限化版本,适配计算机只能处理有限离散数字的硬件特性;
  2. DFT采用有限求和代替无穷积分,输出N点离散频谱,可直接编程实现;
  3. 实值图像、音频序列频谱满足共轭对称,仅前半段频谱包含独立信息,可压缩存储;
  4. DFT是OpenCV、音频处理库、扩散模型频域运算底层核心算法,所有数字AI信号处理都依赖DFT;
  5. 连续傅里叶工具链用于理论推导,DFT用于工程代码落地,二者相辅相成。

本课金句

连续积分转为有限求和,离散DFT打通数学理论与计算机代码;
数字图像、音频、扩散噪声全部依靠DFT完成频域分解与滤波处理。

下节课预告

第56课:快速傅里叶变换FFT,DFT计算复杂度高,FFT通过分治递归拆分,大幅降低运算量,是工程实际使用的高效频域算法。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询