《深度学习》期末练习题 | 简答题第2篇(详解版)
下一篇:《深度学习》期末练习题 | 简答题第3篇(RNN/LSTM、注意力机制、优化器等)
摘要:本文是《深度学习》期末复习系列简答题的第2篇,涵盖线性回归与逻辑回归对比、反向传播算法、Dropout、Batch Normalization 以及 CNN 核心层作用等5道高频考题。每道题均按“原题 + 标准答案 + 深度解析”的结构整理,适合期末冲刺与面试准备。
6. 简述线性回归和逻辑回归在输出类型、损失函数和应用场景上的区别
📝 原题
简述线性回归和逻辑回归在输出类型、损失函数和应用场景上的区别。
✅ 标准答案
- 输出类型:线性回归的输出是连续数值(如房价、销量、温度);逻辑回归的输出是离散类别概率(经 Sigmoid 映射到 [0,1])。
- 损失函数:线性回归常用均方误差(MSE);逻辑回归常用交叉熵损失(Cross-Entropy Loss)。
- 应用场景:线性回归用于回归预测任务;逻辑回归用于二分类或多分类任务(如手写数字识别、疾病诊断、鸢尾花分类等)。
🔍 深度解析
| 对比维度 | 线性回归 | 逻辑回归 |
|---|---|---|
| 模型形式 | y = w T x + b y = w^Tx + by=wTx+b | P ( y = 1 ∣ x ) = σ ( w T x + b ) P(y=1|x) = \sigma(w^Tx + b)P(y=1∣x)=σ(wTx+b) |
| 输出范围 | ( − ∞ , + ∞ ) (-\infty, +\infty)(−∞,+∞) | ( 0 , 1 ) (0, 1)(0,1) |
| 损失函数 | MSE:1 n ∑ ( y i − y ^ i ) 2 \frac{1}{n}\sum(y_i - \hat{y}_i)^2n1∑(yi−y^i)2 | BCE:− 1 n ∑ [ y i log y ^ i + ( 1 − y i ) log ( 1 − y ^ i ) ] -\frac{1}{n}\sum[y_i\log\hat{y}_i + (1-y_i)\log(1-\hat{y}_i)]−n1∑[yilogy^i+(1−yi)log(1−y^i)] |
| 优化目标 | 最小化预测值与真实值的平方差 | 最大化似然 / 最小化负对数似然 |
| 决策边界 | 无(直接输出连续值) | 通常以 0.5 为阈值划分正负类 |
易错提醒:逻辑回归名字中带“回归”,但本质是分类模型。其“回归”指的是对对数几率(log-odds)进行线性建模,而非对标签本身回归。考试中若混淆两者损失函数或输出含义,极易失分。
7. 简要写出反向传播(BP)算法的核心步骤
📝 原题
简要写出反向传播(BP)算法的核心步骤。
✅ 标准答案
- 前向传播:逐层计算各神经元的加权和与激活输出,得到网络最终预测值。
- 误差计算:根据损失函数计算预测值与真实标签之间的误差。
- 误差反向传播:利用链式法则,从输出层向输入层逐层计算损失对各层参数的梯度。
- 参数更新:使用梯度下降(或其变体)根据梯度更新权重和偏置。
🔍 深度解析
反向传播的本质是高效计算梯度的算法,而非独立的优化方法。其数学基础是多元复合函数的链式求导法则:
∂ L ∂ w ( l ) = ∂ L ∂ a ( L ) ⋅ ∂ a ( L ) ∂ z ( L ) ⋯ ∂ z ( l + 1 ) ∂ a ( l ) ⋅ ∂ a ( l ) ∂ z ( l ) ⋅ ∂ z ( l ) ∂ w ( l ) \frac{\partial L}{\partial w^{(l)}} = \frac{\partial L}{\partial a^{(L)}} \cdot \frac{\partial a^{(L)}}{\partial z^{(L)}} \cdots \frac{\partial z^{(l+1)}}{\partial a^{(l)}} \cdot \frac{\partial a^{(l)}}{\partial z^{(l)}} \cdot \frac{\partial z^{(l)}}{\partial w^{(l)}}∂w(l)∂L=∂a(L)∂L⋅∂z(L)∂a(L)⋯∂a(l)∂z(l+1)⋅∂z(l)∂a(l)⋅∂w(l)∂z(l)
- 前向传播缓存中间变量(如z ( l ) z^{(l)}z(l),a ( l ) a^{(l)}a(l)),避免重复计算。
- 反向传播从输出端开始,逐层回传“误差信号”δ ( l ) \delta^{(l)}δ(l),再结合前向缓存计算梯度。
- 实际工程中,自动微分框架(PyTorch/TensorFlow)已封装 BP,但理解原理对调试梯度消失/爆炸、自定义层至关重要。
答题技巧:若题目要求“简要写出”,答出上述四步即可得满分;若要求“详细描述”,需补充链式法则公式及δ \deltaδ的递推关系。
8. 什么是 Dropout 技术?请描述其在网络训练中的作用
📝 原题
什么是 Dropout 技术?请描述其在网络训练中的作用。
✅ 标准答案
Dropout 是一种正则化技术,在训练时以概率p pp随机将部分神经元的输出置零,使网络每次迭代仅依赖子集神经元进行前向与反向传播。其作用是防止过拟合、增强泛化能力,迫使网络学习更鲁棒的特征表示,避免对特定神经元过度依赖。
🔍 深度解析
- 训练阶段:每个神经元以保留概率1 − p 1-p1−p被激活,输出需除以1 − p 1-p1−p(Inverted Dropout)以保持期望不变。
- 测试阶段:所有神经元参与推理,无需额外缩放(因训练时已做补偿)。
- 理论解释:
- 集成学习视角:Dropout 等价于同时训练2 n 2^n2n个共享权重的子网络,测试时隐式集成。
- 噪声注入视角:向隐藏层注入乘性噪声,提升模型对输入扰动的鲁棒性。
- 典型取值:全连接层p = 0.5 p=0.5p=0.5,卷积层p = 0.2 p=0.2p=0.2(因卷积核参数共享,丢弃过多会破坏空间结构)。
注意:Dropout仅在训练时启用,测试时必须关闭。若在测试时误开 Dropout,会导致性能显著下降。
9. 简述 Batch Normalization 的核心思想,并描述其在网络训练中的作用
📝 原题
简述 Batch Normalization 的核心思想,并描述其在网络训练中的作用。
✅ 标准答案
Batch Normalization(BN)的核心思想是对每一层输入的 mini-batch 数据进行标准化,使其均值为 0、方差为 1,再通过可学习参数γ , β \gamma, \betaγ,β进行仿射变换恢复表达能力。其作用包括:缓解梯度消失/爆炸、加速收敛、提高训练稳定性,并具有一定正则化效果。
🔍 深度解析
BN 的计算公式(对 mini-batchB \mathcal{B}B):
x ^ = x − μ B σ B 2 + ϵ , y = γ x ^ + β \hat{x} = \frac{x - \mu_{\mathcal{B}}}{\sqrt{\sigma_{\mathcal{B}}^2 + \epsilon}}, \quad y = \gamma \hat{x} + \betax^=σB2+ϵx−μB,y=γx^+β
- 解决 Internal Covariate Shift:深层网络中,前层参数更新导致后层输入分布剧烈变化,BN 稳定了层间输入分布。
- 允许更高学习率:标准化使损失曲面更平滑,梯度方向更可靠。
- 正则化效应:mini-batch 统计量的随机性引入噪声,类似 Dropout,可减轻过拟合。
- 注意事项:
- BN 依赖 batch size,过小(如 <8)时统计量估计不准,应改用 Layer Norm / Group Norm。
- 推理时使用全局移动平均的均值/方差,而非当前 batch 统计量。
常见误区:BN 并非万能。在 RNN、Transformer 或小 batch 场景下效果可能不佳,需结合具体架构选择归一化策略。
10. 卷积层、池化层、全连接层的作用分别是什么?
📝 原题
卷积层、池化层、全连接层的作用分别是什么?
✅ 标准答案
- 卷积层:通过局部感受野和权值共享提取图像的局部特征(如边缘、纹理、角点等)。
- 池化层:对特征图进行下采样,降低空间维度,减少计算量与参数量,增强平移不变性,辅助防止过拟合。
- 全连接层:将前面各层提取的特征展平并整合,完成高阶语义组合,最终输出分类或回归结果。
🔍 深度解析
| 层类型 | 关键特性 | 典型参数 | 现代趋势 |
|---|---|---|---|
| 卷积层 | 局部连接、权值共享、平移等变性 | 卷积核大小、步长、填充 | 深度可分离卷积、空洞卷积 |
| 池化层 | 下采样、无参数、固定操作 | 池化窗口、步长 | 逐渐被 stride=2 卷积替代 |
| 全连接层 | 全局连接、参数量大 | 输入/输出维度 | 被 Global Average Pooling + 1×1 卷积取代 |
- 卷积层是 CNN 的特征提取器,多层堆叠可构建从低级到高级的特征层次。
- 池化层虽无学习参数,但对模型的空间不变性和计算效率至关重要。Max Pooling 保留显著特征,Average Pooling 保留整体信息。
- 全连接层在传统 CNN(如 AlexNet)中占参数主体,现代架构(如 ResNet、EfficientNet)普遍用 GAP 替代以减少过拟合风险。
答题加分项:提及“权值共享”“局部感受野”“平移不变性”等专业术语,并指出池化层在现代网络中的演变趋势,可体现知识深度。
📌 复习建议
- 对比记忆:将线性回归 vs 逻辑回归、Dropout vs BN 制成表格,强化区分。
- 手推公式:至少完整手推一次 BP 梯度计算和 BN 前向/反向过程。
- 代码验证:用 PyTorch 实现带 Dropout/BN 的简单网络,观察训练曲线差异。
- 关注细节:考试中“Sigmoid 映射到 [0,1]”“BN 推理时用全局统计量”等细节常作为采分点。
下一篇预告:《深度学习》期末练习题 | 简答题第3篇(RNN/LSTM、注意力机制、优化器等)
标签:深度学习期末考试机器学习神经网络CSDN博客
版权声明:本文为原创复习资料,转载请注明出处。