【机器学习专栏】1.3 机器学习基础:正则化
引子没有约束就没有泛化“L1 正则化为什么会产生稀疏解从几何和贝叶斯两个角度解释。”“Dropout 训练时为什么要除以 1-p推理时权重要缩放吗”“Early Stopping 和 L2 正则化有什么数学联系”“Label Smoothing 为什么能提高模型校准性能”“Weight Decay 和 L2 正则化等价吗在 Adam 优化器下呢”“Spectral Norm 是怎么稳定 GAN 训练的”正则化是机器学习中对抗过拟合的核心技术。面试中正则化不仅考察你是否知道各种方法更考察你是否理解每种方法背后的数学原理。本章从经典 L1/L2 正则化出发深入 Dropout、Early Stopping、数据增强等现代深度学习正则化技术涵盖从传统 ML 到 CV、NLP、GAN 等各领域的正则化手段。4.1 L1 与 L2 正则化4.1.1 基础定义在标准损失函数中添加惩罚项限制模型权重的复杂度类型惩罚项损失函数优化器视角L2 (Ridge)lamda * sum(w_j^2)L L0 lamda *L1 (Lasso)lamda * sum(w_j)Elastic Netlamda1*w4.1.2 梯度更新对比无正则化 w_{t1} w_t - eta * grad L0(w_t)L2 正则化权重衰减w_{t1} w_t - eta * (grad L0(w_t) 2lamdaw_t) (1 - 2etalamda)w_t - etagrad L0(w_t)可以看到 L2 在每次更新前先将权重乘以 (1 - 2etalamda) —— 这是权重衰减名称的来源。这个系数恒小于 1意味着权重的范数被持续压缩。L1 正则化软阈值w_{t1} w_t - eta * (grad L0(w_t) lamda * sign(w_t))因为 d||w||_1/dw sign(w)L1 的梯度更新方向与 w 的符号有关。当 w 为正时减去一个正数推向 0为负时加上一个正数也推向 0。整理后得到w_{t1} sign(w_t - etagrad L0) * max(0, |w_t - etagrad L0| - eta*lamda)这就是软阈值算子Soft Thresholding——当权重绝对值小于 eta*lamda 时直接被置零。这是 L1 产生稀疏解的核心机制。QL1 正则化的梯度为什么用 sign 函数它在 w0 处不可导怎么处理初级回答L1 的梯度是 w 的符号w0 处用次梯度取 [-1, 1] 之间的任意值。进阶回答L1 正则化在 w0 处确实不可导但在优化中我们使用次梯度subgradient来处理。次梯度是凸函数在不可导点处所有支撑超平面斜率的集合。对于 f(w) |w|在 w0 处的次梯度是 [-1, 1] 区间。实际实现中通常取 0 作为次梯度的值。更稳定的做法是使用近端梯度法Proximal Gradient Descent它通过近端算子直接求解带 L1 惩罚的优化问题避免处理不可导点prox_{lamda*||.||_1}(z) sign(z) * max(0, |z| - lamda)源码级回答在 sklearn 的 Lasso 实现中默认使用 coordinate_descent 算法坐标下降法而不是次梯度下降。坐标下降法每次只优化一个参数其他参数固定可以解析地求解每个参数的闭式解。其核心更新公式为w_j_hat sign(sum_i x_ij(y_i - y_i_hat(-j))) * max(0, |sum_i x_ij(y_i - y_i_hat(-j))| - lamda) / sum_i x_ij^2其中 y_i_hat(-j) 是不使用第 j 个特征的预测值。这个公式天然包含了软阈值操作。4.1.3 为什么 L1 产生稀疏解几何解释QL1 和 L2 的约束区域形状不同怎么导致稀疏性的差异初级回答L1 的约束区域是菱形有尖角L2 是圆形平滑。等高线在菱形顶点接触时解落在坐标轴上某些权重变为 0。进阶回答详细推导带正则化的优化问题等价于约束优化问题min_w L0(w) s.t. ||w||_p C其中 p1 是 L1p2 是 L2。约束区域的定义L1 约束|w1| |w2| C -- 菱形定义域有尖角L2 约束w1^2 w2^2 C^2 -- 圆形定义域光滑损失函数的等高线是椭圆形因为 Hessian 矩阵通常是正定的。最优解在等高线与约束区域首次相切的位置L2圆形切点一般不会在坐标轴上因为圆形表面光滑等高线的梯度方向在坐标轴附近很难恰好与圆的法线方向一致。结果 w1 和 w2 通常都不为零但都比无正则化时小。L1菱形菱形的角在坐标轴上如 (C,0) 或 (0,C)。当椭圆等高线膨胀到与菱形内切时首次接触点很可能发生在这些尖角处——此时一个权重为 0产生稀疏解。源码级回答L1 正则化的解路径具有**分段线性piecewise linear**性质——LARS 算法Least Angle Regression利用这一性质可以高效计算出 Lasso 的完整解路径。随着 lamda 从大到小变化特征会逐个进入模型每个进入点称为knot。而在 Ridge 中所有特征始终在模型中只是权重被均匀收缩。4.1.4 贝叶斯视角Q从贝叶斯角度理解L1 和 L2 分别对应什么先验初级回答L2 对应高斯先验L1 对应拉普拉斯先验。进阶回答MAP 估计推导从贝叶斯角度看正则化等价于对参数施加先验分布求最大后验估计MAPw_MAP argmax_w log P(y|X,w) log P(w)L2 正则化 高斯先验假设先验 P(w_j) 正比于 exp(-lamda/2 * w_j^2)均值为 0 的高斯分布则log P(w) -lamda/2 * sum w_j^2 const代入 MAP 公式得到 L L0 lamda/2 * ||w||_2^2即 L2 正则化。L1 正则化 拉普拉斯先验假设先验 P(w_j) 正比于 exp(-lamda * |w_j|)拉普拉斯分布则log P(w) -lamda * sum |w_j| const代入 MAP 公式得到 L L0 lamda * ||w||_1即 L1 正则化。拉普拉斯分布和高斯分布的关键区别特性高斯分布 N(0, sigma^2)拉普拉斯分布 Lap(0, b)PDF 形式指数平方衰减指数衰减在 0 处形状平滑二阶可导尖峰不可导尾部快速衰减慢速衰减产生稀疏性否是追问为什么拉普拉斯先验比高斯先验更容易产生 0 权重拉普拉斯分布在 0 处的概率密度远高于高斯分布——拉普拉斯有尖峰高斯是圆顶。这意味着拉普拉斯先验更相信参数为 0。在 MAP 估计中拉普拉斯先验对非零参数施加更重的惩罚。关键在于拉普拉斯先验在 w0 处的概率集中质量使得 MAP 估计趋向于让不重要的参数精确为 0而不是仅仅缩小。4.1.5 Elastic NetQ什么时候该用 Elastic Net 而不是单纯的 L1 或 L2进阶回答Elastic Net 结合了 L1 和 L2 的优点L L0 lamda1 * ||w||_1 lamda2 * ||w||_2^2适用场景特征数 样本数p nLasso 最多只能选出 n 个特征受限于约束区域维度Elastic Net 没有此限制。特征分组相关Lasso 会从一组高度相关的特征中随机选一个Elastic Net 会同时选入或剔除整个组因为 L2 项促进分组效应。希望稀疏但不止于稀疏Elastic Net 能在保持稀疏性的同时让选中的特征系数更稳定。源码级回答sklearn 中的 ElasticNet 使用 l1_ratio 参数控制 L1 和 L2 的混合比例l1_ratio1 是 Lassol1_ratio0 是 Ridge。实际计算中Elastic Net 的求解也使用坐标下降法其更新公式是 Lasso 软阈值和 Ridge 收缩的混合。4.1.6 Group LassoQ如果你想对特征分组施加稀疏性如一个 One-hot 编码的类别变量应该一起选或不选该用什么进阶回答Group Lasso。它对预先定义的特征组施加 L2 范数惩罚但组之间施加 L1 惩罚——一个组要么全部为 0要么全部非 0L L0 lamda * sum_{g1}^{G} sqrt(p_g) * ||w_g||_2其中 p_g 是第 g 组的特征数。Group Lasso 不会在组内产生稀疏性组内用 L2 惩罚但会在组间用 L1 惩罚产生稀疏性。4.2 Dropout4.2.1 原理与原始论文Dropout 由 Srivastava、Hinton 等人在 2014 年提出“Dropout: A Simple Way to Prevent Neural Networks from Overfitting”。核心思想在每次训练迭代中以概率 p 随机丢弃置零每个神经元的输出。Q训练时为什么要除以 1-p初级回答为了保持训练和推理时输出的期望一致。进阶回答数学推导假设神经元在训练时的输出为 h丢弃概率为 p。训练时神经元的输出是随机变量h_train h/(1-p) 以概率 (1-p) 保留h_train 0 以概率 p 丢弃推理时所有神经元都保留输出为 h。为了保持一致性需要 E[h_train] h_inferE[h_train] (1-p) * h/(1-p) p * 0 h h_infer如果不做缩放即训练时直接丢弃h_train h 或 0则 E[h_train] (1-p)h推理时需要乘 (1-p) 来补偿。两种方式等价只是缩放位置不同。PyTorch 和 TensorFlow 都采用训练时缩放的方式Inverted Dropout。importtorchimporttorch.nnasnnclassDropoutLayer(nn.Module):从零实现 DropoutInverted Dropoutdef__init__(self,p0.5):super().__init__()self.pp# 丢弃概率defforward(self,x):ifself.training:# 伯努利掩码每个元素独立以 (1-p) 保留masktorch.rand_like(x)self.p# 训练时缩放returnx*mask/(1-self.p)returnx追问为什么 Dropout 能防止过拟合有三层解释。第一层集成学习Ensemble视角每次 dropout 相当于从完整网络中采样出一个子网络。训练 T 步相当于训练了 T 个不同的子网络权重复用。推理时全部保留相当于对这些子网络的输出做几何平均而非算术平均。Hinton 等人证明了几何平均对应集成学习的 Bagging 思想而且比算术平均更合理因为神经网络输出是概率时几何平均对应概率乘积。对于有 N 个神经元的网络可能的子网络数量为 2^N。虽然实际采样有限但 Dropout 的集成效果远超显式训练少数模型。第二层协同适应Co-adaptation视角没有 Dropout 时神经元可能形成相互依赖的关系——某个神经元依赖另一个神经元的存在来纠正它的错误。Dropout 强制每个神经元独立工作不能依赖其他神经元的补位。这迫使每个神经元学到更鲁棒的特征类似于正则化中的独立性强。第三层隐式数据增强视角Dropout 为每个神经元的输出添加了乘性噪声Bernoulli 噪声。这可以看作是一种隐式的数据增强——通过噪声迫使网络学习更平滑的决策边界。4.2.2 为什么 Dropout 在 CNN 中效果有限Spatial DropoutQ原始 Dropout 在 CNN 上效果不好怎么办初级回答CNN 中使用 Spatial Dropout在通道层面丢弃整个特征图。进阶回答CNN 的卷积层中相邻像素高度相关。原始 Dropout 随机丢弃单个像素几乎不会破坏空间结构——被丢弃的像素可以被相邻像素弥补因为卷积核是共享且滑动的。Spatial Dropout 以概率 p 丢弃整个通道整张特征图迫使网络不依赖于某个通道的信息。classSpatialDropout2d(nn.Module):在通道层面丢弃整个特征图def__init__(self,p0.5):super().__init__()self.ppdefforward(self,x):# x shape: (batch, channels, height, width)ifself.training:masktorch.rand_like(x[:,:,0:1,0:1])self.preturnx*mask/(1-self.p)returnx4.2.3 Stochastic Depth for ResNetStochastic Depth 是 Dropout 在 ResNet 中的变体由 Huang 等人 2016 年提出。核心思想训练时以概率 p 随机丢弃跳过整个残差块Residual Block只保留 shortcut 连接H_l(x) F_l(x) x 以概率 (1-p_l) 保留H_l(x) x 以概率 p_l 丢弃其中 p_l 随层数的增加线性增大底层小顶层大因为浅层提取基础特征更重要。特性DropoutStochastic Depth丢弃粒度神经元整个残差块推理时全部保留全部保留有效深度不变变浅加速训练效果防止过拟合训练更深网络Stochastic Depth 解决了深层 ResNet如 1202 层的训练困难问题同时训练速度提高了约 40%。4.3 Early Stopping4.3.1 什么是 Early Stopping在验证集上的性能不再提升时停止训练是最简单也最常用的正则化方法。实现时需要设置 patience容忍步数防止在验证 loss 的局部波动中误停。classEarlyStopping:Early Stopping 实现def__init__(self,patience10,min_delta0.001):self.patiencepatience self.min_deltamin_delta self.counter0self.best_lossfloat(inf)self.early_stopFalsedef__call__(self,val_loss):ifval_lossself.best_loss-self.min_delta:self.best_lossval_loss self.counter0else:self.counter1ifself.counterself.patience:self.early_stopTruereturnself.early_stop4.3.2 Early Stopping 与 L2 正则化的数学联系Q面试官的经典追问——Early Stopping 为什么可以被看作是一种正则化它跟 L2 正则化有什么关系进阶回答关键洞察考虑一个线性模型 y Xw使用梯度下降优化 MSE 损失。假设 X 的 SVD 分解为 X U * Sigma * V^T权重更新为w^{(t)} w^{(t-1)} - eta * grad L(w^{(t-1)})对于 MSE 损失梯度下降的解可以写为w^{(t)} sum_{i1}^{p} (1 - eta * sigma_i2)t * (u_i^T y / sigma_i) * v_i其中 sigma_i 是 X 的奇异值。这个公式的关键含义每个奇异值方向上的衰减速度是 (1 - eta * sigma_i2)t。奇异值越小对应方差小的方向衰减越快。L2 正则化的解析解为w_ridge sum_{i1}^{p} (sigma_i^2 / (sigma_i^2 lamda)) * (u_i^T y / sigma_i) * v_i对比发现方法衰减因子含义Early Stopping (t 步后)(1 - eta * sigma_i2)t小奇异值方向先被压缩L2 正则化 (lamda)sigma_i^2 / (sigma_i^2 lamda)小奇异值方向被压缩更多两者都在小奇异值方向方差小、噪声可能大的方向衰减更快这解释了为什么 Early Stopping 等价于隐式 L2 正则化。对于 MSE 损失和线性模型Early Stopping 的解与 Ridge 的解之间存在一一对应的关系——迭代步数 t 对应 lamda 与 1/t 成正比。4.4 数据增强4.4.1 为什么数据增强算正则化Q数据增强明明是增加数据为什么会被归类为正则化方法进阶回答数据增强虽然没有修改损失函数但它通过引入先验知识如平移不变性、旋转不变性来扩展训练分布本质上降低了模型对特定输入模式的过拟合。每个增强操作相当于告诉模型“这个样本在某种变形下应该保持相同的预测。” 这与正则化的目标一致——提高泛化能力、降低对训练数据特定模式的依赖。Bishop 在 1995 年证明在输入上添加小噪声等价于一种 L2 类型正则化。4.4.2 图像数据增强基础方法方法操作适用场景超参数水平翻转Flip左右镜像一般物体识别p0.5随机旋转Rotation0-360 度旋转方向无关任务[-30, 30] 度随机裁剪Random Crop截取随机区域后缩放分类/检测裁剪比例 0.08-1.0颜色抖动Color Jitter调整亮度/对比度/饱和度/色调颜色鲁棒任务各参数 /- 0.2随机擦除Random Erasing随机遮挡矩形区域行人重识别遮挡比例 0.02-0.4高级方法CutoutDeVries Taylor, 2017随机擦除输入图像中的正方形区域防止网络过度依赖局部特征。MixupZhang et al., 2018将两张图像按随机比例混合标签也按相同比例混合x_tilde lamda * x_i (1-lamda) * x_jy_tilde lamda * y_i (1-lamda) * y_j其中 lamda 服从 Beta(alpha, alpha) 分布alpha 控制混合强度通常 0.2-0.4。Mixup 的数学直觉强制模型在样本之间线性插值相当于隐式地学习了线性决策边界区域。CutMixYun et al., 2019结合 Cutout 和 Mixup——用另一张图像的 patch 替换被裁剪区域标签按像素比例混合。CutMix 在分类和目标检测上同时有效性能通常优于单独使用 Mixup 或 Cutout。QMixup 为什么有效从理论角度解释。进阶回答Vicinal Risk Minimization (VRM)Mixup 不是经验风险最小化ERM而是邻域风险最小化。ERM 只在训练点上坍塌 Dirac delta 分布VRM 在样本间定义连续的标签分布。模型校准性Mixup 降低了模型的预测置信度使预测概率更接近真实准确率Expected Calibration Error 降低。对对抗样本鲁棒Mixup 学到的决策边界更平滑不易被小的对抗扰动欺骗。4.4.3 文本数据增强文本数据增强比图像更难——因为文本是离散的微小改动可能改变语义。方法操作效果与限制同义词替换SR随机替换词为同义词简单但可能改变语境回译Back Translation翻译到另一语言再译回质量高但计算成本大EDAEasy Data AugmentationSR RI随机插入 RS随机交换 RD随机删除Wei Zou 2019简单有效对抗增强在词嵌入空间加扰动需要额外训练QEDA 的参数怎么设置为什么它有效进阶回答EDA 有四个操作每个按概率执行。Wei Zou 建议的默认参数同义词替换每个句子随机替换 10% 的词随机插入在随机位置插入随机词的同义词比例 10%随机交换随机交换两个词的位置比例 10%随机删除以概率 0.1 删除每个词EDA 的效果在小数据集500 样本上最明显平均提升 3% 准确率在更大数据集上提升有限。局限性对于情感分析等语义敏感任务同义词替换可能反转情感极性。4.4.4 音频数据增强方法操作典型参数噪声叠加Noise Injection加高斯白噪声SNR15-30dB时间拉伸Time Stretch改变播放速度不改变音高0.8x-1.2x音高偏移Pitch Shift改变音高不改变速度/- 2 半音SpecAugment在频谱图上随机掩码时间/频率段掩码宽度 F10, T20SpecAugmentPark et al., 2019是语音识别中最有效的增强方法——直接在 Mel-spectrogram 上应用时间掩码和频率掩码灵感来自 Cutout 在图像上的应用。4.5 Label Smoothing4.5.1 原理QLabel Smoothing 是什么为什么能提高模型泛化能力进阶回答Label Smoothing标签平滑由 Szegedy 等在 Inception-v2 论文中提出。核心思想不要用 one-hot 硬标签训练模型而是用软标签soft labely_i_smooth (1 - epsilon) * y_i_onehot epsilon / K其中 K 是类别数epsilon 是平滑系数通常 0.1。例如三分类时One-hot: [1, 0, 0]Smoothed: [0.9, 0.05, 0.05] (epsilon0.15)4.5.2 为什么有效防止过置信softmax 输出会趋向于 one-hot因为交叉熵在 logit 足够大时饱和Label Smoothing 抑制了 logit 的无限增长。校准性提升模型的预测概率更接近真实准确率。未平滑模型在预测 0.99 时可能只有 90% 的准确率平滑后预测 0.9 时就能达到约 90% 的准确率。模型鲁棒性对错误标签更不敏感——即使训练集中有错误标注平滑后的标签不会要求模型死记硬背错误。追问Label Smoothing 的缺点是什么知识蒸馏中不适用Student 模型需要从 Teacher 的硬预测中学习类别间关系Label Smoothing 会模糊这些关系。影响 Top-1 准确率有些任务中 LS 会轻微降低 Top-1 准确率但提高 Top-5。在小数据集上效果有限数据足够时模型自然校准LS 的增益减小。4.6 各种正则化方法的对比与选择方法原理适用场景训练成本推理影响L2 正则化权重衰减几乎所有模型无额外成本无L1 正则化产生稀疏性特征选择、高维数据无额外成本无Dropout随机丢弃神经元全连接网络少量增加无Spatial Dropout丢弃整个通道CNN少量增加无Stochastic Depth随机跳过残差块ResNet 系列减少训练时间无Early Stopping提前停止训练几乎所有模型降低训练时间无数据增强扩展训练分布CV/NLP/Audio在线增强有额外成本无Label Smoothing软化标签分布分类任务无额外成本无Spectral Norm限制 Lipschitz 常数GAN少量额外计算无正则化的组合使用在实践中深度模型通常组合使用多种正则化方法图像分类ResNet/DenseNet 数据增强Random Crop Flip Color Jitter Mixup/CutMix Weight DecayL2 Label Smoothingepsilon0.1 Stochastic DepthResNet 深度 100 时 文本分类BERT Dropout (p0.1) Weight Decay (lamda0.01) 有时用回译增强 GAN 生成器 Spectral Norm在判别器的每层 Label Smoothing用 0.9/0.1 代替 1/04.7 Spectral Norm 与 Virtual Adversarial Training4.7.1 Spectral NormQSpectral Norm 是什么它如何稳定 GAN 的训练进阶回答Spectral Norm 由 Miyato 等人在 2018 年提出“Spectral Normalization for Generative Adversarial Networks”用于约束判别器Discriminator的 Lipschitz 常数。对于线性层 W其谱范数定义为最大奇异值sigma(W) max_{||x||_2 1} ||Wx||_2谱归一化Spectral Normalization将权重矩阵除以其谱范数W_SN W / sigma(W)这样保证了 sigma(W_SN) 1即 Lipschitz 常数为 1。为什么这对 GAN 重要在 WGAN-GP 中判别器需要满足 1-Lipschitz 约束。谱范数是满足这一约束的最优雅方式——每次权重更新后直接除以谱范数。与梯度惩罚Gradient Penalty相比方法实现复杂度计算成本效果Weight Clipping简单无容易破坏网络容量Gradient Penalty中等高需要计算额外梯度效果好Spectral Norm中等低只需 SVD 近似效果好稳定源码级回答Spectral Norm 的实际实现使用幂迭代法Power Iteration近似最大奇异值避免每次更新都做完整的 SVDdefspectral_norm(W,u,num_iters1):幂迭代法近似最大奇异值for_inrange(num_iters):vW.T u vv/torch.norm(v)uW v uu/torch.norm(u)sigmau W v# 最大奇异值的近似returnW/sigma,u# 返回归一化后的 W 和更新后的 u其中 u 是随机初始化的向量在训练过程中持续更新。4.7.2 Virtual Adversarial Training (VAT)QVirtual Adversarial Training 是如何工作的它和对抗训练有什么区别进阶回答VAT 由 Miyato 等人在 2018 年提出是一种半监督正则化方法。核心思想模型的输出分布应该在输入的局部邻域内平滑——即使对输入施加小的对抗性扰动输出分布也不应剧烈变化。VAT 的损失是 KL 散度的对抗版本L_VAT(x) KL[p(y|x) || p(y|x r_adv)]其中对抗扰动 r_adv 是使 KL 散度最大的方向约束 ||r||_2 epsilonr_adv argmax_{||r||_2 epsilon} KL[p(y|x) || p(y|x r)]与标准对抗训练的区别方面标准对抗训练VAT需要标签是对抗样本必须有真实标签否只用模型当前输出适用场景监督学习半监督/无监督扰动目标最大化真实标签的损失最大化输出分布的 KL 散度正则化效果对特定攻击鲁棒整体决策边界平滑VAT 的优势在于它可以在未标注数据上工作——只需要计算模型当前预测作为伪标签然后寻找使 KL 散度最大的方向。这在半监督学习中非常有效。4.8 正则化的物理学直觉用一个直观的比喻来总结各种正则化方法L2 正则化给权重加了一个弹簧拉力与权重大小成正比防止权重过大。L1 正则化给权重加了一个摩擦力微小的权重会被摩擦消耗到 0。Dropout模拟团队中没有固定依赖关系每个人都要能独立解决问题。Early Stopping相当于限时训练——时间不够长就不会学会噪声模式。数据增强相当于多角度训练——在更多样化的环境中学到不变性。Label Smoothing模拟导师不给出 100% 确定的答案避免学生过度自信。面试速查表考点核心要点常见追问面试频度L1 vs L2稀疏 vs 衰减几何解释、梯度推导、贝叶斯先验⭐⭐⭐⭐⭐Elastic NetL1L2 混合何时用、分组效应⭐⭐⭐Group Lasso组级稀疏性与 L1/L2 的区别⭐⭐Dropout丢弃 缩放为什么除 1-p、集成视角、co-adaptation⭐⭐⭐⭐⭐Spatial Dropout通道级别丢弃CNN 为什么用⭐⭐⭐Stochastic Depth跳过残差块ResNet 训练加速⭐⭐Early Stopping验证 loss 上升前停止与 L2 的数学联系⭐⭐⭐⭐数据增强图像/文本/音频Mixup/CutMix/EDA⭐⭐⭐⭐Label Smoothing软标签校准性提升、缺点⭐⭐⭐Spectral Norm谱范数归一化GAN 稳定性、幂迭代⭐⭐⭐VAT对抗性正则化半监督学习⭐⭐本章总结正则化是机器学习面试中看似简单、实则需要深度的话题。你需要从多个维度理解每种正则化方法数学形式L1/L2 的损失函数、梯度更新公式几何直观L1 的菱形与 L2 的圆形的约束区域差异贝叶斯视角L1 拉普拉斯先验L2 高斯先验工程实现Dropout 的 Inverted Dropout 实现、Spectral Norm 的幂迭代适用场景不同正则化方法适用的模型架构和数据类型面试中的典型追问路径是从 L1/L2 的正则化公式出发追问 L1 为什么产生稀疏性几何再追问贝叶斯解释然后转到 Dropout原理 缩放再问 Early Stopping与 L2 的关系最后问数据增强或高级变体。这条追问链覆盖了本章的绝大部分核心知识点。下一章预告第五章将深入降维与特征选择探索 PCA 的数学推导、t-SNE 的可视化力量以及各类特征选择方法的实战技巧。

相关新闻

最新新闻

日新闻

周新闻

月新闻