L2 正则化核心原理笔记、
Ltotal=Ldata+Lreg
Ltotal: 正则化后的成本
Ldata:训练数据的成本
Lreg:正则化成本 目标是最小化 Ltotal
所以 Ldata+Lreg 要最小
所以要考虑 Ldata 和 Lreg 同时最小
所以 Ldata 最小会拉高 W Lreg 最小会拉低 W 两者相互制衡,最终找到平衡点
这就是 L2 正则化限制 W 预防过拟合的原理
L2 正则化完整推导与原理
一、核心作用
- 抑制模型过拟合:惩罚过大的参数权重,不让任意特征权重无限制变大;
- 让权重整体趋向更小,但不会压缩到 0;
- 优化稳定,梯度平滑,广泛用于线性回归、逻辑回归、神经网络。
二、数学公式推导
以普通最小二乘线性回归举例:
1. 原始损失(MSE)
2. 加入 L2 惩罚项的总损失
L2 正则是对所有权重参数做平方求和,乘以正则系数lambda;偏置项不做正则。
| 特性 | L2 正则 | L1 正则 (Lasso) |
|---|---|---|
| 惩罚形式 | 权重平方和 | 权重绝对值和 |
| 权重效果 | 全部缩小,不会等于 0 | 可将不重要特征权重压缩至 0,实现特征筛选 |
| 等高线 | 圆形 | 菱形 |
| 求解 | 处处可导,优化顺滑 | 存在不可导点,多用坐标下降 |
| 别名 | 岭回归 | Lasso 回归 |
六、底层为什么能防过拟合
过拟合本质:模型记住训练集噪声,依靠极端大权重拟合随机误差。 L2 限制权重上限:
- 不允许参数极端偏大,模型无法精准贴合训练噪声;
- 强制模型依赖更多特征共同预测,而不是少数几个特征猛拉数值;
- 参数更平滑,泛化能力提升,在测试集表现更稳定。