第 7 课
← 返回系列列表

Lecture 13-14:贝叶斯方法与正则化

Stanford CS229 — 斯坦福机器学习

贝叶斯统计、最大后验估计、在线学习。

Lecture 13-14:贝叶斯方法与正则化

课程简介

贝叶斯统计、最大后验估计、在线学习。

🎬 本课程视频:Stanford CS229 — 斯坦福机器学习


一、贝叶斯统计

1.1 频率派 vs 贝叶斯派

在机器学习中有两种主要的统计思想流派:

频率派(Frequentist)
- 参数 $\theta$ 是固定的未知常数
- 数据是随机的
- 我们通过最大化似然 $P(D|\theta)$ 来估计 $\theta$
- 点估计:MLE $\hat{\theta} = \arg\max P(D|\theta)$

贝叶斯派(Bayesian)
- 参数 $\theta$ 是随机变量,有自己的分布
- 数据是固定的(已经观测到的)
- 我们通过贝叶斯定理计算 $\theta$ 的后验分布
- 全分布估计:$P(\theta|D) = \frac{P(D|\theta)P(\theta)}{P(D)}$

1.2 贝叶斯公式

贝叶斯定理是贝叶斯统计的基石:

$$P(\theta|D) = \frac{P(D|\theta) P(\theta)}{P(D)} = \frac{P(D|\theta) P(\theta)}{\int P(D|\theta) P(\theta) d\theta}$$

1.3 先验的影响

先验在数据量少时起主导作用,数据量多时被似然覆盖。

常见共轭对:
- Beta 先验 + 二项式似然 $\to$ Beta 后验
- Gamma 先验 + 泊松似然 $\to$ Gamma 后验
- 高斯先验 + 高斯似然 $\to$ 高斯后验

1.4 预测

贝叶斯预测通过积分消除参数的不确定性:

$$P(y|x, D) = \int P(y|x, \theta) P(\theta|D) d\theta$$

这称为后验预测分布(Posterior Predictive Distribution)。它自然地考虑了参数的不确定性,给出更合理的预测区间。

二、MAP 估计

2.1 定义

最大后验估计(Maximum a Posteriori, MAP)是 MLE 的贝叶斯版本:

$$\theta_{\text{MAP}} = \arg\max_\theta P(\theta|D) = \arg\max_\theta P(D|\theta) P(\theta)$$

与 MLE 不同,MAP 包含了先验信息 $P(\theta)$。

2.2 MAP 与正则化的关系

MAP 估计和正则化有深刻的等价关系。

例子:线性回归中的 MAP

假设先验 $\theta \sim \mathcal{N}(0, \lambda^{-1} I)$,似然为 $y \sim \mathcal{N}(\theta^T x, \sigma^2)$:

$$\theta_{\text{MAP}} = \arg\max_\theta \left[ \log P(D|\theta) + \log P(\theta) \right]$$

$$= \arg\min_\theta \left[ \frac{1}{2\sigma^2} \sum_{i=1}^{m} (y^{(i)} - \theta^T x^{(i)})^2 + \frac{\lambda}{2} |\theta|^2 \right]$$

这正是岭回归(Ridge Regression)——L2 正则化的线性回归!

L1 正则化(Lasso):等价于先验为拉普拉斯分布 $P(\theta) \propto \exp(-\lambda |\theta|)$。

先验分布 正则化项 等价于
高斯 $\mathcal{N}(0, 1/\lambda)$ $\lambda |\theta|^2$ L2 / 岭回归
拉普拉斯 $\text{Laplace}(0, 1/\lambda)$ $\lambda |\theta|_1$ L1 / Lasso

2.3 MAP 的优缺点

优点:
- 比 MLE 更稳定,特别是在数据少时
- 先验可以编码领域知识
- 等价于正则化,防止过拟合

缺点:
- 仍然是点估计,没有不确定性度量
- 先验选择具有主观性
- 无法完全捕捉贝叶斯方法的优势

三、在线学习

3.1 问题设定

在线学习(Online Learning)适用于数据流场景——数据源源不断地到来,模型需要实时更新。

与传统批量学习的区别:
- 批量学习:所有数据一次性可用,训练后部署
- 在线学习:数据逐个到达,模型实时更新

3.2 在线梯度下降

每次收到一个新样本 $(x^{(t)}, y^{(t)})$,更新参数:

$$\theta^{(t+1)} = \theta^{(t)} - \alpha_t \nabla \ell(h_{\theta^{(t)}}(x^{(t)}), y^{(t)})$$

其中学习率 $\alpha_t$ 通常随时间衰减,如 $\alpha_t = 1/\sqrt{t}$。

3.3 遗憾分析

在线学习的一个重要指标是遗憾(Regret)

$$\text{Regret}(T) = \sum_{t=1}^{T} \ell_t(\theta^{(t)}) - \min_{\theta} \sum_{t=1}^{T} \ell_t(\theta)$$

即在线算法的累积损失减去最优固定参数在 hindsight 下的累积损失。

对于凸损失,在线梯度下降的遗憾界为 $O(\sqrt{T})$——平均遗憾以 $O(1/\sqrt{T})$ 的速度趋于 0。这意味着在线算法最终会收敛到与最优固定参数几乎相同的表现。

3.4 Follow The Leader(FTL)

FTL 是最直观的在线学习策略:每次选择到目前为止表现最好的参数。

$$\theta^{(t+1)} = \arg\min_\theta \sum_{s=1}^{t} \ell_s(\theta)$$

FTL 的问题是:如果数据分布变化剧烈,它会过度反应。

改进版:Follow The Regularized Leader(FTRL)——加入正则化项使更新更平滑。

3.5 在线学习的应用

def online_gradient_descent(eta=0.1):
    theta = np.zeros(n_features)
    for t, (x, y) in enumerate(data_stream()):
        # 预测
        pred = sigmoid(theta @ x)
        # 计算梯度
        grad = (pred - y) * x
        # 更新参数
        lr = eta / np.sqrt(t + 1)
        theta -= lr * grad
    return theta

四、正则化的深入理解

4.1 L1 与 L2 正则化的几何解释

L2 正则化在参数空间中对应一个圆形约束区域,L1 对应菱形区域。

L1 正则化的菱形有"尖角"——这使得最优解更容易落在坐标轴上,产生稀疏解(很多参数为 0)。L2 正则化不会使参数恰好为 0。

4.2 贝叶斯视角的统一

从贝叶斯角度看,所有正则化都是先验分布:
- 任何形式的惩罚项都对应某种先验
- 正则化系数对应先验的强度
- 最优的正则化强度可以通过交叉验证或贝叶斯模型选择来确定

五、总结

  1. 贝叶斯统计:将参数视为随机变量,用后验分布量化不确定性
  2. MAP 估计:MLE + 先验 = 正则化,是频率派和贝叶斯派的桥梁
  3. 在线学习:处理数据流场景,遗憾作为核心指标
  4. 正则化:从贝叶斯视角看,所有正则化项都是先验分布

六、贝叶斯方法在实践中的应用

6.1 贝叶斯线性回归

贝叶斯线性回归不仅给出参数的点估计,还给出参数的后验分布和预测分布。

假设先验 $\theta \sim \mathcal{N}(0, \tau^2 I)$,似然 $y \sim \mathcal{N}(X\theta, \sigma^2 I)$,则后验为:

$$\theta|X,y \sim \mathcal{N}\left( \frac{1}{\sigma^2} A^{-1} X^T y, A^{-1} \right)$$

其中 $A = \frac{1}{\sigma^2} X^T X + \frac{1}{\tau^2} I$。

后验均值正是岭回归的解——又一次验证了贝叶斯和正则化的等价性。

预测分布给出了预测值的不确定性区间——这在很多实际应用中非常重要。比如在金融风控中,不仅需要预测违约概率,还需要知道预测的置信度。

6.2 贝叶斯 A/B 测试

传统 A/B 测试使用频率派的假设检验(p 值),但 p 值容易被误解。贝叶斯 A/B 测试更直观:

  1. 对 A、B 两组的转化率设定先验分布(如 Beta 分布)
  2. 根据观测数据计算后验分布
  3. 直接计算 B 优于 A 的概率 $P(\theta_B > \theta_A | \text{data})$

这种方法的优点是可以随时停止实验观察结果,而不需要像频率派方法那样预设样本量。

6.3 贝叶斯优化

贝叶斯优化是一种利用概率模型指导黑箱函数优化的方法。它特别适合超参数调优:

  1. 用高斯过程(Gaussian Process)建模目标函数
  2. 根据当前观测数据计算后验分布
  3. 用采集函数(如 Expected Improvement)选择下一个评估点
  4. 评估后更新模型

相比于网格搜索和随机搜索,贝叶斯优化可以用更少的迭代次数找到更好的超参数组合。

6.4 在线学习的遗憾分析进阶

在线学习算法的一个重要理论结果是:对于凸损失函数,任何在线算法的遗憾至少为 $\Omega(\sqrt{T})$。也就是说,$O(\sqrt{T})$ 的遗憾界是最优的——在线梯度下降达到了这个下界。

对于强凸损失函数,遗憾界可以改进到 $O(\log T)$,这意味着平均遗憾以 $O(\log T/T)$ 的速度趋于零——比一般凸损失的收敛快得多。

L1 与 L2 正则化的贝叶斯解释

从贝叶斯角度看,正则化对应着在参数上施加先验分布。具体来说,L2 正则化等价于在参数上施加高斯先验 $\theta_j \sim \mathcal{N}(0, 1/\lambda)$,然后寻找最大后验估计(MAP)。而 L1 正则化等价于在参数上施加拉普拉斯先验 $\theta_j \sim \text{Laplace}(0, 1/\lambda)$。

这两种先验的关键区别在于它们在原点附近的形状。高斯先验在原点处平滑,倾向于将参数"收缩"到零但不会精确为零。拉普拉斯先验在原点处有一个尖峰,因此 MAP 估计倾向于将不重要的参数精确设为零。这就是为什么 L1 正则化具有特征选择能力——它产生稀疏解,自动告诉我们哪些特征对预测最重要。

贝叶斯信息准则

在模型选择中,贝叶斯信息准则(BIC)提供了一种在拟合优度和模型复杂度之间平衡的度量:

$$\text{BIC} = -2\ln(\hat{L}) + k\ln(m)$$

其中 $\hat{L}$ 是模型的最大似然值,k 是参数数量,m 是样本数。BIC 惩罚参数较多的模型,有助于防止过拟合。与 AIC 相比,BIC 对参数数量的惩罚更严厉($\ln(m)$ vs 2),因此倾向于选择更简单的模型。

延伸阅读

← Lecture 11-12:学习理论 Lecture 15-16:聚类与降维 →