ML1-2 线性回归与参数估计

· 更新于 2026/8/21· Tech

1. 概率与似然

  • 概率:用于在已知一些参数的情况下,预测接下来在观测上所得到的结果
  • 似然:在已知某些观测所得到的结果时,对有关事物性质的参数进行估值
  • 似然函数:对每个观测值 xx(随机变量 XX 的一个实例),似然函数定义为θf(xθ)θ ↦ f(x|θ),通常记作 L(θx)L(θ|x)

换句话说,当 f(xθ)f(x|θ) 被看作 xx 的函数且 θθ 固定时,它是概率密度函数;
当被看作 θθ 的函数且 xx 固定时,它是似然函数。
似然是当参数真实值为 θθ 时观测到特定结果 xx 的概率,它不是参数 θθ 的概率密度。

给定输出 xx 时,关于参数 θ\theta 的似然函数(在数值上)等于给定参数 θ\theta 后变量 xx 的概率:

L(θx)=P(xθ)L(\theta \mid x) = P(x \mid \theta)
f(xθ)f(x \mid θ) 表示样本 X=(X1,,Xn)X = (X_1, \dots, X_n) 的联合概率密度函数,在观察到随机变量 X=xX = x 时,若样本独立同分布(IID),还有下式:

L(θx)=i=1nf(xiθ)L(\theta \mid x) = \prod_{i=1}^{n} f(x_i \mid \theta)

总结

概率是已知参数,预测事件发生的可能性
似然是已知事件,预测参数取值的可能性
概率用于从事件模型中给出数据
似然用于从数据中逼近模型参数
似然不是概率,似然函数不要求满足归一性

2. 贝叶斯定理

参考维基百科,贝叶斯定理是关于随机事件 AABB 的条件概率的一则定理。

P(AB)=P(A)P(BA)P(B)P(A \mid B) = \frac{P(A)P(B \mid A)}{P(B)}
其中 AABB 为随机事件,且 P(B)P(B) 不为零。
P(AB)P(A \mid B) 是指事件 BB 发生的情况下事件 AA 发生的概率。

名词解释

贝叶斯定理有几个约定俗成的名词:

  • 先验概率:主观经验确定的,未见到观测结果前的概率
  • 后验概率:基于观测结果后予以修正的概率

因而有:

  • P(A)P(A)AA 的先验概率,其不考虑任何 BB 方面的因素
  • P(BA)P(B \mid A):有以下几种含义
    • 已知 AA 发生后,BB 发生的条件概率
    • BB 的后验概率
    • 在特定 BB 时,AA 的似然性(因为P(BA)=L(AB)P(B \mid A) = L(A \mid B)
  • P(B)P(B)BB 的先验概率,用于归一化(它可以看做分子部分的累加)

按这些术语,贝叶斯定理可表述为:

后验概率=(似然性先验概率)/全概率后验概率 = (似然性*先验概率)/ 全概率

3. 参数估计

给定观测数据 D={x1,x2,,xn}D = \{x_1, x_2, \ldots, x_n\} ,假设数据符合某个已知形式的分布 f(xθ)f(x \mid \theta) ,但参数 θ\theta 未知。

对于找到最佳参数这个问题,有两种主流观点:

  • 频率论世界是确定的,概率有真值。 当重复实验次数趋近无穷大时,事件发生的频率会收敛到概率的真值。
    • 视未知参数是普通变量(固定值),样本是随机变量
    • 不假设任何的先验知识
    • 数据是随机的,它由这个确定的概率产生
  • 贝叶斯论世界是不确定的,概率只是人们对世界的判断(置信度)。 人们对世界会有一个基本判断,而后通过现有的数据对之前的判断做调整。
    • 视一切变量是随机变量,概率也是,求 θ\theta 值不如说是求 θ\theta 的分布
    • 假设先验知识存在,通过采样修改先验知识,以逼近真实知识
    • 概率是不确定的(至少站在观测者角度如此),数据反而是确定的,数据影响判断

联系:

  • 在数据量趋近无穷时,频率学派和贝叶斯学派得到的结果是一样的,也就是说频率方法是贝叶斯方法的极限
  • P(θ)P(\theta) 为均匀分布,则 θ^MAP=θ^MLE\hat{\theta}_{\text{MAP}} = \hat{\theta}_{\text{MLE}}

参数估计:根据观测数据,求解最合理的 θ\theta 值,归结为对 θ\theta 的最优化问题。

3.1 极大似然估计 MLE

MLE 方法跟频率派思想相关。它认为参数 θ\theta 是未知但确定的常数。目标是找到参数 θ\theta,使得观测到当前数据的可能性最大。

因为 θ\theta 被认为是确定的数,所以我们期望的是找到 θ=θ^\theta = \hat{\theta} ,使得 P(Dθ)P(D \mid \theta) (当参数为 θ\theta 时,DD 的概率分布,即条件概率)最大。

给定观测数据 xx,定义似然函数 L(θx)=f(xθ)L(θ \mid x) = f(x \mid θ)。极大似然估计量(MLE)是使似然函数取最大值的 θθ
θ^MLE=argmaxθL(θx)=argmaxθi=1nf(xiθ)\hat{\theta}_{\text{MLE}} = \arg\max_\theta L(\theta \mid x) = \arg\max_\theta \prod_{i=1}^n f(x_i \mid \theta)

假设数据 X1X2XnX_1,X_2,\dots,X_ni.i.d.i.i.d. 的一组抽样,训练集 X=(X1X2Xn)X = (X_1,X_2,\dots,X_n)。我们有模型 f(xθ)f(x \mid \theta) ,那么 MLE 对 θ\theta 的估计方法可以如下推导( θ\theta 是变量,我们关心的是似然,即当 θ\theta 取何值时,训练集 XX 出现的概率最大)

θ^MLE=argmaxθL(θ)=argmaxθP(Xθ)=argmaxθi=1nP(xiθ)=argmaxθlogi=1nP(xiθ)=argmaxθi=1nlogP(xiθ)=argminθi=1nlogP(xiθ)\begin{aligned} \hat{\theta}_{\text{MLE}} &= \arg\max_{\theta} L(\theta) \\ &= \arg\max_{\theta} P(X \mid \theta) \\ &= \arg\max_{\theta} \prod_{i=1}^{n} P(x_i \mid \theta) \\ &= \arg\max_{\theta} \log \prod_{i=1}^{n} P(x_i \mid \theta) \\ &= \arg\max_{\theta} \sum_{i=1}^{n} \log P(x_i \mid \theta) \\ &= \arg\min_{\theta} -\sum_{i=1}^{n} \log P(x_i \mid \theta) \end{aligned}

对 IID 样本的理解

独立同分布(IID)是指一组随机变量中每个随机变量与其他变量具有相同的概率分布,且所有变量互相独立。一般有两种设计:

  • 样本集 DD 由对同一个随机变量 XX 独立采样 nn 次得到
  • 样本集 DD 由对多个完全相同的随机变量 XX 各独立采样 11 次得到

注意

此处我们不直接最大化似然,而是最小化负对数似然(Negative Log-Likelihood, NLL),因为:

  1. 大量独立概率的连乘会数值下溢。取对数将乘积转换求和,在浮点数范围内可控
  2. 取对数也便于计算梯度
  3. 最小化 NLL 等价于最小化交叉熵,能够与信息论相联系
  4. 这里 XX 是离散变量,但是连续变量的做法和离散是一致的

3.2 最大后验估计 MAP

MAP 方法和贝叶斯派思想相关。它认为 θ\theta 不是固定值,因为我们没有观察到,所以 θ\theta 取任何值都是可能的。因此,θ\theta 被视为一个随机变量,有自己的概率分布 P(θ)P(\theta) (称为先验)。

因为 θ\theta 被认为是一个随机变量,前文 MLE 中力求最大化的 P(Dθ)P(D \mid \theta) 就欠考虑了 P(θ)P(\theta)(因为XθX 、\theta 都是随机变量,应联合),即应最大化概率分布 P(θ)P(Dθ)P(\theta) P(D \mid \theta)。(考虑了贝叶斯定理中的先验)

根据贝叶斯定理,

P(θD)=P(θ)P(Dθ)P(D)P(\theta \mid D) = \frac{P(\theta)P(D \mid \theta)}{P(D)}
即最大化上式中的后验项 P(θD)P(\theta \mid D)

同样的,假设数据 X1X2XnX_1,X_2,\dots,X_ni.i.d.i.i.d. 的一组抽样,训练集 X=(X1X2Xn)X = (X_1,X_2,\dots,X_n)。那么 MAP 对 θ\theta 做如下估计:

θ^=argmaxθP(θX)=argminθlogP(θX)=argminθ[logP(Xθ)logP(θ)+logP(X)]=argminθ[logP(Xθ)logP(θ)]\begin{aligned} \hat{\theta} &= \arg\max_{\theta} P(\theta \mid X) \\ &= \arg\min_{\theta} -\log P(\theta \mid X) \\ &= \arg\min_{\theta} \big[-\log P(X \mid \theta) - \log P(\theta) + \log P(X)\big] \\ &= \arg\min_{\theta} \big[-\log P(X \mid \theta) - \log P(\theta)\big] \end{aligned}

如果 P(θ)P(θ) 为均匀分布(无信息先验),log P(θ)log\text{ }P(θ) 为常数,则 MAP 退化为 MLE。
可见 MLE 和 MAP 的区别就是先验项的取舍。

4. 线性回归的概率解释

当面对回归问题时,为什么线性回归——特别是最小二乘代价函数是一个合理的选择呢?

让我们假设目标变量和输入通过以下方程相关联:

y(i)=θTx(i)+ϵ(i)y^{(i)} = \theta^T x^{(i)} + \epsilon^{(i)}
其中 ϵ(i)\epsilon^{(i)} 是误差项,它捕捉未建模的影响(如我们未考虑的某特征或者某些噪声)。

让我们进一步假设 ϵ(i)\epsilon^{(i)} 独立同分布(IID)于均值为零、方差为 σ2\sigma^2 的高斯分布

ϵ(i)N(0,σ2)\epsilon^{(i)} \sim \mathcal{N}(0, \sigma^2)
那么 ϵ(i)\epsilon^{(i)} 的密度由下式给出

p(ϵ(i))=12πσexp((ϵ(i))22σ2)p(\epsilon^{(i)}) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(\epsilon^{(i)})^2}{2\sigma^2} \right)

这意味着
y(i)x(i);θN(θTx(i),σ2)y^{(i)} | x^{(i)}; \theta \sim \mathcal{N}(\theta^T x^{(i)}, \sigma^2)

p(y(i)x(i);θ)=12πσexp((y(i)θTx(i))22σ2)p(y^{(i)} | x^{(i)}; \theta) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(y^{(i)} - \theta^T x^{(i)})^2}{2\sigma^2} \right)

p(y(i)x(i);θ)p(y^{(i)} | x^{(i)}; \theta) 表示这是 y(i)y^{(i)} 在给定 x(i)x^{(i)} 并由 θ\theta 参数化的分布。由于我们不认为 θ\theta 是随机变量,所以这里不对 θ\theta 做条件。

对上述固定的 θ\theta ,我们将上述概率式子视为 θ\theta 的函数,于是有似然函数

L(θ)=L(θ;X,y)=p(yX;θ)L(\theta) = L(\theta; X, \vec{y}) = p(\vec{y} | X; \theta)

为了找到目标 θ\theta 使数据的概率尽可能大,采用极大似然估计

(θ)=logL(θ)=logi=1n12πσexp((y(i)θTx(i))22σ2)=i=1nlog12πσexp((y(i)θTx(i))22σ2)=nlog12πσ1σ212i=1n(y(i)θTx(i))2\begin{aligned}\ell(\theta) &= \log L(\theta) \\&= \log \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(y^{(i)} - \theta^T x^{(i)})^2}{2\sigma^2} \right) \\&= \sum_{i=1}^{n} \log \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(y^{(i)} - \theta^T x^{(i)})^2}{2\sigma^2} \right) \\&= n \log \frac{1}{\sqrt{2\pi}\sigma} - \frac{1}{\sigma^2} \cdot \frac{1}{2} \sum_{i=1}^{n} (y^{(i)} - \theta^T x^{(i)})^2\end{aligned}

因此,最大化对数似然 (θ)\ell(\theta) 等价于最小化下式
12i=1n(y(i)θTx(i))2\frac{1}{2} \sum_{i=1}^{n} (y^{(i)} - \theta^T x^{(i)})^2

因此,在上述关于数据的概率假设下,最小二乘回归对应于寻找 θ\theta 的极大似然估计。
(这些概率假设对于最小二乘成为一个完全合理的过程并非必要,而且可能也确实存在其他自然假设也可以用来证明其合理性)