ML1-3 局部加权线性回归

· 更新于 2026/8/20· Tech

1. 拟合效果

考虑根据 xRx \in \mathbb{R} 预测前述房价 yy 的问题。下图(左侧)显示了将 y=θ0+θ1xy = \theta_0 + \theta_1 x 拟合到数据集的结果。我们看到数据并不真正位于一条直线上,因此拟合效果不是很好(欠拟合)。

相反,如果我们添加一个额外的特征 x2x^2 ,并拟合 y=θ0+θ1x+θ2x2y = \theta_0 + \theta_1 x + \theta_2 x^2 ,那么我们对数据的拟合会稍好一些。

然而,添加太多的特征也有风险。下方的图是拟合一个五次多项式 y=j=05θjxjy = \sum_{j=0}^{5} \theta_j x^j 的结果。我们看到,尽管拟合曲线完美地通过了数据点,但我们不会认为这是一个非常好的预测。(过拟合)

上述三种情况展示了特征选择与拟合效果间的关系,可见特征的选择对于确保学习算法的良好性能至关重要(将来还会见到自动选择良好特征集的算法)。我们在这里引入局部加权线性回归(LWR) 算法,该算法假设有足够的训练数据,使得特征选择不那么关键。

2. 局部加权线性回归

在之前所述的原始线性回归中,所有参与训练的样本点,其权重可以看作是相同的。要在查询点 xx 处进行预测,我们会:

  1. 拟合 θ\theta 以最小化 i(y(i)θTx(i))2\sum_i (y^{(i)} - \theta^T x^{(i)})^2
  2. 输出 θTx\theta^T x

对于局部加权线性回归,它会根据我们的输入对各个样本的权重做出调整。要在查询点 xx 处进行预测,我们会:

  1. 拟合 θ\theta 以最小化 iw(i)(y(i)θTx(i))2\sum_i w^{(i)} (y^{(i)} - \theta^T x^{(i)})^2
  2. 输出 θTx\theta^T x

这里,w(i)w^{(i)} 是非负的权重。可见如果 w(i)w^{(i)} 很小,那么其对应的那份误差项在拟合中基本会被忽略。

一个常见的权重选择如下式(高斯核/径向基函数),形如 exp((距离)2/2)exp(-(距离)²/带宽²)

w(i)=exp((x(i)x)22τ2)w^{(i)} = \exp\left( -\frac{(x^{(i)} - x)^2}{2\tau^2} \right)
上式依赖我们要做预测的输入点 xx

  • 如果 x(i)x|x^{(i)} - x| 很小,说明训练点 x(i)x^{(i)} 很接近预测点 xx ,则 w(i)w^{(i)} 接近 1
  • 反之,若 x(i)x|x^{(i)} - x| 很大,说明训练点 x(i)x^{(i)} 与预测点 xx 较远 ,则 w(i)w^{(i)} 会很小

因此,θ\theta 的选择会给靠近预测点 xx 的训练样本(的误差)给予更高的权重 ww

注意

虽然权重的公式在外观上类似于高斯分布的密度,但 w(i)w^{(i)} 与高斯分布没有直接关系,特别地,w(i)w^{(i)} 不是服从正态分布或以其他方式分布的随机变量。高斯概率密度函数积分为1,而此式不是。

超参数 τ\tau ,又称带宽参数,它控制训练样本的权重随其 x(i)x^{(i)} 到查询点 xx 的距离下降的速度。

  • τ\tau 越小,有效参与计算的训练样本越少,可能过拟合(锯齿状拟合数据)
  • τ\tau 越大,有效参与计算的训练样本越多,可能欠拟合(过度平滑数据)

总结

局部加权回归的主要好处是拟合非线性数据集不需要手动调整特征
局部加权线性回归在数据集维度相对较低时非常有用,即特征数量n不要太大。
局部加权线性回归的计算复杂度跟训练样本数量直接挂钩(等同线性方程组维数)

3. 参数学习与非参数学习

参数学习:有固定数量的参数,这些参数被拟合到数据上。一旦我们拟合了 θi\theta_i 并将其存储起来,就不需要再保留训练数据来进行未来的预测。e.g.线性回归e.g. \text{线性回归}

非参数学习:需要保留整个训练集来进行未来的预测。我们需要保留的数据随训练集的大小而增长。e.g.局部加权线性回归,线性增长e.g. \text{局部加权线性回归},线性增长