ML1-3 局部加权线性回归
1. 拟合效果
考虑根据 预测前述房价 的问题。下图(左侧)显示了将 拟合到数据集的结果。我们看到数据并不真正位于一条直线上,因此拟合效果不是很好(欠拟合)。
相反,如果我们添加一个额外的特征 ,并拟合 ,那么我们对数据的拟合会稍好一些。
然而,添加太多的特征也有风险。下方的图是拟合一个五次多项式 的结果。我们看到,尽管拟合曲线完美地通过了数据点,但我们不会认为这是一个非常好的预测。(过拟合)
上述三种情况展示了特征选择与拟合效果间的关系,可见特征的选择对于确保学习算法的良好性能至关重要(将来还会见到自动选择良好特征集的算法)。我们在这里引入局部加权线性回归(LWR) 算法,该算法假设有足够的训练数据,使得特征选择不那么关键。
2. 局部加权线性回归
在之前所述的原始线性回归中,所有参与训练的样本点,其权重可以看作是相同的。要在查询点 处进行预测,我们会:
- 拟合 以最小化
- 输出
对于局部加权线性回归,它会根据我们的输入对各个样本的权重做出调整。要在查询点 处进行预测,我们会:
- 拟合 以最小化
- 输出
这里, 是非负的权重。可见如果 很小,那么其对应的那份误差项在拟合中基本会被忽略。
一个常见的权重选择如下式(高斯核/径向基函数),形如 :
上式依赖我们要做预测的输入点 :
- 如果 很小,说明训练点 很接近预测点 ,则 接近 1
- 反之,若 很大,说明训练点 与预测点 较远 ,则 会很小
因此, 的选择会给靠近预测点 的训练样本(的误差)给予更高的权重 。
注意
虽然权重的公式在外观上类似于高斯分布的密度,但 与高斯分布没有直接关系,特别地, 不是服从正态分布或以其他方式分布的随机变量。高斯概率密度函数积分为1,而此式不是。
超参数 ,又称带宽参数,它控制训练样本的权重随其 到查询点 的距离下降的速度。
- 越小,有效参与计算的训练样本越少,可能过拟合(锯齿状拟合数据)
- 越大,有效参与计算的训练样本越多,可能欠拟合(过度平滑数据)
总结
局部加权回归的主要好处是拟合非线性数据集不需要手动调整特征。
局部加权线性回归在数据集维度相对较低时非常有用,即特征数量n不要太大。
局部加权线性回归的计算复杂度跟训练样本数量直接挂钩(等同线性方程组维数)
3. 参数学习与非参数学习
参数学习:有固定数量的参数,这些参数被拟合到数据上。一旦我们拟合了 并将其存储起来,就不需要再保留训练数据来进行未来的预测。
非参数学习:需要保留整个训练集来进行未来的预测。我们需要保留的数据随训练集的大小而增长。


