1. 概率与似然
- 概率:用于在已知一些参数的情况下,预测接下来在观测上所得到的结果
- 似然:在已知某些观测所得到的结果时,对有关事物性质的参数进行估值
- 似然函数:对每个观测值 x(随机变量 X 的一个实例),似然函数定义为θ↦f(x∣θ),通常记作 L(θ∣x)
换句话说,当 f(x∣θ) 被看作 x 的函数且 θ 固定时,它是概率密度函数;
当被看作 θ 的函数且 x 固定时,它是似然函数。
似然是当参数真实值为 θ 时观测到特定结果 x 的概率,它不是参数 θ 的概率密度。
给定输出 x 时,关于参数 θ 的似然函数(在数值上)等于给定参数 θ 后变量 x 的概率:
L(θ∣x)=P(x∣θ)
设 f(x∣θ) 表示样本 X=(X1,…,Xn) 的联合概率密度函数,在观察到随机变量 X=x 时,若样本独立同分布(IID),还有下式:
L(θ∣x)=i=1∏nf(xi∣θ)
总结
概率是已知参数,预测事件发生的可能性
似然是已知事件,预测参数取值的可能性
概率用于从事件模型中给出数据
似然用于从数据中逼近模型参数
似然不是概率,似然函数不要求满足归一性
2. 贝叶斯定理
参考维基百科,贝叶斯定理是关于随机事件 A 和 B 的条件概率的一则定理。
P(A∣B)=P(B)P(A)P(B∣A)
其中 A 和 B 为随机事件,且 P(B) 不为零。
P(A∣B) 是指事件 B 发生的情况下事件 A 发生的概率。
名词解释
贝叶斯定理有几个约定俗成的名词:
- 先验概率:主观经验确定的,未见到观测结果前的概率
- 后验概率:基于观测结果后予以修正的概率
因而有:
- P(A):A 的先验概率,其不考虑任何 B 方面的因素
- P(B∣A):有以下几种含义
- 已知 A 发生后,B 发生的条件概率
- B 的后验概率
- 在特定 B 时,A 的似然性(因为P(B∣A)=L(A∣B))
- P(B):B 的先验概率,用于归一化(它可以看做分子部分的累加)
按这些术语,贝叶斯定理可表述为:
后验概率=(似然性∗先验概率)/全概率
3. 参数估计
给定观测数据 D={x1,x2,…,xn} ,假设数据符合某个已知形式的分布 f(x∣θ) ,但参数 θ 未知。
对于找到最佳参数这个问题,有两种主流观点:
- 频率论:世界是确定的,概率有真值。 当重复实验次数趋近无穷大时,事件发生的频率会收敛到概率的真值。
- 视未知参数是普通变量(固定值),样本是随机变量
- 不假设任何的先验知识
- 数据是随机的,它由这个确定的概率产生
- 贝叶斯论:世界是不确定的,概率只是人们对世界的判断(置信度)。 人们对世界会有一个基本判断,而后通过现有的数据对之前的判断做调整。
- 视一切变量是随机变量,概率也是,求 θ 值不如说是求 θ 的分布
- 假设先验知识存在,通过采样修改先验知识,以逼近真实知识
- 概率是不确定的(至少站在观测者角度如此),数据反而是确定的,数据影响判断
联系:
- 在数据量趋近无穷时,频率学派和贝叶斯学派得到的结果是一样的,也就是说频率方法是贝叶斯方法的极限。
- 若 P(θ) 为均匀分布,则 θ^MAP=θ^MLE
参数估计:根据观测数据,求解最合理的 θ 值,归结为对 θ 的最优化问题。
3.1 极大似然估计 MLE
MLE 方法跟频率派思想相关。它认为参数 θ 是未知但确定的常数。目标是找到参数 θ,使得观测到当前数据的可能性最大。
因为 θ 被认为是确定的数,所以我们期望的是找到 θ=θ^ ,使得 P(D∣θ) (当参数为 θ 时,D 的概率分布,即条件概率)最大。
给定观测数据 x,定义似然函数 L(θ∣x)=f(x∣θ)。极大似然估计量(MLE)是使似然函数取最大值的 θ:
θ^MLE=argθmaxL(θ∣x)=argθmaxi=1∏nf(xi∣θ)
假设数据 X1,X2,…,Xn 是 i.i.d. 的一组抽样,训练集 X=(X1,X2,…,Xn)。我们有模型 f(x∣θ) ,那么 MLE 对 θ 的估计方法可以如下推导( θ 是变量,我们关心的是似然,即当 θ 取何值时,训练集 X 出现的概率最大)
θ^MLE=argθmaxL(θ)=argθmaxP(X∣θ)=argθmaxi=1∏nP(xi∣θ)=argθmaxlogi=1∏nP(xi∣θ)=argθmaxi=1∑nlogP(xi∣θ)=argθmin−i=1∑nlogP(xi∣θ)
对 IID 样本的理解
独立同分布(IID)是指一组随机变量中每个随机变量与其他变量具有相同的概率分布,且所有变量互相独立。一般有两种设计:
- 样本集 D 由对同一个随机变量 X 独立采样 n 次得到
- 样本集 D 由对多个完全相同的随机变量 X 各独立采样 1 次得到
注意
此处我们不直接最大化似然,而是最小化负对数似然(Negative Log-Likelihood, NLL),因为:
- 大量独立概率的连乘会数值下溢。取对数将乘积转换求和,在浮点数范围内可控
- 取对数也便于计算梯度
- 最小化 NLL 等价于最小化交叉熵,能够与信息论相联系
- 这里 X 是离散变量,但是连续变量的做法和离散是一致的
3.2 最大后验估计 MAP
MAP 方法和贝叶斯派思想相关。它认为 θ 不是固定值,因为我们没有观察到,所以 θ 取任何值都是可能的。因此,θ 被视为一个随机变量,有自己的概率分布 P(θ) (称为先验)。
因为 θ 被认为是一个随机变量,前文 MLE 中力求最大化的 P(D∣θ) 就欠考虑了 P(θ)(因为X、θ 都是随机变量,应联合),即应最大化概率分布 P(θ)P(D∣θ)。(考虑了贝叶斯定理中的先验)
根据贝叶斯定理,
P(θ∣D)=P(D)P(θ)P(D∣θ)
即最大化上式中的后验项 P(θ∣D)。
同样的,假设数据 X1,X2,…,Xn 是 i.i.d. 的一组抽样,训练集 X=(X1,X2,…,Xn)。那么 MAP 对 θ 做如下估计:
θ^=argθmaxP(θ∣X)=argθmin−logP(θ∣X)=argθmin[−logP(X∣θ)−logP(θ)+logP(X)]=argθmin[−logP(X∣θ)−logP(θ)]
如果 P(θ) 为均匀分布(无信息先验),log P(θ) 为常数,则 MAP 退化为 MLE。
可见 MLE 和 MAP 的区别就是先验项的取舍。
4. 线性回归的概率解释
当面对回归问题时,为什么线性回归——特别是最小二乘代价函数是一个合理的选择呢?
让我们假设目标变量和输入通过以下方程相关联:
y(i)=θTx(i)+ϵ(i)
其中 ϵ(i) 是误差项,它捕捉未建模的影响(如我们未考虑的某特征或者某些噪声)。
让我们进一步假设 ϵ(i) 独立同分布(IID)于均值为零、方差为 σ2 的高斯分布
ϵ(i)∼N(0,σ2)
那么 ϵ(i) 的密度由下式给出
p(ϵ(i))=2πσ1exp(−2σ2(ϵ(i))2)
这意味着
y(i)∣x(i);θ∼N(θTx(i),σ2)
即
p(y(i)∣x(i);θ)=2πσ1exp(−2σ2(y(i)−θTx(i))2)
p(y(i)∣x(i);θ) 表示这是 y(i) 在给定 x(i) 并由 θ 参数化的分布。由于我们不认为 θ 是随机变量,所以这里不对 θ 做条件。
对上述固定的 θ ,我们将上述概率式子视为 θ 的函数,于是有似然函数
L(θ)=L(θ;X,y)=p(y∣X;θ)
为了找到目标 θ 使数据的概率尽可能大,采用极大似然估计
ℓ(θ)=logL(θ)=logi=1∏n2πσ1exp(−2σ2(y(i)−θTx(i))2)=i=1∑nlog2πσ1exp(−2σ2(y(i)−θTx(i))2)=nlog2πσ1−σ21⋅21i=1∑n(y(i)−θTx(i))2
因此,最大化对数似然 ℓ(θ) 等价于最小化下式
21i=1∑n(y(i)−θTx(i))2
因此,在上述关于数据的概率假设下,最小二乘回归对应于寻找 θ 的极大似然估计。
(这些概率假设对于最小二乘成为一个完全合理的过程并非必要,而且可能也确实存在其他自然假设也可以用来证明其合理性)