← 深度学习导航
CORE PATH · 02

概率、损失与
贝叶斯推断

把最小二乘、平方误差和、最大似然估计、交叉熵、权重衰减、最大后验估计与贝叶斯推断放在同一张关系图中。

最小二乘(Least Squares)与平方误差和(SSE)

最小二乘(Least Squares)

核心定义

选择参数,使预测值与观测目标值之间的平方误差总和最小。

平方误差和(Sum of Squared Errors, SSE)

核心公式

E = ½ Σᵢ(zᵢ − tᵢ)²

扩展理解:最小二乘是优化原则,SSE 是常用的目标函数。前面的 ½ 只为简化求导,不改变损失最小时的参数位置。

最大似然估计与交叉熵

最大似然估计(Maximum Likelihood Estimation, MLE)

核心定义

MLE 选择最能解释观测数据的参数。

选择让已观察数据出现概率最大的参数。

交叉熵(Cross-Entropy)

核心定义

t = 1 ⇒ CE = −log z

t = 0 ⇒ CE = −log(1 − z)

Sigmoid + CE gradient = z − t

CE(t,z) = −[t log z + (1−t) log(1−z)]二元交叉熵;z 是预测为 1 的概率
扩展理解:分类任务中,最小化负对数似然(Negative Log-Likelihood, NLL)与最小化交叉熵方向一致。模型给真实类别的概率越高,NLL 越小。

权重衰减(Weight Decay)

Weight decay

原笔记

权重衰减是在数据损失上加入权重平方惩罚。

Ltotal = Ldata + λ Σⱼwⱼ²λ 控制 regularization 强度;原笔记的 w² penalty 在这里写成全部权重的总和
扩展理解:惩罚过大的权重可以限制模型复杂度、缓解过拟合(Overfitting)。在高斯先验下,L2 权重衰减也可以解释为 MAP 估计的一部分。

最大后验估计与贝叶斯推断

最大后验估计(Maximum A Posteriori, MAP)

核心定义

MAP 在似然之外加入参数的先验分布。

MAP = ML + prior

贝叶斯推断(Bayesian Inference)

核心定义

Posterior ∝ Likelihood × Prior

观察数据后的后验分布,由似然与先验共同决定。

P(h|D) = P(D|h)P(h) / P(D)P(h):prior · P(D|h):likelihood · P(h|D):posterior · P(D):evidence
BEFORE DATA

先验分布(Prior Distribution)

P(h):观察数据前对假设或参数的概率描述。

DATA SUPPORT

似然(Likelihood)

P(D|h):假设 h 成立时观察到数据 D 的概率。

AFTER DATA

后验分布(Posterior Distribution)

P(h|D):结合数据后对假设 h 更新得到的概率分布。

NORMALIZATION

证据(Evidence)

P(D):用于归一化后验分布的边际概率。

扩展理解:MLE 只找 likelihood 最大的参数;MAP 找 posterior 最大的参数。若 prior 是均匀分布,MAP 会退化为 MLE。

原笔记:KL 散度不对称

KL divergence

原笔记

DKL(p∥q) ≠ DKL(q∥p)

DKL(p∥q) = Σₓ p(x) log[p(x) / q(x)]期望是在 p 下计算,所以交换 p、q 会改变权重与结果;KL 不是普通的对称距离
扩展理解:Cross Entropy 满足 H(p,q)=H(p)+DKL(p∥q)。当真实分布 p 固定时,最小化 Cross Entropy 等价于最小化对应方向的 KL。

一张图串起全部关系

Observed data训练样本与 targets
Likelihood参数怎样解释数据
MLE / CE最大化 likelihood 或最小化 NLL
+ Prior加入参数的原本信念
MAP最大化 posterior
Weight Decay常见 Gaussian prior 对应 L2 penalty
快速记忆:ML 只问“哪个参数最能解释数据”;MAP 再问“这个参数是否也符合 prior”;Bayes 给出完整 posterior;KL 负责比较两个概率分布。

概率、损失与贝叶斯推断测验(Quiz)

40 道选择题覆盖最小二乘、交叉熵、MLE、MAP、贝叶斯推断、权重衰减与 KL 散度。

开始 40 题测验 →