最小二乘(Least Squares)与平方误差和(SSE)
最小二乘(Least Squares)
核心定义
选择参数,使预测值与观测目标值之间的平方误差总和最小。
平方误差和(Sum of Squared Errors, SSE)
核心公式
E = ½ Σᵢ(zᵢ − tᵢ)²
扩展理解:最小二乘是优化原则,SSE 是常用的目标函数。前面的 ½ 只为简化求导,不改变损失最小时的参数位置。
最大似然估计与交叉熵
最大似然估计(Maximum Likelihood Estimation, MLE)
核心定义
MLE 选择最能解释观测数据的参数。
选择让已观察数据出现概率最大的参数。
交叉熵(Cross-Entropy)
核心定义
t = 1 ⇒ CE = −log z
t = 0 ⇒ CE = −log(1 − z)
Sigmoid + CE gradient = z − t
CE(t,z) = −[t log z + (1−t) log(1−z)]二元交叉熵;z 是预测为 1 的概率
扩展理解:分类任务中,最小化负对数似然(Negative Log-Likelihood, NLL)与最小化交叉熵方向一致。模型给真实类别的概率越高,NLL 越小。
权重衰减(Weight Decay)
Weight decay
原笔记
权重衰减是在数据损失上加入权重平方惩罚。
Ltotal = Ldata + λ Σⱼwⱼ²λ 控制 regularization 强度;原笔记的 w² penalty 在这里写成全部权重的总和
扩展理解:惩罚过大的权重可以限制模型复杂度、缓解过拟合(Overfitting)。在高斯先验下,L2 权重衰减也可以解释为 MAP 估计的一部分。
最大后验估计与贝叶斯推断
最大后验估计(Maximum A Posteriori, MAP)
核心定义
MAP 在似然之外加入参数的先验分布。
MAP = ML + prior
贝叶斯推断(Bayesian Inference)
核心定义
Posterior ∝ Likelihood × Prior
观察数据后的后验分布,由似然与先验共同决定。
P(h|D) = P(D|h)P(h) / P(D)P(h):prior · P(D|h):likelihood · P(h|D):posterior · P(D):evidence
BEFORE DATA先验分布(Prior Distribution)
P(h):观察数据前对假设或参数的概率描述。
DATA SUPPORT似然(Likelihood)
P(D|h):假设 h 成立时观察到数据 D 的概率。
AFTER DATA后验分布(Posterior Distribution)
P(h|D):结合数据后对假设 h 更新得到的概率分布。
NORMALIZATION证据(Evidence)
P(D):用于归一化后验分布的边际概率。
扩展理解:MLE 只找 likelihood 最大的参数;MAP 找 posterior 最大的参数。若 prior 是均匀分布,MAP 会退化为 MLE。
原笔记:KL 散度不对称
KL divergence
原笔记
DKL(p∥q) ≠ DKL(q∥p)
DKL(p∥q) = Σₓ p(x) log[p(x) / q(x)]期望是在 p 下计算,所以交换 p、q 会改变权重与结果;KL 不是普通的对称距离
扩展理解:Cross Entropy 满足 H(p,q)=H(p)+DKL(p∥q)。当真实分布 p 固定时,最小化 Cross Entropy 等价于最小化对应方向的 KL。
一张图串起全部关系
Observed data训练样本与 targets
Likelihood参数怎样解释数据
MLE / CE最大化 likelihood 或最小化 NLL
+ Prior加入参数的原本信念
MAP最大化 posterior
Weight Decay常见 Gaussian prior 对应 L2 penalty
快速记忆:ML 只问“哪个参数最能解释数据”;MAP 再问“这个参数是否也符合 prior”;Bayes 给出完整 posterior;KL 负责比较两个概率分布。
概率、损失与贝叶斯推断测验(Quiz)
40 道选择题覆盖最小二乘、交叉熵、MLE、MAP、贝叶斯推断、权重衰减与 KL 散度。
开始 40 题测验 →