训练与反向传播
SSE
E = ½ Σᵢ(zᵢ−tᵢ)²一个或多个输出的平方误差总和
SSE + Sigmoid 误差信号
δout = (z−t)z(1−z)输出神经元的误差信号(Error Signal)
权重梯度(Weight Gradient)
∂E/∂v₁ = δoutx₁后端误差信号 × 连接输入
梯度下降(Gradient Descent)
w ← w − η∂E/∂w沿损失下降方向更新参数
Sigmoid
σ(a) = 1 / (1 + e⁻ᵃ)一个 logit → 二分类概率
Softmax
pᵢ = eᶻⁱ / Σⱼeᶻʲ多个 logits → 总和为 1 的概率分布
交叉熵(Cross-Entropy)
H(t,p) = −Σᵢ tᵢ log pᵢ真实类别概率越低,损失越大
CE + Sigmoid 梯度
∂L / ∂a = z − t抵消 Sigmoid 导数,保留较强学习信号
似然、贝叶斯与正则化(Likelihood, Bayes & Regularization)
二元交叉熵(Binary Cross-Entropy)
−[t log z + (1−t)log(1−z)]t=1 时 −log z;t=0 时 −log(1−z)
贝叶斯公式(Bayes' Rule)
P(h|D) = P(D|h)P(h) / P(D)后验 ∝ 似然 × 先验
最大后验估计(MAP)
MAP = ML + prior最大化后验;均匀先验时退化为 ML
权重衰减(Weight Decay)
L = Ldata + λΣw²数据损失 + 权重平方惩罚
KL 散度(KL Divergence)
DKL(p∥q) ≠ DKL(q∥p)KL 散度不对称
卷积神经网络(CNN)
输出尺寸
out = ⌊(N + 2P − F) / S⌋ + 1N 输入 · F Filter · P Padding · S Stride
卷积参数量
(H × W × Cᵢₙ + 1) × CₒᵤₜBias 为 +1;输出通道数等于 Filter 数
循环神经网络(RNN)与强化学习
隐藏状态(Hidden State)更新
hₜ = f(Wₓₕxₜ + Wₕₕhₜ₋₁ + b)新的状态由当前输入与上一状态共同决定
Q-learning 更新
Q ← Q + α[r + γ max Q′ − Q]当前估计向 bootstrap 目标靠近
Optimal Value / Policy
V*(s)=maxaQ*(s,a)
π*(s)=argmaxaQ*(s,a)max 给值;argmax 给动作
词向量(Word Vectors)
SVD
X = UΣVT保留主要奇异值:高维共现矩阵 → 低维词表示
Word2Vec Softmax
P(j|k) = euj / Σj′euj′Candidate scores → Probability Distribution
CBOW
CBOW: Context → Center大家猜中间
Skip-Gram
Skip-Gram: Center → Context中间猜大家
必须能口述的 10 句话
01Forward 算预测,Loss 打分,Backpropagation 算梯度,Gradient Descent 改权重。训练闭环
02Softmax 把 logits 变成概率分布,Cross Entropy 用真实类别概率计算 Loss。概率
03CE 抵消 Sigmoid 导数,输出层梯度简化为 z−t。高频
04CNN 参数少来自局部连接与权重共享。CNN
05Pooling 不学习参数,只做降采样并增强一定平移鲁棒性。CNN
06RNN 用 Hidden State 保存历史,但长序列 BPTT 容易梯度消失/爆炸。RNN
07LSTM 用三门管理 Cell State;GRU 用 Update / Reset 两门且没有独立 Cell State。门控
08Attention 为每个输出动态关注输入中最相关位置,缓解固定长度向量瓶颈。Attention
09SVD 把高维 co-occurrence matrix 压缩成低维 word representation。Word Vectors
10Word2Vec 用 prediction 学 embedding;CBOW 由 context 猜 center,Skip-Gram 由 center 猜 context。Word2Vec
公式速记测验(Quiz)
40 道概念题与计算题,集中检查训练、概率、CNN、RNN 与 Q-learning 公式。
开始 40 题测验 →