★★★★★ 链式求导 · KL 方向 · Bayes 分母
固定检查 先 Forward,再 Loss,最后沿连接往回传
PART A · BACKPROPAGATION
Simple Gradient Descent ★★★★
01 · FORWARD
02 · LOSS
03 · GRADIENT
04 · UPDATE
INPUT x
→
PREDICTION wx
→
LOSS E
← gradient ←
最大坑: 当 prediction ≠ target 时,loss 不是 0。即使 \(w=0\),只要 \(t=1\),仍有 \(E=0.5\)。
SOFTMAX + CROSS ENTROPY
从 logits 到 probability 与 gradient ★★★★★
01 · STABLE EXP
02 · PROBABILITY
03 · CE LOSS
04 · GRADIENT
Cross Entropy \(L=-\log p_y\Rightarrow \partial L/\partial z=p-y\)。正确类别是 \(p_y-1\),其他类别是 \(p_j\)。
符号检查 若题目问 \(\partial\log p_y/\partial z\),答案方向相反:\(y-p\)。先检查是否有负号。 If the question asks for \(\partial\log p_y/\partial z\), the direction is reversed: \(y-p\). Check the negative sign first.
CNN CALCULATION
Output、Neurons、Parameters、Connections ★★★★★
OUTPUT SHAPE
NEURONS
PARAMETERS
CONNECTIONS
固定顺序: 先算空间 output size;neurons 再乘 filters;parameters 只计算独立共享权重;connections 才按每个 neuron 的 receptive field 展开。
PART B · CHAIN RULE
两层 Neural Network Backprop ★★★★★
1 Forward
2 \(dz\)
3 \(dy\)
4 ReLU
5 \(dw\)
两层神经网络梯度流
从输入经过 ReLU 隐藏层到输出和损失,再反向传播梯度。
x₁=1 x₂=2
u₁=-1 y₁=0 u₂=2 y₂=2
z=1 dz=1
E=.5 t=0
ReLU 检查 \(u_1=-1<0\),所以 \(y_1=0\) 且 \(du_1=0\)。连入该 neuron 的 weight 本次不更新。
固定模板 \(dz=z-t\) → \(dv=dz\cdot y\) → \(dy=V^Tdz\) → ReLU → \(dw=du\cdot x\)。
BAYES RULE
看到结果后,重新判断原因 ★★★★
分母检查: \(P(RR\mid B_1)P(B_1)\) 只是“选到 Bag 1 且看到 RR”的 joint probability。答案必须再除以所有可能原因的总和。
ENTROPY + KL DIVERGENCE
不确定性与分布差异 ★★★★★
distribution \(p\) · 逗号分隔
distribution \(q\) · 逗号分隔
恢复示例
Entropy \(H(p)\)
越平均,entropy 越大;确定性越高,entropy 越小。
\(D_{KL}(p\parallel q)\)
KL 有方向,通常 \(D_{KL}(p\parallel q)\neq D_{KL}(q\parallel p)\),所以它不是 distance。
HUFFMAN TREE
每次合并最小的两个概率 ★★★
叶节点权重 · 逗号分隔
恢复示例
内部节点不是原始概率: 合并后出现的 \(1/2\) 可能是两个小节点的和,不要把它与原始 \(1/2\) 叶节点混淆。
考试前 30 秒检查
反向传播是否先做完 Forward 和 Loss?
ReLU 前的 \(u<0\) 时,是否把 \(du\) 设为 0?
weight gradient 是否乘的是连入该 weight 的 input?
Softmax 是否先取 exponential,而不是直接按 logits 比例归一化?
Cross Entropy 梯度是否写成 \(p-y\),并检查题目有没有负号?
CNN neurons 是否乘了 filters,parameters 是否避免重复计算共享权重?
Bayes 是否除以所有可能原因的总和?
KL 的 \(p\) 和 \(q\) 方向是否与题目一致?
Huffman 是否每一轮都重新选最小的两个?
25 道核心计算与概念题 新增 Softmax、Cross Entropy gradient、重复输入、线性层、CNN 完整计算、BatchNorm 与 ResNet / DenseNet。每次重置都会重新随机排列选项。
开始 25 题核心测验 →