Entropy、Cross Entropy 和 KL Divergence:从编码代价理解模型训练📅 2026年07月14日 · ☕ 5 分钟 · ✍️ k4i用一个两结果分布的手算例子解释 entropy、cross entropy 和 KL divergence:真实分布本身有多难编码、用错误分布编码要多贵,以及为什么 cross entropy 会自然成为分类和语言模型训练目标。
KL Divergence 为什么不是距离:方向一换,问题就变了📅 2026年07月07日 · ☕ 7 分钟 · ✍️ k4i用编码代价、SFT/RLHF 目标和连续分布例子解释 KL divergence:为什么 KL(P || Q) 不等于 KL(Q || P),以及两个方向分别惩罚什么。
Optimizer:从 SGD 到 AdamW,模型参数到底怎么更新📅 2026年06月29日 · ☕ 9 分钟 · ✍️ k4i理解深度学习 optimizer 的发展脉络:SGD、Momentum、RMSProp、Adam、AdamW 分别解决什么问题,为什么 AdamW 成了现代深度学习的默认强基线,以及什么时候还会选择别的 optimizer。
Loss Function:模型到底在优化什么📅 2026年06月23日 · ☕ 8 分钟 · ✍️ k4i从损失函数的视角理解训练目标:MSE、MAE、Huber、binary cross entropy、cross entropy、KL divergence、hinge loss、contrastive loss 分别适合什么任务。
Activation Function:神经网络里那个很小但很关键的非线性📅 2026年06月18日 · ☕ 7 分钟 · ✍️ k4i从机制出发总结 activation function:为什么神经网络需要非线性,sigmoid、tanh、ReLU、GELU、SiLU 各自解决什么问题,以及为什么 400 个 activation 的综述更适合作为地图而不是菜单。