Zifeng Mai's Blog

Keep scaling and you will meet your aha moment.

随机过程(2)

宽平稳随机过程相关函数的时频分析

本文是张颢老师随机过程课程笔记的第二篇。在本文中,我们分别从时域和频域两个角度深入分析了一个宽平稳随机过程的相关函数。从时域上,我们介绍了相关函数的一些性质,包括柯西不等式、周期性、连续性等。我们通过Bochner定理,从数学的视角上证明了相关函数的正定性与其傅里叶变换的关系。在频域上,我们介绍了Wiener-Khintchine定理,证明了相关函数的傅里叶变换等于功率谱密度,从物理的视角上进一步深化了Bochner定理的认识。

随机过程(1)

线性相关

本文是张颢老师随机过程课程笔记的第一篇。文中主要介绍了两个随机变量之间的线性相关关系,从定性分析和符号化定义的角度,介绍了如何刻画两个随机变量之间的线性相关关系。

论文推荐:RFT的熵动力学分析

On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models

本文从理论角度分析了RFT(Reinforcement Fine-Tuning)过程中经常出现的熵坍塌 (Entropy Collapse) 现象。作者构建了一个描述token级别熵变化的理论模型,通过推导单个Logit更新对策略熵的一阶影响,提出了熵判别器分数(Entropy Discriminator Score)的核心概念。理论表明,策略熵的变化方向由更新方向与的判别器分数的符号共同决定。基于此,文章解释了为何奖励高置信度的答案会导致探索能力丧失,并统一了现有多种熵控制方法的理论解释。最后,作者提出了两种梯度截断算法,在不引入额外超参的情况下,有效缓解了熵坍塌现象,显著提升了模型在数学推理任务中的探索能力。

优化器 (2)

Muon

本文介绍了一种新的优化器Muon。与SGD和Adam等优化器不同,Muon将参数看作一个矩阵,而不是一个向量。这使得Muon能够更好地利用参数的结构信息,获得更稳定的训练过程、更快的收敛速度以及更高的性能上限。在本文中详细介绍了Muon的数学原理,并从范数理论的视角来分析了Muon的优势所在。最后,本文结合Kimi在大规模LLM预训练场景下的实践经验,介绍了几个将Muon应用在大规模模型训练上的经验和工程优化。

优化器 (1)

SGD和Adam

本文深入探讨了机器学习优化器的基本原理,从梯度下降开始,逐步深入以SGD和Adam为代表的现代机器学习优化器,展示了其理论基础和工程实践相结合的魅力。此外,本文从动力学的视角理解了某些优化器,可以为读者提供一些新的理解和启发。

论文推荐:利用PRM监督生成式推荐模型

PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations

利用PRM监督生成式推荐模型的中间解码步骤,并由此获得test-time scaling的能力,在推理阶段仅需增加少量计算量就能稳定提升性能。