From LR to ELR: A Better Heuristic for Pretraining Dynamics在大模型(Large Language Models,LLM)预训练中,超参数是影响效果好坏、控制模型训练动态的关键因素。而学习率(Learning Rate, LR)作为预训练中最重要的超参数之一,却无法精确控制模型参数的演化速率,其最优取值又往往随模型和数据规模的扩大而改变。本文引入了有效学习率(Effective Learning Rate, ELR)来控制模型权重的方向变化。作为可调超参数,ELR 比 LR 更贴近训练的内在动态,因此是更合适的调参依据:在多幂律(Multi-Power Law, MPL)模型中,以 ELR 为依据可以更准确地预测损失,最优 ELR 也能更可靠地迁移到不同规模的模型。进一步地,ELR 这一视角还能指导我们设计更合适的 LR 调度策略,并在实验中优于常规 LR 调度策略基线。