全部/快讯/快讯

腾讯混元研究 · 快讯

ARCHIVE近 30 天历史柱高表示当天去重快讯数量
222
09/12—10/11 有历史数据
  • 更大的 batch 让每次更新能够处理更多序列,从而利用更多并行计算资源;但在样本预算固定时,模型可更新的次数也会减少。在强化学习中,什么时候增大 batch 才能缩短达到目标性能所需的实际时间?对于大语言模型,还必须考虑训练轨迹需要在线生成,以及生成与训练对计算资源的需求并不相同。我们建立了一个将达标所需样本数与端到端吞吐量联系起来的分析框架:只有吞吐增益超过额外的样本代价,更大的 batch 才能加速训练。这也给出了一个实用的调参顺序:先找到 batch size 变化后学习效果仍近似不变的范围,再在这个范围内优化吞吐量。GRPO 和 PPO 实验表明,重新调整学习率后,不同 batch 的学习曲线在一定范围内按累计样本数比较时大致对齐。在固定硬件上,增大 batch 使生成吞吐量最高提升 2.29 倍;我们测得的最佳 GRPO 配置在不增加 GPU 的情况下,将达到同一验证目标所需的时间缩短了 29%。
  • 在大模型(Large Language Models,LLM)预训练中,超参数是影响效果好坏、控制模型训练动态的关键因素。而学习率(Learning Rate, LR)作为预训练中最重要的超参数之一,却无法精确控制模型参数的演化速率,其最优取值又往往随模型和数据规模的扩大而改变。本文引入了有效学习率(Effective Learning Rate, ELR)来控制模型权重的方向变化。作为可调超参数,ELR 比 LR 更贴近训练的内在动态,因此是更合适的调参依据:在多幂律(Multi-Power Law, MPL)模型中,以 ELR 为依据可以更准确地预测损失,最优 ELR 也能更可靠地迁移到不同规模的模型。进一步地,ELR 这一视角还能指导我们设计更合适的 LR 调度策略,并在实验中优于常规 LR 调度策略基线。
  • 今天我们推出Hyra-1.0,这是 Hyra(Hunyuan Research Agent) 的首个版本:一个能够递归自我改进、专为性能导向的研究与工程任务打造的智能体。
  • Hy-MT2 是支持 33 种语言互译的多语言模型,其中7B 和 30B-A3B模型在各类翻译任务上达到了开源模型最佳效果,超越了几十倍参数量的模型。轻量级的 1.8B 模型也超越了微软和豆包等主流商业 API,且得益于 AngelSlim 1.25-bit 极端量化,仅需 440MB 存储空间,可以轻松部署在苹果、高通、联发科等手机芯片上支持本地推理,相比Hy-MT1.5推理速度提升 1.5 倍。基于Hy-MT2模型的“腾讯Hy翻译”小程序已经上线,IOS和安卓APP即将上线(支持本地推理)。
  • 此前,我们发布了 CL-bench,用来测试 AI 能否从 context 中掌握复杂的新知识,并将其有效运用。它关注的是专业场景中相对清晰、经过整理的 context。但现实生活中的 context 并不是一本提前梳理好的“说明书”。如果要成为真正好用的日常助理,AI 不能只停留于理解和运用新知识;它还必须能看懂复杂的人际关系,处理混乱、碎片化、不断变化的信息,并从这些线索中读懂我们真实的生活。