对应论文
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
视频简介
当前学界普遍认为,基于可验证奖励的强化学习(RLVR)能够使大语言模型超越基础模型的能力边界,在数学、编程等推理任务上持续自我提升、涌现出全新的推理能力。然而,这一假设从未在系统层面得到严格验证。本文以"RLVR是否真正激发了超越基础模型的推理容量"为核心问题,对多个模型家族、多种RL算法及多类推理基准展开全面实证分析。 论文引入pass@k指标作为核心评估工具,在大k值下(k=128至1024)系统比较RLVR训练模型与基础模型的覆盖能力。关键发现是:RLVR训练模型仅在小k(如k=1)时超过基础模型,当k增大时基础模型始终反超,说明RLVR提升的是"采样效率"而非"推理边界"。此外,困惑度分析证实RLVR模型的推理路径已经存在于基础模型的输出分布之中,而对比实验表明蒸馏方法才能真正引入基础模型中不存在的新推理模式。 这项工作对当前AI推理研究的主流叙事构成实质性挑战:大量将RLVR视为"激发新推理能力"的论文需要重新审视其结论的有效范围。该论文提供了清晰的方法论框架(pass@k + 困惑度分析),可作为评估未来推理增强方法的标准工具,对本仓库关注的推理与推断控制方向具有重要参考价值。 该论文的主要局限在于其结论高度依赖当前RLVR的具体实现(PPO、GRPO等六种算法),对更前沿或未来改进的RL范式尚未覆盖。作者本人也指出研究停留在诊断层面,未提出足以弥补"推理边界"差距的具体新方法。此外,实验规模(最大k=1024)受计算资源限制,极端k值下的结论是否成立仍有讨论空间,这是其未达到更高评级的原因。