会做和会想:RLVR 到底扩展了什么
可验证奖励强化学习是小 k 更强还是真扩展了能力边界?两篇立场相反的代表工作给出了各自的硬数字:一边发现大 k 时基座反超,一边在低支持空间任务里让基座从零变到可解。梳理这场争论的判据、指标与边界条件。
从会搜到会研究:Agentic RL 的配方与头号风险
深度研究代理的训练配方高度趋同:可验证结果奖励加多轮工具环境加异步 rollout。梳理 GRPO 算法谱系、从 Search-R1 到 Kimi-Researcher 的路线,以及 reward hacking 这个头号工程问题。





