会做和会想:RLVR 到底扩展了什么
可验证奖励强化学习是小 k 更强还是真扩展了能力边界?两篇立场相反的代表工作给出了各自的硬数字:一边发现大 k 时基座反超,一边在低支持空间任务里让基座从零变到可解。梳理这场争论的判据、指标与边界条件。
一千条样本够吗:小数据如何激发大推理
强基座上一千条精选长思维链就能把竞赛数学从个位数拉到六成,成本仅七张 H100 的 GPU 时。但精选是否必要正在被推翻,而评测噪声比效果本身还大:三十道题、单点提升常常落在噪声带里。
想久一点就有用吗:推理时扩展的能与不能
采样、搜索、验证、预算分配四层方法全谱系,加上一条被反复印证的结论:生成容易选择难——覆盖率能涨四个数量级,但多数投票约一百个样本后就饱和。梳理成本反转让小而多训变得划算,以及知识密集型任务上算力为何失效。
机器人为什么会在第十步出错:长时程推理与记忆
从 SayCan、VoxPoser 到 Helix、GR00T 和具身记忆,梳理机器人长时程任务的接口演进、双系统架构、错误恢复与评测缺口:真正缺的不是更长的上下文,而是能被验证的恢复闭环。







