考卷本身也会错:Agent 评测学的四大失效
OpenAI 正式弃用 SWE-bench Verified:审计发现近六成判分有实质缺陷。从判分器可被绕过、数据污染、跑间抖动的量化证据,到统计功效与排行榜操纵,梳理 Agent 评测为什么必须被当作一门学科来对待。
L2 误差不是指标:端到端智驾的评测重建
端到端智驾的评测正在被重建:只看轨迹 L2 误差的模型能打平甚至超过感知方案,开环排名与闭环排名会发生反转。梳理三组否定开环指标的证据、闭环与伪闭环基准的迁移,以及 VLA 化之后动作输出机制的真实形态。
仿真分数高,真机就一定好吗:Sim2Real 评估的缺口
Domain randomization、3D Gaussian Splatting、Isaac Lab、Genesis 和视频世界模型分别解决了什么?从 SIMPLER 与 GAUGE 出发,说明仿真—真机相关性为何仍缺统一协议,以及个人研究者如何做配对评估。






