L2 误差不是指标:端到端智驾的评测重建
端到端智驾的评测正在被重建:只看轨迹 L2 误差的模型能打平甚至超过感知方案,开环排名与闭环排名会发生反转。梳理三组否定开环指标的证据、闭环与伪闭环基准的迁移,以及 VLA 化之后动作输出机制的真实形态。
机器人为什么会在第十步出错:长时程推理与记忆
从 SayCan、VoxPoser 到 Helix、GR00T 和具身记忆,梳理机器人长时程任务的接口演进、双系统架构、错误恢复与评测缺口:真正缺的不是更长的上下文,而是能被验证的恢复闭环。
机器人没有互联网数据:一张数据引擎与 Scaling Law 地图
机器人数据从哪里来?梳理真机遥操作、仿真合成与人类视频三条路线,以及多样性幂律、跨本体混合和负迁移之间的张力:机器人 scaling law 存在,但远不是把数据量乘大那么简单。
触觉不是多一张图:它如何进入 VLA
触觉补上的不是视觉分辨率,而是接触状态:滑动、力、局部几何与形变。梳理 GelSight、AnySkin、Sparsh 到触觉残差、未来触觉预测和柔性物体评测,给个人实验室一条低成本路线。
换一台机器人就不灵了:VLA 跨本体泛化卡在哪
拆解 VLA 跨本体泛化的核心障碍——动作空间异构,以及从离散 token 到物理对齐的四代解法。重点梳理一份系统消融的实证:物理对齐比数据规模更重要,异构数据朴素混合反而带来负迁移(LIBERO 上 77.3% 逐级降到 72.1%)。
先想象,再动手:世界动作模型这一年
半年内两篇独立综述把世界动作模型(WAM)立成正式方向。梳理它的定义边界、三种工程实现与产业合流,以及正反两面证据:最强证据来自把世界模型当训练器而非直接当策略,而联合评估协议至今缺失。
直接读出答案:从 GPT 双头到 Jev 的一条线索
闭集判断为什么要先生成一串文本?这个问题在 Jev 出现之前已经问了八年:从 GPT 的双头模型、DETR 和 Perceiver IO 的 query 读出、Hydragen 的共享 prefix,到 FIRST 的首 token 排序,三条线索最终在 Jev 汇合。
机器人推理的指标不是 Token/s
LLM 推理基础设施优化的是 Token 吞吐,机器人要的是 Observation → Action 的闭环延迟。梳理两者在缓存对象、调度目标、延迟语义上的根本差异,以及目前最接近「机器人 vLLM」的几条技术路线。
一个 Backbone,三种输出:2026 年 VLA 架构正在分岔
梳理 2026 年 13 篇 VLA 论文:研究重点已经从「能不能工作」转向「世界表征形成之后,决策和动作该用什么方式读出来」,并正在分成四条路线和三种互相对立的架构。












