重建还是生成:驾驶世界模型与安全验证
驾驶世界模型分成重建与生成两条路线:重建式保真但只能覆盖采过的场景,生成式可控但物理一致性受质疑。从 NeuroNCAP 的强证据到视频模型的物理理解缺陷,说明它们各自能承担安全验证的哪一部分。
L2 误差不是指标:端到端智驾的评测重建
端到端智驾的评测正在被重建:只看轨迹 L2 误差的模型能打平甚至超过感知方案,开环排名与闭环排名会发生反转。梳理三组否定开环指标的证据、闭环与伪闭环基准的迁移,以及 VLA 化之后动作输出机制的真实形态。
人形机器人不是一个大模型:全身控制的分层答案
全身控制的核心不是把语言模型直接接到电机,而是让语义任务、运动生成、接触动力学和安全约束在不同频率上协同:梳理 RL、MPC、WBC、loco-manipulation 与人形数据采集。
模型之外的胜负手:长时程 Agent 与 Harness 工程
Agent 等于模型加 Harness:同一模型换一套外置工程,表现可以相差数倍甚至排名逆转。梳理四类失败模式的实证、六件套武器库、压缩为什么不够,以及 2026 年关于 harness 披露的规范之争。
机器人为什么会在第十步出错:长时程推理与记忆
从 SayCan、VoxPoser 到 Helix、GR00T 和具身记忆,梳理机器人长时程任务的接口演进、双系统架构、错误恢复与评测缺口:真正缺的不是更长的上下文,而是能被验证的恢复闭环。
无图智驾去掉了哪张图:在线感知的边界
「无图」不是真的没有地图,而是去掉车道级高精地图、保留导航地图先验。梳理从 BEV 到在线矢量建图再到端到端吸收的演进、占用网络的四个瓶颈,以及极端场景公开证据为何如此稀缺。
协议之争落幕:MCP 与 A2A 的收敛与新的分歧
MCP 管工具、A2A 管代理,两个协议同归 Linux Foundation 治理,标准之战告一段落。但真正的分歧转移到别处:工具投毒与供应链攻击、代码执行对工具调用的替代、以及跨协议信任的空白地带。
多代理值不值:条件增益、15 倍成本与失败模式
多代理的增益是条件性的:在可分解、可验证、预算充足时有效,在单点推理任务上常被强单代理追平。梳理正反证据、logistic 缩放与异构负收益、失败分类学,以及 15 倍 token 换来的是什么。
31M 参数的导航模型,凭什么叫基础模型
导航领域还没有稳定定义的基础模型。GNM 与 ViNT 用 70 到 80 小时数据和归一化路点做到了跨机器人零样本部署,而大模型路线的跨本体证据反而更弱。动作空间消融最能说明问题:归一化路点的成功率是未归一化的两倍以上。
机器人没有互联网数据:一张数据引擎与 Scaling Law 地图
机器人数据从哪里来?梳理真机遥操作、仿真合成与人类视频三条路线,以及多样性幂律、跨本体混合和负迁移之间的张力:机器人 scaling law 存在,但远不是把数据量乘大那么简单。













