人形机器人不是一个大模型:全身控制的分层答案
全身控制的核心不是把语言模型直接接到电机,而是让语义任务、运动生成、接触动力学和安全约束在不同频率上协同:梳理 RL、MPC、WBC、loco-manipulation 与人形数据采集。
机器人为什么会在第十步出错:长时程推理与记忆
从 SayCan、VoxPoser 到 Helix、GR00T 和具身记忆,梳理机器人长时程任务的接口演进、双系统架构、错误恢复与评测缺口:真正缺的不是更长的上下文,而是能被验证的恢复闭环。
31M 参数的导航模型,凭什么叫基础模型
导航领域还没有稳定定义的基础模型。GNM 与 ViNT 用 70 到 80 小时数据和归一化路点做到了跨机器人零样本部署,而大模型路线的跨本体证据反而更弱。动作空间消融最能说明问题:归一化路点的成功率是未归一化的两倍以上。
机器人没有互联网数据:一张数据引擎与 Scaling Law 地图
机器人数据从哪里来?梳理真机遥操作、仿真合成与人类视频三条路线,以及多样性幂律、跨本体混合和负迁移之间的张力:机器人 scaling law 存在,但远不是把数据量乘大那么简单。
仿真分数高,真机就一定好吗:Sim2Real 评估的缺口
Domain randomization、3D Gaussian Splatting、Isaac Lab、Genesis 和视频世界模型分别解决了什么?从 SIMPLER 与 GAUGE 出发,说明仿真—真机相关性为何仍缺统一协议,以及个人研究者如何做配对评估。
触觉不是多一张图:它如何进入 VLA
触觉补上的不是视觉分辨率,而是接触状态:滑动、力、局部几何与形变。梳理 GelSight、AnySkin、Sparsh 到触觉残差、未来触觉预测和柔性物体评测,给个人实验室一条低成本路线。
走了 150 步之后:VLN 的长程与真实化难题
VLN 从短指令加导航图走向长程任务与连续环境,但长程化远未解决:LH-VLN 上领先方法的成功率只有 2.44。梳理任务演化、稳定的失败模式(停止错误、过度旋转、错误累积)、测试时适应与大模型时代的合流。
能被控制的未来:世界模型的三种动作接口
游戏、驾驶与机器人对世界模型的要求并不相同,统一它们的不是像素而是动作接口:显式动作条件、潜在动作与视觉动作。从 Genie 到 KineBench,梳理正面证据、物理基准的负面结论,以及尚未被证实的强命题。
换一台机器人就不灵了:VLA 跨本体泛化卡在哪
拆解 VLA 跨本体泛化的核心障碍——动作空间异构,以及从离散 token 到物理对齐的四代解法。重点梳理一份系统消融的实证:物理对齐比数据规模更重要,异构数据朴素混合反而带来负迁移(LIBERO 上 77.3% 逐级降到 72.1%)。
先想象,再动手:世界动作模型这一年
半年内两篇独立综述把世界动作模型(WAM)立成正式方向。梳理它的定义边界、三种工程实现与产业合流,以及正反两面证据:最强证据来自把世界模型当训练器而非直接当策略,而联合评估协议至今缺失。













