仿真分数高,真机就一定好吗:Sim2Real 评估的缺口
Domain randomization、3D Gaussian Splatting、Isaac Lab、Genesis 和视频世界模型分别解决了什么?从 SIMPLER 与 GAUGE 出发,说明仿真—真机相关性为何仍缺统一协议,以及个人研究者如何做配对评估。
触觉不是多一张图:它如何进入 VLA
触觉补上的不是视觉分辨率,而是接触状态:滑动、力、局部几何与形变。梳理 GelSight、AnySkin、Sparsh 到触觉残差、未来触觉预测和柔性物体评测,给个人实验室一条低成本路线。
车路云一体化:项目变多了,钱变少了
车路云一体化是中国官方明确的技术路线,协同感知的学术脉络也已成形;但 2025 年项目数量增长 20%、市场规模却下降超过 30%。梳理政策要求、融合范式、数据集演进、海外路线,以及还没有闭环的商业模式。
走了 150 步之后:VLN 的长程与真实化难题
VLN 从短指令加导航图走向长程任务与连续环境,但长程化远未解决:LH-VLN 上领先方法的成功率只有 2.44。梳理任务演化、稳定的失败模式(停止错误、过度旋转、错误累积)、测试时适应与大模型时代的合流。
能被控制的未来:世界模型的三种动作接口
游戏、驾驶与机器人对世界模型的要求并不相同,统一它们的不是像素而是动作接口:显式动作条件、潜在动作与视觉动作。从 Genie 到 KineBench,梳理正面证据、物理基准的负面结论,以及尚未被证实的强命题。
换一台机器人就不灵了:VLA 跨本体泛化卡在哪
拆解 VLA 跨本体泛化的核心障碍——动作空间异构,以及从离散 token 到物理对齐的四代解法。重点梳理一份系统消融的实证:物理对齐比数据规模更重要,异构数据朴素混合反而带来负迁移(LIBERO 上 77.3% 逐级降到 72.1%)。
先想象,再动手:世界动作模型这一年
半年内两篇独立综述把世界动作模型(WAM)立成正式方向。梳理它的定义边界、三种工程实现与产业合流,以及正反两面证据:最强证据来自把世界模型当训练器而非直接当策略,而联合评估协议至今缺失。
GPT Image 的架构,写在一张白板上
OpenAI 从未公开 GPT Image 的网络结构与参数量,但发布博文里的一张架构白板、系统卡原文和 API 行为拼出了它的形状:自回归先验负责想清楚画什么,强大的解码器负责画得像;而改图整图重生成、像素级不可保,正是这条架构路线的直接代价。
生成模型画不对一颗松动的螺栓
做工业巡检缺陷图时发现,通用图生图模型改小色块和小组件很不可靠。从失败模式出发,说明为什么机械缺陷必须交给确定性几何编辑,AI 只负责补洞和纹理。
直接读出答案:从 GPT 双头到 Jev 的一条线索
闭集判断为什么要先生成一串文本?这个问题在 Jev 出现之前已经问了八年:从 GPT 的双头模型、DETR 和 Perceiver IO 的 query 读出、Hydragen 的共享 prefix,到 FIRST 的首 token 排序,三条线索最终在 Jev 汇合。













