想久一点就有用吗:推理时扩展的能与不能
采样、搜索、验证、预算分配四层方法全谱系,加上一条被反复印证的结论:生成容易选择难——覆盖率能涨四个数量级,但多数投票约一百个样本后就饱和。梳理成本反转让小而多训变得划算,以及知识密集型任务上算力为何失效。
大多数人读的那种大学,有人认真写了下来
黄灯跟踪一个二本班级八年:52 人、毕业时无人考研、八年后散落珠三角。关于学历的“初始定价单”、普通家庭的风险计算,以及“被看见”本身的价值。
Flag 总倒,先别怪自己
为什么 flag 总倒?《掌控习惯》给的答案不是意志力,而是环境设计:四定律、身份认同、复利曲线的平段,以及“糟糕的坚持好过放弃”这句话为什么有用。
你缺的不是时间,是一次诚实的记账
德鲁克 1966 年就把时间管理写透了:先记录时间,再谈效率。五个习惯、三个案例,以及一个诚实的问题——这本六十年前的书,离学生到底远不远。
考卷本身也会错:Agent 评测学的四大失效
OpenAI 正式弃用 SWE-bench Verified:审计发现近六成判分有实质缺陷。从判分器可被绕过、数据污染、跑间抖动的量化证据,到统计功效与排行榜操纵,梳理 Agent 评测为什么必须被当作一门学科来对待。
补个向量库是不够的:Agent 记忆的四条路线与一场信任危机
Agent 记忆已成为独立工程学科:四条实现路线、四类记忆操作、以及一场至今没有中立复现的基准争议。梳理 mem0 与 Zep 各自的证据、长上下文与记忆的成本-延迟取舍,以及为什么评测是这个领域最大的短板。
把经验变成资产:Agent 自我改进的五条路线
从技能库、语言反思到记忆设计元学习,Agent 自我改进已分化为五条路线。梳理四种经验沉淀形式的证据强度、负迁移的边界条件、以及误差放大与记忆投毒这类被低估的风险。
从会搜到会研究:Agentic RL 的配方与头号风险
深度研究代理的训练配方高度趋同:可验证结果奖励加多轮工具环境加异步 rollout。梳理 GRPO 算法谱系、从 Search-R1 到 Kimi-Researcher 的路线,以及 reward hacking 这个头号工程问题。
点不准是最大瓶颈:计算机使用代理的两年
纯视觉加坐标操作已成为 GUI 代理主流范式,两年内基准成绩从 12% 涨到超过人类基线。但失败分析显示 75% 以上含点击不准,长任务的性能衰减近四倍——梳理这条曲线的来路、代价与仍未解决的问题。
知道自己什么时候不确定:智驾安全量化的缺口
校准好的不确定性不等于安全的决策:智驾安全量化的证据几乎全部来自仿真。梳理共形预测的理论缺口、形式化验证的规模墙、最小风险机动的现实反思,以及 L3 法规落地后仍未闭环的问题。













