读到的内容也会变成指令:Agent 安全的结构性难题
Agent 把读到的网页、邮件、工具返回值都变成了可执行上下文,于是指令与数据共用同一个自然语言通道。梳理四层信任边界错配、六类攻击面、七层防御的证据强度,以及为什么这个问题至今没有完备解。
考卷本身也会错:Agent 评测学的四大失效
OpenAI 正式弃用 SWE-bench Verified:审计发现近六成判分有实质缺陷。从判分器可被绕过、数据污染、跑间抖动的量化证据,到统计功效与排行榜操纵,梳理 Agent 评测为什么必须被当作一门学科来对待。
补个向量库是不够的:Agent 记忆的四条路线与一场信任危机
Agent 记忆已成为独立工程学科:四条实现路线、四类记忆操作、以及一场至今没有中立复现的基准争议。梳理 mem0 与 Zep 各自的证据、长上下文与记忆的成本-延迟取舍,以及为什么评测是这个领域最大的短板。
把经验变成资产:Agent 自我改进的五条路线
从技能库、语言反思到记忆设计元学习,Agent 自我改进已分化为五条路线。梳理四种经验沉淀形式的证据强度、负迁移的边界条件、以及误差放大与记忆投毒这类被低估的风险。
从会搜到会研究:Agentic RL 的配方与头号风险
深度研究代理的训练配方高度趋同:可验证结果奖励加多轮工具环境加异步 rollout。梳理 GRPO 算法谱系、从 Search-R1 到 Kimi-Researcher 的路线,以及 reward hacking 这个头号工程问题。
点不准是最大瓶颈:计算机使用代理的两年
纯视觉加坐标操作已成为 GUI 代理主流范式,两年内基准成绩从 12% 涨到超过人类基线。但失败分析显示 75% 以上含点击不准,长任务的性能衰减近四倍——梳理这条曲线的来路、代价与仍未解决的问题。
模型之外的胜负手:长时程 Agent 与 Harness 工程
Agent 等于模型加 Harness:同一模型换一套外置工程,表现可以相差数倍甚至排名逆转。梳理四类失败模式的实证、六件套武器库、压缩为什么不够,以及 2026 年关于 harness 披露的规范之争。
协议之争落幕:MCP 与 A2A 的收敛与新的分歧
MCP 管工具、A2A 管代理,两个协议同归 Linux Foundation 治理,标准之战告一段落。但真正的分歧转移到别处:工具投毒与供应链攻击、代码执行对工具调用的替代、以及跨协议信任的空白地带。
多代理值不值:条件增益、15 倍成本与失败模式
多代理的增益是条件性的:在可分解、可验证、预算充足时有效,在单点推理任务上常被强单代理追平。梳理正反证据、logistic 缩放与异构负收益、失败分类学,以及 15 倍 token 换来的是什么。












