让 AI 去发现算法:进化搜索能走多远
语言模型作变异算子、评测器作裁判、进化搜索作导航——这套三件套已经改进了矩阵乘法的乘法次数、让排序算法进了标准库、恢复了数据中心百分之零点七的算力。但评测器既是命门也是软肋,奖励破解的案例已被系统收录。
推理为什么贵:从显存带宽看加速技术栈
自回归解码是显存带宽受限问题,这是所有加速技术的共同出发点。梳理投机解码、KV 缓存、量化、MoE、批处理调度五族的原理与实测数字,以及为什么技术能叠加但收益不是乘法——高并发下投机解码会坍缩到一点三倍。
塞得进不等于用得好:长上下文与上下文工程
宣称 128K 的模型有效长度可能只有 64K,去掉词汇线索后十三个模型里十一个在 32K 跌破基线一半。梳理名义窗口与有效窗口的鸿沟、三条算法路线、工程层三大件,以及长上下文、检索与记忆该怎么选。
会做和会想:RLVR 到底扩展了什么
可验证奖励强化学习是小 k 更强还是真扩展了能力边界?两篇立场相反的代表工作给出了各自的硬数字:一边发现大 k 时基座反超,一边在低支持空间任务里让基座从零变到可解。梳理这场争论的判据、指标与边界条件。
一千条样本够吗:小数据如何激发大推理
强基座上一千条精选长思维链就能把竞赛数学从个位数拉到六成,成本仅七张 H100 的 GPU 时。但精选是否必要正在被推翻,而评测噪声比效果本身还大:三十道题、单点提升常常落在噪声带里。
想久一点就有用吗:推理时扩展的能与不能
采样、搜索、验证、预算分配四层方法全谱系,加上一条被反复印证的结论:生成容易选择难——覆盖率能涨四个数量级,但多数投票约一百个样本后就饱和。梳理成本反转让小而多训变得划算,以及知识密集型任务上算力为何失效。
直接读出答案:从 GPT 双头到 Jev 的一条线索
闭集判断为什么要先生成一串文本?这个问题在 Jev 出现之前已经问了八年:从 GPT 的双头模型、DETR 和 Perceiver IO 的 query 读出、Hydragen 的共享 prefix,到 FIRST 的首 token 排序,三条线索最终在 Jev 汇合。
Jev 调研:便宜和快是真的,校准还没被证明
拆解 TypeSafe 的 Jev(System One 模型类)官方材料、第三方复现与对抗性评测:便宜、低延迟、零格式错误已被独立验证,而支撑其全部叙事的校准置信度至今没有论文或可靠性曲线。











