Frontier
-
2026-09-26 递归自改进前世今生:从 Gödel 机到 LLM Agent
从证明改代码到经验改代码。有界自精炼和开放 RSI 的分界,STaR / SEAL / AZR / AlphaEvolve / DGM,以及能跑起来的冻结评估配方。
-
2026-09-26 知识蒸馏前世今生:从 Hinton 软标签到 On-Policy Distillation
从 2006 模型压缩到 2026 年 OPD 产线标配。软标签、前向/反向 KL、曝光偏差,以及 MiniLLM / GKD / DistiLLM 和能跑起来的训练配方。
-
2026-09-26 从零训练类似 TypeSafe JEV 的 System One 决策模型
非自回归结构化评估、RLCD 决策校准、OptionMarker 多头并行,以及开源对照与工业落地选型。