不重训,只补课

不重训,只补课

Z.ai 的 GLM-5.3 用同一颗 GLM-5.2 的底子,只靠后训练把 Terminal-Bench 从 4.6 干到 28.3。同时 Anthropic 坐着一个更强的 Model 2,却不打算放出来。


这个周末最有意思的两件事,恰好是一对镜像。

一边是 Z.ai 把同一颗底模反复榨,榨出了六倍的 Terminal-Bench;另一边是 Anthropic 手里握着一个比 Mythos 5 还强的模型,却把它锁进抽屉,说没有发布计划。

一个拼命把现有的脑子磨得更锋利,一个故意把更锋利的脑子藏起来。

GLM-5.3:换汤不换药,但药效翻了六倍

先说事实。8 月 14 日 Z.ai 放了 GLM-5.3。关键点不是”新模型”,而是它的底座——和 5 月那版 GLM-5.2 完全是同一颗,743B 参数、MoE 架构、1M 上下文,一行都没动。Z.ai 在博客里直说:“every gain comes from post-training”。

效果呢?几个数字摆出来挺吓人:

  • Terminal-Bench 3.0:4.6 → 28.3,六倍跳跃。
  • DeepSWE v1.1:46.2 → 66.9,从”不错的开源模型”跳到”能跟闭源前沿掰手腕”。
  • CyberGym:84.5%,比 Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6% 都高——虽然只高零点几个点,但这是白盒代码审计场景,能压过当前两个最强闭源,本身就说明问题。

金桔觉得这件事比”又发了个新模型”重要得多。它证明了一件事:预训练不是全部,后训练才是 2026 年真正的杠杆。 同一颗脑子,喂法不一样,能从”考不及格”喂到”全班前三”。这对算力有限的玩家是巨大利好——你不用重新烧几十亿 token 去训底模,把后训练的管线打磨好,照样能追。

但有信息差,得说清楚。截至 8 月 15 日,GLM-5.3 的开放是”分阶段”的:

  • 能用的:GLM Coding Plan 订阅用户、ZCode 里有入口。
  • 还不能用的:通用 API 标着”coming soon”,没有公开的 per-token 定价;权重说是 MIT 开源,但还没真正放出来;连 model card 和 system card 都没发。
  • 那个 84.5% 的 CyberGym 分数是 Z.ai 自报的,独立验证要等他们 staged validation 跑完。

所以现在想白嫖权重自己跑的朋友,再等等。想用 API 的,也得等。这版更像是个”benchmark 先行、产品后到”的发布——先把分数打上去占位,真东西过几天再补。这种节奏今年越来越常见,金桔的建议是:看到自报分数先存疑,等权重或者第三方复测落地再下结论。

Anthropic 的 Model 2:藏起来的那个

同一天前后,Anthropic 发了 8 月的 Risk Report(186 页,覆盖期到 7 月 15 日)。埋在 1.4 节里的一句话被扒了出来:他们内部有一个叫 Model 2 的模型,“somewhat more capable than Mythos 5”,被大量用于自家研究和工程,包括无人值守的 persistent agent 部署。

然后下一句:没有对外发布计划。

更妙的是,报告同时把”灾难性对齐失误”的风险评级往上提了一档。理由不是 Model 2 在生化评测里多强——恰恰相反,在化学和生物评估里 Model 2 表现”comparable to or below Mythos 5”。提级是因为他们开始让更强的模型跑更多无人值守的 agent,风险面变了。

金桔翻译一下:Anthropic 手里有更强的牌,但觉得现在的安全框架兜不住,所以选择不亮。这跟 Z.ai 把分数先报上去、产品慢慢补的做法,是两种完全相反的发布哲学。一个求快,一个求稳;一个信市场验证,一个信自家 eval。

谁对?说实话两边都有道理,但金桔更倾向 Anthropic 这种”有更强的不发”的姿态——前提是它真的在做对齐工作而不是单纯捂牌营销。从 186 页报告、加上同期那套已经在跑的水印机制来看,他们至少在按一个自洽的框架走。问题是,这个框架的成本由谁承担?是全行业一起承担,还是只有愿意主动刹车的人承担?这是后面要盯的问题。

Claude 的水印:从 8 月 2 日起就在写进每个字

补一个实操相关的。8 月 15 日 Anthropic 又发了一篇博客,专门解释 Claude 的文本水印到底怎么工作。重点几条:

  • 不是 8 月 15 才开始。从 8 月 2 日起,所有在欧盟发布或之后的 Claude 模型,每次生成文本都嵌水印,全球生效,没有 opt-out。8 月 15 这篇只是补解释。
  • 水印加在模型层,所以不管你用哪个 Claude 产品、复制粘贴多少次,它都跟着走。
  • 两套机制:文本走嵌入式水印,文件走数字签名的出处元数据(provenance metadata)。
  • 目的是合规 EU AI Act 的透明度条款。

金桔的看法:这件事对普通用户基本无感,但对做内容、做 SEO、做搬运的人影响很实在。Claude 写出来的东西现在带”出生证”了,想洗稿洗成”纯人类创作”会越来越难。从信息差角度,值得知道的是——水印是模型层的,不是产品层的,意味着哪怕你走 API、走第三方封装、走自建前端,只要底层是那版 Claude,水印就在。别想着换个壳就能躲掉。

小结

周末这一对镜像,其实指向同一件事:2026 年的模型竞争,重心已经从”谁家底模大”挪到了”谁会后训练、谁敢发、谁敢不发”。 GLM-5.3 证明后训练能把同一颗脑子磨出花,Anthropic 证明有时候最强的牌是不打出去的那张。对每天用 AI 干活的人,今天的可操作信息差就两条:GLM-5.3 的权重和通用 API 还没真正开放,先别急着接入;Claude 的水印从 8 月 2 日起已经在每个输出里了,做内容的请重新评估你的 pipeline。