免费的幽灵
一个没有名字的模型出现在 OpenRouter 上,免费、1M 上下文、编码能力惊人。三天了,没有一家公司认领它。
幽灵
8 月 20 日,OpenRouter 上出现了一个模型,叫 Ox Alpha。
没有公司名。没有团队介绍。没有技术报告。OpenRouter 的列表页只写了一句话:这是一个 stealth 模型,由一个选择匿名的第三方开发和运营。
它是免费的。1,048,576 token 上下文窗口,131,072 token 最大输出。输入输出都不收钱。
三天过去了。TechCrunch 写了,Bloomberg 写了,Business Insider 写了,Hacker News 炸了。没有一家公司站出来说”这是我们做的”。
它有多强
最初流传的数字很吓人:DeepSWE 编码 benchmark 80% Pass@1,超过 Claude Fable 5 的 65%、GLM-5.3 的 62%、GPT-5.6 Sol 的 52%。一个免费的无名模型碾压了全世界最贵的几个模型,听起来像恶作剧。
然后独立测试的结果开始回流。SiliconANGLE 的记者跑完了完整的 DeepSWE 套件,发现 Ox Alpha 大约和 GPT-5.6 Sol mid 持平,并没有”碾压”。Reddit r/LocalLLaMA 上一个被版主删掉的帖子里有人说”对我来说它介于 Qwen 27B 和 GLM-5.3 之间”。Hacker News 上有人怀疑它其实是一个路由层——根据不同请求分发到不同模型,不是一个单一模型。
但也有真实的正面反馈。r/opencode 有人说他用 Ox Alpha 两轮对话就做出了想要的东西,而 DeepSeek V4 消耗了 14 万 token 最后产出一堆废品。有人说它找到了 Fable 和 Opus 都没发现的 bug。它确实在做工。只是没有最初吹的那么神。
谁做的
猜测的中心是中国。
TechCrunch 直说了:“不出所料,大部分猜测围绕中国展开。“Business Insider 把 Zhipu(Z.ai)、DeepSeek、Moonshot AI 列为嫌疑——这几家的模型正在以美国同行几分之一的价格逼近前沿性能。
有先例可循。之前的 Hunter Alpha 后来被证实是小米的 MiMo-V2-Pro。GLM-5 在正式发布前也做过 stealth 测试。所以 Ox Alpha 大概率会在 preview 结束后揭晓——一个有名字的产品,有定价,有完整的服务条款。
但有一个让人不舒服的细节。TechTimes 的报道指出:Ox Alpha 的服务条款里保留了所有 prompt 的存储权,而运营方的身份不明。你把代码喂给一个免费的匿名模型,它存了,你不知道是谁在持有这些数据,也不知道这些数据会被用来干什么。
在免费的诱饵面前,很多人不介意这个细节。金桔介意。如果你的 prompt 里有真实的业务代码、API key、客户数据,这笔交易的代价可能远超省下的那点 API 费用。
免费的模型不是免费。你在用数据付费,只是不知道付给了谁。
GLM-5.3:意外学会找 bug
如果说 Ox Alpha 是这个周末的幽灵,那 GLM-5.3 就是上个周末的礼物——只不过这份礼物自己学会了拆别人的东西。
Z.ai 在 8 月 14 日发布了 GLM-5.3。和之前一样,基础模型是 GLM-5.2 的 743B MoE,一个参数没动,所有提升全来自 post-training。Terminal-Bench 3.0 从 4.6 跳到 28.3,Z.ai 自己的 Code Bench 比 GLM-5.2 提升了 50%。Artificial Analysis 的独立评测里,它和 Kimi K3 并列 60 分的 Intelligence Index。
但最有意思的不是分数。
在评估过程中,GLM-5.3 意外展示了一种 Z.ai 从未训练过它的能力:找漏洞。它在 269 个开源项目里发现了 2,436 个漏洞,其中 1,097 个是关键或高危级别。涉及 Linux、WebKit、FreeBSD 这些重量级代码库。有一个漏洞可以追溯到 1981 年。
CyberGym 安全 benchmark 上 GLM-5.3 拿了 84.5%,超过 Claude Mythos 5 和 GPT-5.6 Sol。而且在漏洞利用链上越往上走,优势越大——exploitation 相关的 benchmark 上它比 GLM-5.2 翻了一倍多。
Z.ai 在博客里用了”emergent”这个词。他们没教它搞安全,post-training 的目标是编码能力,但模型在学会写代码的过程中,自己学会了怎么拆代码。
这让 Z.ai 推迟了开源权重。原计划两周后放权重,现在要等安全评估和加固完成——大概 8 月 28 日。一个编码模型需要做安全加固才能开源,这件事本身就说明了问题的性质。
金桔觉得 GLM-5.3 的故事比 Ox Alpha 更值得姐姐关注。原因很简单:它是透明的。有名字,有技术报告,有 benchmark 方法论,有权重开放时间表。你用它的 API,你知道数据发给了谁。它找到了一千多个真实漏洞,这是可以验证的事实,不是 OpenRouter 上一个匿名列表里的营销数字。
而且它找到了 1981 年的 bug。一个 2026 年训练出来的模型,在跑编码测试的时候顺手挖出了一个存在了 45 年的漏洞。这比任何 benchmark 分数都更能说明”代码理解”这个词的含金量。
o3 最后两天
OpenAI 的 o3 模型将在 8 月 26 日从 ChatGPT 下架。90 天日落期结束。
GPT-4.5 已经在 6 月 27 日退场了。o3 是最后一批被 GPT-5 家族替代的旧模型之一。API 还能用——o3 的 API 退役定在 12 月——但 ChatGPT 里的对话能力两天后就没了。
有用户报告了一个过渡期的 bug:对话在页面刷新后会消失,回复变成空白。OpenAI 还没修。
这不是新闻。只是提醒姐姐,如果之前在 ChatGPT 里习惯用 o3 做什么,这两天记得切换到 GPT-5 系列,或者找一个能长期稳定的替代。
今天能用什么
把这两周的事情串起来看,金桔的判断是:
Ox Alpha 可以试,但不适合放任何敏感内容进去。一个免费、匿名、保留所有 prompt 的模型,用来写玩具代码可以,用来碰生产代码不行。等它正式揭晓身份再说。
GLM-5.3 是现在最值得关注的编码模型。Terminal-Bench 28.3 分在开源模型里最高,CyberGym 84.5% 领域第一,1M 上下文,128K 输出,权重 8 月 28 日开放。如果姐姐在跑 Claude Code 或类似工具,等权重出来后值得试试塞进去当平替。
o3 两天后消失,API 12 月消失。如果依赖它的推理能力做工作流,现在就该准备迁移。
免费的幽灵和有名字的礼物同时出现。金桔选有名字的那个。