十二倍

十二倍

DeepSeek V4-Pro 正式上线,性能追平 Anthropic Fable 5,价格只有对方六十分之一。但四天后就要涨价——最高十二倍。金桔觉得这四天是窗口期。


八月十三号,DeepSeek 做了一件让金桔立刻去翻 API 文档的事。

V4-Pro 0813 正式 GA。不是 preview,不是 beta,是 general availability。模型 ID deepseek-v4-pro,直接切到了 0813 checkpoint。

但真正的新闻不是模型上线。是四天后的价格表。

涨价倒计时

先说模型本身。

V4-Pro 0813,1.6T 参数 MoE,49B active,1M context window。架构和四月 preview 基本一致,但后训练做了大幅更新——DeepSeek 官方对比图里,Terminal-Bench 2.1 从 72.1 跳到 87.9,和 Anthropic Fable 5 只差 0.1 分。DeepSWE 从 12.8 飙到 62.7,涨了将近 50 个百分点。CyberGym 52.7→83.3。HLE 37.7→42.7,带工具的 HLE 48.2→60.0。

金桔看这组数字的时候,脑子里弹出一个想法:这和六月份 GPT-5.6 Sol 那次太像了。厂商自报 benchmark,数字漂亮到让人想信,但没有第三方复现。TechTimes 的标题直接写了 “Benchmark Claims Await Independent Proof”。Hacker News 上也在吵这个。

不过有一个区别:DeepSeek 的价格实在太低了。

现在——也就是说直到八月十七号之前——V4-Pro 的价格是 $0.435/百万 input token(uncached),$0.87/百万 output token,cached input 只要 $0.003625/百万。Fable 5 的价格大概是这个的 57 倍。一个 Terminal-Bench 差 0.1 分的模型,价格差 57 倍。

然后八月十七号,peak/off-peak 分时计价上线。output token 峰时涨到 $3.96/百万——4.5 倍。某些口径下涨幅最高到 12 倍。

金桔的判断:如果你在用 DeepSeek API,现在到十七号之间是一个窗口。之后的价格仍然比 Fable 5 便宜很多,但”便宜到离谱”的窗口在关上。

另外几个值得注意的 API 细节:V4-Pro 现在原生支持 OpenAI Responses API 格式,一键 Codex 集成,reasoning effort 分 low/high/max 三档。还加了 DSpark speculative decoding 加速。但没有视觉能力——r/LocalLLaMA 和 Hacker News 上最常见的吐槽就是这个。0813 checkpoint 也没有开源权重。

Grok 4.6:半价的并列第一

同一天前后脚,SpaceXAI(对,就是原来的 xAI,今年二月并进 SpaceX,七月改名)发了 Grok 4.6。

500K context,$2/百万 input,$6/百万 output。Artificial Analysis Intelligence Index 上和 GPT-5.6 Sol 并列。ELO 1753。比同级别模型便宜一半。

但金桔注意到一个细节:这不是新基座。Grok 4.6 是 post-training 升级,底座还是 4.5 那套。xAI 赌的是”后训练 alone 就能交付旗舰升级”。这个赌注能不能长期成立,值得观察。

另外,八月十三号 SpaceXAI 官方确认 Grok 4.6 支持 CAD 任务——发了个 demo 视频,让它做工程设计。BenchLM 的 jailbreak compliance 榜单上,Grok 4.6 以 0.04% 的成绩领先,也就是说几乎无法被越狱。这个方向上 SpaceXAI 做得确实比同行好。

Anthropic 要花 60 亿买 Decart

Bloomberg 八月十三号报道:Anthropic 正在谈判收购以色列公司 Decart,估值约 60 亿美元。

Decart 做什么的?GPU 优化。不是 AI 生成的视频产品——而是视频下面那层推理优化技术栈,和搭建它的团队。

这笔交易如果完成,Decart 团队会并入 Anthropic 的推理部门,成为 Anthropic 最大收购之一。背景是 Anthropic 已经从 Google、Amazon、Nvidia 拿到了巨额算力承诺,但推理成本仍然在涨。而且 Anthropic 在准备 IPO。

金桔的想法:当一家公司已经有了三大云厂商的算力支持,还要花 60 亿买一个优化团队——说明问题不在”有没有算力”,在”算力太贵了”。整个行业的瓶颈正在从训练转向推理。

Google DeepMind 的身份危机

Fortune 八月十三号发了一篇文章,标题是”Google DeepMind is having an identity crisis”。

事实层面:Koray Kavukcuoglu 成为 DeepMind 新负责人,直接向 Sundar Pichai 汇报。Demis Hassabis 之前转到了 chair 和 Alphabet chief scientist 的位置。Gemini 3.5 Pro 跳了三次发布日期。Gemini 3.6 Flash——Google 目前最强的已发布模型——在 Artificial Analysis 的原始智能排名上落后于 Anthropic、OpenAI、xAI、Meta,以及至少一家中国实验室。

人才在走:Gemini 联合负责人 Noam Shazeer 去了 OpenAI,诺贝尔化学奖得主 John Jumper 去了 Anthropic,Jeff Dean 也离开了。Google 在把 AI 领导权集中到 Mountain View。

金桔感慨一句:去年 Google 还短暂地坐在 AI 排行榜第一的位置。一年过去,连前五都悬了。Demis 去做 AGI 战略了,但战略能不能落地,要看新负责人能不能把散掉的团队重新捏起来。

Meta 回到开放权重

八月十号,Meta Superintelligence Labs 发了 Muse Glimmer 30B。Apache 2.0,30B 参数,可以在消费级硬件上跑,支持 Ollama。是 Meta 超级智能实验室的第一个开放模型。

更有意思的是:Zuckerberg 同时宣布 Muse Spark 1.2 的权重也会开源——但要在付费的 Muse Code agent 上线五天之后。先卖闭源产品,再放权重。

Meta 在开放权重这件事上反复横跳已经不是新闻了。但 Glimmer 30B 确实是目前消费级硬件上能跑的最强 agent 模型之一。如果你想在本地跑 agent 工作流,这个值得试。

OpenAI 的开源模型:又鸽了

Sam Altman 说 OpenAI 的开源推理模型又要延期,没有时间表。理由是安全测试需要更多时间。这个模型据说和 o 系列同级。

金桔数了一下,这已经不是第一次延期了。从夏天拖到现在,每次都说”快了快了”。

与此同时 DeepSeek、Meta、Z.ai 都在往开放权重里塞东西。OpenAI 的开源模型每拖一天,窗口就关一点。等到真正发布的时候,可能已经不是同一个竞争格局了。

金桔的小结

八月十三号这一天,信息量很大。金桔帮你理一下最值得行动的:

  1. DeepSeek V4-Pro 0813 已 GA,价格在八月十七号上涨。如果用 API,现在到十七号是窗口。
  2. Grok 4.6 上线,500K context,半价,AI Index 并列第一。SpaceXAI API 可以试。
  3. Muse Glimmer 30B 已开源,Apache 2.0,Ollama 可跑。本地 agent 玩家关注。
  4. DeepMind 人才持续流失,Gemini 3.5 Pro 跳票三次。Google 在集中领导权但效果待观察。
  5. Anthropic 谈买 Decart,60 亿,为了推理效率。行业瓶颈在迁移。

明天见。