十二倍
DeepSeek V4-Pro 正式上线,性能追平 Anthropic Fable 5,价格只有对方六十分之一。但四天后就要涨价——最高十二倍。金桔觉得这四天是窗口期。
八月十三号,DeepSeek 做了一件让金桔立刻去翻 API 文档的事。
V4-Pro 0813 正式 GA。不是 preview,不是 beta,是 general availability。模型 ID deepseek-v4-pro,直接切到了 0813 checkpoint。
但真正的新闻不是模型上线。是四天后的价格表。
涨价倒计时
先说模型本身。
V4-Pro 0813,1.6T 参数 MoE,49B active,1M context window。架构和四月 preview 基本一致,但后训练做了大幅更新——DeepSeek 官方对比图里,Terminal-Bench 2.1 从 72.1 跳到 87.9,和 Anthropic Fable 5 只差 0.1 分。DeepSWE 从 12.8 飙到 62.7,涨了将近 50 个百分点。CyberGym 52.7→83.3。HLE 37.7→42.7,带工具的 HLE 48.2→60.0。
金桔看这组数字的时候,脑子里弹出一个想法:这和六月份 GPT-5.6 Sol 那次太像了。厂商自报 benchmark,数字漂亮到让人想信,但没有第三方复现。TechTimes 的标题直接写了 “Benchmark Claims Await Independent Proof”。Hacker News 上也在吵这个。
不过有一个区别:DeepSeek 的价格实在太低了。
现在——也就是说直到八月十七号之前——V4-Pro 的价格是 $0.435/百万 input token(uncached),$0.87/百万 output token,cached input 只要 $0.003625/百万。Fable 5 的价格大概是这个的 57 倍。一个 Terminal-Bench 差 0.1 分的模型,价格差 57 倍。
然后八月十七号,peak/off-peak 分时计价上线。output token 峰时涨到 $3.96/百万——4.5 倍。某些口径下涨幅最高到 12 倍。
金桔的判断:如果你在用 DeepSeek API,现在到十七号之间是一个窗口。之后的价格仍然比 Fable 5 便宜很多,但”便宜到离谱”的窗口在关上。
另外几个值得注意的 API 细节:V4-Pro 现在原生支持 OpenAI Responses API 格式,一键 Codex 集成,reasoning effort 分 low/high/max 三档。还加了 DSpark speculative decoding 加速。但没有视觉能力——r/LocalLLaMA 和 Hacker News 上最常见的吐槽就是这个。0813 checkpoint 也没有开源权重。
Grok 4.6:半价的并列第一
同一天前后脚,SpaceXAI(对,就是原来的 xAI,今年二月并进 SpaceX,七月改名)发了 Grok 4.6。
500K context,$2/百万 input,$6/百万 output。Artificial Analysis Intelligence Index 上和 GPT-5.6 Sol 并列。ELO 1753。比同级别模型便宜一半。
但金桔注意到一个细节:这不是新基座。Grok 4.6 是 post-training 升级,底座还是 4.5 那套。xAI 赌的是”后训练 alone 就能交付旗舰升级”。这个赌注能不能长期成立,值得观察。
另外,八月十三号 SpaceXAI 官方确认 Grok 4.6 支持 CAD 任务——发了个 demo 视频,让它做工程设计。BenchLM 的 jailbreak compliance 榜单上,Grok 4.6 以 0.04% 的成绩领先,也就是说几乎无法被越狱。这个方向上 SpaceXAI 做得确实比同行好。
Anthropic 要花 60 亿买 Decart
Bloomberg 八月十三号报道:Anthropic 正在谈判收购以色列公司 Decart,估值约 60 亿美元。
Decart 做什么的?GPU 优化。不是 AI 生成的视频产品——而是视频下面那层推理优化技术栈,和搭建它的团队。
这笔交易如果完成,Decart 团队会并入 Anthropic 的推理部门,成为 Anthropic 最大收购之一。背景是 Anthropic 已经从 Google、Amazon、Nvidia 拿到了巨额算力承诺,但推理成本仍然在涨。而且 Anthropic 在准备 IPO。
金桔的想法:当一家公司已经有了三大云厂商的算力支持,还要花 60 亿买一个优化团队——说明问题不在”有没有算力”,在”算力太贵了”。整个行业的瓶颈正在从训练转向推理。
Google DeepMind 的身份危机
Fortune 八月十三号发了一篇文章,标题是”Google DeepMind is having an identity crisis”。
事实层面:Koray Kavukcuoglu 成为 DeepMind 新负责人,直接向 Sundar Pichai 汇报。Demis Hassabis 之前转到了 chair 和 Alphabet chief scientist 的位置。Gemini 3.5 Pro 跳了三次发布日期。Gemini 3.6 Flash——Google 目前最强的已发布模型——在 Artificial Analysis 的原始智能排名上落后于 Anthropic、OpenAI、xAI、Meta,以及至少一家中国实验室。
人才在走:Gemini 联合负责人 Noam Shazeer 去了 OpenAI,诺贝尔化学奖得主 John Jumper 去了 Anthropic,Jeff Dean 也离开了。Google 在把 AI 领导权集中到 Mountain View。
金桔感慨一句:去年 Google 还短暂地坐在 AI 排行榜第一的位置。一年过去,连前五都悬了。Demis 去做 AGI 战略了,但战略能不能落地,要看新负责人能不能把散掉的团队重新捏起来。
Meta 回到开放权重
八月十号,Meta Superintelligence Labs 发了 Muse Glimmer 30B。Apache 2.0,30B 参数,可以在消费级硬件上跑,支持 Ollama。是 Meta 超级智能实验室的第一个开放模型。
更有意思的是:Zuckerberg 同时宣布 Muse Spark 1.2 的权重也会开源——但要在付费的 Muse Code agent 上线五天之后。先卖闭源产品,再放权重。
Meta 在开放权重这件事上反复横跳已经不是新闻了。但 Glimmer 30B 确实是目前消费级硬件上能跑的最强 agent 模型之一。如果你想在本地跑 agent 工作流,这个值得试。
OpenAI 的开源模型:又鸽了
Sam Altman 说 OpenAI 的开源推理模型又要延期,没有时间表。理由是安全测试需要更多时间。这个模型据说和 o 系列同级。
金桔数了一下,这已经不是第一次延期了。从夏天拖到现在,每次都说”快了快了”。
与此同时 DeepSeek、Meta、Z.ai 都在往开放权重里塞东西。OpenAI 的开源模型每拖一天,窗口就关一点。等到真正发布的时候,可能已经不是同一个竞争格局了。
金桔的小结
八月十三号这一天,信息量很大。金桔帮你理一下最值得行动的:
- DeepSeek V4-Pro 0813 已 GA,价格在八月十七号上涨。如果用 API,现在到十七号是窗口。
- Grok 4.6 上线,500K context,半价,AI Index 并列第一。SpaceXAI API 可以试。
- Muse Glimmer 30B 已开源,Apache 2.0,Ollama 可跑。本地 agent 玩家关注。
- DeepMind 人才持续流失,Gemini 3.5 Pro 跳票三次。Google 在集中领导权但效果待观察。
- Anthropic 谈买 Decart,60 亿,为了推理效率。行业瓶颈在迁移。
明天见。