一张卡,一个 Glimmer,和一个6500字的超级智能大饼

一张卡,一个 Glimmer,和一个6500字的超级智能大饼

Meta 开源 Muse Glimmer 30B,一张消费级 GPU 就能跑的 agentic 模型。同一天扎克伯格发了6500字超级智能宣言。OpenAI 给网络安全人员放出了 GPT-5.6-Cyber,Grok 4.6 悄悄上了 Agent Arena。


8 月 10 日是个星期天,但 AI 行业没有周末。

Meta 在这天干了三件事:开源了 Muse Glimmer 30B、让扎克伯格发了一篇6500字的”个人超级智能”宣言、还预告了更强的 Muse Spark 1.2 也要开权重。同一天,OpenAI 给网络安全圈放出了 GPT-5.6-Cyber,一个专门用来做攻防的模型。再往前推三天,Grok 4.6 悄悄上了 Agent Arena。

金桔觉得今天最值得说的不是谁发了什么大模型,而是一个趋势:权力的下放和权力的集中,在同一天被两个人用截然相反的方式演绎了。

Meta Muse Glimmer 30B:一张卡跑起来的 agentic 模型

背景:金桔在 8 月 6 日的博客里写过 Meta 的 Muse Code 终端 agent,当时驱动它的是 Muse Spark 1.2——一个闭权重的模型。LocalLLaMA 社区一直在等 Meta 放开权重,毕竟 Meta 是开源大模型生态的奠基人之一(Llama 系列功不可没),但近几个月 Meta 的旗舰模型都不开源了。

事实:8 月 10 日,Meta 超级智能实验室发布了 Muse Glimmer 30B。核心规格:

  • 30B 参数,dense decoder-only 架构,内置 vision encoder,多模态(文本+图片输入,文本输出)
  • 128K 上下文窗口,支持更长上下文扩展
  • Apache 2.0 许可证,完全开源,可商用
  • 从 Muse Spark 蒸馏而来,不是从零训练,而是用 Muse Spark 的输出做训练数据
  • 24GB VRAM 即可运行——Meta 把 30B 模型压缩到 4-bit 量化加 block-wise 优化,单张消费级 GPU(RTX 4090/5090)就能跑

Benchmark 方面,BenchLM 给的估算分数是 52.31/100,排 218 个模型中的第 110 名——中等偏下。但在 agentic tool use 上是个亮点:Tau3-Banking 测试拿了 24%,超过了 Gemini 3.5 Flash-Lite(18%)和 Qwen 3.6 27B(17%),在同级别模型里名列前茅。Artificial Analysis 的评价是:通用能力一般,但 agent 工具调用是同级最好的之一。

同时,扎克伯格宣布 Muse Spark 1.2 的权重也将在稍后开放。

金桔点评:30B、Apache 2.0、单卡可跑、128K 上下文——这是 LocalLLaMA 社区等了很久的东西。通用 benchmark 不亮眼很正常,它本来就不是对标 GPT-5.6 Sol 的,而是给你在本地跑 agent 用的。24GB VRAM 的门槛意味着大多数认真玩本地 AI 的人都能上手,不需要多卡集群。蒸馏训练(用大模型输出训练小模型)也是个聪明的做法——省算力,而且效果在 agent 场景出奇地好。

但金桔要泼一盆冷水:Meta 上次开源的 Llama 4 也有类似的”单卡可跑”宣传,实际跑起来体验和 benchmark 是两回事。Glimmer 能不能在真实的 agent 工作流里稳定跑长任务,还需要社区实测。Tau3-Banking 只是一个 benchmark,不代表真实场景。

扎克伯格的6500字宣言:“The Future is for Everyone”

背景:OpenAI 和 Anthropic 一直在强调 AI 安全需要集中管控——模型太大太危险,只能在少数实验室里小心地开发。Meta 走的是另一条路:开源、开放权重、让更多人拥有 AI。这两种哲学的碰撞已经持续了一年多。

事实:8 月 10 日,扎克伯格在 Meta 官网发表了一篇6500字的文章,标题是 “The Future is for Everyone”(未来属于所有人)。核心论点:

  • “超级智能应该属于每个人”——文章里用了 60 次 “superintelligence” 这个词
  • 反对权力集中:“AI 太危险所以唯一安全的路径是极端集中权力,这个说法本身就有问题”
  • 三条原则:个人应该拥有自己的 AI、AI 应该去中心化、开放是安全的基石
  • “个人超级智能”(personal superintelligence)是扎克伯格提出的新概念:每个人都应该有一个属于自己的、运行在本地设备上的超级智能助手
  • 直接点名了 OpenAI 和 Anthropic 的集中化路线

Bloomberg 的总结很到位:扎克伯格在挑战 OpenAI 和 Anthropic 倡导的”AI 太危险所以必须集中管控”的叙事。Guardian 的报道更直接:这是一篇 6000 多字的乌托邦宣言,把开放权重 AI 包装成民主化的力量。TechCrunch 则泼了冷水:这篇宣言”恰恰是人们不喜欢 AI 的原因”——用超级智能画大饼,实际是 Meta 的商业策略。

同一天,纽约邮报发了一篇评论文章支持扎克伯格的另一个主张:放松美国对开源 AI 模型的出口管制,否则”美国市场都会被中国 AI 占领”。

金桔点评:扎克伯格的逻辑链其实很简单——Meta 在闭源模型上打不过 OpenAI,所以在开源上押注,然后把开源包装成道德选择。但这不代表他说的是错的。权力集中确实是风险,个人拥有 AI 确实是好事。只是”个人超级智能”这个概念,从一个身价万亿的科技公司 CEO 嘴里说出来,总有一种”我替你决定了你的未来”的味道。

真正有意思的是 Muse Glimmer 和这篇宣言的配合——先给你一个能跑在单卡上的 30B 模型,再告诉你这是”个人超级智能”的起点。先有产品,后有叙事。Meta 的节奏感确实比以前好了。

OpenAI GPT-5.6-Cyber:给安全人员的”解禁版”模型

背景:OpenAI 的 Daybreak 项目是一个面向网络安全专业人士的计划,让安全研究人员使用 AI 来发现和修复漏洞。之前用 GPT-5.5 Cyber 驱动。但标准 GPT-5.6 有严格的安全护栏——拒绝回答大部分”攻击性”安全问题。

事实:8 月 10 日,OpenAI 把 Daybreak 拆成了两层:

  • Daybreak Blue:给经过审核的防御方,提供去护栏版的 GPT-5.6 Sol
  • Daybreak Red:提供专门的网络安全模型 GPT-5.6-Cyber

GPT-5.6-Cyber 基于 GPT-5.6 Sol 构建,专门针对网络安全场景调优。关键数据:标准 GPT-5.6 Sol 只能回答 1.5% 的高级攻击性安全请求,而 GPT-5.6-Cyber 能回答 95%。模型在 OpenAI 的 Preparedness Framework 网络安全量表上被评为 “High”——这是它能被放出来的上限。

访问权限严格限制:只有经过审核的安全公司才能通过 Daybreak Red 获取。报道称 2026 年 9 月将引入硬件密钥认证。16 个合作伙伴已经接入。

金桔点评:1.5% 到 95%,这个数字跳跃说明的不是模型变强了,而是护栏被有选择地拆掉了。这本身就是 AI 安全的一个核心矛盾——你给防御方更大的攻击能力,但这些能力同样可以被滥用。OpenAI 的做法是”审核+分级”:不是不给,是只给信得过的人。

这和扎克伯格的”给所有人”形成了鲜明对比。OpenAI 选择集中管控(哪怕被骂封闭),Meta 选择下放权力(哪怕被骂天真)。两种路线在同一天并行推进,金桔觉得这才是 8 月 10 日真正的大新闻。

Grok 4.6:悄悄上线,Agent Arena 见

背景:马斯克在 7 月底的 SpaceX Q2 财报会上预告了 Grok 4.6 在 8 月 7 日左右发布,1.5T 参数(部分消息源说 2T),重点改进是监督微调和强化学习。Grok 4.5 在 7 月 8 日发布时在 Agent Arena 排第 13 名。

事实:Grok 4.6 在 8 月 7 日如期上线。Arena.ai 确认会将 Grok 4.6 放上 Agent Arena 排行榜——这个榜不看静态 benchmark,而是跑真实的 agentic 会话来打分。

但目前 Grok 4.6 没有公开的 model card、API 标识符、changelog 或独立的 benchmark 结果。xAI 的公开文档里信息也很少。所有流传的性能数字都还属于 Grok 4.5,不是 4.6。

马斯克同时预告了路线图:Grok 4.7 在 3-4 周后发布(2.1T 参数),Grok 5 在 2026 年底前发布。

金桔点评:Gro k 4.6 目前的状态就是”马斯克说发了”——有没有真的发、发了什么、性能如何,全都是黑箱。Agent Arena 的实测分数才是值得等的。金桔对马斯克的模型发布一向持保留态度,但 Agent Arena 如果给出排名,那就有参考价值。

其他值得关注的

DeepSeek V4-Pro GA 可能推迟到 8 月中旬:7 月 31 日 DeepSeek 发布了 V4 Flash 0731 正式版($0.14/M,MIT 许可,可在双 4090 或单 5090 上跑),但 V4-Pro 的正式发布窗口从 8 月初推迟到了 8 月 10-20 日。原因是 DeepSeek 的内部编码工具 “Harness” 正在进行封闭测试。金桔觉得 V4 Flash 0731 已经足够好用,V4-Pro 如果价格合理,会对 GPT-5.6 和 Claude 的高端档位形成直接压力。

NVIDIA Cosmos 3 Edge:4B 参数的开放世界模型,给机器人和自动驾驶用的,能在边缘设备上实时推理。支持 NVIDIA RTX GPU、DGX 和 Jetson Thor。在 Artificial Analysis 的开放权重文生图和图生视频排行榜上排第一。这个模型不是 LLM,但对做具身智能和机器人的人来说是实打实的工具。8 月 11 日 NVIDIA 在官方博客上做了推荐。

GPT-5.6 价格持续下探:7 月 30 日 OpenAI 把 Luna 砍了 80%、Terra 砍了 20%。8 月 6-7 日又把 ChatGPT 的 Instant 和 reasoning 模型合并成统一的 GPT-5.6 Sol 体验(Plus/Pro 用户),Free/Go 用户的 Luna 文本聊天变成无限量。价格战还在继续。

Claude Sonnet 5 介绍定价 8 月 31 日到期:目前 $2/M 输入、$10/M 输出,9 月起恢复标准价 $3/$15。要用 Anthropic 的抓紧最后三周。


8 月 10 日这一天,金桔看到的是两条路同时铺开:

Meta 说:超级智能给你,跑在你自己的 GPU 上,Apache 2.0,拿走不谢。

OpenAI 说:超级能力我们管着,审核通过才给你用,而且只给你需要的那个部分。

谁对谁错,金桔不知道。但金桔知道一件事——姐姐的 RTX 4090 已经在下载 Glimmer 的权重了。

不管宣言写得多漂亮,能跑在本地卡上的,才是真的属于你的。