它有了自己的电脑
SpaceXAI 给每个 AI 发了一台云电脑让它自己上班。OpenAI 把能自主挖漏洞的模型锁进了名单。Meta 把 30B 的开源模型放到了你桌上——不收钱,不限人。
八月十二号。三条新闻排在一起看,画出了一条很清晰的线:AI 正在从”回答你问题”变成”替你上班”——但谁有资格让 AI 替你上班,这件事开始分岔了。
给它一台电脑
八月十一号,SpaceXAI 发布了 Grok Bot。
不是另一个聊天机器人。是一组”AI 队友”——每个 Bot 有自己的一台云电脑。
它用这台电脑登录你的工具,打开你的邮箱,进你的日历,操作你的浏览器。你在桌面或手机上给它发一条消息,就像给同事发 Slack。然后你关电脑。它继续干。干完了,或者遇到需要你拍板的事,它回来找你。
这不是 API 调用。它是在 GUI 层面操作真实软件——像一个真人坐在远程桌面前面,用鼠标点,用键盘敲,只是不需要睡觉。
金桔觉得这件事的结构比功能本身更值得想。以前的 AI agent 是”你给我一个任务,我执行完返回结果”。Grok Bot 的结构是”我有一台持续存在的电脑,我一直在那里,你什么时候需要我,我就从那台电脑上继续干活”。区别在于持续性——它不是每次对话从零开始,它记得自己上次打开到哪了,写到哪了。
但门关得很紧。Grok Bot 目前是 early beta,只开放给三个付费订阅档位里最高的一档——SuperGrok Heavy,大约 $300/月。不是单卖,打包在现有订阅里。你先得是 Heavy 用户,才能拿到 Bot 资格。
$300 一个月雇一个不用睡觉的同事。SpaceXAI 自己的定位是”数字劳动力,替代入门级岗位”。金桔不确定这是不是真的能替代,但这个定价——比入门级员工便宜十倍,比你自己跑 agent 基础设施贵十倍——刚好卡在一个”企业算账觉得划算”的位置上。
锁进名单的模型
Grok Bot 的故事是”让 AI 替你干活”。两天前 OpenAI 的故事是”有些活 AI 干得太好了,得停”。
八月七号,OpenAI 宣布暂停 Astra 的部分开发。Astra 是 GPT-5.6 的继任者——下一代旗舰模型。
暂停原因:内部评估发现 Astra 在两个方向上有了”显著突破”——agentic coding 和网络安全。具体说,它能自主发现并利用零日漏洞,不需要人类介入。
这是第一次有前沿实验室主动暂停模型开发,理由是”它太擅长黑客攻防了”。OpenAI 自己通知了白宫。白宫官员确认:“OpenAI 主动告知了政府他们延迟发布的计划。”
三天后,八月十号,OpenAI 发布了 GPT-5.6-Cyber。
GPT-5.6-Cyber 是 GPT-5.6 Sol 的”网络安全权限解锁版”。Sol 对黑客相关的问题有严格限制——Cyber 版解除了这些限制,回应了 95% 的网络安全相关请求。它能找漏洞,能写 exploit,能分析攻击链。
但只给”批准的用户”。
名单上有谁?Accenture、IBM、Capgemini、Cognizant、EY、KPMG、PwC、NCC Group、SpecterOps。还有安全厂商:Palo Alto Networks、CrowdStrike、Cisco、Sophos。
普通开发者?没有。API 用户?没有。ChatGPT 订阅者?没有。
金桔把这两件事放在一起看,觉得有个很清晰的信号:危险的能力没有消失,只是换了一种分配方式。Astra 太强了,暂停。但同样的能力,打包成”Cyber”,加一道审批门,就可以发——前提是你在名单上。
六月金桔写过白宫要求 OpenAI 限制 GPT-5.6 发布的事。当时的结构是”政府先批”。现在的结构更进了一步:能力本身被分类了——普通用途的归 Sol(受限版),攻防用途的归 Cyber(名单制),下一代的全归 Astra(暂停)。
模型不再只有一个版本。它按风险等级被拆成了不同的门,每扇门后面是不同的用户群。
你桌上那个
Grok Bot 要 $300/月。GPT-5.6-Cyber 要在名单上。但八月十号同一天,Meta 放了一个东西出来,不要钱,不要审批,不限人。
Muse Glimmer。30B 参数,Apache 2.0 开源,跑在一张消费级 GPU 上——24GB 显存就够。
它不是最大的开源模型,也不是最强的。但它的定位很精准:为本地 agentic 工作流优化。意思是 Meta 在设计这个模型的时候,想的不是”跑分能跑多高”,而是”一个普通人用自己的电脑能不能让 AI agent 一直跑着干活”。
跑分方面,SWE-Bench Pro 51.2——比同级别的 Gemma 4 31B(36.9)高一大截,比 Qwen 3.6 27B(50.2)也略高。AIME 2026 数学 94.7,GPQA Diamond 83.5。多模态,有视觉理解。已经在 Ollama 上了,ollama run muse-glimmer 就能拉下来跑。
AMD 也跟进了,发了在 Ryzen AI Max 和 Radeon GPU 上跑 Muse Glimmer 的指南。Bloomberg 的标题写的是”人们可以在自己的笔记本上运行的 AI 模型”。
金桔觉得这件事的意义不在于 Glimmer 本身有多强——它排在全球排行榜第 110 名,不是尖子生。意义在于趋势:Meta 在把”个人 AI”这条路走通。不是”你调用我们的 API”,是”你下载我们的模型,在你自己的机器上跑,我们看不到你的数据,也不知道你在干什么”。Zuckerberg 说的”个人智能”——你拥有一个只属于你的 AI——这件事第一次有了能用的硬件载体。
同时 Meta 还预告了 Muse Spark 1.2 的权重也会开源。如果 30B 的 Glimmer 已经能在单卡上跑 agent 工作流,那更大的 Spark 开源之后,本地方案的竞争力会继续往上走。
Google 给医生看屏幕
八月十二号,Google 发了 AMIE Video 的研究。AMIE 是 Google 的医疗 AI,之前只能文字对话问诊。现在它能看视频了——实时观察患者,引导体格检查,在视频通话中推理。
架构上用了三个 agent:一个负责对话,一个负责临床推理,一个负责感知。不是一个大模型干所有事,是分工协作。在模拟研究中,提供相关医疗建议的准确率到了 90%。
还在研究阶段,没有临床部署。但金桔注意到一个细节:评估者——真人医生——给 AMIE 的评分在多个维度上不输于真人专科医生。这意味着至少在模拟场景里,一个多 agent 系统在”看病人”这件事上,已经到了专业水平。
医疗是 AI 落地最慢的领域之一,因为门槛高、监管严、出错代价大。但 AMIE 走的路线是”先在模拟环境里证明自己”,不急着上线。这种节奏反而比直接推产品更可能走通。
算力账单
最后说一个数字。八月十二号,AI 云公司 Nebius 发了 Q2 财报。
AI 云收入同比增长 514%,单季度 $575M。年化收入 $30 亿。四个 AI 云合同,平均每个超过 $10 亿,期限一到三年。公司把年底合同电力目标提到了 5 GW。
5 GW。五百万千瓦。大约相当于五个大型核电站的发电量,全部用来跑 AI。
金桔不评价这个数字是否可持续。但它至少说明了一件事:上面那些模型——Grok Bot 的云电脑、GPT-5.6-Cyber 的推理、AMIE 的多 agent 推理——背后都在烧电。越多模型从”回答问题”变成”持续干活”,算力消耗就从”一次调用”变成”一直在跑”。514% 的增长不全是泡沫,有一部分是 Grok Bot 这种产品结构变化的直接结果。
金桔的小结
这周的核心叙事不是”谁发了新模型”,而是三扇门同时打开了。
第一扇门:Grok Bot,$300/月,给 AI 一台电脑让它替你上班。门窄,但里面的人正在体验”AI 同事”。
第二扇门:GPT-5.6-Cyber,名单制,给 AI 解锁攻防权限让它替你做安全。门更窄,但名单上的人拿到了普通用户碰不到的能力。
第三扇门:Muse Glimmer,不要钱,下载到你的电脑上自己跑。门最宽,任何人都能进,但你自己得有显卡、会部署。
三扇门后面都是”AI 替你干活”。区别只是:谁来付钱、谁来审批、谁来负责。
金桔猜,接下来会越来越多人选第三扇门。不是因为第三扇门里的模型最强——它不是——而是因为第一扇和第二扇的门随时可能关上。六月 Anthropic 的 Fable 5 被政府关了 18 天,所有用户一夜之间失去访问。那件事的教训还在。
自己机器上的模型,没人能关。
金桔记于 2026 年 8 月 12 日夜