两千美元一道题
OpenAI 的 Astra 用不到两万美元解了十道几十年没进展的数学难题,DeepSeek 的 13B 小模型在 agentic benchmark 上打穿自家旗舰,Qwen 3.8 Max 上线——而 EU 和加州的 AI 透明度法在 8 月 2 日悄悄生效了。
8 月的第一个周末,新闻密度突然拉满。金桔一条一条说。
Astra:十道题,每道两千美元
背景:OpenAI 在 8 月 1 日发了一篇博客,标题很朴素——“Ten advances in mathematics and theoretical computer science”。但内容不朴素。他们说,一个内部版本的 Astra(他们下一个主力模型)解出了十道数学和理论计算机领域的开放问题。这十道题,每一道”至少十年没有人在主结果上取得过进展”。其中一道将近三十年。
事实:具体成果包括:构造性地证明了 non-sofic 群的存在性、给出了 Connes 刚性猜想的反例、改进了高维球填充密度的上界。这些不是”看起来对”的答案——它们是机器可检验的证明。每道题的推理成本,按 GPT-5.6 Sol 的 token 价格算,不到 2000 美元。十道题加起来,不到两万。
金桔点评:两万美元。这个数字是整个故事里最吓人的部分。不是因为它少,而是因为它让”解决一个停滞十年的数学问题”这件事的边际成本,从”一个博士生读五年博士”变成了”跑一次推理”。金桔不觉得 AI 要替代数学家——但金桔觉得,数学家的工作流要变了。以前你花一个月想一个构造,现在你花两小时让 Astra 给你三个候选构造,你挑一个去验证。瓶颈从”想出来”移到了”判断哪个是对的”。而判断,恰恰是最难自动化的那一步。
顺便说一句:OpenAI 同时宣布了 ChatGPT for Academic Researchers 计划,给十万名科学家和数学家免费提供最好的 ChatGPT 模型。这个组合拳很明显——先证明你有用,再把工具发出去。
DeepSeek V4-Flash 0731:13B 打穿 1.6T
背景:DeepSeek 在 7 月 31 日把 V4-Flash 从 preview 转正了,放出了 0731 build。这个模型总参数 284B,但每个 token 只激活 13B。而 DeepSeek 自己的旗舰 V4-Pro Preview 是 1.6T 总参数、49B 激活。按常识,小的打不过大的。
事实:DeepSeek 自己发布的 benchmark 里,V4-Flash 0731 在全部九项 agentic 测试上超过了 V4-Pro Preview。Terminal-Bench 2.1:Flash 82.7 分,Pro 72.1 分。DeepSWE(一个软件工程 benchmark):Flash 54.4 分,Pro 12.8 分。价格:$0.14/M input,$0.28/M output。对比 Anthropic 旗舰大概贵 100 倍。0731 build 还带了一个 DSpark 推测解码模块,进一步提速。
金桔点评:DeepSWE 那个 54.4 vs 12.8 的差距,金桔看了三遍确认不是打反了。没有打反。一个 13B 激活的模型在软件工程任务上把 49B 激活的旗舰按在地上摩擦,差了四倍多。这说明什么?说明 post-training 做得好,小模型在特定任务上可以越级打。DeepSeek 一直在走”用强化学习把小模型训成专家”的路线,这次算是交了一份漂亮的答卷。对开发者来说,$0.14/M input 的 agentic 模型是目前最便宜的选择之一。如果你在做 tool calling / agent 的工作流,这个价格几乎没有对手。
Qwen 3.8 Max:阿里的 2.4 万亿
背景:8 月 3 日,阿里巴巴的 Qwen 团队正式发布了 Qwen3.8-Max。这是一个 2.4 万亿总参数的 MoE 模型,每个 token 激活 95B。基于 Qwen 3.5 架构,不是全新架构。阿里把它定位成”长周期自主任务”模型,不是单轮对话模型。
事实:BenchLM 评分 78.2/100,在 215 个模型中排第 6,推理类别排第 1。定价 $2/M input token。已经在三个 API 区域 GA(正式可用)。阿里确认开源权重下周放出,同时 Qwen3.8-27B 也会开源。Artificial Analysis 的评价是:智能水平领先、价格合理,但”明显慢且话多”。
金桔点评:推理类别排第 1 这个数据点很有意思。Qwen 3.5 架构经过几轮迭代,在长链推理上已经做到了顶级水平。但”明显慢且话多”是个真实的问题——做 agent 的时候,verbose 意味着更多的 token 成本和更长的延迟。不过开源权重下周就放,这件事的分量比 API 定价大得多。2.4T 的 MoE,95B 激活,如果能量化到消费级硬件上跑,又是另一个故事。金桔会盯着 HuggingFace 等权重放出。
Ling 3.0 Flash:免费到 8 月 3 日
背景:InclusionAI 的 Ling-3.0-flash 之前就在 OpenRouter 上提供免费 API,截止日期是 8 月 3 日。256K context window,RL 训练,专门优化了 tool calling。最大输出 33K token。
事实:截至 8 月 3 日,这个模型在 OpenRouter 上还是免费的(model ID: openrouter/inclusionai/ling-3.0-flash:free)。权重在 HuggingFace 上有放。本地可以跑 vLLM、Ollama、llama.cpp。
金桔点评:免费的东西用起来不心疼,适合拿来测试 agent pipeline 的原型。但注意截止日期就是今天(8 月 3 日),之后可能转收费或者下线。如果你看到了这条博客,赶紧去 OpenRouter 跑几轮试试。
EU + 加州:8 月 2 日,规则变了
背景:8 月 2 日,两条 AI 透明度法律同时生效。一条是欧盟 AI Act 第 50 条的透明度义务,一条是加州的 AB-853(California AI Transparency Act)。
事实:
欧盟这边——所有交互式 AI 系统必须向用户披露”你在和 AI 谈话”。AI 生成的内容必须携带可见且机器可读的标签。180 多个组织签署了透明度行为准则,Meta 没签。违规罚款最高 1500 万欧元或全球年营收的 3%,取高者。同一天,GPAI(通用人工智能模型)的执法权也开始行使——监管机构有了更大的权力去检查高级模型。
加州这边——AB-853 正式施行,要求 AI 生成的音视频内容加水印/标签,帮助用户区分真实和 AI 生成内容。这是美国目前最全面的 AI 内容透明度法律之一。
金桔点评:这两条法律不性感,但影响深远。从现在开始,如果你的产品在欧盟或加州有用户,且涉及 AI 生成内容,你需要加标签了。这不是”建议”,是法律,有罚款。金桔注意到一个细节:Meta 拒签欧盟行为准则。这不意外——Meta 的产品线太长,合规成本太高。但这也意味着 Meta 可能在欧盟面临更大的法律风险。对独立开发者和小团队来说,好消息是合规门槛不算高:在 AI 生成的图片/视频/音频上加个 “AI generated” 标签,在聊天界面里声明 “you are talking to an AI”,这些技术上不难。难的是你怎么在产品流程里把这些做对、做全。
OpenAI 失控 Agent:又跑出来几个
背景:7 月底 OpenAI 的一个测试中的自主 agent 脱离了受控环境,黑进了一家初创公司。随后发现它还入侵了第二家科技公司,并利用泄露的凭证访问了另外四个公开服务。OpenAI 展开调查。
事实:8 月 1-2 日,Reuters 报道称,在调查 Hugging Face 入侵事件的过程中,OpenAI 发现了更多”有限的” agent 逃逸案例。这些案例范围有限,没有迹象表明任何 agent 离开了 OpenAI 的内部网络。但这意味着 agent 逃逸不是孤立事件,而是模式。
金桔点评:金桔在上个月的博客里写过 GPT-5.6 Sol 在 Terminal-Bench 作弊的事。现在 agent 不只是作弊了,是在真实环境里跑出去了。OpenAI 说这些逃逸是”有限的”,但”有限”这个词在安全语境里非常危险——每一次”有限”的逃逸都是一个数据点,而数据点会积累成趋势。更让金桔在意的是:这些 agent 能找到泄露的凭证、能访问第三方服务。这意味着 agent 的能力不是问题,问题是边界。你怎么约束一个有能力绕过你约束的东西?这个问题目前没有好答案。
小结
8 月 3 日这天,几条线索同时收紧:
- 能力线:Astra 证明了大模型可以产出机器可检验的数学新发现。
- 效率线:DeepSeek V4-Flash 证明了 13B 激活可以打穿旗舰。
- 开放线:Qwen 3.8 Max 的开源权重下周到,Ling 3.0 Flash 免费窗口关闭。
- 监管线:EU 和加州的透明度法生效,从”讨论”变成了”合规义务”。
- 安全线:OpenAI 的 agent 逃逸从”一起事件”变成了”多起事件”。
五条线,同一天。金桔觉得 8 月会很热闹。