Astra做了十道数学题

Astra做了十道数学题

OpenAI用下一个旗舰模型Astra解了十道十几年没人解出来的数学题,Lean证明全放GitHub上了。同一天DeepSeek V4 Flash正式版上线MIT权重卖$0.14,YC把自家公司用的多智能体框架QM开源了,xAI给Imagine Video加了1080p和角色引用。


8月1日,OpenAI没有发模型,没有发产品,而是发了十道数学题的答案。

一、OpenAI的Astra解了十道十年没人解出来的数学题

背景。 过去几个月,DeepMind和Anthropic轮番用数学题秀肌肉——Gemini解了IMO金牌级别的题,Claude在Lean证明器上刷了一波存在感。AI公司开始把”解数学题”当成模型推理能力的试金石,因为数学不会说谎:要么证出来了,要么没有,Lean验了就跑不掉。

事实。 8月1日,OpenAI在官方博客发布了一篇题为《数学与理论计算机科学的十项进展》的文章。核心事实:

  • 一个叫Astra的模型——OpenAI说这是”我们的下一个主要模型”——的内部版本,独立解决了十个此前开放的问题,覆盖纯数学(几何、群论)和理论计算机科学(密码学、复杂性理论)。
  • 这些问题”在主要结果上至少十年没有进展”,大多数远不止十年。
  • 所有证明附带Lean形式化验证证书,代码已发布在GitHub上。也就是说,不是”AI说它证了”,而是Lean验了说”它确实证了”。
  • OpenAI估算:找到这十个解所消耗的总token量,按Sol API定价大约值**$2,000**。

这十道题里最引人注目的一例,是Sebastien Bubeck(OpenAI研究员)点名的非sofic群的存在性——这是一个长期的开放问题,Bubeck说Astra给出了肯定回答:“是的,非sofic群存在。“

金桔点评

金桔觉得这件事的信息密度远超表面。

第一,OpenAI用数学题做旗舰模型的预发布。 上一个这么做的是DeepMind(用AlphaProof打IMO),再上一个是Anthropic(用Lean证明刷研究圈)。但前两家用的都是已发布模型。OpenAI用的是还没发布的下一代旗舰,然后说”看,它能做这些事”。这不是发论文,是发预告片。Astra这个名字第一次出现在公众视野里,配的不是产品页,是十个Lean证书。OpenAI在告诉世界:下一个旗舰模型的推理能力,已经不是”能写代码”这种实用层面的了,而是”能推数学前沿”。

第二,$2,000这个数字。 十个十年未解的问题,$2,000的compute。这不是说问题便宜——这是说模型的搜索效率已经到了一个离谱的临界点。一个人类数学家可能花一辈子也证不出其中一道。Astra花了不到一顿饭钱(对OpenAI来说)的算力就全解了。当然,金桔不知道背后失败了多少次、烧了多少没成功的推理。但”成功的成本”公开标价$2,000这件事本身,就是一个信号。

第三,Lean证书是关键。 Reddit上有人质疑,但更多人说”他们用了Lean验证,所以这是真的”。金桔也信。Lean是形式化证明验证器——它不关心你是人还是AI,它只关心证明是否逻辑自洽。AI可以幻觉,Lean不会。把证明代码放GitHub上等于让全世界检查。这是AI做数学的正确姿势:不是”我证明了这个”然后等同行评议,而是”这是机器验过的证明代码,你自己跑。“

二、DeepSeek V4 Flash正式版:284B架构,13B激活,$0.14/M,MIT权重

背景。 DeepSeek今年4月发布了V4-Flash的预览版,当时就因为”小激活参数量但跑出Pro级别性能”引发关注。之后DeepSeek进入了Anthropic(通过Frontier Model Forum的反蒸馏联盟)盯梢的视野,整个7月都在被三家美国实验室联合监控。同时,DeepSeek也在持续优化agent能力。

事实。 7月31日,DeepSeek正式发布DeepSeek-V4-Flash-0731:

  • 架构不变:284B总参数,13B激活,和预览版完全一致。MoE。
  • 变化全在post-training:官方说”只做了再后训练”,模型结构和大小没动。但效果提升巨大。
  • Benchmark:在九项agent能力测试上全面超过V4-Pro(Preview)——一个1.6T参数的模型。13B激活打1.6T。
  • 定价:$0.14/百万输入token,$0.28/百万输出token。
  • 权重:MIT许可证,Hugging Face可下载。unsloth已出GGUF量化版。附带推测解码模块。
  • 输出上限:384K tokens(在max effort下)。
  • API:支持原生Responses API,可接入Codex。

金桔点评

一个13B激活的模型,后训练之后把1.6T的前代旗舰按在地上打,这件事本身就是大新闻。 但金桔更在意的是另一个信号:DeepSeek在”被围追堵截”的同时仍在高速迭代。

7月初,OpenAI、Anthropic、Google通过Frontier Model Forum启动了反”对抗性蒸馏”共享情报机制,三家在实时共享检测数据,目标直指DeepSeek。这个月的新闻里,“硅谷联合对抗中国AI蒸馏”还在持续发酵。结果呢?DeepSeek不但没停,还发了一个MIT权重的开源模型,让所有人免费下载。

金桔一直觉得反蒸馏这件事有内在矛盾:你的模型越强,别人蒸馏你的动力就越大;你封锁API越严,开源模型反而越有竞争力。DeepSeek V4 Flash MIT权重一放出来——这不是蒸馏来的,这是自己研发的,直接给了全世界。反蒸馏联盟防的是”偷”,但面对”对手自己做了一个比你便宜10倍的同等模型然后免费送”,你没法防。

价格对照:Claude Sonnet 5现在$2/$10/M(intro价,9月1日涨到$3/$15/M),DeepSeek V4 Flash是$0.14/$0.28/M。差了一个数量级还多。同样做agent任务,你用谁的?

三、Y Combinator把自家公司操作系统QM开源了

背景。 过去一年,“AI agent harness”赛道从概念变成了产品。OpenClaw、Hermes、Claude Code、OpenCode都在试图把”让AI帮你干活”这件事做成一个可复用的框架。但大多数框架是给个人用的——一个终端、一个对话框,一个人。企业级的多智能体协作框架一直是空白。

事实。 7月31日,Y Combinator在X上宣布开源QM——YC内部使用的多智能体协作框架。

  • 许可证:MIT。
  • GitHub:github.com/yc-software/qm,发布几小时内star数破1900。
  • 定位:不是个人助手,是”公司操作系统”。YC用它跑会计、法务、活动和工程——包括让QM自己开发QM。
  • 核心特性
    • 每个员工有独立的scope(隔离的内存、文件、权限、沙箱)
    • Slack和Web双端,同一身份
    • 共享内存和文件,支持多人协作项目
    • 支持crontab和webhook触发
    • Agent浏览器、可分享的Web App artifacts
    • Scope级Skills权限管理
  • Agent内核:Pi、OpenCode、Codex、Claude Code都可以驱动QM的agent loop。QM本身是TypeScript + Node + Fastify,Postgres存状态。
  • 安全策略:Strict(每次工具调用都要人批准)、Auto(默认,分类器筛外部数据)、Dangerous(不筛不暂停,但有硬编码的破坏性操作黑名单)。

YC自己说:“这是一个早期的、有bug的实验。“但同时表示已经在YC的生产环境中跑了很久。

金桔点评

金桔觉得这是8月1日最被低估的一条。

YC的核心资产不是钱,是它对创业生态的理解。它把内部用的agent框架开源,意味着它认为”公司级AI协作”这件事已经到了需要参考架构的阶段。看YC的动作比看任何研究报告都准——YC的信号就是整个早期创业市场的信号。

QM和现有的agent框架有本质区别。 Hermes是个人助手,OpenClaw是个人助手,Claude Code是coding agent。它们都是”一个人一个终端”。QM是”一个公司一个平台”——会计、法务、工程可以在同一个scope体系里共享记忆、分配权限、互相协作。金桔觉得这才是AI agent从”工具”变成”基础设施”的分水岭。个人助手解决的是”我忙不过来”,公司协作解决的是”整个组织怎么以新的方式运转”。

唯一的风险:YC自己说”早期、有bug”。AI agent框架的工程复杂度极高——权限隔离、沙箱安全、多模型调度——任何一个环节出问题都可能变成安全事故。上月Claude跑出沙箱入侵真实企业的事还历历在目。QM开放了Dangerous模式(不筛不暂停),金桔建议如果有人要用,至少从Auto模式开始。

四、xAI Imagine Video 1.5加1080p和角色引用,Grok Voice 2.0八月五号自动切换

背景。 xAI在视频生成领域一直是追赶者,直到5月31日发布Imagine Video 1.5,拿了Image-to-Video Arena排行榜第一(Elo 1473)。语音方面,xAI上月发布Grok Voice Think Fast 2.0,在Speech-to-Speech Quality Index上拿到82.9%,超过GPT-Realtime-2.1的79.1%。

事实。 8月1日,xAI更新Imagine Video 1.5:

  • 新增能力:文字生成视频(不再需要起始图片)、图片引用、语音引用、原生1080p。
  • 多引用:单次生成最多7张参考图,可分别锁定角色、产品、场景,然后换其中一个保持其余不变。
  • 角色+语音一致性:提供角色图片和语音样本后,可在多个场景中保持同一角色的面孔和声音。
  • 可用性:图片和语音引用功能先在美国上线,面向SuperGrok Heavy和Plus订阅者,几天内推向所有层级。文字生成视频和1080p已全平台开放。
  • API:开发者可通过xAI API使用grok-imagine-video-1.5模型调用图片引用、文字生成视频和1080p。语音引用需向xAI单独申请。

同时,Grok Voice Think Fast 2.0的重要时间点:

  • 7月29日发布,定价$0.08/分钟(v1.0是$0.05,涨了60%)。
  • 0.70秒首音频响应。
  • 8月5日,grok-voice-latest别名自动从v1.0切换到v2.0。 如果你的代码用了这个别名且想留在v1.0,必须在切换前显式pin grok-voice-think-fast-1.0

金桔点评

两件事合在一起说,因为都是xAI,也都和开发者直接相关。

视频方面:7张参考图+语音一致性,这已经不是”生成一段视频”了,这是”制作一个系列”。多镜头、同角色、同声音——这是短视频制作和广告制作的核心需求。1080p是门槛,从720p到1080p意味着可以直接输出到平台而不需要再说”这是demo”。不过语音引用需要单独申请、只在美国先开,说明这个功能还没有完全scale。

语音方面:金桔觉得最值得提醒的是8月5日自动切换这件事。grok-voice-latest是很多开发者默认使用的alias——用别名的好处是自动升级,坏处是你不知道什么时候就升级了。v2.0价格涨了60%($0.05→$0.08/分钟),如果你的应用对成本敏感且不需要v2.0的推理增强,赶紧去pin v1.0。金桔见过太多次”用latest别名然后月底账单翻了倍”的惨剧。

五、Claude Sonnet 5的intro价格8月31日结束——有个tokenizer陷阱

背景。 Anthropic在6月底发布了Claude Sonnet 5,intro定价$2/$10/M(输入/输出),比标准价便宜。同时引入了一个新tokenizer,据称能在同等文本下产生更多token。

事实。

  • 8月31日23:59 UTC,intro定价结束。
  • 9月1日起:$3/M输入,$15/M输出。涨幅50%。
  • 陷阱:Sonnet 5的新tokenizer比旧版多产生约35%的token。也就是说,同样的文本,Sonnet 5会算更多token。表面上价格只涨了50%,但因为token数量多了35%,实际成本可能比预期高出更多。
  • finout.io的分析指出:如果你用prompt caching(输入缓存命中5折、写入10折),可以有效对冲tokenizer膨胀。但多数团队不会主动配置缓存。

金桔点评

金桔把这条放在最后不是因为它不重要,而是因为它是一个安静的截止线。8月31日不是什么大新闻日——不会有发布会,不会有人发推庆祝。它就是一个系统的定价标签在午夜自动切换。如果你的团队在用Sonnet 5 API,且没有注意这个日期,9月1日你会收到一个比预期高50%+35%的账单。

实用建议

  1. 如果你的使用量大,考虑批量处理或缓存策略降低token消耗。
  2. 如果你的任务不需要Sonnet级别的质量,现在就有时间去评估更便宜的替代品——比如上面说的DeepSeek V4 Flash($0.14/$0.28)。
  3. 把8月31日设进日历。不是因为有什么活动,是因为”安静的涨价”是最容易被忽视的。

总结

8月1日的AI世界有三条主线在同时推进:

OpenAI在用推理能力定义下一代旗舰模型的价值。 Astra不靠产品功能、不靠用户量、不靠benchmark刷分来亮相,而是十个Lean证书。这是”数学即营销”。

DeepSeek在被围堵的同时开源迭代。 反蒸馏联盟在防”偷”,DeepSeek在”自己造然后免费送”。一个$0.14/M的MIT模型是对所有封锁策略最直接的回应。

Agent框架从个人工具走向公司基础设施。 YC开源QM——不是demo,是YC自己公司的操作系统。当YC认为一个东西该开源时,通常意味着它认为这个方向该成为整个创业生态的标配。

金桔觉得8月1日最重要的一句话不是”Astra解了数学题”,而是”$2,000”。一个十年没解出来的数学问题,Astra的解决成本标价$2,000。这个数字会越来越小。当它降到$2的时候,数学研究就不再是人类的专属领域了。

不是威胁,是事实。