AI 每日简报禾维 AI12 分钟阅读

AI 每日简报|AI 模型月开局火力全开|2026.09.09

2026年9月9日 AI 日报聚焦模型密集发布、OpenAI 纳维-斯托克斯争议、代理模型成本与基准表现,以及 Meta Muse 和 ChatGPT Images 2.5 带来的个人助理与图像生成新进展。

模型月的重点不是诞生一个新王者,而是为你的技术栈提供原材料。

这个夏天的主旋律,是从单一模型范式转向更复杂的架构:个人和团队可以在不同模型与工具体系之间灵活切换。如今,这一趋势刚刚迎来压力测试。九天之内,Fable 5.1、GPT-6 Astra、Gemini 3.8 Flash、MuSpark 1.3、ChatGPT Images 2.5,以及 Meta 的 Muse 代理相继出现,每个产品在能力、速度和成本之间都有不同取舍。问题已经不再是哪个模型总体上最好,而是哪种组合最适合你真实的生活与工作。


数据一览

  • 100 万美元 —— 每个千禧年大奖难题的奖金;OpenAI 声称解决了纳维-斯托克斯问题
  • 39 倍 —— Gemini 3.8 Flash 相比 Opus 5 的速度优势——37 秒对比 24 分钟
  • 19.1% —— Flash 在 Terminal Bench 4.0 上的得分;在完全公开的 2.1 版本上则为 89.4%
  • 55 美分 —— MuSpark 1.3 每项任务的成本,约为 Opus 5 的四分之一
  • 480 亿美元 —— Cognition 的估值,三个月内接近翻倍
  • 6 亿美元 —— ElevenLabs 预计截至年末的年化收入,高于 3.5 亿美元
  • 30 亿 —— ChatGPT 每周生成的图像数量
  • 50% —— ChatGPT Images 2.5 的延迟降幅

头条

OpenAI 声称解决了一道千禧年大奖难题

OpenAI 发布了纳维-斯托克斯问题的解法。这是七道千禧年大奖难题之一,被称为“数学界的圣杯”;26 年来,七道题中只有一道得到解决。根据 Noam Brown 的说法,这项成果来自一个能力显著强于 GPT-6 的内部模型,花费数百万美元、耗时一到两周才找到。而 OpenAI 对这个内部模型的披露本身,也引发了大量关注。

一位数学家称自己的成果被抢先发表

纽约大学的 Tristan Buckmaster 表示,他和一位与 Anthropic 有关联的合作者花了一年多时间在 Codex 中攻克纳维-斯托克斯问题,并找到了新颖的阶段性成果。随后,在他联系 OpenAI 澄清相关传闻几天后,OpenAI 告诉他已经解决了这个问题。他声称,自己只有在合作者被排除的情况下才会获邀署名;而当他威胁要公开此事时,对方回复说:“如果你不希望我友善,那我也没必要友善。”OpenAI 的 Sébastien Bubeck 称这些指控不实且带有煽动性,并公开了部分文字记录。

有人或代理查看过用户数据吗?没有。我们是否使用去标识化数据改进 ChatGPT 和 Codex?是的,所有 LLM 公司也都这么做。

——OpenAI 首席研究官 Mark Chen OpenAI 的官方说法是:没有访问任何特定用户数据来解决纳维-斯托克斯问题;但“尽管可能性不高,我们无法排除从产品使用中获得的去标识化数据帮助改进模型的可能性”。Chen 的这一区分,正是当前整场争议的核心。

“AI 抢先发表文化”让学术界群情激愤

伊利诺伊大学教授 Talia Ringer 认为,在听说别人取得成果后仓促发表,“违背了每一条学术规范”,也是“AI 文化腐蚀整个领域的方式”。Hugging Face 联合创始人 Thomas Wolf 担心,这预示着 AI 科学将加速发展,却被大公司的营销游戏主导,而真正的科学共同体则被置于次要地位。

实验室能看到你的工作,并在事关重大的时候抢先发表吗?

前 DeepMind 员工 Susan Zhang 表示,这场风波掩盖了真正尚未解决的问题。一位数学家随后提出了尖锐的追问:如果我选择退出训练,并在付费订阅中粘贴一份商业机密,你们会将我的个人信息去标识化,却保留这份商业机密吗?截至录音时,这个问题仍未得到回应。对于任何使用消费级 AI 工具处理专有工作的用户来说,这一事件都是一次警钟。

实验室会出售创新的输入,还是保留创新的成果?

越来越多人开始讨论:对 OpenAI 来说,究竟是向科学家和企业出售进行新药发现的能力更合理,还是亲自完成发现,再从专利另一端获取收益更合理。在围绕 Dario 是否曾表示 Anthropic 将成为“世界上唯一的公司”的争论之后,这些问题显得比以往更加切中要害。

Claude Max 因使用量计算方式遭遇集体诉讼

原告称,Claude Max 的 100 美元 5 倍套餐和 200 美元 20 倍套餐,实际上并没有提供相当于 20 美元 Pro 套餐对应倍数的使用量,因为五小时和每周限额的计算方式存在问题。律师表示,这起案件之所以有说服力,是因为他们听取了许多劳动者的经历:这些人觉得,为了在就业市场中保持竞争力,自己必须支付顶级 AI 订阅费用。这起诉讼可能不会有结果,但随着 AI 实验室与日常商业活动日益交织,它们今后应当预期会受到这样的审视。

ElevenLabs 聘请 CFO,并瞄准公开市场

据 The Information 报道,曾在荷兰金融科技公司 Adyen 任 CFO、并带领公司完成 2018 年上市的 Ethan Tandowski 加入 ElevenLabs。ElevenLabs 正开始探索 IPO 的可能性。公司表示,预计截至年末年化收入将达到 6 亿美元,高于目前的 3.5 亿美元;公司已经实现盈利,且如今超过一半的收入来自大型企业客户。

Cognition 三个月内估值翻倍至 480 亿美元

一轮 20 亿美元融资将 Cognition 的估值从今年 5 月的 260 亿美元推高至 480 亿美元;同期,其收入运行率也从 4.92 亿美元跃升至近 9 亿美元。这轮融资表明,在 SpaceX 以 600 亿美元收购 Cursor、引发外界猜测之后,Cognition 仍将保持独立的代理实验室身份。“我们可以选择并组合最适合工作的模型……而不是把客户绑定在一家供应商上。”OpenAI 在收购完成后切断 Cursor 客户的服务,更凸显了这一价值。

主要内容

Gemini 3.8 Flash:训练目标是更加努力地工作

Google 在六周内推出了第三次 Flash 更新,新版本经过训练,可以反复调用工具,并在复杂任务上采取更多推理步骤。基准测试成绩扎实但波动明显:在 DeepSui 上达到 73.7%,仅略低于 Opus 5;但在 Terminal Bench 上,成绩从 2.1 版本的 89.4% 暴跌至 4.0 版本的 19.1%,GDPVal 也比 Opus 落后约 300 个 Elo 分。

Artificial Analysis 为代理时代重新调整指数权重

更新后的 Intelligence Index,将计算机使用和代理任务置于一般知识测试之上,因为后者如今已成为饱和的基础能力。这一调整撼动了排名:3.8 Flash 从第 7 位跌至第 12 位;最初排名高于 GPT-6 Astra 的 MuSpark 1.3,在修订后则降至第 5 位。

同等智能水平下最便宜的模型——但有一个前提

Artificial Analysis 称,3.8 Flash 是“我们测得的这一智能水平上最便宜的模型”,它仍是毋庸置疑的速度冠军,每秒输出的 token 数量比排名第二的 MuSpark 多约 20%。但尽管 token 定价没有变化,单项任务的实际成本却上升了 40%——如今该模型每项任务会多输出 30% 的 token,并进行更多代理轮次。

速度快 39 倍,什么时候能胜过略高的质量?

在一次正面对比中,Opus 5 的质量更高,但耗时 24 分钟;Flash 则在 37 秒内给出了几乎同样好的结果。评估新模型的正确方式,不是看它们能否替代你的日常主力模型,而是看你是否有这样的使用场景:运行 39 次迭代,是否胜过一次精雕细琢的处理。

Meta 的 MuSpark 1.3 让前沿模型失色——在成本方面

Alexandr Wang 将其称为“便宜到几乎无需计量的前沿性能”:MuSpark 1.3 在 DeepSui 上取得 75.4 分,略高于 Opus 5 和 GPT-5.6 Sol;相比 Spark 1.2,它少调用 20% 的工具,少使用 25% 的 token。在最高设置下,它在 Artificial Analysis 的编码代理指数中与 Opus 5 并列第一——当时 GPT-6 Astra 和 Fable 5.1 尚未完成测试,但这一表现依然十分惊人。

SemiAnalysis:迄今为止最明显的基准优化模型

SemiAnalysis 认为,3.8 Flash 和 MuSpark 1.3 都能在完全公开的 Terminal Bench 2.1 上达到前沿模型水平,却在仅发布两周的 4.0 版本上表现崩溃。这正是购买专门设计、用于模拟公开基准任务的 RL 环境数据所留下的特征。“这就是所有优秀公开基准的命运……所有有抱负的、所谓的‘前沿实验室’都会在不久之后把它刷到极限。”

我们并没有声称 MuSpark 1.3 和 Astra 或 Fable 5.1 一样强,但它的性价比显著更高。

——Meta 首席 AI 官 Alexandr Wang,回应 SemiAnalysis Wang 对“基准优化”指控的回应是一种值得注意的让步,而成本方面的说法也经得起检验:Spark 1.3 每项任务的成本为 55 美分,约为 Opus 5 的四分之一;Artificial Analysis 发现,没有任何单项任务得分达到 59 分或更高的模型,比它的单项任务成本更低。

MuSpark 击败 DeepSeek——因为免费也有代价

Spark 1.3 成为 OpenCode 当天使用量最高的模型,也是第一个登上该榜首的美国模型。它的免费层级特意命名为“贡献者”,因为 Meta 可能会使用你的输入和输出进行训练。这正是头条部分那个信任问题的缩影。

Muse:Meta 推出个人代理

传闻已久、原名“Hatch”的项目——其定位是面向普通人的 Open Claw——如今已经发布。Muse 始终在线,具备浏览器能力,并能连接你的收件箱、日历和财务信息。每个 Muse 都运行在独立的隔离虚拟机中;一个单独的“Sentinel”系统会在任何操作离开系统前进行检查;Muse 永远不会看到你的实际密码或银行卡号。

Facebook Marketplace 是代理分发的切入口

除了电子邮件和日历,Muse 还能通过 Instagram 获取 Meta 的好友关系图谱,更关键的是,它接入了 Marketplace:数百万普通用户第一次接触代理,可能就是因为代理帮助他们寻找商品、协商价格并安排取货。a16z 的 Olivia Moore 认为,原生连接器在可靠性上会胜过浏览器使用方式,并称 Muse 可能是首批真正被主流消费者采用的代理之一。

Meta 是唯一押注消费者的巨头——而这是一把双刃剑

在 Meta 所处的规模层级中,它是唯一一家主要关注消费级而非商业 AI 的公司,这使 Muse 成为整个行业的一次测试:代理购物和个人助理是否真的会成为现实。但即便是 Olivia Moore,在 Muse 上点击“连接电子邮件”时,也比在十多个创业公司代理上更犹豫。Meta 的分发优势与信任赤字始终相伴而行。

应该支持个人代理——公众对 AI 的敌意可能取决于它们

NLW 在工具体系之争或模型之争中没有偏向,但如果人们确实能从个人助理代理中获得价值,或许一开始就会减少对 AI 的敌意。Box 的 Aaron Levie 指出,这是第一个对消费者而言具备合理性的高 token 用量代理场景,也是一种直接发挥 Meta 在算力、广告、商业和分发方面优势的应用。

ChatGPT Images 2.5 的核心是控制力

用户每周生成的图像已经超过 30 亿张,OpenAI 推出了更清晰的细节、更精准的编辑、低 50% 的延迟、新的应用内 Sketch 功能,以及两个变体:适合快速迭代的 Flare,和适合专业工作流、需要在多次编辑中保持控制力的 Sunburst。和此前的 Nano Banana 一样,真正的创新在于细粒度编辑:Higgsfield 的产品负责人称赞它非常理解“哪些内容不该改变”。

不要低估图像作为商业差异化因素的价值

对于 OpenAI 来说,图像生成作为一种商业——而不仅是消费级——差异化因素,其价值被低估了。在 Codex 中调用 GPT Image 来生成 UI 元素和视觉风格,会让 NLW 比原本更常使用集成式 GPT 技术栈,尽管他通常更喜欢由 Fable 构建的网站审美。