
AI周报 | 8月31日–9月6日:本周AI大事盘点
这周的 AI 圈,最重的几锤几乎挤在同两天里:OpenAI 凌晨发布 GPT-6 Astra,直接把「欢迎来到 AGI 时代」写进发布会口号;英伟达则把上周还停在传闻的 Hugging Face 收购案坐实成 129 亿美元的官宣。Anthropic 一边让 Claude 用 11 天形式化证明了费马大定理,一边把 IPO 推进到临门一脚;国产阵营同样没闲着,DeepSeek 的 16 万颗昇腾大单与阿里 Qwen3.8-Max 登顶 CodeArena,各自改写着算力与编程的牌面。
1. OpenAI 发布 GPT-6 Astra,口号是「欢迎来到 AGI 时代」
9 月 4 日凌晨,OpenAI 正式发布新一代旗舰 GPT-6 Astra:ARC-AGI-3 得分 99.9%,FrontierMath 最高难档 98%,上下文窗口拉到 105 万 token,API 定价约为 GPT-5.6 Sol 的 2.5 倍。发布后两天内,模型已向企业 Trusted Access、API 与 ChatGPT 的 Pro、Business、Enterprise 分批推送,Pro 及以上用户拿到的是更强的 Astra Pro 变体。相比前代,它更像一次「会操作电脑」的代际跃升(OSWorld 2.0 达 72.6%),而非全榜单碾压——官方对比里带工具的 Humanity’s Last Exam 等项仍落后 Claude Fable 5.1。为什么重要: 这是第一家敢把「AGI 时代」当发布语的实验室,而「发布→安全审查→分批放量」的新节奏,把旗舰的可获得性推成了比跑分更现实的竞争维度。来源
2. 英伟达 129 亿美元收购 Hugging Face,传闻在一周内落定
英伟达官宣以约 129 亿美元收购开源 AI 平台 Hugging Face,其中约 119 亿美元现金外加约 10 亿美元员工股权留存池,预计 2027 年上半年完成监管审批,是公司史上第二大收购。Hugging Face 承载着超 15 万个开源模型与数据集,是全球最大的开源模型分发社区;收编之后,「卖铲人」同时握住了芯片、软件栈与开发者入口。为什么重要: 上周还是「据报」,这周就落槌,模型的分发与社区入口已经被大厂当成和算力同级、值得百亿美元下注的战略资产。来源
3. Claude 用 11 天完成费马大定理首个机器可验证证明
Anthropic 宣布 Claude 把人类 350 多年才攻克的费马大定理翻译成约 1300 万行 Lean 代码,证明 3 万多个中间定理,全程基本自主运行 11 天、消耗约 60 亿个输出 token,代码规模超过核心数学库 Mathlib 的五倍。背后是研究员彭天翼搭建的 Prove2Me 平台:把证明拆成一张定理依赖图,几十个 Claude 智能体并行分工,人类只给出「Jacobian 作为概型优先级很高」这类高层指令。为什么重要: 人类以年计的证明形式化工程被压缩到 11 天,AI 第一次在可验证推理上做出数学界公认的里程碑——而陶哲轩同期对「黑盒抢答」的警告,恰好给这份兴奋补上了冷静的另一面。来源
4. Anthropic IPO 冲刺:估值预期超 2 万亿美元,150 亿美元信贷先行
Anthropic 计划在美国劳动节假期后递交招股书,目标 9 月底至 10 月初登陆纳斯达克;市场预期其上市估值突破 2 万亿美元,有望成为史上最大的科技 IPO 之一。上市之前,公司先敲定一笔约 150 亿美元的循环信贷,由摩根士丹利、高盛、摩根大通、花旗等 14 家银行参团,每家的承诺出资都超过 10 亿美元。为什么重要: 第一家前沿模型公司即将在公开市场被定价,无论成色如何,这个估值锚都会成为 OpenAI 上市和整个行业后续融资的参照系。来源
5. DeepSeek 为内蒙古数据中心下单至少 16 万颗华为昇腾芯片
据彭博社报道,DeepSeek 计划在其位于乌兰察布的大型数据中心部署至少 16 万颗华为新一代加速器 Ascend 950DT,该设施为吉瓦级数据中心,预计 2027 年底至 2028 年初部分上线,建成后将是已知规模最大的国产 AI 芯片集群之一。为什么重要: 一家以高效训练著称的头部模型公司,把训练与推理底座大规模迁到昇腾生态,意味着国产芯片正从「能跑」走向「规模化承载头部大模型」,给算力封锁下的另一条技术路线写下了注脚。来源
6. 阿里更新 Qwen3.8-Max:前端编程登顶 CodeArena
阿里本周更新旗舰模型 Qwen3.8-Max,在聚焦前端编程的 CodeArena 榜单上得分提升 22 分至 1691 分,超越 Claude Opus 5、Kimi K3 等一众模型登顶总榜第一;同步更新的性价比榜单显示,其综合成本约每百万 token 5 美元,处在帕累托前沿。为什么重要: WebDev 是智能体编程最接近真实交付的主战场,国产模型第一次在这种第三方榜单登顶还保持低价,会让按「前端产出」选型的企业开发者重新掂量选项。来源
7. Google 两周一代刷新 Flash:Gemini 3.8 Flash 与 Flash Cyber 上线
Google DeepMind 发布 Gemini 3.8 Flash,距离 3.7 Flash 仅约三周,是六周内推出的第三个 Flash 版本;它主打长周期软件工程与智能体工作流,在 DeepSWE v1.1 上超过多数更大的前沿模型,HLE-Verified 得分 54.9%,介绍价维持每百万输入 0.75 美元、输出 3.75 美元。同场发布的 Flash Cyber 聚焦漏洞发现与自动修复,通过新设的 Fairwind Program 向政府、关键基础设施运营方等可信防御者开放。为什么重要: 谷歌把「小参数 + 高频率迭代」当作战术,Flash 线的更新速度已经快过不少实验室发旗舰的节奏,价格战和版本战被叠在了同一张牌桌上。来源
8. Anthropic 发布 Claude Fable 5.1,缓存读取降价 75%
Claude Fable 5.1 与受限访问的 Claude Mythos 5.1 同期发布,两者是同一基础模型的不同安全配置,前者面向一般编码与知识工作,后者服务经过审核的网络安全和生命科学机构。能力之外更值得算的是账本:缓存读取价格降至每百万 token 0.25 美元,较 Fable 5 下降 75%,Anthropic 估计典型工作负载成本下降约 25%,高度智能体化的任务最高可省约 45%。为什么重要: 和 Gemini 3.8 Flash 挤在同一周发布,前沿模型正在把竞争重心从跑分挪到「完成一个真实任务的成本」,缓存定价成了新的角力点。来源
9. Astra 被曝采用「循环深度」架构,推理黑盒化震动安全圈
The Information 与 Fortune 相继报道,GPT-6 Astra 部分采用了循环深度(looped Transformer)架构:token 反复循环通过同一组网络层,中间推理以人类无法直接阅读的「神经网络语」在隐空间完成。好处是省算力——同类研究显示同等性能可节省 50% 到 90% 的计算量;代价是思维链不可读,而思维链监控恰恰是 OpenAI 防范智能体越权的主要手段,多名安全研究者将其称为「触及行业红线」。为什么重要: OpenAI 承诺限制使用范围、未来公布架构细节,但一旦「完全不可读的推理」成为行业选项,依赖思维链的整套安全监控体系都得重新设计。来源
10. 英伟达 35 亿美元入股 MediaTek:把定制芯片拉进自家数据中心
英伟达宣布向联发科投资 35 亿美元,并开放 NVLink Fusion,帮助其为 AI 公司和云厂商设计可直接插入英伟达数据中心的定制芯片;联发科预计其定制数据中心 ASIC 业务 2026 年收入可达 20 亿美元。为什么重要: 面对亚马逊、谷歌、微软自研芯片的围剿,英伟达的选择是「打不过就纳入」——让定制 ASIC 分担部分计算,同时把互联和机架级基础设施牢牢攥在自己手里。来源
本周趋势
这一周最清晰的方向是「智能体经济性」:谷歌两周一代地刷 Flash,Anthropic 把缓存读取直接降价 75%,GitHub 则用多模型动态编排把成本打下去 65%——前沿模型的竞争正在从榜单分数转向每个真实任务的成本,谁的 agent 跑一个活更便宜,谁就更可能拿到下一批企业订单。第二条线是 AI 与数学的双面叙事:Claude 的费马大定理证明把可验证推理推到里程碑,陶哲轩却警告解题太快、过程太黑盒会让数学本身失去增量价值,Astra 的不可读推理争议正是同一焦虑在模型架构层面的回响。算力一侧,英伟达既买下 Hugging Face 补生态、又入股 MediaTek 拉拢定制芯片,国产阵营则在 DeepSeek 的昇腾大单里加速走自己的路线。AI 基建的景气仍在沿着存储、服务器与定制加速器层层传导,Anthropic 招股书能否如期落地、Astra 全量放量后的第三方评测怎么打分,是下周最值得盯的两件事。