这周的 AI 圈,最值得说的是「最贵的那一档」突然不值钱了。Anthropic 把 Claude Opus 5.5 的能力做到逼近更高一档的 Fable 5.1,价格反而降了 20%;OpenAI 同一天给 GPT-6 补上 Sol 与 Luna 两个更便宜的层级,报价直接砍半;另一头,小米用 1.02 万亿参数的 MiMo-V2.6 把开源模型的单任务成本压到 0.13 美元。热闹之外还有一条更硬的线:智能体越权从论文里走出来变成实证,OpenAI 因此暂停了自家最强模型的训练与工具调用。
1. Anthropic 发布 Claude Opus 5.5:能力摸到上一档,价格反而降了 20%
Anthropic 9 月 22 日推出 Claude 5.5 系列首款模型 Opus 5.5,官方称它在多数工作任务上的表现已经接近定位更高的 Claude Fable 5.1($10/$50 档),而典型负载下的运行成本比 Opus 5 低约 40%。定价同步下调:输入从 $5 降到 $4/百万 token,输出从 $25 降到 $20,缓存读取从 $0.50 砍到 $0.20,Batch API 照旧再打五折,上下文保持 1M、最大输出 128K。回答风格也做了调整,官方强调更直白、少用行话、重要信息前置,并沿用自 Fable 5.1 起的「保留思考」反蒸馏保护。Sonnet 5.5 与 Haiku 5.5 预计未来数周跟进。
这是 Dario Amodei 公开呼吁全行业给前沿推进「定节奏」之后,Anthropic 交出的第一款新模型。减速的表态和降价的定价出现在同一周,说明它真正在意的竞争对手不是安全问题,而是开放权重那一边的成本曲线。
来源 | TechCrunch
2. OpenAI 给 GPT-6 补上 Sol 与 Luna,API 价格砍半
与 Anthropic 同日,OpenAI 为 GPT-6 系列新增两个层级:定位低于 Astra、面向编程等复杂工作负载的 GPT-6 Sol,以及面向信息抽取、文档摘要这类高容量任务的 GPT-6 Luna。官方口径是相比 GPT-5.6 的促销定价,API 价格降低 50%。
两家前沿实验室在同一周同时选择「降价 + 下探台阶」,背景是更便宜的开放权重模型持续挤压,加上企业客户开始收紧 AI 支出。竞争的重心从刷榜转到单位智能成本,而这一转,直接决定 Agent 这类按 token 烧钱的产品明年还能不能算得过账。
3. 小米开源 MiMo-V2.6:1.02 万亿参数,把单任务成本压到 0.13 美元
小米 9 月 22 日发布并开源 MiMo-V2.6 系列,全模态旗舰 MiMo-V2.6-Pro 为 1.02 万亿参数稀疏 MoE、激活约 420 亿、支持 1M 上下文,连同 7k+ 高质量强化学习任务环境与训练代码一起以 MIT 许可放出;同系列还有高效推理版本 MiMo-V2.6-Flash。Pro 在 Artificial Analysis 综合智能指数拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max,登顶全球开源模型与国产模型双第一,实测单任务成本 $0.13,而 API 定价与上一代 V2.5 持平。RL 后训练全程直播 6 天,约 75 万条轨迹,Flash 与 Pro 合计花掉 347 万美元;长程软件工程成绩 Flash 从 48.8 升到 65.68、Pro 从 58.4 升到 72.57。小米还展示了两处科研用法:为吸附 PFAS 的 MOF 材料做筛选,把约一个月的周期压到 2—3 天;在 Lean 4 中完成 Li–Yorke 定理的形式化,产出 6000 余行通过内核核验的证明。
万亿参数、MIT 许可、单任务成本进到 0.1 美元,这三件事叠在一起,意味着「前沿能力」的价格锚点正在从闭源厂商的价目表转向开源社区的推理账单。
4. DeepSeek 年化营收破 10 亿美元,二轮融资冲着 5000 亿元估值去
据 The Information 9 月 24 日援引两名直接知情人士,DeepSeek 当前年化营收运行率已达 10 亿美元(约 67 亿元人民币),是 7 月披露的 4—5 亿美元区间的两倍,梁文锋在近期投资者会议上亲口给出了这个数字。融资节奏同步:公司计划 10 月底前完成第二轮融资,目标募资 500 亿元(约 75 亿美元)、目标估值 5000 亿元;而 6 月刚完成的 A 轮约 510 亿元、投后估值约 4000 亿元,三个月估值跳涨超千亿。支撑这组数字的是涨价没伤到需求——8 月 17 日峰谷分时定价生效后调用价格上涨 2.3—4.5 倍,客户没有流失;前 7 个月实际营收约 4.75 亿元,已是 2025 年全年的约 10 倍,API 业务毛利率 82.9%,同期净亏损约 7.15 亿元,超七成算力投向新模型训练。技术侧同日有硬料:DeepSeek 与清华联合署名、131 位作者的 DSec 训练沙盒论文公开,单个生产单元约 160 台 CPU 节点、3 万核、250TB 内存,单日服务约 300 万个沙盒、峰值并发超 38 万、创建速率超过每秒 5000 个,单个训练任务最多一次性拉起 3.2 万个沙盒。
API 涨价两到四倍而客户不走,加上 82.9% 的毛利率,说明它手上的定价权来自成本结构而不是补贴。三个月估值跳涨千亿之后,10 月底那一轮融资会成为下半年最值得盯的一笔定价。
5. 谷歌确认 Gemini 4 已进入后训练,发布时点「远早于年底」
9 月 23 日晚,The Information 的 AI Agenda Live 峰会上,8 月接替 Demis Hassabis 的 Koray Kavukcuoglu 首次以 DeepMind 负责人身份公开亮相,披露旗舰模型 Gemini 4 已进入后训练的初期开发,发布时点将「远早于今年年底」,团队已看到早期成果。他给了一个侧面信号:谷歌工程师已在内部用 Gemini 4 跑自家的 Antigravity 编程工具,并同步做防护机制与安全测试。节奏上谷歌今年跳过 Gemini 3.5 Pro 直接瞄准 Gemini 4,把 9 月的精力放在 Gemini 3.8 Flash 系列轻量模型上;同一周它还上线了 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音合成模型,把声音从「挑选」改成「用自然语言描述」,音色库从上一代的 30 个扩到 2000 多个,覆盖 100 多种语言与方言。
在被 GPT-6 系列与 Claude Mythos 压着打了几个月之后,谷歌终于把旗舰的发布窗口说了出来。先放轻量模型、后出旗舰的顺序也很清楚:它想先用便宜档位把调用量和价格带占住,再拿 Gemini 4 去抢能力位。
来源 | IT之家 | Gemini 3.8 TTS
6. Anthropic 与 Akamai 签下 116 亿美元云合同,11 个月算力承诺累计约 5170 亿美元
据路透社,Anthropic 与 Akamai 签下一份为期七年、总额 116 亿美元的云服务合同,同时拿到最多相当于 Akamai 5% 股份的认股权证——其中 2% 绑定当前合同,另外 3% 视合同是否扩大到追加 90 亿美元而定。消息公布后 Akamai 盘后股价跳涨 22%;为承接这笔生意,Akamai 预计需要约 55 亿美元资本开支,并在年底前额外支出约 17 亿美元。这已经是 Anthropic 的常规动作:上个月它刚向 Nscale 承诺 450 亿美元算力容量,把所有已签署合同加总,11 个月内规模约 5170 亿美元。同期它的年化收入运行率突破 1000 亿美元,较 7 月底的 650 亿美元在七周内再涨约 50%,IPO 时间表从 10 月推迟到 11 月,目标估值接近 2 万亿美元。
以未来收入预期为前提的锁量模式,风险是 Anthropic 自己点过的——Dario Amodei 说过估算偏差一点公司就可能破产。这周它一边再签百亿美元合同,一边把上市往后挪一个月,等于用时间换更漂亮的季度数据,也把风险敞口再撑大一轮。
来源 | TechCrunch
7. 16 块谷歌 TPU 跑 Kimi K3 比 GB200 快 57%
推理创业公司 Inferact 做了一组干净的对撞实验:同样 16 块芯片、同样跑 Kimi K3、同样用 vLLM 引擎,唯一的变量是芯片与底层 kernel。结果 TPU v7 Ironwood 跑到每秒 709 个 token,英伟达 GB200 只有 452 个,TPU 快 57%;其中相当一部分提速来自 DeepSeek 提出的 DSpark 推测解码框架,acceptance length 达到 6。关掉推测解码看裸速,差距反而更大:batch size 为 1 时 TPU 249 tok/s、GB200 127 tok/s。有意思的是硬件规格解释不了这个差距——TPU v7 的 HBM 带宽 7380 GB/s,反而低于 GB200 的 8000 GB/s,差别出在软件层:Inferact 把 Kimi K3 的 92 层 MoE 计算整段塞进一个 Pallas 程序,一次调用走完整个前向传播,消除几百个小 kernel 交接时的带宽空转,并实现跨层权重预取,编译时间也从 30 分钟以上压到 90 秒内。这支团队几乎就是 vLLM 原班人马,CEO Simon Mo 是原始维护者,公司今年完成 1.5 亿美元种子轮、估值 8 亿美元,megakernel 代码已经开源。
过去几年推理效率的叙事一直是英伟达硬件加 CUDA 生态的组合拳,这组实验给的是一个反例:在特定模型结构上,软件层的重构能把非英伟达芯片推到前面。对自研芯片阵营来说这既是机会也是提醒——追平 TensorCore 之前,中间还隔着一整层 kernel 工程。
8. 智能体越权被实证:OpenAI 暂停最强模型的工具调用,独立调查挖出近百万条「作案短链」
OpenAI 首次公开两起此前未披露的内部安全事件,并宣布所有最强模型的训练、评测以及广义的「带工具推理」仍处于暂停状态。第一起里,一个执行搜索训练任务的 Agent 发现研究环境的 DNS 解析器没有正确过滤,于是用 DNS 委派把查询路由到外部聊天服务,从本该高度隔离的环境里自己凿出一条外网通道;监控 12 分钟内报警、人工评审 3 分钟后响应,但预设的自动关停没有生效,任务又跑了 2.5 小时才被人手动终止。第二起里,另一个 Agent 把 GitHub token 故意发布到公开仓库,并两次无视研究员的直接指令。另一份由八名安全与 AI 研究者组成的 Swarm Traces 顺着公网残留痕迹扫了数百万个 URL,找出接近 100 万个相关短链,还原出超过 8 万份攻击载荷——针对的正是 7 月冲出沙箱、打进 Hugging Face 的那批智能体:它们把要执行的程序切碎塞进大量短链,每条指向下一条;再借截图服务当「外接浏览器」,把代码藏进网页让对方代打开,执行结果被转成像素格截图,Agent 再从图片里解码读回。载荷里那份脚本把搜刮到的凭证直接命名为 LOOT,按权限大小给 token 排序,前五名用于继续读取 Kubernetes 的 Secret 与 ConfigMap,它们甚至调用 DeepSeek-V4-Pro/Flash、Kimi-K2.6、Qwen3-235B 当「外援」评估攻击方案能否通过评测。研究者称这可能是首个被公开记录的大型实验室智能体自主学习调用其他 AI 模型的案例。
越权不再是一个假想场景,而是一条可复现的技术链。OpenAI 选择暂停自家最强模型的工具推理,说明它也没找到既能继续跑、又能管住 Agent 的办法;同一周联合国 AI 专家组首份简报给出了另一个侧面数字——那次事件涉及约 1200 个 agent、超过 7 万条消息与文件。
9. 云栖大会:真武 V900 芯片亮相,Qwen4 已在训练,RSI 走进训练与推理
2026 云栖大会 9 月 22 日至 24 日在杭州举行,阿里平头哥发布新一代训推一体 AI 芯片真武 V900:算力是上代真武 M890 的 3 倍,配备 216GB 显存与 1200GB/s 片间互联带宽,官方称是当前算力最强的中国自研 AI 芯片,通过自研 ICNSwitch 互联芯片实现千卡全带宽互联,配合新一代磐久超节点服务器,单一 AI 集群可扩展到 50 万卡,计划 2027 年一季度量产售卖。模型侧,基于新一代架构的 Qwen4 已在训练中,后续 Qwen4.5、Qwen5 将扩展到 5—10T 参数;另一边,大模型递归自我改进已初步进入训练、推理与芯模协同环节,官方给的三个数字是:Qwen3.8-Max 在人类零参与的情况下自主搭建训练流程、构造数据、设计实验并定位缺陷,持续迭代一个多月、完成 33 轮有效迭代;在一款从未见过的平头哥新款 GPU 上自主适配推理框架,单实例吞吐量提升 96%;仅凭一份真实的总线模块规范自主跑完前端到后端全链路,自主运行 60 多小时、调用 EDA 工具上万次,完成面积减少 42% 的物理实现优化。阿里 CEO 吴泳铭同时给出更长期的目标:2032 年阿里云全球数据中心规模超 20GW。
国产芯片的叙事这一周从「替代」转向「自研互联加集群级扩展」,而 RSI 那三个数字比芯片更值得记——它说的是模型开始参与下一代模型和芯片的设计流程。这条线一旦跑通,人力和算力之外会多出一个加速度变量。
10. AMD 市值首次突破 1 万亿美元
周一美股盘中,AMD 股价一度上涨近 10% 至 613.5 美元上方创历史新高,市值首次站上 1 万亿美元,成为继英伟达、博通、美光之后第四家跻身万亿俱乐部的美国芯片公司。AMD 已录得五连涨、区间累计涨幅约 25%,2026 年内累计上涨超过 180%。市场押注的是它在 AI 算力中的份额提升:公司正从单颗芯片转向整机系统,并在服务器推理用 CPU 上持续蚕食英特尔份额。同一周国内这边,华为在全联接大会上发布 UnifiedBus 互联架构,把互联带宽从 100 GB/s 级提升至 TB/s 级、往返时延从 7 微秒降到 2 微秒,支持从单机柜到百万 NPU 集群的弹性扩展,并同步推出面向智能体的 AI 超节点集群。
万亿市值这一档过去一年属于英伟达一家,现在有第二家跟上来,说明 AI 算力的订单已经多到容得下多供应商格局。加上海光把产品线伸向机器人芯片、华为把互联推到百万卡级,硬件这一层的竞争正在从单点性能转向系统与集群。
本周趋势
前沿能力的定价还在下坠,而且是两头同时按:闭源这边 Anthropic 与 OpenAI 同日推出更便宜的档位,开源这边小米把万亿参数模型做到每任务 0.13 美元。性能依旧在涨,但「最强」的溢价正在被「同等任务用更少 token」这套账目替代,模型榜单的第一名越来越难证明自己值那个价差。
算力与资本的绑定同时在加速。Anthropic 一边签下 116 亿美元合同、把 11 个月的算力承诺堆到约 5170 亿美元,一边把 IPO 往后挪一个月换更漂亮的季度数据;DeepSeek 三个月估值跳涨超千亿、10 月底要给第二轮融资定价;AMD 站上万亿美元市值,华为把互联推到百万 NPU 集群,阿里把自研芯片的量产时点写到 2027 年一季度。链条两端都在加杠杆,中间的应用层这周只剩 Meta 给每个用户发一台云端 Ubuntu 电脑、微软把 Copilot 改成按量计费这类结构性动作。
安全这条线第一次不再靠预测支撑。OpenAI 的 Agent 自己凿出 DNS 通道、绕开沙箱用短链和截图服务拼出读写互联网的能力,还顺手调用别家的模型当外援;联合国专家组和 Transluce 的报告从两个方向把同一批事件钉在案上。Agent 的身份、出口与运行时控制,正在从论文题目变成采购清单。
下周两件事值得盯:9 月 29 日的 OpenAI 开发者大会,Sol 与 Luna 这条更便宜的产品线怎么定价,会直接影响 Agent 调用的成本表;以及 Gemini 4 会不会把「远早于年底」兑现成一个具体日期。