1. 前沿模型扎堆上新:Gemini 3.7 Flash、Grok 4.6、DeepSeek V4 Pro 齐闯「Baba Is You」新基准
8 月中旬的模型发布潮仍在发酵。独立开发者用益智游戏「Baba Is You」搭建的新基准 Baba Is Bench 复测显示:Gemini 3.7 Flash 通关全部 8 个关卡,且单次成本仅 5.38 美元,比上代 Gemini 3.6 Flash 便宜 20 倍以上;Grok 4.6 只差一关未解,成本约为 Grok 4.5 的三分之一;DeepSeek V4 Pro 0813 解出 7/8 关(上代仅 3/8),成本还降了 4 倍,单次仅 2.94 美元。开源阵营中 GLM-5.3 与 5.2 表现持平,Qwen3.8 Max 较 3.7 有明显进步,而 Qwen3.8 27B 因「过度思考」得分反而低于上代——测试者发现它倾向于一次性求解而不去棋盘上试错。推理模型「想太多」正在成为普遍问题。
2. DeepSeek 多模态模型「开天眼」:V4-Flash-Vision-Exp 上线,剑指 Agent 时代
DeepSeek 推出面向 Agent 场景的多模态模型 deepseek-v4-flash-vision-exp,已上线 API 平台。该模型在保持 V4-Flash 文本、推理与 Agent 能力不变的基础上新增视觉理解,官方称其在多模态 Agent 基准上表现接近 Opus 4.8 等高端模型。同步推出的 Files API 支持图片一次上传、多次引用(单文件最大 64 MiB,单用户 25 GiB),解决多轮 Agent 任务重复传图的痛点。定价延续 V4-Flash 体系:每张图片最高折算 384 tokens,百万 tokens 输入 1.5-3 元、输出 4.5-9 元,走低价路线。DeepSeek Harness 0.1.1 也已原生支持该模型,开发者可把「看图」能力直接接入 Agent 工作流。
3. 英伟达 AI 服务器明年涨价 15% 以上,1GW 数据中心成本或增 50 亿美元
内存涨价潮传导到了英伟达服务器。据彭博社与 The Information 报道,部分大客户已收到通知:明年初交付的 AI 服务器价格将上调 15% 以上,其中 GB300 与下一代 Vera Rubin 200 部分系统预计涨价约 17%。按现价模型估算,一座 1GW 规模的 AI 数据中心仅此一轮加价就要多花至少 50 亿美元;一套 72-GPU Vera Rubin 机架价格可能从约 700 万美元涨到 800 万美元。背后是内存行情飙升:TrendForce 预计 Q2 传统 DRAM 合约价环比涨 58%-63%、NAND 涨 70%-75%,且服务器 DRAM 价格可能逐季上涨到 2027 下半年。英伟达甚至开始重新评估 Rubin Ultra 的 HBM 配置方案。
4. 神秘「隐身模型」Ox Alpha 上线 OpenRouter,全网猜身份:智谱 GLM 还是微软 MAI?
一款名为 Ox Alpha 的匿名模型上周四上线 OpenRouter,定位「面向编程、长时 Agent 工作与生产负载的推理模型」,引发全网竞猜幕后团队。Stripe CEO Patrick Collison(Stripe 正在收购 OpenRouter)在 X 上评价它「非常惊艳」。OpenRouter 官方称其为「隐身模型」,由匿名第三方开发运营。最初的猜测集中在智谱(Z.ai)的 GLM 系列,但随着讨论发酵,风向又转向微软未发布的 MAI 模型——Reddit 上「不可能是中国团队」与「高度确信是中国团队」的帖子各执一词。继此前的「牛来」之后,匿名模型已成为社区最热门的推理游戏。
5. 全球首次:人形机器人全自主网球对打登上央视直播,「AstraTennis 时刻」来了
8 月 22 日世界人形机器人运动会开幕,银河通用机器人与网坛顶尖运动员同场竞技,并由央视面向全球直播——这是全球首次通过大型赛事直播完整呈现人形机器人全自主网球对打。机器人在真实赛场上自主感知、决策、行动:连续多拍对打、双打与人类队友实时协作、高速攻防中极限救球,摔倒后还能自主站起继续比赛。支撑它的是银河通用自研的具身智能大模型「银河星脑」AstraBrain,据称全球首次将大脑、小脑、神经控制集于一模,并能从不完美的人类数据中学习。媒体称之为继 AlphaGo 之后、属于具身智能的「AstraTennis 时刻」。
6. DeepMind 校友创业公司 Inherent:27B 小模型「复现论文」胜过 Opus 4.8 与 GPT-5.5
伦敦 AI 创业公司 Inherent 公布成果:其 AI 智能体 Faraday 在「独立复现论文实验结果」任务上胜过 Anthropic Claude Opus 4.8 和 OpenAI GPT-5.5——而它运行的底座只是 27B 参数的 Qwen 3.6。Inherent 由 DeepMind 校友创办,刚以 5000 万美元种子轮走出隐身。创始人称重点不在「赢」,而在方法:团队用强化学习训练模型具备「科研品味」,即判断哪些实验值得做、如何设计实验;Faraday 甚至调用 OpenAI 的 GPT-5.5 Codex 写代码,像人类科学家使用现成工具一样。这家 12 人团队押注的是更远的目标——让 AI 自主发现新科学知识。
7. FreeToken 开源推理引擎:单张工作站显卡跑起 753B 的 GLM-5.2
UC Berkeley 与 UT Austin 团队开源了边缘推理引擎 FreeToken,主打把个人电脑变成「弹性推理平台」:35B 模型可在 8GB 显存笔记本上达到交互速度,284B 模型跑在游戏台式机上,753B 的 GLM-5.2 单张工作站显卡即可运行。原理是利用 MoE 稀疏性——DeepSeek-V4-Flash 的 284B 参数每 token 只激活 13B,关键是把专家权重在显存与内存之间动态调度,避开 llama.cpp 等引擎「prefill 阶段流式搬运整个专家池」的低效路径。项目 Apache-2.0 开源,提供一键桌面应用,可把 Claude Code、Codex 等接到本地模型上。对 token 账单超过显卡成本的个人开发者,本地推理正变得现实。
8. AI 正在成为 AI 最大的客户:OpenRouter 上 Agent 用量暴涨 14 倍
OpenRouter 分析师 Peter Walker 观察到一个拐点:2026 年 2 月 6 日可能是人类 token 消耗量最后一次超过 AI Agent。此后 Agent 的 token 用量从 0.51 万亿增长到 7.3 万亿,翻了约 14 倍,而人类用量同期仅增长 2.8 倍。Agent 们越来越长时间自主工作,还会中途再拉起新的 AI 进程。不过实际账单没那么夸张——近 70% 的 Agent 用量来自缓存命中的提示词,按低得多的缓存价格计费。分析师提醒,推理模型「想得越长越好」的趋势还在加剧 token 膨胀,OpenRouter 因偏向开源模型可能放大了这一效应,但各大实验室内部趋势大概率类似。
9. Anthropic 新旗舰叫好不叫座:Fable 5 只占企业支出 8%,Opus 4.8 仍是主力
FT 援引知情人士数据:Anthropic 7 月年化收入已达 650 亿美元(5 月为 470 亿),并有 6000 家客户年消费超 10 万美元,Q3 预计按同样口径实现盈利。但支付数据平台 Ramp 的 AI 指数显示,7 月企业模型支出中 Opus 4.8 占 28%,7 月底才发布的新旗舰 Fable 5 仅占 8%——「最强模型」并未立刻转化为收入。作为对比,OpenAI 年化收入已超 400 亿美元,7 月发布的 GPT-5.6 让公司季度至今收入环比跳增 35%。行业逻辑正在变化:更便宜、够用的模型正在分流旗舰模型的用户。
10. 法律 AI 独角兽 Harvey 发布自训模型 Tenet:基于 Kimi K3,长程法律任务完成数近翻倍
法律 AI 公司 Harvey 发布首个自训模型 Harvey Tenet(研究预览版):以国产模型 Kimi K3 为底座,与 Fireworks 合作通过异步强化学习,针对长程法律 Agent 任务后训练,语料由合成数据、公开法律数据与专家数据混合而成,官方明确未使用客户数据。结果显示:相比底座 K3,Tenet 在 Harvey 自建的 Legal Agent Benchmark 上完成的任务数量接近翻倍,Contracts 子集提升 20%,全通过率分别提高 9 和 2 个百分点,并在 Contracts 子集上达到 SOTA。用开源底座 + 领域后训练做垂直 Agent 模型,正在成为专业软件公司的新路线。