1. 谷歌 Gemini 4 Pro 匿名偷跑竞技场,13 项基准全面压制竞品
2026 年 9 月 18 日,一款以 “gemini-3.8-flash” 为匿名马甲的模型悄然登上 LMSYS Chatbot Arena,开发者实测后几乎一致判断:这就是谷歌 DeepMind 的下一代旗舰 Gemini 4 Pro。泄露的基准对比图显示,它在 13 项测试中对 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5 形成全面压制——Agent 编码 DeepSWE v1.1 拿下 88.7%(Astra 为 86.9%),真实知识工作 GDPval-AA v2 达到 2064 Elo,是唯一突破 2000 分的模型;终端编码 Terminal-bench 2.1 为 95.3%,计算机使用 OSWorld-2.0 为 86.8%。
价格是更狠的一刀:每百万 Token 输入 2.25 美元、输出 11.25 美元,约为 Astra(12/60 美元)的五分之一。有研究员探查后端发现,它支持 1000 万输入 Token、25.6 万输出上限、永久跨会话记忆,且无需 API 即可联网。业内普遍把这次匿名亮相视为正式发布前的“活体检查点”,预计发布窗口在 2026 年 10 月至年底之间。
2. 阿里发布 Qwen3.8-Omni-Flash,音频输入 API 价格砍到上一代的 2%
阿里通义千问 9 月 18 日发布原生全模态模型 Qwen3.8-Omni-Flash,原生支持文本、图像、音频、视频四种输入与百万级上下文,并同步上线超低延迟版本 Qwen3.8-Omni-Flash-Realtime——约 981 毫秒即可响应 20 秒音频输入。
性能上,较上一代 Qwen3.5-omni-flash 平均分提升 25%,Agent 能力多项分数翻倍;多人重叠会议场景下语音识别错误率从 88% 降至 3%,并原生支持最长 1 小时连续音视频输入。价格是最直接的杀招:音频输入 API 从每百万 token 18 元降至 0.8 元,降幅达 98%。阿里同时推出 Qwen-Live-Harness 悬浮球交互框架与 Qwen-MM-Plugins 插件库,让 Claude Code、Gemini CLI、Codex 等第三方智能体工具也能接入 Omni 多模态能力。
3. Anthropic 公布 RSI 实测:Claude 已主导 26% 的 AI 研发工作
Anthropic 本周五发布博客,首次给出 AI 研发自动化的实测量化:截至今年 8 月,Claude 已在公司内部 AI 研发工作中主导 26%,超过 90% 的研发至少进入“AI 协作”阶段。而在今年 2 月,进入“AI 主导”(AL4)层级的比例还不到 1%。
支撑这个数字的是规模:Anthropic 内部 Agent 平台上任意时刻约有 3 万个 AI Agent 在从事研究与工程工作,仅今年 8 月就产生超过 10 亿次决策,其中约 0.002% 被在线监控拦下;离线监控每周还会标记约 10 万条记录,最高优先级的约 50 条升级人工审查。Anthropic 也承认,AL3 与 AL4 的边界带有主观性,需要第三方统一方法验证。若趋势延续,其给出的推演是:到 2026 年底,“AI 主导”比例将接近 80%。
4. 智谱唐杰曝 RSI 进展:Infra Agent 把 10 万卡集群吞吐提升到 3 倍
智谱创始人唐杰 9 月 17 日在 X 发布长文,首次公开智谱在递归自我改进(RSI)上的成果:在超过 10 万卡的国产芯片集群上,GLM-5.3 驱动的 Infra Agent 参与搭建了 GLM-5.3-Flash 的生产级推理服务,不到两周完成从模型适配到生产可用,端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 的相当水平。
这套技术栈融合了节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合精度缓存量化以及 EPD 分离式架构。唐杰的关键论点是“稠密反馈”:让 Agent 拿到足够局部、低成本、可客观验证的信号,而不只是“吞吐下降了”这类端到端结果。他的判断是——距离完全递归自我改进还很远,但“模型优化系统、系统服务于模型”的最小闭环已经出现。
5. ChatGPT 共同发明人推出 Jev:不聊天、只做决策的“机器原生”模型
OpenAI 前研究员、ChatGPT 与 RLHF 共同发明人 Diogo Almeida 创办的 TypeSafe AI 结束两年隐身,推出模型 Jev——一种完全舍弃自然语言输出、改用结构化概率分布的新型 Transformer,公司已完成 4000 万美元种子轮融资,估值约 2 亿美元。
Jev 用并行采样替代传统自回归逐字生成,官方端到端响应时间 70–500 毫秒,比前沿模型快 40–200 倍;输入定价 0.042 美元/百万 token,输出 token 免费,同等任务较 Fable 5.1 便宜约 238 倍。演示中 Jev 玩 Doom 的响应为 0.114 秒,而 GPT-5.6 Terra 需 8.566 秒。它的定位不是“陪人聊天”,而是 Agent 工作流中的护栏、路由分类器与决策验证器,官方称其做到“结构层零幻觉”。
6. MiniMax 以 MIT 协议开源 Code CLI,任务通过率 76.7%
9 月 18 日晚间,MiniMax 将编码 Agent 核心组件 MiniMax Code CLI v0.4.12 开源,采用 MIT 协议。在基于 FrontierHarness Eval 的评测中,它取得 76.7% 的任务通过率,成功任务耗时中位数 4 分 33 秒,两项指标均优于官方列出的公开基线。
工具提供交互式 TUI(mcode [prompt])、Headless(mcode exec)与 ACP 接入三种入口,兼容 Node.js 22.19+,也可使用 MiniMax 账户登录或自带模型。代码已在 GitHub(MiniMax-AI/minimax-code)发布,支持 macOS/Linux/WSL 与 Windows 一键安装。官方明确表示,开源的目的之一是让社区审视工具调用与权限处理机制,降低企业部署时的安全审计门槛。
7. 前 OpenAI 副总裁用 1300 张 H200,在真实物理任务上击败 GPT-6 Astra
由前 OpenAI 研究副总裁 Liam Fedus 联合创立的 Periodic Labs 发布材料科学模型 Neon。在 X 射线衍射(XRD)分析基准 FrontierXRD 的 134 个复杂问题上,Neon 把成功率从基线 2.7% 拉到 55.3%,超过动用 10 万+ Grace Blackwell 的 GPT-6 Astra,在同任务上同时压制 Claude Fable 5.1。
Neon 是万亿参数模型,基于 Kimi K2.6 从开放权重出发继续训练,最终训练峰值仅需 1300 张 H200,训练数据来自自家高通量实验室的真实实验结果——这些模型如今已在实验室里分析实验,用于搜索更好的超导体与磁体。在“互联网语料即将耗尽”的背景下,这条路线给出了另一种答案:与其继续堆算力,不如自建实验室生产高质量的物理数据。
8. 阿里达摩院通用医疗影像模型登《Science》正刊,达影像科专家水平
阿里达摩院联合浙大一院等机构研发的通用医疗影像模型 DAMO RADAR 登上《Science》正刊并开源。该模型聚焦腹部增强 CT,在涵盖 18 个解剖结构、146 种临床相关影像学表现的近 4 万次系统评估中,平均 AUC 达到 0.913,首次达到影像科专家水平。
这是通用医疗影像模型首次以正刊形式进入国际顶刊视野,也被视为中国团队在“AI + 医学影像”方向上从单病种模型走向通用基础模型的一个标志性节点——模型与数据管线一同开源,意味着后续研究可以直接在其上继续推进。
9. 加州州长签署行政令,推进 AI“紧急关停”机制
加州州长 Gavin Newsom 于 9 月 18 日签署行政令,加速落实此前签署的两项 AI 法律,并推进包括要求 AI 公司为最先进模型开发 “kill switch”(紧急关停) 在内的方案:成立专家组评估可行性、给出建议,同时建立对 AI 公司的独立监督与安全审查。
Newsom 在随后的声明中直接批评联邦层面行动迟缓,称“特朗普和国会在方向盘上睡着了”,并表示必须由州一级先行保护公众。此举让加州成为美国讨论前沿模型强制关停权的第一个州,也让“AI 安全”从自愿承诺进一步走向可强制执行的监管。
10. CNN:美军 AI 报告的幻觉,险些引发对华冲突
CNN 9 月 18 日独家披露:今年春季美伊冲突期间,美国特别作战司令部太平洋总部一名分析师用聊天机器人分析船舶舱单,错误地判定一艘位于中东的中国船只正在运输核武项目组件。这份以标准军方情报报告格式分发、并被军政官员普遍采信的结论“完全错误”,却已触发实战级响应准备——武装人员待命登船、军机升空,直到执行前的最后一刻被高层复查发现。
消息人士称此事件“几乎引发一场战争”。背景是美国防部长 Hegseth 要求把 AI 工具部署到 300 万军政人员的“人工智能加速战略”,但各部门使用不同工具、不同安全标准,缺乏统一核验规范。一名熟悉内情的前高级官员的形容是:内部工具“大多是商业产品的化妆复制品”。这是首次有公开证据显示,一线情报产品中的 AI 幻觉可以推进到接近开火的程度。