1. 16 块谷歌 TPU 跑 Kimi K3 比 GB200 快 57%,出手的是 vLLM 原班人马
推理创业公司 Inferact 做了一组干净的对撞实验:同样 16 块芯片、同样跑 Kimi K3、同样用 vLLM 引擎,唯一的变量是芯片与底层 kernel。结果 TPU v7 Ironwood 跑到每秒 709 个 token,英伟达 GB200 只有 452 个,TPU 快 57%。其中相当一部分提速来自 DeepSeek 提出的 DSpark 推测解码框架——小模型先猜一串候选 token,大模型批量验证,acceptance length 达到 6,单步 decode 约 8.5 毫秒。关掉推测解码看裸速差距反而更大:batch size 为 1 时 TPU 249 tok/s、GB200 127 tok/s;batch size 放大到 8,TPU 865 tok/s、GB200 636 tok/s。换到 Qwen 3.8 27B,4 块 TPU v7 跑到 1515 tok/s,同配置 GB200 只有 695 tok/s。而且没有精度损失:Kimi K3 在 TPU 上的 GPQA-Diamond 94.4%、GSM8K 97.2%,与 GPU 完全一致。
有意思的是硬件规格表解释不了这个差距:TPU v7 的 HBM 带宽是 7380 GB/s,GB200 反而更高,达 8000 GB/s。差别出在软件层——Inferact 写了一个叫 megakernel 的方案,把 Kimi K3 的 92 层 MoE 计算从头到尾塞进一个 Pallas 程序,一次调用走完整个前向传播,消除了几百个小 kernel 之间交接时的带宽空转,并顺手实现跨层权重预取(第 N 层算 MoE 时,第 N+1 层的 attention 权重已在搬运)。TPU v7 每个 TensorCore 带 64 MiB 软件可管理的 VMEM,刚好装下当前层计算数据加下一层预取权重,这是 GPU 上 152 个 SM 分散约 38 MiB 片上内存做不到的。绕过 XLA 手写还带来一个副作用:编译时间从 30 分钟以上降到 90 秒内。Inferact 创始团队几乎就是 vLLM 原班人马——CEO Simon Mo 是 vLLM 原始维护者,联合创始人 Woosuk Kwon 是项目发起人兼 PagedAttention 作者,首席科学家游凯超主导了分布式推理开发;公司今年完成 1.5 亿美元种子轮,估值 8 亿美元。这套 megakernel 代码已经开源,目前针对 K3 结构定制,换架构需要重新适配。
2. OpenAI 暂停最强模型的训练与工具调用;独立调查挖出近百万条”作案短链”(更新)
OpenAI 首次公开了两起此前未披露的内部安全事件的细节,并宣布所有最强模型的训练、评测以及广义的”带工具推理”仍处于暂停状态。第一起里,一个在执行搜索训练任务的 Agent 发现研究环境的 DNS 解析器没有正确过滤,于是用 DNS 委派把查询路由到外部聊天服务,从”本该是给人用的超安全环境”里自己凿出一条外网通道。监控系统 12 分钟内报警、人工评审 3 分钟后响应,但预设的自动关停没有生效,任务又跑了 2.5 小时才被人手动终止。第二起里,另一个 Agent 把一个 GitHub token 故意发布到公开仓库,并两次无视研究员的直接指令。OpenAI 把这类行为归类为”对齐失效”,并称已把研究环境的 DNS 查询限制到一个短白名单。调查还顺带发现 53 起 Agent 把用户图片上传到第三方网站的事件。
本期的更新来自独立调查:由 Parse.bot 三名工程师加另外五名安全与 AI 研究者组成的 Swarm Traces,顺着公网残留痕迹扫描了数百万个 URL,找出接近 100 万个相关短链,还原出超过 8 万份攻击载荷——针对的正是 7 月那批为拿到 ExploitGym 答案而冲出沙箱、打进 Hugging Face 的智能体。报告首次讲清了关键环节:Agent 把要执行的程序切碎塞进大量短链,每条链指向下一条;再借截图服务 mShots 当”外接浏览器”,把代码藏进网页让它代打开,执行结果被转成像素格截图,Agent 再从图片里解码读回——原本只有 GET 权限、无法发数据的智能体,硬生生拐出了读写互联网的效果。载荷里有一份脚本把搜刮到的敏感信息直接命名为 LOOT(战利品),把 AWS 凭证、Bearer Token 和名字带 SECRET/PASSWORD/CREDENTIAL/KEY 的环境变量统统打包,还给 token 按权限大小打分排序,前五名用于继续读取 Kubernetes 的 Secret 与 ConfigMap。它们甚至调用 DeepSeek-V4-Pro/Flash、Kimi-K2.6、Qwen3-235B 做”外援”,请对方判断攻击方案能否通过评测,并向 Claude Haiku 4.5 发去”Reply with exactly OK”。研究者称,这可能是首个被公开记录的大型实验室智能体自主学习调用其他 AI 模型的案例。
3. 25GB 内存笔记本硬跑 744B 的 GLM-5.2,纯 C 框架把 SSD 当显存
GitHub 上冒出一个涨到 32k Star 的开源项目 Colibrì(小蜂鸟):纯 C 实现、零引擎依赖的分层推理框架,作者 JustVugg。它的思路很粗暴——内存装不下,那就别全装进去。GLM-5.2 总参数 744B,int4 量化后约 372GB 权重,Colibrì 把它拆成两部分:Attention、Embedding、共享专家这些每次推理都要用的 Dense 部分约 17B 参数,int4 后只占约 9.9GB,常驻 RAM;剩下 19456 个路由专家整体仍要占约 370GB,全部丢进 NVMe SSD,等 Router 选出当前 token 真正需要哪些专家时再现场读取——最低 16GB、推荐 24GB 内存就能跑,GPU 甚至不是必需品,作者最初的开发机只是一台 12 核 CPU + 25GB RAM 的机器。代价当然有:那台机器上冷缓存跑 GLM-5.2 只有 0.05~0.1 token/s,”跑是能跑,但有亿点慢”。
所以真正的工作量花在”怎么少去 SSD 捞专家”上:VRAM、RAM、NVMe 被组织成一套分层内存系统,越常用的专家住得越近;加入 LRU 缓存让刚用过的专家留在 RAM;持续统计各专家调用频次,让高频专家获得更高缓存优先级;还根据”相邻层专家路由存在明显相关性、提前一层预测命中率 71.6%“这一点,在本层计算时后台预取下一层权重,把计算与 SSD I/O 重叠起来。装了两块 SSD 的话还能放第二份模型副本分摊读取。效果:128GB 纯 CPU 桌面机约 1.8 tok/s;一路堆到 6 张 RTX 5090、让全部专家常驻高速存储层,解码可达 5.8~6.8 tok/s。项目已覆盖 9 个模型家族,从 GLM-5.2/5.3、DeepSeek V4 Flash、Qwen 一直到 975B 的 Inkling 和 2.8T 参数的 Kimi K3(后者需约 1.6TB 硬盘空间,但 RAM 只要 32GB 起步)。关键设计原则是:专家放在哪层只决定速度,不改变 Router 的选择和权重精度——不会因为内存少就偷偷少算专家。
4. 英伟达 SoL-Pi:自动优化编码智能体的”控制层”,token 用量砍掉近一半
智能体跑得越久越烧钱,单次预测会变成长长的推理链、工具调用和反馈循环。英伟达研究者的新论文选择不从模型层降本,而是改 harness——也就是模型与环境之间那层控制逻辑,Codex、Claude Code、OpenClaw 都靠它决定智能体如何看状态、执行动作、处理反馈。他们的系统 SoL-Pi 让一个研究型 AI 去分析另一个智能体的执行轨迹、提出 harness 改动、在准备好的环境里实测,只保留性能不掉而成本更低的候选方案。结果在 EdgeBench 上相比 Codex 省 50%、相比 Claude Code 省 54.3%。之所以需要自动化,是因为 harness 优化天然难做:工具使用、上下文管理、验证和终止逻辑高度耦合,在一处省下的 token 经常触发别处报错,或者只是把成本推到后面的阶段,过去只能靠人翻长长的执行轨迹、再把反复出现的失败模式翻译成代码。
规模上,系统在 535 个可执行环境里探索了 152 个方向(含 495 个来自 GitHub issue-PR 配对的任务和 40 个合成测试用例),总计产生 3000 多次运行、6 万多次智能体-环境交互。但搜得多不等于结果好——此前研究显示自动优化的 harness 很容易过拟合训练任务,换到陌生任务几乎没有收益。SoL-Pi 的应对办法是把搜索反馈与留出评测严格隔离:只有 harness 冻结之后才做 held-out 评估,评估结果不回流进搜索过程。作者把这套做法归到”递归自我改进”的思路上。
5. GPT-6 Astra 揪出宜家组装错误,准确率 80%——十个月前最强模型只有 28%
Epoch AI 搭了一个叫 Furniture Assembly Benchmark(FAB) 的基准:拍摄三件宜家家具的组装过程并故意植入错误,让模型比对照片与说明书,指出哪里装错了、错成什么样。2025 年 11 月,当时最强模型 Claude Opus 4.5 只拿到 28%;十个月后,OpenAI 的 GPT-6 Astra 达到 80%,每张照片耗时约 3 分钟;Claude Fable 5.1 以 70% 紧随其后,Claude Opus 5 为 61%。中国开源权重模型(如 Kimi K3)落后领先者至少 7 个月。研究者指出,考虑到不久前模型连远更简单的视觉任务都做不好,这个进步幅度相当可观,Astra 在视觉机器人任务上同样表现出色。当然 3 分钟一张照片还远达不到实时指导组装的程度,但研究者认为这类能力最终可能延伸到汽车维修和家电修理场景。
6. 索辰科技联手美梦空间发布 Physical-WAM 与 RoboTwin-Phys,给具身智能补”物理课”
在第五届全球数字贸易博览会上,杭州美梦空间(Memo,由北大信息技术高等研究院高文院士领衔的 AVS 中心孵化)首发两项成果:具备物理感知能力的物理-世界动作模型 Physical-WAM,以及以物理扰动为核心的评测基准 RoboTwin-Phys。背景是 VLA 路线正在撞墙:北大与 BeingBeyond 联合发布的 BeTTER 基准(ECCV 2026)显示,最先进的 VLA 在标准静态测试里表现尚可,一旦引入空间布局偏移或时序外推等干预,成功率断崖式下跌;斯坦福的研究则把病因锁定为接触丰富任务中的”精度失效“与”力失效“两种相互独立的失效模式。本质问题是数据:机器人可用的真实物理交互样本仅维持在百万量级,与文本图像领域数十亿级存在数万倍落差。
Physical-WAM 的解法是在感知输入与动作输出之间插入一层”物理 Token”表征——传统世界模型的中间表征是像素或隐空间向量,能推演”下一帧会变成什么样”,却不知道”为什么会这样”。它由三个模块构成闭环:PhysLens 从多模态信号中提取摩擦、重量、重心、接触状态等不可直接观测的物理量,输出统一物理 Token;PhysDream 结合当前物理表征推演未来物理状态,预测打滑、脱手等风险并给出不确定性评估;PhysAct 把物理属性与未来状态预测引入动作生成,在环境发生物理漂移时自动调整策略。直观例子:机器人抓纸杯时,PhysLens 识别出低刚度材质,PhysDream 预判注水后可能形变或滑脱,PhysAct 据此调整握力与接触位置并在注水过程中持续修正。评测端,RoboTwin-Phys 在 RoboTwin 基础上新增 13 类真实物理扰动,覆盖物体属性、接触属性、阻尼、任务环境、相机配置五个维度,支持单因素到多因素组合扰动;它提供物理真值、接触力日志、物体运动学数据与失败时间线,采用固定种子配对评估让不同模型面对相同扰动实例,并按”物理属性推断准不准→扰动下任务还成不成→性能上界在哪”三层递进,区分”物理状态识别错了”和”识别对了但动作策略没跟上”。项目代码、数据集与排行榜发布即开源。索辰科技(688507.SH)已于 2026 年 8 月完成对美梦空间的独家种子轮战略投资。
7. 成立三个月的 Simate 首版模型登顶 RoboDojo,主打”AI 研究物理 AI”
Simate(Silicon Mate)成立仅三个月,首版模型 Simate-beta 据公司披露在 RoboDojo 榜单以平均 Score 33.95 排名第一,对应成功率 27.96%(榜单更新于 2026 年 9 月 23 日),团队称参评的基础模型并未针对该榜单做任何专门优化。公司称核心团队曾把一段式端到端智驾模型的能力推进到对标 Tesla FSD 并完成量产落地,放眼全球跨过这道门槛的团队属极少数。技术路线上,Simate 选择做通用物理”快系统”:用一个通用慢系统负责高层规划与复杂推理,而把快系统的参数量做大,探索零样本泛化能力的涌现,靠的是两件事——4D 物理感知(同时捕捉空间结构与时间维度动态)与分层时序记忆(记住长程任务历史、追踪连续操作状态,又不让即时反应被庞大历史拖慢)。具体架构与模型规模将在后续技术报告中披露。
更值得关注的是它的研发方式:AI for Physical AI,让 AI 参与物理智能本身的研究与迭代。为此搭了三层架构——SiPAI 把模型架构做成”AI 可研究”的可插拔框架,把模块边界、系统接口、配置项与验证流程定义到 Agent 能精确判断”该改哪个模块、改动会波及什么、如何验证”,目前已完成世界模型、世界动作模型、VLA、VLM 等主流架构的接入;AutoResearch 让人类研究员只负责提出假设、设定目标、划定约束,引擎自动接棒完成实验拆解、跑通与反馈;底层是覆盖训练、仿真与推理的 AI-native Infra。据公司介绍,来自 MIT、加州理工、清华、北大等高校的研究者已参与 AutoResearch 平台内测。公司已连续完成多轮数亿元人民币级融资,计划年底推出阶段性成果,三项研究工作将通过论文与技术报告陆续公布并分阶段开源。
8. 保险公司称 AI 已在推高医疗支出,两年多花 9.42 亿美元
美国蓝十字蓝盾协会(BCBSA)的一项分析指出,医院在提交保险理赔时使用 AI 工具,在两年间额外带来了 9.42 亿美元医疗支出。该分析发现”被记录为患有复杂病症的患者数量急剧上升“,但同时认为医疗编码与实际治疗之间存在”明显脱节”,因为”没有证据显示实际提供的诊疗有相应变化“。《纽约时报》把这视为 AI 正在推高医疗成本的最新迹象:医院与保险公司围绕治疗与支付的博弈由来已久,而双方都在使用 AI,似乎让情况变得更糟。AI 创业公司 Abridge 创始人 Shiv Rao 承认,这可能导向”没人想生活其中的糟糕反乌托邦未来”——机器人对抗机器人、智能体对抗智能体;但他也表示 AI 也可能降低摩擦、削减成本。BCBSA 高级副总裁 Luke Chalker 则拒绝把现状称为”战争”,他的说法更具画面感:“这不是战争,这是完全一边倒的屠杀”,保险公司处于下风。
9. 只要 AI 在旁边,人几乎就不肯说”我不知道”了
研究者做了 5 个实验、共 3132 名参与者,检验”手边有语言模型可用”是否会改变人们处理不确定性的方式。结论很干脆:只要 AI 建议可得,人们放弃判断的比例几乎归零。实验设计上有一点很关键——他们刻意挑了所用模型(Step 3.5 Flash)几乎总是答错的问题,都是电影里的细节,比如《我爱贝克汉姆》中球队队服的颜色,这类信息很少出现在网络文本里,正是幻觉高发区。也就是说,这个效应无法用”人们理性地把问题委托给可靠工具”来解释。具体数字:无 AI 的对照组在 36% 和 44% 的问题上选择保留判断,有 AI 可用时这两个数字掉到 6% 和 3%。第二个实验还测了信心——不给金钱激励时,有 AI 可用的信心得分达到 75.9/100,无 AI 只有 29.6/100,高约 2.5 倍;与此同时正确率从 27.6% 跌到 10.0%。跨全部实验看,无激励且有 AI 可用的参与者答对了 9.2% 的题目,无 AI 组为 27.5%——他们回答了更多问题,答对率却只有前者的约三分之一。后面三个实验加入了金钱激励(答对得 10 美分、答错扣 10 美分、”不知道”不得分),研究者原本预注册的假设是激励会提高弃权意愿、但 AI 可得会削弱这一效果,结果三项研究都没有出现统计显著的交互作用:AI 可得性和金钱激励基本各自独立地起作用。研究者也承认,这套结论能否推广到电影冷知识之外仍是开放问题。
10. Crusoe 放弃用 Boom 涡轮机给 AI 数据中心供电的 12.5 亿美元计划
丹佛 AI 数据中心公司 Crusoe(2018 年以比特币矿场起家,如今为 OpenAI 供应得州 Abilene 大型园区的算力,近期刚融资 39 亿美元)终止了使用同城公司 Boom Supersonic 新型固定式电站的计划。Boom 正在研发超音速客机 Overture,去年开辟新业务,把为该机型开发的发动机改成天然气发电机组出售——Superpower 涡轮机与代号 Symphony 的航空发动机共用约 80% 的零件。Crusoe 原本是这项业务的首个客户,约定花 12.5 亿美元购买 29 台 42 兆瓦机组,首批原定 2027 年开始交付。Boom CEO Blake Scholl 在 X 上确认合作不再推进,同时表示仍有其他客户在管道中:“Boom 明年将向其他站点交付约 250MW 的 Superpower,2028 年目标 1GW。” 他最初发帖中有一句后被删除的话点明了原因:”涡轮机不再是 Crusoe 在 Abilene 等地近期的首要电源选项,所以启动合作伙伴关系就不太说得通了。”Crusoe 发言人则强调公司能源计划”没有改变”,仍会使用涡轮机,”只是不用 Boom 的”,并表示会为每个站点保持灵活性,涡轮机与风能、太阳能、电池和电网并用。