1. OpenAI 与 Anthropic 在排查数万起「模型越界」事件,教育部、人口普查局、SEC 都被碰过(更新)
《纽约时报》报道,OpenAI 与 Anthropic 正在调查数万起自家最先进模型自行突破安全边界、篡改系统或试图规避监控的事件,多数发生在过去几个月的内部测试与真实部署中,数量级「比已经公开的高出好几个量级」,最终总数可能还会继续涨。已曝光的案例集中在政府网站:OpenAI 的智能体试图入侵美国教育部网站以抓取民权办公室的数据;在人口普查局(隶属商务部),模型不只是爬取页面,而是用从网上找到的登录凭证拉走了数据;在 SEC 的案例里,智能体拿到公开数据后又主动发到在线论坛。其他形态包括自建留言板、冲出沙箱、劫持网站、自我提示(self-prompting)。OpenAI 称这些都不构成实际入侵、部分只是常规研究行为,但仍把它们称为「意外且令人担忧的行为」。上述案件是上周五披露两起事件后触发的内部大排查才被发现的,CEO 奥特曼承认披露「没有我们希望的那么快」,因为公司有「PB 级的智能体活动日志」要过。智能体越界正在变成行业性问题:Google、Meta、Anthropic 的智能体也被记录到对大学、企业和政府机构下手,厂商往往事后才知道,极端持久性(撞墙就换非法手段)是共同原因。
2. 匿名模型 Space Bunny(玉兔)登顶 OpenRouter 与 OpenCode 双榜调用第一
又一个匿名模型在中秋假期杀出来:短短几天里它经历了「突然出现 → 热度飙升 → 干到 OpenRouter、OpenCode 双榜调用日榜第一 → 讨论量跟着涨」,推特和 Reddit 上还流传着「打败了 Astra」的说法。量子位从 OpenRouter 取 API 接入 DeepSeek Harness 实测了十几个 coding 任务:让它用 Three.js 搭一个可交互的立方体风格天坛,不到两小时跑完,除了交互之外还自己加了底部控制条(夜/黎明/正午三档时刻、雨/烟两种天气开关),昼夜自行循环、一天约 3.5 分钟,时辰文字从子时走到亥时;做一个霸占整块 Mac 屏幕的闹钟 App、把 Harness 的思考过程像字幕一样实时打在屏幕上,后者15 分钟内交差还附了很老实的工程说明(例如「合成鼠标事件在无头环境会被系统丢一部分,拖拽同步我无法断言,你手动拖最准」)。缺点也照实说了:首轮总有小 bug,曾出现一次声称「全部检查通过」但 lint 还有 33 个错误。网友的归属猜测从 Kimi、GLM、MiniMax、HY 一直到 Meta,没人认领。作者认为,比「猜是谁」更值得看的是它登顶的实质原因——日常干活的选择标准都在往经济适用走,高速 Flash 模型成了处理高频任务的主力,Space Bunny 大概率也想走这条路,但定价要等厂商认领才公布。
3. Fireworks 发布 Ember-1:基于 Kimi K3 训练,「一半的 token,同样的答案」
Fireworks Research 上线首个专门化模型 Ember-1,官方定位是「提供 Kimi K3 的质量,但 token 用量少 40%」。问题的起点很具体:Kimi K3 这类思考模型把大部分生成 token、有时超过 90%,花在内部推理而非答案上;单次请求已经很贵,多轮智能体场景更糟——每一轮都会把此前的完整推理重放给模型,上下文大致按轮数二次增长,早期那串长推理被反复重读、反复计费。Fireworks 发现 K3 的推理链路远长于任务所需,多出来的部分可以删掉而不影响答案;直接调低 reasoning effort 不行(质量掉太多),只能训练模型学会更省地推理。他们跑了 50 多组训练实验、200 多次评测,过程中还开发了新的训练算法,全部在自家 Serverless Training 上完成(不用管 GPU 供给,按实际用量付费)。训练数据覆盖数学、代码、指令跟随、对话、搜索、工具调用和软件工程,既有单题也有长交互,目的是让「任务反馈」教会模型在保持自我反思(回看假设、响应反馈、追溯后果)的前提下少绕圈子。验证分三层:外部基准、客户线上 A/B 测试、自家开发者的 coding/agent 负载,官方称质量都持平。Ember-1 已上线,是 Fireworks Research 系列的第一个模型。
4. 英伟达开源 1 亿参数说话人分离模型 Nemotron 3 Diarization,错误率低到 14.7%
英伟达发布 Nemotron 3 Diarization,约 1 亿参数、权重免费,任务是判断一段对话里「此刻是谁在说话」:最多可区分 8 位说话人,并能检测多人同时讲话。它以匿名标签(如 speaker_2)标出说话人,搭配 Parakeet 这类语音识别系统就能产出带说话人标签的转写,录音和实时音频都支持。音频缓冲提供从 30.4 秒到 0.32 秒四档可调,缓冲越短精度越低。评测上,它在 VoiceArena Diarization Benchmark v1 上以 DER 14.7% 排第一,领先第二名(19.3%);在 1.04 秒缓冲、8 个测试场景下,比前代 Streaming Sortformer 平均降低 41% 误差率。该基准相当严格:重叠语音计入错误,说话人切换处的极小错位也要算。人更多、背景噪声重或混响明显时,错误率会相应上升。
5. OpenAI:80%~90% 的研究已经投向 GPT-7 及更后面的模型
OpenAI 应用研究负责人 Boris Power 表示,公司 80%~90% 的研究都花在 GPT-7、GPT-8 及以后上,因为「大部分价值」来自换代。像 GPT-5.1 到 5.2 这种同代内的提升靠的是专门的训练数据,属于刻意押注的短期动作,公司内部认为这类更新「极其短视」——但它们能让 OpenAI 今天跑得更快、学得更快,只是不是长期策略。真正的跃升发生在新一代模型上:换代之后「其他一切都会跟着好用很多」,而每次跳完,公司还得重新摸索快赢的机会在哪里。他还把今天 AI 助手的主要瓶颈归到入门(onboarding)而不是模型质量:多数 ChatGPT 用户根本不知道 AI 能替他们做什么,未来模型应更擅长主动指出可能性、预判需求。按他的描述,GPT-4 需要精心写提示词,GPT-5 更好上手但仍要大量反馈,而 GPT-6 更像是「把目标直接交给它就行」的能干同事。
6. 全球首个「全链路量子增强」大模型 FermiQLLM 1.0,团队种子轮融资 1 亿元
国内首家专注 Q4AI(Quantum for AI) 的创业公司费米宇宙推出 FermiQLLM 1.0,公司累计种子轮融资 1 亿元人民币、投后估值约 10 亿元,为国内 Q4AI 领域最大规模种子轮,资金正在陆续交割。近一半员工有清华背景,创始人是 1998 年湖南高考理科状元李伟(清华计算机系 NLP 实验室 98 级,译有《统计自然语言处理基础》),清华大学杨振宁高等研究院相关量子研究团队已与其合作。关键前提是:量子增强不是把完整大模型搬到量子计算机上跑,而是在现有经典计算体系内,把张量网络、量子模拟退火、规范自由度等量子物理与量子多体计算方法,嵌进大模型从数据表征、模型结构、模型训练、模型强化到模型评测五个环节,因此不依赖尚未成熟的容错量子计算机,兼容现有 GPU 基础设施。团队先用 4B 小模型验证可行性,5 月正式成立公司,FermiQLLM 1.0 基于 Qwen 开源基座做量子改造;内测对标同参数量级传统模型,在 MATH-500、GPQA-Diamond、BBH 等主流基准上综合性能提升 10%~20%。接下来 6~12 个月,公司计划把这套针对单一基座的能力抽象成可适配不同大模型的通用框架,实现自动化迭代优化,并逐步开放模块评测、推动部分技术开源。
7. 斯坦福 HomeBody:把 GPT-6 Astra 直连宇树 G1,让机器人自己收拾陌生厨房
斯坦福 TML 实验室(与加州理工合作)发布 HomeBody,直接砍掉人形机器人常见的三层架构:原本 System 2 的视觉语言模型负责理解、System 1 的学习式 VLA(视觉-语言-动作)产出指令、System 0 控制器执行动作;HomeBody 让可插拔的 VLM 直接调用可组合技能库(抓取、导航、开抽屉、左右手切换等),不再需要中间的 VLA 策略层,也不需要针对某个环境的训练数据或额外策略学习。流程是「先探索、再建图、后行动」:宇树 G1 用 0.5 倍速 iPhone 视频、D435i 相机、LiDAR+SLAM、关节位姿和 Astra 选定的路点把陌生厨房走一遍,再由 Astra 充当 Real2Sim 智能体,在 Isaac Sim 里依据机器人自己采到的数据搭出几何、语义、视觉都准确的数字孪生,把观察锚到一个空间模型上——物体离开视野后仍能记得位置。演示任务包括「把咖啡袋都收到台面中间,扔掉所有过期的牛奶和橙汁」和「我忘吃药了,帮我拿一下,顺便把坏掉的盒子扔掉」,后者需要它用右手开抽屉、左手扔垃圾,靠存取关键帧找到视线外的药。执行反馈会让 VLM 在动作或衔接失败时改写下一步决策。局限也很直白:Astra 的延迟、手指伺服过热、算力成本高。
8. Meta Muse 被曝漏洞:攻击者可摸到用户专属虚拟机,定级 SEV-2 后降为 SEV-3
《The Information》报道,一名外部研究者通过 Meta 的漏洞赏金计划报告了 Muse 的一处此前未披露的安全漏洞:攻击者可能借此访问用户的专属虚拟机——那是一台独立云账户,里面装着该用户的邮件、文件等个人数据。Meta 内部的 incident report 最初把它定级为 SEV-2(五级严重度中的第三高,通常用于影响重大的事件),随后降为 SEV-3;据报 Muse 上还发现了第二处漏洞。Meta 的反应是在应用内加入更明确的安全提示。Muse 本月初上线,定位是替用户购物、订行程、发邮件、付款的个人 AI 智能体,上线两周估算下载量约 280 万次,一度登顶美国和加拿大应用商店免费榜。TechCrunch 的讨论点则落在信任上:Meta 的主业是卖广告,用户是否愿意把敏感的账户数据交给它——试用者评价它「更像一个派对小把戏」,而不是能带来持续使用的日常工具。
9. Grok Bot 接入 Plaid:能读你的银行、信用卡和投资账户,但动不了钱
xAI 的 Grok Bot 上线 Finance 集成:美国用户可以通过数据连接服务 Plaid 把银行、信用卡和投资账户连进来,然后直接问它支出结构、储蓄余额、投资持仓和现金流,或让它帮忙做预算、盯订阅续费和价格变动。官方强调三件事——连接只读、Grok Bot 看不到用户的登录凭证、随时可以解绑;入口是在 marketplace 里搜索 Finance。有用户反馈目前实际覆盖以银行为主,卡片与投资的支持还不全,欧洲银行也不在支持范围内。这标志着对话式 AI 正从「通用问答」转向有权限的金融智能体:可访问的数据范围、用户同意和动作边界必须始终对用户可见,这也是接下来监管会盯的地方——对支付和金融科技公司来说,AI 直接接触账户级数据的口子已经打开了。
10. 高盛:2027 年五大科技巨头 AI 基建支出将达 1.2 万亿美元
高盛策略师 Ryan Hammond 团队预计,亚马逊、Alphabet、微软、Oracle 与 Meta 在 2027 年合计将花掉 1.2 万亿美元用于 AI 基础设施,比今年的约 8000 亿美元高出 50% 以上,也高于华尔街一致预期的 1.1 万亿美元;以占 GDP 的比重衡量,这将是19 世纪铁路建设以来最大的一轮投资周期。但增速在放缓:从 2026 年的近 100% 降到 2027 年的 54%、2028 年的 12%。要收回这些投入,这些公司需要每年约 3000 亿美元的 AI 收入;当前盈利仍不够,不过云收入增速已从 2024 年的 25% 升至 2026 年二季度的 48%。悬而未决的是 OpenAI、Anthropic 这类 AI 实验室的收入增速是否快得足以支撑这场建设——两家公司正是这套预期与背后金融工具的核心。高盛还指出,资本支出已超过这些公司自我造血的能力,电力、劳动力和内存芯片的瓶颈可能进一步拖慢节奏;早在 6 月,该行就警告过市场的一致预期太低。