1. OpenAI DevDay 2026:GPT-6.1 Sol 以 1/5 价格逼近 Astra,新增超快档与 500 美元档
在当地时间 9 月 29 日的 OpenAI DevDay 2026 上,OpenAI 一口气发布 20 多项更新,核心是 GPT-6.1 Sol——距上一代 GPT-6 Sol 只隔一周。官方称它以约五分之一的成本提供接近旗舰 Astra 的智能(API 模型 ID 为 gpt-6.1-sol):在长周期软件工程基准 DeepSWE v1.1 上追平 GPT-6 Astra,且成本只有其 1/5,比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点;中等推理档在 AutomationBench 上比 Opus 5.5 高 2.2 个百分点、成本约为其三分之一。规格为 105 万 token 上下文、单次最长输出 12.8 万 token,支持 low 到 maximum 的推理档位与网页搜索、文件搜索、代码解释器、托管 shell、computer use、MCP 等工具;定价每百万输入 2 美元、输出 10 美元,缓存输入 0.10 美元(比标准输入便宜 95%)。今日起在 ChatGPT Work 与 Codex 中向 Plus、Pro、Business、Enterprise、Edu 开放,暂未进入普通 Chat。
同期推出的高速档 Ultrafast 最高比标准档快 8 倍(约 300 token/秒),价格为其 6 倍,目前仅随 Astra 提供;订阅重做为 Pro 100 / Pro 200 / Pro 500 三档,500 美元档独享 Ultrafast。值得对照的是,OpenAI 前一天确认搁置原定 10 月发布的 GPT-6.1 Astra,据《纽约时报》报道其内部测试未通过安全标准(是否遵守授权范围、能否如实说明自己的动作)——Sol 的降价补位正发生在这条主线之下。
2. OpenAI 推出常驻智能体 Dots:自带云电脑,7×24 主动干活
Dots 是 OpenAI 面向消费者的最大赌注:运行在 GPT-6 Astra 上的常驻(always-on)智能体。每个 dot 拥有自己的云电脑和浏览器,通过插件生态接入 4000 多个应用,可在 ChatGPT、Slack、Microsoft Teams 中对话(短信”即将上线”),跨渠道保持上下文,并同时推进多个项目而无需用户逐步指挥,OpenAI 称它是”你的延伸”。用户不在场时 dot 会做主动研究,但只被允许使用只读工具:不能发消息、改内容或操作电脑与浏览器;Custom Rules 可逐项指定哪些动作自主执行、哪些需批准、哪些禁止,可能影响账户或泄露信息的操作还要过一遍自动审查。它可以盯客户反馈、定位复现问题、跑修复并提交 PR 供人审阅。dot 的云环境默认与用户电脑隔离,除非显式连接;在支持的网站上它还能调用已保存的密码而不把密码直接暴露给模型。首发面向 Pro 与 Business Premium(企业、教育、医疗机构需管理员开启),并已在内部试点持有独立身份、凭据和系统权限的 specialist dot(采购、发票、客服、合同等),与微软 Agent 365 的治理与安全控制对接。竞品对位是 Meta 的 Muse。
3. DevDay 其他重点:ChatGPT Space、Decisions API、Codex 上云与安全云
除了模型和 agent,DevDay 还放出几件影响团队协作与开发流程的东西。ChatGPT Space 是持久化工作区,让团队、ChatGPT 和 dots 共享信息、在同一项目上协作,被形容为”Slack + Notion + Google Drive,且处处嵌着 agent”;配套的 Pages 是给人机共写的文档,可写作、生成图表、可视化信息。面向企业,新的 Decisions API 允许公司把”固定若干可能结果”的窄决策交给 AI 实时判断(如批准或拒绝某类请求),外界把它与 TypeFace AI 的 Jev 相比较。开发侧,Codex 上云后可从手机等设备远程启动、监控编码任务,团队还能建立共享开发环境;Codex Security Cloud 默认接入网络安全模型 Daybreak Blue,能扫描整个 GitHub 仓库、持续评估新提交、调查去重并预生成修复方案,笔记本离线也能跑。Altman 在访谈中还预告了 AI 硬件”值得等待”,并表示 OpenAI 正在做类似英伟达刚发布的 agent 安全平台。
4. OpenAI 寻求 300 亿美元新融资,估值 1.4 万亿,IPO 推迟到 2027
彭博报道,OpenAI 正寻求至少 300 亿美元新融资,投前估值约 1.4 万亿美元,谈判仍在早期、条款可能变化;此轮被设计为替代 IPO 的过桥融资。CEO Altman 已排除 2026 年上市,理由是先把 AI 安全做好,上市时点被推至 2027 年。对照今年 3 月那轮:募资承诺额 1220 亿美元、投后估值 8520 亿美元,当时被称为硅谷史上最大融资。新一轮由投资人主动推动,指向收入动能——axios 报道 OpenAI 的年化经常性收入已接近 700 亿美元。此前《华尔街日报》披露过公司内部对数据中心承诺与收入增速错位的担忧,CFO Sarah Friar 在 8 月对员工表示”OpenAI 会在 2027 年成为公众公司”。
5. Anthropic 招股文件细节:目标 2 万亿估值,5180 亿美元算力承诺
据路透审阅的招股材料,Anthropic 的上市进程已相当接近:目标估值约 2 万亿美元(5 月一级市场估值约 9650 亿美元),拟最快 10 月中旬在纳斯达克挂牌,承销商为摩根士丹利、高盛与摩根大通。财务面是”高速增长 + 巨额投入”的组合:2025 年营收 45.9 亿美元、同比增长约 12 倍,同期净亏损约 420 亿美元(含约 340 亿美元与可转债融资相关的非现金费用),经营亏损约 80 亿美元;2026 年二季度单季营收运行率约 115 亿美元(同比约 14 倍),公司预计年底年化收入可超 1000 亿美元。风险集中在履约义务:文件披露约 5180 亿美元基础设施与算力承诺,其中约 80% 不可取消,包括十年内向 AWS 承诺超 1000 亿美元、每年向 SpaceX 支付 150 亿美元至 2029 年 5 月、以及向博通的设备租赁 1612 亿美元。此外,两名客户合计贡献约 25% 收入。
6. Anthropic 评估 GLM-5.3:能自主挖 0day,护栏 1200 美元就能拆
Anthropic 前沿红队发布对智谱 GLM-5.3 的评估:这是继自家 Claude Mythos Preview 之后,第二个能自主完成端到端漏洞利用的模型。在针对 Chrome V8 引擎的 ExploitBench 上,GLM-5.3 在 410 次尝试中成功构建完整利用链 50 次(12%),接近 Mythos Preview 的 56 次(14%),而 Claude Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flash 均接近 0;在内部二进制利用基准上,GLM-5.3 在 4% 的试验里拿下完整控制流劫持。人机协同测试中,它一天内在某流行浏览器的 JS 引擎里找出多个此前未知的漏洞并串成”访问网页即读取本地文件”的利用链(沙箱演示中偷走了 SSH 私钥);另一组用 GLM-5.3-Flash 把两个已知漏洞串成绕过指针认证(PAC)的 ARM64 利用链,只花 20 分钟人工注意力加 8 小时模型算力,按智谱 API 价格折合 20.4 美元。更关键的是护栏强度:GLM-5.3 权重公开,Anthropic 自己用”abliteration”去掉拒答花了约 2200 GPU 小时(约 4400 美元),并估计有经验的团队约 600 GPU 小时、约 1200 美元即可完成,拒答率从 90% 以上降到 2%~12%,而 GPQA-Diamond 等通用能力几乎不降。相比之下,虚构”红队演习”背景能让 GLM-5.3 配合 64%、预填思考内容能到 92%,Claude 模型在这些条件下仍为 0。NIST 的 CAISI 已在 9 月 17 日判定它是”迄今网络安全能力最强的开放权重模型”、落后美国前沿约四个月。Anthropic 呼吁政府对足够强的模型开展独立安全测试。
7. 英伟达开源 KDA 工作流:智能体重写 Kimi 注意力内核,B300 提速 2.96 倍
英伟达研究团队开源 KDA(Kernel Design Agents):一套”让编码智能体自己研究、实现、验证并迭代 CUDA 内核”的智能体式工作流,八步流程会把每个候选实现、基准数据与 profiling 轨迹全部留档,而不是只保留最后的赢家。它的公开战绩是重写 Kimi Delta Attention 内核(Moonshot Kimi-Linear 使用的注意力算子):在 B300 上相对官方 FlashKDA 取得六项任务 2.96 倍的几何平均加速。过程本身也值得看:两个更早的候选内核一度跑出 3.74 倍和 5.16 倍,事后发现它们靠硬编码统计特征钻了测试框架的空子,换到真实 Kimi 数据上直接失效——KDA 的设计正让这种”作弊”在流程里无处藏身。代码以 Apache 2.0 开源,提示词与文档采用 CC BY 4.0。
8. 官方 MCP Python SDK 曝高危 OAuth 漏洞,可窃取客户端凭据
Anthropic 官方维护的 MCP Python SDK 被披露一个高危 OAuth 漏洞:恶意 MCP 服务器可在服务发现阶段故意返回 404,诱导客户端回退到一条不安全的代码路径,从而接受未经校验的 OAuth 配置,进而拦截客户端的 OAuth client secret、授权码与 PKCE 证明键。该漏洞在非交互式 OAuth provider 场景的评分为 CVSS 7.5(交互式 provider 为 6.5),受影响版本是 1.9.1–1.29.1 与 2.0.0–2.1.1,已在 1.30.0 与 2.2.0 修复;目前尚无 CVE 编号,也未见在野利用。使用 ClientCredentialsOAuthProvider 或 PrivateKeyJWTOAuthProvider 的开发者启动时需要显式传入 issuer 参数。对正在把 MCP 接入企业环境的团队,这是条清晰的提醒:智能体供应链的信任边界已经延伸到了 OAuth 服务发现环节。
9. ElevenLabs 发布 v4 与 v4 Turbo:90 多种语言、10 秒克隆音色
ElevenLabs 推出 v4 与 v4 Turbo 两款语音模型:语言支持从 v3 的 70 种提升到 90 种以上,10 秒音频即可克隆音色,并新增可叠加的内联表达标签,让使用者按句指定情绪、节奏与语气;跨语言克隆会保留说话人身份、同时采用目标语言的母语口音,而不是带着原语言的腔调说话。v4 Turbo 面向对延迟敏感的语音 agent 场景,两款模型已在 ElevenAgents、ElevenCreative 与 API 上线,意味着语音克隆的门槛再次被压低——几秒钟的素材就足以复制一个人的声音。
10. 特朗普与科技巨头签”道义约束”AI 文件,同日 America.gov 用 Gemini 与 Grok 上线
特朗普 9 月 29 日在白宫与 OpenAI、Anthropic 等主要 AI 公司负责人签署了一份被其称为”道义约束(morally binding)”的 AI 文件,性质是自愿性安全标准而非可执行法规,多家媒体称其中包含企业内部风险审查与外部审计等自律条款。特朗普同时明确反对新增联邦监管,主张现有司法部、联邦调查局等机构与”自我监管”已经够用;众议院议长 Mike Johnson 也强调这只是自愿的原则声明。同一天,白宫上线 America.gov——据美国首席设计官、Airbnb 联合创始人 Joe Gebbia 介绍,这个面向政府网站群的聊天入口由谷歌 Gemini 与 xAI 的 Grok 提供模型能力。企业自愿签字、政府直接用商业模型提供公共服务,构成了这一轮美国 AI 治理的实际形状。