AI早报 | 2026年10月9日(周五):Anthropic 发起网络任务、Google 发布 Gemini Agent

AI日报8小时前发布 程序员阿超
582 0 0

1. Anthropic 发起 Cyber Mission:给开源项目免费扫漏洞,联手工控巨头守住水电与电网

10 月 8 日,Anthropic 宣布启动长期项目 Anthropic Cyber Mission,从两条线切入网络安全。第一条是关键基础设施:新设的 Critical Infrastructure Defense Program(CIDP)把前沿 Claude 模型、驻场工程师和威胁研究带到守护工控系统(OT)的一线。首批 11 家创始伙伴包括 Accenture、Booz Allen、CrowdStrike、Deloitte、Dragos、Hitachi、Insane Cyber、Nozomi Networks、Palo Alto Networks、PwC 与 Rockwell Automation——覆盖咨询、安防厂商和控制器制造商。

第二条是开源软件:推出免费的 OSS Scanner,开源项目可自愿报名,由 Anthropic 最强的模型(含 Claude Mythos)定期扫描代码,直接产出 PoC、解释和候选补丁,号称预期真阳性率超过 90%、无需人工分诊。此前用于挖洞的 Project Glasswing 已在本周并入扩容后的 Cyber Verification Program。Anthropic 给出的判断很克制:两三年后 AI 会更利于防守方,但眼下漏洞利用成本在下降,修补速度却仍取决于人,在工控场景里一个补丁甚至可能要等上数年才能安全上线。

来源

2. Google 发布 Gemini Agent:把 Workspace、M365、Slack、Salesforce 串成一个“万能工作 Agent”

在 10 月 8 日的 Gemini at Work 2026 活动上,Google 发布了通用工作 Agent Gemini Agent,并把它并入现有 Gemini Enterprise。用户只需在一个界面里给出目标,Agent 就会自己搜集信息、编排步骤并执行,覆盖信息调研、文档撰写、生图、编程等任务;它同时打通 Google Workspace(Gmail、Drive、Docs、Sheets、Calendar)与外部系统 Microsoft 365、Slack、Salesforce,例如“调研市场趋势→生成分析表→做成演示文稿”可以一口气跑完。

企业侧的能力是重点:每个 Agent 在统一的 Agent Registry 获得加密身份和可追踪目录,能用自己的专属邮箱、日历、Drive 参与协作(Coworker agent,同事可通过 Google Chat 或文档评论派活);对外通信经 Agent Gateway 套用内部安全规则;还支持给每个项目设花费上限,超限即自动暂停。用户还可按任务选择 Gemini 4 Argon 或 Claude Opus 5.5。此外 Google 同步放出 Gemini for Financial Services 与 Gemini for Legal 的行业版本预览。目前 Gemini Agent 仅面向部分企业限量预览,全面开放时间未定。

来源

3. Anthropic 推 Claude Haiku 5.5:最便宜的“能干活”小模型,百万 token 输入 0.1 美元

10 月 7 日,Anthropic 发布 Claude Haiku 5.5(API 名 claude-haiku-5-5),补齐 Claude 5.5 家族。定价是最大看点:10 万 token 以内的请求,每百万输入 0.10 美元、输出 0.50 美元,仅为 Haiku 4.5 的十分之一,与 OpenAI 的 GPT-6 Luna 持平;超过 10 万 token 则跳档为 0.50 / 2.50 美元。Anthropic 称综合新分词器后,平均运行成本下降约 75%。

这也是首款带可调 effort 档位(low 至 max)的 Haiku,上下文扩到 1M、最大输出 128K。官方跑分(max effort)显示它不再是“只会分类的小模型”:OSWorld 2.1 离线子集 72.4%(Haiku 4.5 仅 15.7%、GPT-6 Luna 48.9%)、Terminal-Bench 4.0 39.2%(Haiku 4.5 为 0.0%)、HLE 无工具 45.9% / 带工具 57.4%、GDPval-AA 1620 Elo。需要留意的三个“隐藏成本”:10 万 token 分界线会让整个请求按 5 倍计价、新分词器同等文本约多用 30% token、以及默认 effort 是 medium(并非跑出上述分数的档位)。同日 Anthropic 把 Sonnet 5.5 的缓存读取价格腰斩至每百万 0.10 美元。

来源

4. Mistral 放出万亿参数“Le Chonk”:Mistral Large 4 开放 API 预览,剑指金融、法律与网络安全

法国 Mistral 为 Mistral Large 4(社区绰号 “Le Chonk”)开放公共 API 预览。这是一个原生多模态、总参数达 1 万亿的混合专家(MoE)模型,定位为企业级工作负载,重点瞄准网络安全、金融与法律场景,被官方描述为对标闭源前沿模型的开放权重替代方案。预览期定价为每百万输入 0.68 美元、输出 2.09 美元,通过 Mistral Studio 提供。

完整模型权重计划在 2026 年 10 月底释出,目前团队正与网络安全厂商及国家主管部门一起做红队测试。对开发者而言,这意味着又一款“万亿级、可自部署、不锁厂商”的选择在路上的信号。

来源

5. Odyssey-3 世界模型刷新物理理解 SOTA:Physics-IQ 拿到 66.1,一套模型就能操控机械臂

10 月 8 日,Odyssey 发布其最强基础世界模型 Odyssey-3,架构为自回归扩散 Transformer,能根据历史观测和最新动作/事件,实时预测环境如何演进。产品分两档:Odyssey-3(480p)与 Odyssey-3 Pro(720p),另有一个更快的 Flash 变体供免费浏览器研究预览(支持第一/第三人称导航与自由镜头)。

在衡量流体、光学、固体力学、磁学与热力学的 Physics-IQ Verified 视频到视频评测上,Pro 版取得 66.1(best-of-8)、提示增强 63.4,为该榜目前最高分;480p 版基础分 51.8 / 增强 61.6 / best-of-8 64.4,图像到视频为 54.7,Odyssey 还自称在 4 个 WorldMark 类别中拿下 3 项第一。物理 AI 方面,一个用观测-动作对训练的 action decoder 可将模型表征映射为控制信号,仅需数十小时示教就能操控多种机械臂,并出现训练数据中不存在的“恢复行为”。目前不开放权重,API 需申请,且公开文档仍停留在 Odyssey-2 Pro。

来源

6. AWS Bedrock AgentCore 曝“AgentCorruption”漏洞链:一句提示词可劫持同区域所有 Agent

Zenity Labs 披露了一条针对 AWS Bedrock AgentCore 的漏洞利用链,代号 “AgentCorruption”:攻击者只需向一个对外暴露的 Agent 发一句提示词,就能接管同一 AWS 账户与区域内所有 AgentCore Agent。这条链串联了三处缺陷——未被阻断的 IMDS 访问、过于宽泛的默认执行角色,以及记忆注入——最终可窃取私密对话、源代码、Secrets Manager 凭据和 OAuth token。

AWS 已收紧默认配置并为新建 Agent 强制启用 IMDSv2,全部缓解措施在 2026 年 9 月 29 日完成。这起案例再次说明:当 Agent 具备云上身份与工具权限后,提示词层的一个入口就可能变成横向移动的跳板。

来源

7. 《今日美国》母公司起诉 OpenAI:索赔逾 2.5 亿美元,要求销毁相关模型

10 月 8 日,USA TODAY 母公司 USA Today Co. 联合多家关联实体在纽约南区联邦法院起诉 OpenAI(案号 1:26-cv-08892),指控其未经许可复制“数十万篇”文章用于训练模型,并索赔超过 2.5 亿美元。诉状涵盖 19 家出版物,包括 USA TODAY、The Tennessean、Detroit Free Press、The Arizona Republic、The Indianapolis Star、The Columbus Dispatch 与 Milwaukee Journal Sentinel 等。

起诉方主张故意侵权:每件被故意侵权的作品索赔最高 15 万美元,每次剥离版权管理信息(CMI)另索赔最高 2.5 万美元(DMCA 项)。诉状称该报业集团的内容在 OpenAI 的 GPT-2 训练集 WebText 中占 逾 16 万条,在 2019 年 Common Crawl 快照 C4 中占 逾 1.22 亿 token(其中 usatoday.com 约 2300 万),并要求法院下令销毁使用这 19 家内容训练的 GPT 模型与数据集、举行陪审团审判。这已是针对 OpenAI 的又一桩版权诉讼,此前纽约时报、The Intercept、Ziff Davis、CBC/Radio-Canada、大英百科全书、韦氏词典等已陆续提告。

来源

8. a16z 领投 8.7 亿美元:决策模型新秀 TypeSafe(Jev)估值 75 亿美元

决策模型 Jev 的开发商 TypeSafe AI 完成约 8.7 亿美元融资,估值达 75 亿美元,由 Andreessen Horowitz(a16z) 领投,Sequoia 等参与。公司称 Jev 上线数天内用户即达约 100 万,目前已被约三分之一的《财富》500 强企业使用。联合创始人 Diogo Almeida 把这一波热度归给一支病毒式传播的发布视频,正是它把 Jev 推到各家 AI 模型候选清单的前列。在“模型即产品”的竞争里,一次成功的传播正在快速转化为资本与订单。

来源

9. Memento 3 通关 ARC-AGI-3:25 款游戏全达标,LLM 冻结、靠“规则手册”自我改写

来自伦敦大学学院(UCL)与华为诺亚方舟实验室的研究者发布 Memento 3:在 ARC-AGI-3 的 25 款公开游戏上全部通关,平均 RHAE 达到 100.0(该基准的满分),全程仅用 7,518 步操作,相当于人类基线(17,135 步)的 44%。关键之处在于底层的语言模型始终保持冻结——Agent 靠不断修订一份 Markdown 格式的自然语言“规则手册”,以及一个可执行的 Python 世界模型引擎来学习,每次预测失败就重写它们。

对照之下,Claude Opus 5 在同一基准上平均 RHAE 仅 40.7,低了 59.3 分。在 Atari Pong 的案例里,一个用 9,504 帧仿真数据训练出的反馈控制器,在执行阶段完全不调用 LLM的情况下三局 21:0 获胜,研究者称其样本效率比 EfficientZero V2 等基于模型的强化学习基线高约 42 倍(后者约需 40 万帧)。消融实验显示,规则手册本身带来 9% 的操作数与 18% 的回合数下降;在游戏 wa30 上用双模型群体把操作数从 899 降到 597(-33%),而 RHAE 仍保持 100。论文于 10 月 9 日发布。

来源

10. 优必选联手一汽-大众:人形机器人从质检走向工厂物流,签下具身智能合作协议

10 月 8 日,优必选(UBTECH)与一汽-大众签署战略合作协议,将联合开发与测试面向工厂物流与智能制造的具身智能人形机器人应用,并在真实产线上建设示范场景。这延续了此前的合作基础:优必选的 Walker S Lite 曾在一汽-大众青岛工厂执行整车质量检测,并被接入工厂的自动化控制系统。此次协议把合作从单点质检扩展到更广的智慧制造流程,凸显人形机器人正从“演示”加速走向有明确工位和 KPI 的产线场景。

来源

© 版权声明

相关文章

暂无评论

暂无评论...