AI早报 | 2026年9月3日(周四):Astra达到关键级网络安全阈值、Gemini 3.8 Flash发布、Fable 5.1降价、Muse Spark 1.3上线

AI日报22小时前发布 程序员阿超
932 0 0

1. OpenAI:Astra 被列为首个“关键级”网络安全能力模型

OpenAI 在 9 月 1 日更新了 Astra 的安全评估,认为它已经达到 Preparedness Framework 的 Critical cybersecurity capability 阈值:在获得工具和访问权限后,模型能够在多个防护完善的真实系统中发现此前未知的漏洞,并在无需人工逐步引导的情况下设计利用链。内部 ExploitBench 测试中,Astra 达到 100%;在包含 20 个较新高危漏洞的内部数据集上,模型还发现并利用了两个零日漏洞,OpenAI 表示正在向维护者披露。

Astra 仍未全面公开,最先进的网络安全能力将先提供给一小批测试者,随后通过 Daybreak Blue 扩大防御性使用。OpenAI 称,Astra 在网络安全越狱测试中的拒答率为 91.5%,高于 GPT-5.6 Sol 的 59%,并将部署额外的行为监控来拦截未经授权的行动。这里的评估结果反映的是 Daybreak Blue 访问条件,不等同于默认生产配置。

来源

2. Google 发布 Gemini 3.8 Flash 与 Flash Cyber,继续押注高性价比智能体

Google DeepMind 发布 Gemini 3.8 FlashGemini 3.8 Flash Cyber,距离 3.7 Flash 发布仅约三周,也是 Google 六周内推出的第三个 Flash 版本。3.8 Flash 面向软件工程、智能体工作流和多步推理,官方称其在 DeepSWE v1.1 长周期软件工程测试中超过多数更大的前沿模型;HLE-Verified 得分为 54.9%

3.8 Flash 的介绍价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,但优惠将于 2026 年底结束,2027 年起涨至 1.50/7.50 美元。Cyber 版本聚焦漏洞发现和自动修复,通过新设的 Fairwind Program 向政府、关键基础设施运营方和软件维护者等可信防御者开放。

来源

3. Anthropic 推出 Claude Fable 5.1,缓存读取降价 75%

Anthropic 发布 Claude Fable 5.1 和受限访问的 Claude Mythos 5.1。两者是同一基础模型的不同安全配置:Fable 5.1 面向一般编码和知识工作,已通过 API、云平台及 Claude 产品提供;Mythos 5.1 则面向经过审核的网络安全和生命科学机构。

本次更新的重点不只是能力提升,更是智能体经济性。Fable 5.1 的常规 API 价格仍为每百万输入 token 10 美元、输出 token 50 美元,但缓存读取价格降至 0.25 美元/百万 token,较 Fable 5 下降 75%。Anthropic 估计,典型工作负载成本下降约 25%,高度智能体化的任务最高可节省约 45%。公司还称,新网络安全防护将误报减少 60%,允许模型发现软件漏洞,但暂不允许生成对应的利用代码。

来源

4. Meta 发布 Muse Spark 1.3,编码任务工具调用减少约 20%

Meta AI Research 发布 Muse Spark 1.3,现已进入 Muse Code 和 Meta Model API。新版本针对长周期智能体任务和编码工作流改进了上下文保持、工具调用、多任务切换以及对自身能力边界的判断;在面对不可逆操作时,模型会先请求确认。

Meta 表示,相比 Muse Spark 1.2,1.3 在内部对比中约减少 20% 的工具调用25% 的 token 使用量,同时改善了复杂长指令的执行稳定性。当前已提供此前的推理模式,最高推理模式还在进行额外安全测试。Meta 同时表示,Muse Spark 的开放权重版本正在规划中,但本次发布仍是托管 API 模型,并非开放权重发布。

来源

5. Google 将“智能体式视频理解”带入 Gemini API,token 最多减少 88%

Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding。它不再按固定帧率把整段视频平均切片,而是让模型根据问题主动决定查看哪些时间段、使用画面、音频还是字幕,再通过工具循环定位目标片段。

Google 在标准视频分析测试中称,该功能最多可减少 88% 的 token 消耗、降低 66% 的成本,并将准确率提高 7%。它支持亚秒级时间点检索、长视频“针尖找 haystack”、异常检测以及动作和物体计数,目前可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,不额外收取功能费。

来源

6. Perplexity 在 Mac 推出混合计算,让敏感步骤留在本地

Perplexity 为 Mac 版 Computer 推出 Hybrid Compute:云端模型继续负责前沿推理、搜索和规划,本地模型则处理私密文件、敏感信息和设备上的操作。Mac 端的隐私门会识别人名、地址、账号、密码、支付卡和政府证件等信息,在必要时选择本地处理、脱敏后上传、拒绝操作或请求用户同意。

该功能首发支持 Gemma 4 E4B、Qwen3.6 35B-A3B 和一个 Perplexity 本地模型,面向 Pro、Max 和 Enterprise 用户;要求 Apple Silicon Mac、macOS 15 或更高版本,以及至少 24GB 统一内存。它并不意味着 Computer 完全离线,云端仍承担非敏感任务,因此企业仍需要用自己的数据集评估隐私分类器的漏报和误报。

来源

7. Broadcom:第三季度 AI 半导体收入同比增长 221% 至 167 亿美元

Broadcom 公布 2026 财年第三季度业绩,AI 半导体收入达到 167 亿美元,同比增长 221%,环比增长 54%;公司预计第四季度 AI 半导体收入将达到 217 亿美元,同比增长 236%。公司整体季度收入为 295.91 亿美元,同比增长 86%,其中半导体解决方案业务收入 208.39 亿美元,同比增长 127%。

Broadcom 将增长归因于定制 AI 加速器和网络需求,称目前有六家 XPU 客户正在加快部署。公司给出的第四季度整体收入指引约为 348 亿美元,非 GAAP 营业利润率预计约 66%。这组数据表明,AI 基础设施的受益范围正从 GPU 扩大到定制加速器、网络芯片和相关互连系统。

来源

8. HiddenLayer 获 1 亿美元 B 轮融资,AI 安全从模型扩展到智能体运行时

AI 安全公司 HiddenLayer 完成 1 亿美元 B 轮融资,由 Delta-v Capital 领投,Microsoft 的 M12、Morgan Stanley、Ten Eleven Ventures 和 Booz Allen Hamilton 等参与。公司称,过去一年经常性收入增长超过 10 倍,已达到“数千万美元”规模,超过 90% 的增长来自过去一年新增客户。

HiddenLayer 原本提供模型保护、攻击模拟和供应链安全,如今将范围扩展到提示注入、智能体操纵、恶意工具调用和工作流运行时防护。TechCrunch 援引 Gartner 估计称,企业今年用于保护 AI 工具的支出将达到 28.3 亿美元,较 2025 年增长 83%,2027 年可能接近 47.8 亿美元。随着智能体获得更多系统权限,安全产品的边界也从“模型是否安全”延伸到“模型正在调用什么、执行什么”。

来源

9. AIR 以 5000 万美元融资出 stealth,专门审查智能体插件和 MCP 组件

AI 安全创业公司 AIR 从 stealth 状态公开亮相,并宣布通过两轮种子融资筹得 5000 万美元:第一轮 1000 万美元由 Sequoia 领投,第二轮 4000 万美元由 Greenoaks 领投。公司由曾在以色列 Unit 8200 工作的 Yair Saban 和 Niv Hoffman 创立。

AIR 的产品面向智能体软件供应链,可发现企业内部运行的智能体,持续审查它们使用的 skills、插件、MCP 服务和其他组件,并阻止不符合安全标准的工具连接软件或外部数据源。这个方向的核心判断是:当智能体开始像操作系统一样调度工具时,插件和技能就不应再以“普通配置文件”的方式被无条件信任,而需要签名、审核、权限边界和运行时控制。

来源

10. World Labs 发布 Atlas,用少量照片重建并模拟 3D 世界

由李飞飞参与创办的 World Labs 发布 Atlas,这是一个从文本、图像、视频和 3D 数据训练的空间智能模型,能够从少量照片生成、重建和模拟三维场景。它以空间位置组织输入,而不是只把内容当作一维或二维序列,因此可以根据明确的相机路径生成新视角,并输出点云和 3D Gaussian splats 等空间数据。

Atlas 支持从一张到数十张照片重建场景,官方演示包括从斯坦福 Main Quad 的 2 到 25 张地面照片逐步生成高处视角;在相机控制生成中,最高可输出 1440p、最长一分钟的视频。对机器人而言,Atlas 还能把真实房间转换成可改变物体、位置、光照和背景的仿真环境,为抓取和移动任务生成更多训练数据。它的价值不只是生成更逼真的画面,而是把视觉生成推进到可验证、可交互的空间模拟。

来源

© 版权声明

相关文章

暂无评论

暂无评论...