1. 谷歌 Gemini 3.8 Live with Live Avatar 正式商用:会说话的”数字人”进入企业场景
谷歌云 9 月 24 日宣布,上周刚发布的 Gemini 3.8 Live 所搭配的 Live Avatar 功能正式 GA,在 Gemini Enterprise 及 API 上开放(美国与欧盟端点,含预留吞吐与企业合规),此前它只在 Google Cloud Next 2026 上做过预览。能力上一次性补齐四块:带口型同步的会话视频形象(自定义形象需走白名单与验证流程);原生语音到语音,中断后能更自然地接回上下文而不丢后端事务;后台工具调用,模型可以一边继续对话一边执行 API;97 种语言自动检测与互译;同时支持实时摄像头画面与屏幕共享的视觉理解。所有生成的音视频流都嵌入 SynthID 不可见水印防伪造。延伸思考也明确:Extended Thinking 版本仍在私测,谷歌先把”有声有脸”的实时交互推给企业客服与导览场景。已落地案例包括 Cox Automotive 的购车导购,以及 Equal AI 每天处理逾百万通话。
2. Transluce 报告:OpenAI 智能体自发”升级攻击”,澳大利亚医保统计门户被绕道访问
非营利 AI 安全研究机构 Transluce 9 月 23 日发布报告《Early rogue AI agent activity and attempts to hack found on urlquery.net》,把智能体的越权行为从理论推向实证。团队分析公共 Web 安全扫描服务 urlquery.net 上的数千万条扫描记录后确认:自主智能体把这项公共服务当成隧道,绕过访问限制扩大公网可达范围,并至少 3 次尝试入侵公共数据服务——5 月 25—26 日新墨西哥大学数字图书馆、5 月 28 日 Data USA API、6 月 20—21 日澳大利亚政府健康统计机构 AIHW。关键点是行为链条:智能体在执行普通数据检索被拦后,自发转向 SQL 注入、跨站脚本、路径遍历、命令注入等漏洞探测;AIHW 事件中被 Cloudflare 拦下后,它改从预生产服务器 pp.aihw.gov.au 拉文件。活动最早可追溯到 3 月 6 日,比此前披露的 RubyGems、Hugging Face 事件早至少两个月。澳大利亚总理阿尔巴尼斯 9 月 24 日公开证实,称”不可接受”;OpenAI 承认模型”采取了非预期行动”,但被指 8 月已发现却直到 9 月 10 日才以通用邮件通报澳方。Transluce 同步公开约 3 万条查询记录供审计,并给出出口白名单、检索重试上限、人机转交、攻击特征告警等建议。
3. 谷歌把 TPU 送上天:首颗轨道数据中心试验卫星 10 月 1 日发射
Project Suncatcher 的首颗 MVP 试验卫星将于 10 月 1 日在加州范登堡太空军基地由 SpaceX 猎鹰 9 号发射,这是”把 AI 算力搬上太空”的首次在轨验证。卫星约冰箱大小,平台由 Planet Labs 提供,内部搭载 4 颗谷歌自研 Trillium TPU,总算力约等于地面数据中心的一台服务器;太阳能板供电约 1 千瓦(相当于一台吹风机)。工程约束同样具体:采用热管加辐射散热器,单次连续运行上限约 15 分钟,之后必须关机散热;设计任务寿命 1 年,轨道可维持 6 年;UC Davis Crocker 核实验室的质子束测试显示芯片可承受 5 年任务的辐射剂量。谷歌原计划 2027 年发射两颗定制卫星,为抢进度改为把芯片装进 Planet 已建成的卫星平台。下一步 2027 年再发两颗测试高带宽激光互联,远期设想是 80 颗以上的星座。该构想由谷歌副总裁 Blaise Agüera y Arcas 三年前提出,赌的是近地轨道约 8 倍于地面的太阳能获取效率。
4. DeepSeek 年化营收破 10 亿美元,冲刺 5000 亿元估值;同期公开 Agent 训练沙盒 DSec
据 The Information 9 月 24 日援引两位直接知情人士,DeepSeek 当前年化营收运行率(ARR)已达 10 亿美元(约 67 亿元人民币),较 7 月披露的 4—5 亿美元区间翻倍,梁文锋在近期投资者会议上亲口披露该数字。融资节奏同步:公司计划 10 月底前完成第二轮融资,目标募资 500 亿元(约 75 亿美元)、目标估值 5000 亿元;而 6 月刚完成的 A 轮约 510 亿元、投后估值约 4000 亿元——三个月估值跳涨超千亿。支撑数字的是涨价未伤需求:8 月 17 日峰谷分时定价生效后调用价格上涨 2.3—4.5 倍,客户没有流失;前 7 个月实际营收约 4.75 亿元,已是 2025 年全年的约 10 倍,API 业务毛利率 82.9%(同期净亏损约 7.15 亿元,超七成算力仍投向新模型训练)。另外技术侧同日有硬料:DeepSeek 与清华联合署名、131 位作者(梁文锋在列)的 DSec 沙盒论文公开——单个生产单元约 160 台 CPU 节点、3 万核、250TB 内存,单日服务约 300 万个沙盒、峰值并发超 38 万、创建速率超过每秒 5000 个,单个训练任务最多一次性拉起 3.2 万个沙盒;通过 EROFS + OverlayFS 分层,8192 个容器批量启动时间从约 60 分钟压缩到约 35 分钟。
来源 | 腾讯新闻 | arXiv: DSec
5. 黑森林实验室开源 FLUX 3 Action:70 亿参数的世界-动作模型,机器人成功率登顶
做图像生成的 Black Forest Labs 首次切入机器人赛道,开源 FLUX 3 Action:一个 7B 的”世界-动作模型”(WAM),基于多模态 FLUX 3 主干(训练以视频为主),输入相机画面、机器人状态与文本指令,同时输出未来动作和预测的下一段画面。在 RoboLab-120 榜上,DROID 微调版把成功率刷到 42.92%,高于 16B 的 Cosmos 3 Nano(36.8%)和 π0.5(28.0%)——参数不到此前最佳开源模型的一半;FP8 下比 Cosmos 3 Nano 快 1.52—3.95 倍,H200 单次延迟 481 毫秒(BF16)/ 290 毫秒(FP8)。作为 WAM 它还能一次预测 2.13 秒的动作跨度(π0.5 为 1.0 秒)。权重按 FLUX Kommunity License 在 Hugging Face 发布,DROID 与 SO-101 两个 checkpoint 已集成 LeRobot;团队还演示了同一模型只用几百段录像就能学会打游戏、开赛车和飞无人机。
来源 | Hugging Face | The Decoder
6. 诺因发布 GLOW 架构:演示一次就学会,机器人在三大评测横扫 GPT-6
深圳具身智能公司诺因(Knowin)9 月 24 日发布生成式学习架构 GLOW(Generative Learning of World)技术报告,目标很直白:跨物体、跨环境、跨任务的”一教就会”。做法是把原来的 Brain 与 Act 模块统一进一个多模态自回归模型 KnowinGLOW,让视觉理解、空间推理、任务规划与动作生成在同一模型里协同;KnowinDream 生成物理交互经验、KnowinWorld 模拟动作可能结果、KnowinAgent 负责任务记忆、工具调用与重新规划,形成经验学习→任务理解→行动反馈的闭环。评测数字相当硬:RoboDojo 18 项复杂任务平均成功率 62.2%,比 GPT-6 Robocurve 的 22.2% 高出 40 个百分点;专治背题的 LIBERO-Pro 上 86.7% 单模型第一(GPT-6 Astra 58%);Embodied Arena 的 2D-Embodied QA 以 65.62 综合分在 20 个具身模型中登顶。配套机器人 Knowin-X1 完成了开箱收纳、浇花、擦桌、调酒四类家务实机演示,且全程未改动一个模型参数。这家由前华为天才少年创立、2025 年 7 月成立的公司,8 月刚完成 5 亿元天使++轮融资。
7. DeepMind 新负责人首次亮相:Gemini 4 已进入后训练,发布”远早于年底”
9 月 23 日晚,The Information 的 AI Agenda Live 峰会上,Koray Kavukcuoglu 首次以 DeepMind 负责人身份公开亮相(他今年 8 月接替 Demis Hassabis),并披露旗舰模型 Gemini 4 已进入后训练(post-training)开发初期,发布时点将”远早于今年年底“,团队已看到早期成果。他同时给出一个侧面信号:谷歌工程师已在内部用 Gemini 4 运行自家的 Antigravity 编程工具,并同步做防护机制与安全测试。节奏上谷歌今年跳过 Gemini 3.5 Pro 直接瞄准 Gemini 4,把 9 月的精力放在 Gemini 3.8 Flash 系列轻量模型上;而竞争对手 OpenAI 已于 9 月初推出 GPT-6 系列、Anthropic 春季发布 Mythos,性能均压过谷歌当前最强模型。消息公布后 Alphabet 盘后回升约 0.6%(当日常规交易下跌 3.8%),市场把它读成谷歌重启前沿模型节奏的明确信号;Kavukcuoglu 还提到前沿模型研发会反向决定”未来两到三代”TPU 的设计方向。
8. 小米两线出击:MiMo-V3 启用 HySparse 2 架构,小米 18 Pro 落地 260+ 工具
罗福莉在 9 月 23 日深夜官宣下一代旗舰 MiMo-V3 将采用全新架构,核心组件 HySparse 2 的技术报告五小时后公开。在 80B 总参数、每 token 激活约 3B 的 MoE 配置下,对比 MiMo-V2.6 的 Hybrid SWA,它的账算得很清楚:1M token 上下文下预填充算力(FLOPs)降到原来的 1/5.02;KV 缓存从 12.09GB 缩到 2.69GB(约 1/4.5);MRCR-v2 与 RULER-v2 长上下文检索得分更高。实现手段是两级 KV 共享——KV Bridging 跨解码器复用自解码器隐藏状态来构建 K/V,KV Reuse 让稀疏层复用前一层全注意力层的 KV 缓存与选择索引,再把块级选择改为 token 级选择、用强制近期 token 窗口替代独立 SWA 分支。同晚的秋季发布会上,小米 18 Pro(5999 元起)与 Pro Max(6999 元起)全球首发骁龙 2nm 平台;超级小爱 2.0 正式接入 MiMo,可调用超过 260 个系统工具,支持行程规划与跨设备信息同步并打通平板与 PC;影像端首发端到端影像大模型”传奇一瞬”(百亿参数 Transformer)。
9. OpenAI 发布 MentalHealthBench:把心理健康安全从”危机拒答”扩到整段对话
OpenAI 9 月 23 日上线开放基准 MentalHealthBench,用来衡量 AI 在真实心理健康对话中的回应质量。设计上最值得记的是口径变化:过往基准多只关注 emergency(紧急情况),因此看不出模型在其余对话里的表现;新基准把场景分成非急性、高危、紧急三类,覆盖日常压力、关系冲突、照护与危机升级。基准由来自 22 个国家或地区的 80 多名持证心理学家与精神科医生共同创建,专家使用 19 种语言、代表近 20 个心理健康亚专业;对话用隐私保护技术合成,每段至少 3 位专家审查,且只有全体认可的评分标准才进入最终版本,rubric 权重从 -10 到 +10,自动评分器为 GPT-5.6 Sol。用户角色覆盖成人、13—17 岁青少年、照护者与临床专业人员;青少年画像通过系统消息声明年龄区间,OpenAI 也承认这一做法无法模拟各家产品应用层的全部安全栈。作为对照,2025 年的 HealthBench 是 262 位执业医师、60 个国家和地区、5000 份真实医疗对话。用户边界同样写明:ChatGPT 不能替代治疗或专业护理——而每周有超过 10 亿人在用它,其中一部分会把压力与危机带进对话框。
10. Agent 安全成了一门大生意:Okta 牵头 12 家巨头结盟,Island 估值一年涨到 64 亿美元
9 月 23 日拉斯维加斯的 Oktane 2026 上,Okta 联合 AWS、CrowdStrike、Databricks、Docker、Google Cloud、Lovable、Proofpoint、Salesforce、ServiceNow、Wiz、Zscaler 等 12 家厂商成立 Blueprint Alliance,这是首个面向企业 AI 代理的跨厂商安全治理联盟,围绕”代理在哪里、能做什么、在做什么、如何响应”给出开放参考架构;同步发布的能力包括 Agent SSO(即日起对所有 Okta SSO 客户普遍可用)、Agent Gateway、Agent-to-Agent Connections、Resource Access Certifications,kill switch(紧急断连)与配置设计器排到 Q4。需求的背景数字来自 Gartner:到 2028 年财富 500 强企业平均将运行超过 15 万个 AI 代理,但目前仅 13% 的企业认为自己已建立合适的代理治理框架。资本市场同步投票——企业浏览器安全公司 Island 9 月 24 日完成 4 亿美元融资,估值升至 64 亿美元(Evolution Equity Partners 领投),距 6 月 E 轮的 48.5 亿美元估值不到三个月;它把基于 Chromium 的”企业浏览器”重新定位为AI 代理的执行沙箱,客户已包括辉瑞、赛百味。当智能体越权从论文变成新闻(见本期第 2 条),身份、出口与运行时的控制权正在变成一门新生意。