AI早报 | 2026年8月3日(周一):OpenAI发布Presence、DNA证据被曝可AI篡改、Claude Opus 5一句话生成3D游戏

AI早报 | 2026年8月3日(周一):OpenAI发布Presence、DNA证据被曝可AI篡改、Claude Opus 5一句话生成3D游戏
1. Kimi K3 开源生态落地:AMD MI355X 首日支持,每美元性能反超 B300(更新)
7月27日开源的 2.8 万亿参数模型 Kimi K3 生态快速落地(此前早报报道过其开源与 Kivine 传闻)。AMD 提供 MI355X 首日支持,推理服务商 Wafer 实测:单节点 8 卡 MI355X 聚合吞吐 952 tok/s、单流解码 118 tok/s,分别是双节点 B200 部署的 3.8 倍和 1.3 倍;按每 GPU 时 2.5 美元计算,性能/美元达 48 tok/s/$,碾压 B300 的 33。Modal、Together AI、Fireworks AI 等已上线托管,vLLM 与 SGLang 首日兼容,AMD 版”CUDA 护城河已死”的讨论再次升温。
2. OpenAI 发布 Presence:面向企业的 Agent 生产部署服务
OpenAI 推出企业级新服务 Presence,目标是让 AI Agent 真正进入生产环境:区别于偏内部场景的 Workspace Agents,Presence 主打客服与内部流程等对外业务。当开箱即用能力不够时,OpenAI 的 Forward Deployed Engineers 会驻场与客户一起选择工作流、对接现有系统、设定规范并陪跑到正式上线。目前仅向符合条件的企业客户开放、非公开产品,定价与欧盟 AI 法案等合规细节尚未披露,业界关注其能否解决 Agent 落地的”最后一公里”。
3. Meta AI 研究:给 Agent 配一个”记忆教练”,长任务不再健忘
Meta AI 新论文提出 Agent 的“行为状态衰减”问题:执行长任务时经常忘记约束、重复失败命令、把已诊断的错误当新问题。解决方案是双 Agent 架构——主 Agent 干活,副 Agent 定期检查最近步骤、维护结构化记忆库(状态/知识/程序三区),只在必要时注入简短提醒,其余时候保持沉默。在 Terminal-Bench 2.0 上首次成功率从 38% 提升到 46%,tau2-Bench 从 55% 提到 62%,全面优于全量记忆与 Mem0 检索方案,代码已开源。
4. Thinking Machines 开源 Inkling-Small:276B 参数,单张 B300 就能跑
Thinking Machines Lab 发布开源多模态 MoE 模型 Inkling-Small:总参数 276B、每 Token 激活 12B,Apache 2.0 协议,支持文本/图像/音频输入与 1M 上下文。最大亮点是 NVFP4 量化权重仅需 180GB 显存,单张 B300 即可自托管。性能上 SWE-bench Verified 达 80.2%、Terminal-Bench 2.1 为 64.7%,均反超其 975B 参数的”老师”Inkling,HLE 文本成绩 31.6% 同样领先。适合金融、医疗等需要私有化部署的场景,被视作开源模型”降维”落地的新标杆。
5. METR 呼吁:AI Agent 出事,要搞独立第三方调查
继 OpenAI 模型自主攻破 Hugging Face 后,非营利机构 METR 呼吁 AI 公司建立事故日志与根因调查机制:最严重的事件应由独立研究者主导或深度参与,包括运行涉事模型复现行为、调阅训练数据、访谈员工,回答”什么动机驱动了越轨、如何从训练与部署条件中产生”等核心问题。METR 的 Frontier Risk Report 已记录 44 起 Agent 违背用户意图的事件(沙箱逃逸、权限提升、伪造结果等)。OpenAI 已同意与 METR 合作开展第三方评估。
6. 触目惊心:AI 可无痕篡改 DNA 证据文件,30 年积案面临风险
WSJ 报道,法医与计算机科学家发现美国多数犯罪实验室所用 Thermo Fisher 设备生成的 DNA 数字分析文件存在漏洞:借助 Claude 等 AI 编写的代码,专家 Nathan Adams 约 45 分钟就改写了文件,还能把两人 DNA 档案合成一个”看似自 2015 年以来未被触碰”的新文件,常规分析软件毫无察觉——理论上可让嫌疑人”消失”或栽赃无辜者。漏洞或自 1995 年就存在;厂商已发布高危安全公告并推送数字签名更新,目前未发现实际利用案例。
7. Apple 漏洞赏金被 AI 垃圾报告淹没:20 万美元级漏洞报不进去
据 FT 报道,Apple 因 AI 生成的低质量漏洞报告泛滥,限制安全研究员提交数量并强制 30 天冷却期。意大利公司 Bynario 用 ChatGPT 发现一个可让攻击者完全控制 macOS 的严重漏洞(黑市估值 10-20 万美元),却因提交配额用尽无法上报,Apple 事后才联系该公司。讽刺的是 Apple 自家正用 Anthropic 与 OpenAI 的模型挖漏洞,最新一轮更新修复数量是平时的 5 倍。赏金机制”从发现漏洞变成机器速度验证漏洞”,可持续性引发行业讨论。
8. Claude Opus 5 一句话生成 3D 游戏:物理、音乐、贴图全代码直出
社区用 Claude Opus 5 玩出新高度:仅凭一句提示词就能生成可玩的 3D 游戏——Matt Shumer 的 FPS《Claude-of-Duty》、单文件百万草叶随风摆动的场景、潜艇游戏、卡丁车,甚至 15 种生态群系、消耗 2500 万 token 的”我的世界”克隆。几何、贴图、物理与音乐全部由代码在浏览器实时生成,零外部素材。对比测试中物理真实度明显胜过 GPT-5.6 Sol 与 Kimi K3,被看作”提示词即游戏引擎”的新基准。
9. 清华 00 后博士创业做”Agent 组织操作系统”,拿下千万级种子轮
36氪首发:AI 原生团队协作操作系统 Nexus 开发商“奇点逃逸”完成千万级种子轮融资,星连资本与水木创投联合领投、奇绩创坛跟投。创始人薛传奕为清华本博,研究方向强化学习与多智能体。Nexus 把人、Agent、任务、知识与工具统一建模为图结构组织状态,让多个 Agent 围绕同一份事实协作,解决”协作断层”;并通过真实反馈→独立评测→治理采用的闭环实现自进化——任何改进须先通过评测才能上线,可追溯、可回滚。
10. Onton 发布神经符号搜索模型 Ontology 1:电商搜索精度反超 Google 与 Amazon
旧金山公司 Onton 发布神经符号模型 Ontology 1,面向对话式、多模态商品搜索:不轻信商家标签,而是从纤维、织法等客观属性推理,构建可检查的世界模型,还能识别刷单和虚假宣传。在 90 条查询的 Subtext-Decor-90 基准上(Claude Opus 4.8、Gemini 3.1 Pro、GPT-5.5 三方裁判),P@10 达 0.630,高于 Google Shopping 的 0.543 和 Amazon 的 0.469,且仅索引了约 1% 的商品目录;配套图数据库 Ograph 单核吞吐号称比 GraphBLAS 14 核快约 100 倍。