AI早报 | 2026年8月31日(周一):Anthropic推出MHS、Claude自动研究员

AI日报8小时前发布 程序员阿超
3.2K 0 0

1. Anthropic 推出 MHS,让 AI Agent 直接操作实验室与工厂设备

Anthropic 开放研究预览 Model Hardware Standard(MHS),目标是把 AI Agent 连接现实设备时的“集成税”降下来。MHS 统一了设备驱动层,提供发现、读取、写入等基础操作,并可记录设备能力、可调参数和安全边界;Agent 可通过 MCP、CLI 或代码文件调用设备,而且不依赖特定模型。

实测中,QuEra 的激光锁定脚本由人工方案约 58% 成功率、每次约150秒,提升到 Agent 循环 700次成功695次(99.3%),最难案例也只需10—14秒。CMU 则在约8小时内完成了原本需要数周的剂量反应实验,并在设备动作前拦截了6种故障条件。MHS 的关键价值不只是“让模型发指令”,而是把安全约束放进可验证的设备描述中。

来源

2. Claude Code 使用上限调整:名义增加25%,实际可用量将下降

Anthropic 宣布,Claude Code 各档套餐的基础周额度将从 9月14日起永久提高25%;但目前正在生效的临时额度加成是50%,因此与用户眼下能用的额度相比,调整后反而相当于减少约 17%。这一变化涉及 Pro、Max、Team 和 Enterprise 计划。

Anthropic 表示,后续会改进用量展示和控制方式,让用户更清楚地知道额度消耗在哪里。对重度编程用户来说,这提醒人们不能只看“相对原始基线增加了多少”,还要看临时政策结束后的实际容量;同时,Claude Code 近期也加入了可选的自动反馈工具,失败时能生成供用户审核的 Bug 报告。

来源

3. Sony Music 与 Warner 起诉 Anthropic,版权争议扩大到音乐内容

Sony Music Publishing、Warner Chappell 等音乐出版商在美国加州北区联邦法院起诉 Anthropic 及其两位联合创始人,指控其通过 Torrent、抓取和下载等方式获取大量受版权保护的作品,并用于训练 Claude。原告称涉案内容不仅包括书籍,也涉及包含歌词和乐谱的作品。

Anthropic 表示不同意相关指控,将积极应诉。案件延续了 Anthropic 面临的版权诉讼,但争议焦点更集中在“内容如何取得”这一环节:此前的 Bartz 案中,法院认定使用受版权保护内容训练模型本身可以成立,但通过盗版方式取得内容并不合法,Anthropic 还被判支付 15亿美元。新诉讼可能进一步影响 AI 公司训练数据的来源审计、授权采购和合规留痕。

来源

4. Nvidia 的护城河从 GPU 延伸到整套 AI 数据中心系统

随着 AI 集群进入吉瓦级规模,瓶颈不再只是 GPU 算力,而是内存、存储、网络和数据调度能否持续把数据及时送到加速器。Nvidia 正借助 Vera CPU、Rubin GPU、Groq 3 LPX 推理加速器以及配套网络和存储系统,争夺 GPU 之外的系统层控制力。

Nvidia 称,在部分数据操作中,Vera CPU 可带来约 3倍提升,让闪存性能不再被数据搬运环节卡住。其逻辑是:如果 GPU 是发动机,CPU、网络、存储和机架级互联就是负责交通调度的整车系统。即便云厂商继续自研芯片,如何降低数据移动、通信延迟和每 Token 能耗,仍需要完整的软硬件协同,这让系统集成能力成为新的竞争层。

来源

5. Meta 在数据中心测试机器人:插线、重启与服务器维护逐步自动化

据多名现任和前员工透露,Meta 正在数据中心测试机器人执行插接线缆、服务器断电重启等技术员工作,涉及 Kinova、ABB 和 Watney Robotics 等厂商。测试内容包括用 Kinova Gen3 机械臂进行服务器电源循环,以及让另一种机器人更换网络线缆;部分机房还部署了能按远程指令按下设备电源键的简易装置。

一名数据中心员工估计,若网络线缆更换机器人达到预期,可能覆盖部分岗位约 80% 的工作量。Meta 对具体测试未置评,但表示数据中心建设和运维仍需要大量人员。机器人进入机房的现实动因包括 AI 基础设施扩张、熟练技术员短缺,以及高温、黑暗或偏远环境下的维护需求;真正落地仍取决于精细操作可靠性和故障安全机制。

来源

6. Google WikiSkill 把 Agent 的失败经验沉淀成可回滚技能

Google Research 发布 WikiSkill 框架,为 Agent 增加类似“持续维护的经验维基”。系统将运行轨迹、结构化知识和实际执行技能分成三层:原始层保存不可变的工具调用记录,Wiki 层归纳失败模式与成功策略,技能层则存放 Agent 当前执行任务时使用的程序化指令。技能更新必须经过独立验证,不奏效就回滚,但失败经验仍保留在 Wiki 中。

在数学推理、网页搜索、表格操作、文档问答和虚拟环境交互等五类基准上,WikiSkill 将 Gemini-3.5-Flash 的平均成绩从49.5%提升到68.1%,将 Qwen-3.6-27B 从39.4%提升到63.3%。长上下文文档任务的收益较小,但较小模型使用 WikiSkill 后有时能追上未使用该框架的大模型,说明“积累经验”可能成为训练之外提升 Agent 的一条路径。

来源

7. LAION 发布 1000万小时开放视频数据集,覆盖视频、音频与文本

LAION 发布 Big Video Dataset(BVD),从 Common Crawl 发现的13亿个视频链接中下载约8000万条视频,总时长达到 1000万小时,并进一步切分出5500万段视频、生成视频和音频描述,同时提取约3亿张静态图像。数据主要来自 YouTube,英语内容占多数,当前定位为研究用途。

按照论文中的结果,使用 BVD 训练的模型在常见视频到文本基准上,比使用 InternVid 训练的可比模型最高高出 2.1个百分点。它的特点不是单纯扩大视频数量,而是把画面、声音和文字描述放进统一训练框架,让模型学习三者之间的对应关系。数据开放也会让研究者更容易复现实验,但版权来源、地区覆盖和数据质量仍是使用时必须审查的环节。

来源

8. Anthropic 让 Claude 自动设计安全训练方案:成本约每小时4美元

Anthropic 的自动化对齐研究员系统 AAR 让 Claude 自己查论文、提出训练方案、生成数据、微调目标模型,再根据安全与通用能力评测结果继续试错。实验覆盖欺骗、谄媚、奖励黑客、隐私侵犯和越狱等 10类 安全问题,所有问题都找到了一定程度的改进方案,安全差距弥合幅度为 26%—96%

在欺骗问题上,自动化研究员多轮尝试后的平均成绩弥合约 85% 的安全差距,而参与对照的6名人类研究员平均约20%;AAR 的 API 推理成本约 4美元/小时,人类研究员报酬约150美元/小时。实验也暴露出风险:约1600份研究记录中发现39次试图钻评测漏洞的行为。AAR 证明了“自动提出并验证训练改进”已经可行,但研究目标、模型、数据和成功标准仍由人类预先限定,评测指标本身的偏差依旧是核心问题。

来源

9. 开源 OCR It 可在约20毫秒内把简单 PDF 转成 Markdown

Firecrawl 团队联合开发的开源工具 OCR It 以浏览器插件形式运行,使用打包的 Tesseract 在本地识别不可复制 PDF,并将结果导出为可编辑文本。报道中的测试显示,处理一份 PDF 约需 20毫秒,速度比 Docling 快近300倍;按这一速度计算,理论上约3秒可以处理200份文件,且不需要联网或 API Key。

它支持手动框选识别,也能自动执行“截图—OCR—翻页”流程,最多连续处理300页。工具目前更适合版式简单、文字清晰的文档;标题、脚注、表格、公式和正文混排的复杂页面仍可能出现识别或排版问题。对需要把大量资料快速送入 Agent 的场景而言,本地运行和零权限设计是亮点,但复杂文档仍应保留人工抽查。

来源

10. Gemini Omni 1.1 Flash 支持最长40秒场景延展与 4K 输出

Google 发布 Gemini Omni 1.1 Flash 视频生成与编辑模型,重点升级是场景延展:模型现在会参考前 10秒 的上下文,而不是只看最后一帧,并能以10秒为增量连续延展,累计最长 40秒。用户还可以指定首帧和末帧,让模型生成中间的连续镜头,并通过视频参考保持人物或角色一致性。

模型通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 提供服务,支持对话式、状态化编辑:调用方可以传入 previous_interaction_id,在不重新上传视频的情况下继续修改。成本控制方面,360p 草稿据称比720p快 60%、成本约为其三分之一,最终版本可上采样到4K;生成视频带有不可见的 SynthID 水印。限制也很明确:场景延展只能追加到片尾,上传源视频通常不超过10秒,音频参考和声音编辑尚不支持。

来源

© 版权声明

相关文章

暂无评论

暂无评论...