AI早报 | 2026年9月6日(周日):Claude 11天完成费马大定理首个机器验证证明、陶哲轩警告AI“抢答”或伤数学

1. Claude 用 11 天完成费马大定理首个机器可验证证明

Anthropic 9 月 5 日宣布,Claude 完成了费马大定理的首个端到端、可由计算机完整检查的形式化证明——把人类 350 多年才攻克的命题,翻译成约 1300 万行 Lean 代码,过程基本自主运行了 11 天,共证明 3 万多个中间定理(最终证明用到约 2.95 万个),代码规模超过 Lean 核心数学库 Mathlib 的 5 倍,全程消耗约 60 亿个输出 token

背景的戏剧性在于:怀尔斯 1995 年给出 129 页证明后,”把证明形式化”被数学界公认是以年为单位的工程——帝国理工 Kevin Buzzard 2024 年才启动多年社区计划,仅蓝图就写了 86 页。主导此事的 Anthropic 研究员彭天翼(清华姚班 2017 届本科、MIT 博士、哥伦比亚大学助理教授)原本只想测试 Claude 能把项目推多远,结果一路推到终点:他自研的协作平台 Prove2Me 把证明拆成一张定理依赖 DAG,几十个 Claude 智能体并行分工推进,人类只给过”Jacobian 作为概型优先级很高”这类高层指令。过程并非一帆风顺——早期智能体协作”失忆”导致失败,失败尝试留下的代码约占成品非模板代码的 7%。Buzzard 审阅后评价这是”非凡的自动形式化成就”,证明只用 Lean 的三个标准公理,且经 comparator 核对与 Mathlib 中的陈述完全一致。

来源 · 量子位

2. 陶哲轩罕见警告:AI 把孪生素数上界压到 186,黑盒”抢答”恐伤数学

一向积极拥抱 AI 的菲尔兹奖得主陶哲轩,9 月 5 日罕见公开发出 AI 告警,称当前这一幕是”令人无语“:GPT-6 Astra 发布前后,OpenAI 宣布用 Lean 形式化证明把”存在无穷多对间距不超过 H 的连续素数”的上界从 246 压到 186,Anthropic 与 Axiom 的模型同期也各自缩到 188 和 212。这条战线从张益唐的 7000 万起步,经 Maynard 的 600、Polymath 的 246 一路走低;牛津数学家 Julia Stadlmann 8 月 31 日刚凭平滑模数的新估计缩到 240,陶哲轩庆幸她”赶在问题被污染之前”公开了分析。

陶哲轩警惕的不是”AI 能不能做数学”,而是解题太快、过程太黑盒会掩盖数学研究中宝贵的失败——那些看似死胡同的路线为何失败,本身往往极具启发性。他以纳维-斯托克斯方程全局正则性为例:人类攻克它的过程中诞生了 Leray–Hopf 弱解、Beale–Kato–Majda 爆破判据等一批奠基性思想;若一个自主 AI Harness 在巨量算力下把试错全程在内部跑完,公司又把通往答案的路径隔绝在公众视野之外,那么问题在技术意义上被解决了,数学本身却几乎没获得新增价值,严重时 AI 对数学的影响可能从正面变成净负面。

来源

3. 更新:GPT-6 Astra 开始向 Pro、企业与 API 用户铺开

OpenAI 正在把新旗舰 GPT-6 Astra 从”发布”推进到”放量”。OpenAI 帮助中心最新信息显示,由 Astra 驱动的 GPT-6 Pro 已开始在 ChatGPT Pro($100/$200 两档)、Business 与 Enterprise 计划中推送,Pro 用户可在 Chat、Work 和 Codex 中调用 Astra;公司此前表示数日内将扩展到 Plus、API 与 AWS。CEO 阿尔特曼亲自下场吆喝,称”货到了”。在 7 月智能体失控事件后,OpenAI 为 Astra 增加了额外安全护栏,并先向网络安全项目 Daybreak 的参与组织开放——”发布→安全审查→分批放量”成为这次旗舰上线的节奏,也把”旗舰模型的可获得性”推成了比跑分更现实的竞争维度。

来源

4. 光象科技×清华发布 Phi-WM 1.0:一个”训练完就退场”的世界模型

9 月 5 日,具身智能公司光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0(代号 ActEffect),思路相当”反骨”:传统世界模型像机器人的”脑内沙盘”,执行时也要在线推演未来;ActEffect 的受控世界模型只在训练阶段检查动作后果,把反馈写进策略权重,等机器人真正上岗时它便退出部署链路——执行阶段不展开未来预测,省时延、省算力。

训练时,策略会先交出三版动作答案(前馈反应、MIP 粗提案、精修提案),世界模型逐一预测后果并与真实未来比较,用排序损失推动更好的提案逼近真实观测,还加了梯度截断防止”差答案靠更差来衬托好答案”。语言指令留在 VLA 一侧,世界模型只看画面和动作,未来状态放进冻结的 DINOv3 特征空间。效果上,ActEffect 在 LIBERO 达 98.8%、加入七类分布偏移的 LIBERO-PLUS 达 80.3%(对比 Fast-WAM 的 51.5%)、29 维动作空间的 RoboCasa-GR1 达 67.5%。这家清华孵化的公司瞄准汽车工厂:焊接上下料、移动质检等工位已完成真机验证,其 Phi-Bot X1 在蔚来焊接场景连续运行 3 天、累计 21.5 小时零失误零中断。

来源

5. Uber × Wayve 在伦敦上线英国首批自动驾驶网约车

Uber 与英国自动驾驶公司 Wayve 9 月 3 日宣布,伦敦成为英国首个可在 Uber App 上打到自动驾驶行程的城市:乘客叫 UberX、Uber Electric 或 Uber Comfort 时,可能免费被匹配到一辆 Wayve 车(也可拒绝换乘普通车)。车队基于福特 Mustang Mach-E,搭载 Wayve 的端到端 AI Driver——不依赖高精地图与海量规则,而是让系统学习理解环境、像人类一样适应新路况;初期出于监管要求,安全驾驶员仍坐在方向盘后监督,属于”有人监督的自动驾驶”。

伦敦窄街、密集行人与自行车流的复杂路况被视为严苛的试炼场。双方计划把合作从伦敦起步扩展到 12 个市场,Wayve 也在同步测试完全无人驾驶版本。这是继特斯拉 Cybercab 在奥斯汀开启商业首秀后,自动驾驶出行在全球主流打车平台的又一次落地。

来源

6. 阿里更新旗舰模型 Qwen3.8-Max:前端编程能力跃居全球第一

阿里本周更新旗舰模型 Qwen3.8-Max,在编程与专业办公场景做了专项后训练。在聚焦前端编程(WebDev)的全球权威三方榜单 CodeArena 上,新版得分提升 22 分至 1691 分,超越 Claude Opus 5、Kimi K3 等一众模型,位居总榜第一;CodeArena 同步更新的性价比榜单显示,Qwen3.8-Max 每百万 token 综合成本约 5 美元,处在帕累托前沿,官方称”斩杀”所有定价高于 5 美元的竞品。

Qwen3.8-Max 是千问迄今最强的模型:总参数 2.4 万亿、支持 100 万 token 上下文,更新后涌现出更强的智能体编程能力,更适合企业复杂任务、科研与长周期工作。目前新版已上线千问开放平台提供 API,千问办公、Qoder 与千问 App 已第一时间接入。

来源

7. Anthropic 开源 Claude Commerce Agents:购物与商家智能体的”通用蓝图”

Anthropic 开源了 Claude Commerce Agents——一套让开发者几天内跑起电商智能体的蓝图(github.com/anthropics/commerce-agents),包含两类角色:面向消费者的 Shopping Agent(理解自然语言需求、检索比较商品、多件加购、回答订单退换货问题、把购物车交接给支付)和面向商家的 Merchant Agent(销售分析、库存监控、定价促销建议、营销草稿,改动需人工批准),并附零售、旅行、电信、票务四类行业的参考实现与 Claude Code 插件。

架构上,它把产品搜索等高频逻辑放在 prompt 里,把长尾能力拆成 skills(search-discovery、customer-care、memory-personalization 等),通过 StorefrontBackend 接口对接各家目录、购物车与订单系统。Shopify 同日发布参考实现,可把智能体直接连到真实店铺;Anthropic 展示了 Shopify、Priceline、Visa、Mastercard、Intuit 等一串合作名单。其深层信号是”Agent 化电商“的标准之争——这套开源协议与 OpenAI、Stripe 此前推动的 Agentic Commerce Protocol 正在并行定义未来”AI 替你买东西”的交易接口。

来源

8. 纽约公立学校新政:2-K 至 8 年级禁用生成式 AI,波及近 60 万学生

纽约市长 Mamdani 与教育总监 Samuels 宣布面向 2026-27 学年的 AI 新政:学生使用生成式 AI 被按下一年暂停键——从 2-K 到 8 年级全面禁止,波及约 60 万学生、占全市公立学校近三分之二;陪伴型聊天机器人则在所有年级禁用。教师仍可使用符合安全标准的 AI 工具,部分辅助技术与特殊教育需求可豁免;新政还配套了新的屏幕时间限制。

值得注意的是,纽约对高中采取的是”教着用”路线:高中生每年要上两节 45 分钟模块,学习偏见、风险、伦理与 AI 对职业的影响,最多 5 万名学生可在教师监督下参与精选 AI 工具试点。政策逻辑是给低龄学生留出打好基础、不因过早依赖 AI 而失去基本能力的时间窗口,同时让青少年为 AI 无处不在的未来做准备。这套”低年级禁、高年级教”的分层做法,也引发了关于一刀切与差异化孰优的讨论。

来源 · CNBC 分析

© 版权声明

相关文章

暂无评论

暂无评论...