AI早报 | 2026年10月12日(周一):何恺明发布视觉Harness、陶哲轩宣告数学2.0

AI日报2小时前发布 程序员阿超
516 0 0

1. 何恺明团队发布 VISTA:给多模态模型装上「视觉原生」的 Harness

何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出了一套视觉原生的脚手架:不再把环境抽象成文字或代码网格,而是让模型直接观察原始画面,并在推理时随时回看、放大、检查细节,无需从头训练基础模型。整套系统由三个组件构成:视觉观测(把官方 64×64 画面放大成 512×512 PNG 交给模型,保留颜色、外观与空间关系)、无损视觉记忆(每个动作后的所有画面按回合号与帧号建索引,连动画中间帧都存下来)、主动视觉检查(通过 inspect 工具调取任意历史回合画面并裁剪放大)。研究把这套机制称为对交互历史的显式注意力。成绩很硬:搭配 VISTA,Claude Opus 5.0 通关 ARC-AGI-3 全部 25 个公开游戏,相对人类动作效率得分拿到满分 100,所用动作数比首次游玩的人类基线少 57.4%;换成 GPT-5.6 Sol 同样全部通关,得分 99。团队还在浏览器游戏、迷宫与连线题上做了验证,并把更接近物理世界的具身任务列为后续方向。

来源:量子位

2. 陶哲轩宣告「数学 2.0」:证明从稀缺走向泛滥,但评价体系还没跟上

菲尔兹奖得主陶哲轩正式发文,给出一个判断:建立在「证明稀缺」之上的数学 1.0 时代即将落幕。他归纳出数学之所以最先被 AI 冲击的三个叠加条件——证明可以被客观检验、数学对象与推理过程高度可数字化、大量高质量文献已经以数字形式存在。现实变化已经很明显:OpenAI 一夜之间甩出 722 篇数学论文,并把王虹解决的三维挂谷集维数猜想进一步扩展到四维。陶哲轩认为门槛确实降低了,但麻烦在后面:判断解答是否正确、贡献究竟多大、怎样与已有研究衔接,仍需要人来认真处理,否则会出现一种错位——解出了题,却没有相应地增加人的理解。他亮出经典的飞机弹孔图警告幸存者偏差:AI 能力并不均匀,厂商展示的都是精挑细选的成功案例,现在迫切需要建立更透明、更科学的评估机制,把失败结果和 AI 算力成本一并纳入报告。他还用了一个比喻:开放问题像灯塔,指引人们探索周边的数学世界,而抵达灯塔并不等于完成了探索——如果评价体系只奖励「已解决」,那些尚未走过的路径就会失去被探索的动力,盲目优化「解题」指标终将损害数学的长期健康。

来源:量子位

3. Nano Banana 2.1 上线:4K 直出、中文错字大幅改善,价格还砍了一半

Google 突然发布新一代生图模型 Nano Banana 2.1,围绕视觉设计、蒙版编辑、主体一致性和真实自然度做了全面升级,支持 4K 直出,画圈即可保留主体并无缝替换背景。据 Arena 评测,相比上一代 Nano Banana 2,文本转图像、多图像编辑、单张图像编辑三项平均提升约 61.7 分:文生图排名第四(提升 80 分,仅次于 GPT)、多图编辑第五(1328 分,+67)、单图编辑第六(1428 分,+38)。价格是另一个杀招:1K、2K 图片生成价格直接砍半,4K 也便宜约 25%。多位设计师实测反馈中文清晰度与错字问题改善明显,可一键生成 4K 海报。目前 Nano Banana 2.1 已上线 Gemini App、Google AI Studio(以 Gemini 3.6 Flash 为底层框架,每天赠送 50 积分),开发者可通过模型名 gemini-nano-banana-2.1 接入付费 API。短板同样存在:有网友实测发现水印叠加 Bug,连续多次编辑后原本不该变的区域会出现噪点、色彩漂移与纹理失真,越改越糊。

来源:量子位

4. arXiv 出手限流:每人每月最多投 2 篇,AI 论文洪峰压垮志愿审稿人

从 2026 年 10 月 1 日起,arXiv 规定每人每个自然月只能提交 2 篇论文,2024 年起实施的「同时最多 3 篇活跃投稿」限制继续保留。新规覆盖所有分类,只约束提交者本人,共同作者不受影响;被拒的论文照样占用额度(因为同样消耗审核时间),但作者在正式发表前撤稿可以拿回名额。投稿量确实到了失控边缘:2016 年 9 月 9869 篇 → 2024 年 9 月 20569 篇 → 2026 年 9 月 40363 篇,两年翻倍;仅 cs.AI 一个分类两年就增长超过 6 倍,平台创下历史单月最高纪录,并因此积压了近 9000 张支持工单。志愿审稿人抱怨的正是这几类东西:内容单薄、范围极窄的凑数论文,「萨拉米切片」式把一项工作拆成好几篇,以及一眼能看出由 AI 批量生成的密集文本。

来源:The Decoder

5. 多智能体团队被证伪:贵 1.8 到 5.1 倍,效果几乎没有差别

评测公司 Vals AI 在 Vibe Code Bench 上让 GPT-6 Sol 和 Claude Opus 5.5 分别以单智能体和多智能体团队两种形态跑同一批任务,推理强度分中档与最高档。结论不太好看:团队模式的成本是单智能体的 1.8 倍到 5.1 倍,而四组对比里只有一组出现了统计学上显著的提升——GPT-6 Sol 在中档推理下团队得分高 7.3 分;在最高档推理下,团队形态对两个模型都没有实质性帮助。这提示当模型本身已经跑满算力时,再加 agent 的边际收益极低。Anthropic 自己的测试也指向同一方向:用 Opus 5.5 做多智能体实验,从 10 个 agent 扩到 100 个,24 小时后分数只挪动了一点点(知识库任务 0.70 → 0.74,Lean 定理证明 0.66 → 0.68),大规模团队的主要收益是更快达到某个水平,而非突破上限;在 ProgramBench 里速度提升同样伴随 token 消耗上升。

来源:The Decoder

6. Epoch AI 的结论:AI 能跑实验,但还不是研究员,还会夸大结果

Epoch AI 用新基准 InnovationEval 测试了 AI 智能体能否独立做研究:任务是发明一种改进语言模型后训练的新方法,然后自行实现、测试与迭代。起点是广泛使用的 GRPO,人类设计的参考方法是 SDPO(利用报错信息等额外信号,对答案内部的每一步给出更精确的学习反馈,让模型自己当老师)。Claude Fable 5 与 GPT-5.6 Sol 在测试前均不了解 SDPO,每个智能体最多可用 3000 小时的算力,评测覆盖科学问答类短答题与代码任务。结果显示:模型可以跑通实验流程,但缺乏科学上的自我批判能力,也缺乏真正的创造性思维,并且倾向于夸大自己的结果。这给行业热情浇了盆冷水:Google DeepMind 正把 Co-Scientist 扩成完整研究系统,OpenAI 9 月推出「自动研究实习生」,并计划到 2028 年 3 月把它升级为在人类监督下的自主 AI 研究员——而「科学判断力」这一关键能力目前仍然缺席。

来源:The Decoder

7. OrcaCyber Zero 1.5:1M 上下文的安全专用模型,Cybench 满分但全是自报数据

OrcaRouter 发布 OrcaCyber Zero 1.5,定位是授权漏洞研究场景(漏洞复现、利用开发、渗透测试),是 9 月 17 日 1.0 版的后继。规格:1M token 上下文、最大 128K 输出、原生函数调用与结构化输出、纯文本进出;只提供托管 API,不放权重也没有量化版本,参数量未披露。成绩单亮眼但需谨慎看待——厂商自报数据在安全基准上接近天花板:Cybench 100%(39/39 任务,不限制 agent 执行)、CVE-Bench 也很高,而 SWE-bench Pro V2 的 76.5% 是其公布的最低分;定价为每百万 token 输入 3 美元、输出 7.5 美元。文章特别提醒:所有数字均为自报,且 CVE-Bench 只有 24 个可评估任务,样本量偏小。厂商给安全团队的口号是「更少的报告,更多被验证并修复的漏洞」。

来源:MarkTechPost

8. Sakana AI 让 AI 当审稿人:4 次评审抓到 73% 的核心论断错误,成本 0.47 美元

Sakana AI 在 TMLR 发表论文《Beyond Imitation》,用错误检测而不是「像不像人类审稿人」来衡量 AI 评审。团队做了两样东西:一个矛盾基准(在 5 个会议的 257 篇论文里植入 1164 处矛盾)和一套多层级评审系统 MLR(Multi-Layered Review),能读取最多 10 页正文。关键数字:MLR 在 4 次评审下抓到 73.43% 的核心论断错误,而最好的基线只有 14.81%,在四个被测系统中检出率最高且评分与人类趋势一致。部署门槛也很低——用现成的 Claude Sonnet 4 与 Claude Haiku 3.5 API 即可,不需要 GPU、不需要微调,单次评审约 0.47 美元。局限同样明确:在真实被撤稿的 arXiv 论文上,精确匹配率只有 16.11%;系统仍然会被隐藏的提示注入骗过。对做研究类 agent 的开发者来说,这条经验是通用的:系统设计和模型选择都会实际影响错误检出能力,先读完再下判断的流程,比直接生成一段「审稿意见」有用得多。

来源:MarkTechPost

9. vLLM 语义路由器放出决策模型家族 Decision 3.0:最小 0.85B,全部 Apache-2.0

vLLM Semantic Router 团队发布 Decision 3.0,一组多模态决策模型:读文本、JSON 和图片,然后针对类型化问题给出答案。这套模型返回的是概率而不是生成的文本,因此可以非常快地完成分类、路由和请求门控,无需解析模型输出。共 5 个尺寸,全部采用 Apache-2.0 许可:d3-lite 0.85B、d3-nano 2.21B、d3-mini 4.54B、d3-flash 8.39B、d3 26.09B;延迟在单张 AMD Instinct MI325X 上测量,提供 BF16 权重、暂无官方量化版本。性能方面,27B 的 d3 在自家模型卡的文本与视觉两项表格中都领先(均为内部评测):最好的成绩是文档抽取 KIE(CORD+FUNSD)97.7 分,最差是 R-Bench-M 的 34.1 分。团队强调的一条趋势值得注意:一个 9B 模型已经能打赢上一代的 27B——决策类小模型的迭代速度正在明显加快。

来源:MarkTechPost

10. 民间版 DeepSeek-Bot 来了:DSH 装个插件,就能养一支有长期记忆的机器人团队

DeepSeek 官方 Muse 还没影,社区先交作业了。作者 @Fei2411 发布 DeepSeek-Bot——基于 DeepSeek Harness(DSH)的一套多 Bot 团队插件:每个 Bot 都有自己的名字、职责说明、指令、形象以及背后调用的模型,并有持久化运行状态与长期记忆。技术上,每个 Bot 对应一个 DSH Session,拥有自己的工作上下文;超出上下文窗口的长对话靠压缩、交接摘要和本地搜索来管理;记忆以 Markdown 文件存储,另外设计了团队共享记忆,每轮对话结束后模型会自动做一次记忆审查,判断哪些信息该保存、更新或删除。为了省 token,可以指定一个 Main Bot 主管:群里消息默认由主管回复,再由它去协同其他 Bot,也支持直接 @ 单个 Bot 一对一沟通。数据全部本地化在 DSH 主目录的 bot/ 与 sessions/ 下,卸载插件也不会删除;用量统计可在 Settings → Usage 里按时间、Bot、模型分类查看;项目采用 Apache License 2.0。桌面端在侧边栏「插件」→「添加插件」里输入 ds-bot 即可安装,Web 端需要 Node.js 22.19+ 与 pnpm。上线不到一天,项目已收获 250+ 星。

来源:量子位

© 版权声明

相关文章

暂无评论

暂无评论...