AI早报 | 2026年9月14日(周一):Claude Fable 5.1 破解370年古密码、AllSpark 开源397B搜索智能体

AI日报5小时前发布 程序员阿超
1.5K 0 0

1. Claude Fable 5.1 用 44 分钟破解 370 年未解古密码

Anthropic 的 Claude Fable 5.1 在一个开放式任务里破解了 17 世纪英国作家 Sir Thomas Urquhart 留下的「Cyphral Distich」——两行共 64 个数字的密文。这道题 1899 年被《Notes and Queries》当作公开难题刊出,后来被密码史研究者 Klaus Schmeh 收录进「未解密文 Top 50」,此前的频率分析、替换密码、同音替换全部失败。模型的突破点在于两处文本线索:密文紧跟在 Urquhart 的 32 条 Proquiritations 之后,他本人还特意强调「再没有像三十二这样的数字」;配诗则暗示诚实的读者会在里面读到「自己心中的愿望与作者的心意」。据此,这 64 个数字被解读为按 32 个心愿条目做的定位引用。全程 44 分钟、176k tokens、零人工干预,破解方评价这个答案「回头看对人类颇为尴尬」。

来源

2. AllSpark 开源 397B 搜索智能体 Iris-pro,并放出完整训练配方

中国团队 AllSpark 发布两个开源搜索智能体 Iris-mini(35B)与 Iris-pro(397B),分别基于 Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B,统一 256K 上下文,团队称二者在各自参数级别中都是开源搜索智能体里最强的。更值得看的是数据构造方式:训练任务从网页链接结构「反向工程」而来——以种子页及其外链构建术语关系图,再据此生成需要多跳串联才能回答的问题;除最终答案外所有术语都被同义改写,让线索无法靠关键词检索直接命中。只有「参考模型无工具解不出、给对来源后能解出」的题目才进入数据集,两阶段过滤再剔除劣质样本。论文称训练数据与模型还外溢到了没训练过的通用工具调用和办公任务上。

来源

3. 亮源新创连发三项技术,把 2000+ 真实场景搬进仿真

亮源新创(Physical AI 路线)在一个多月内连续发布三项技术:LightParkour 从简短人类动作片段出发,靠物理仿真与课程学习扩展跑酷类复杂接触技能;LightNav-0 基于 Real2Sim2Real 数据引擎,把 2000+ 个互联网来源的真实场景转成可反复使用的仿真环境,产出 4000+ 小时视觉、语言、动作经验用于通用导航后训练;Light REACT 针对外力扰动、跌倒和硬件损伤做全身韧性控制,让机器人依据自身交互历史调整运动方式。公司把这条路线概括为「三段范式」:规模化预训练、规模化对齐、规模化部署形成数据飞轮,目标是让能力可跨环境、跨任务、跨本体扩展,而不是每加一个任务就重训一次。

来源

4. 蚂蚁外滩大会摊开 AI 全景:Ling 3.0、Agentar 超级工厂与 31 项合作

2026 Inclusion·外滩大会上,蚂蚁给出了自己的答案:底层做模型,上层做应用,同时把 AI 从屏幕推向物理世界。百灵模型已迭代到 Ling 3.0,其中 Ling-3.0-flash 总参数 1240 亿、每 Token 仅激活 51 亿,轻量版 Ling-3.0-tiny 为 79 亿总参 / 13 亿激活,flash 还使用超过 1 万个交互式环境训练以强化工具调用。应用侧,医疗 AI「阿福」用户数达 1.5 亿、日均健康咨询约 2000 万次;生活服务入口「阿宝」已完成万余项服务的 AI 化适配;企业侧 Agentar 升级为「商业智能体超级工厂」,预置约 200 个岗位级数字专家模板。蚂蚁数科 CEO 赵闻飙披露,过去两年整体业务年均增长接近 50%,AI To B 增速达到三位数。大会期间蚂蚁数科另在绿色能源、智能终端、酒店文旅、数字内容等领域达成 31 项合作,包括与阜博集团共建版权大模型。

来源 | 来源

5. 斜跃智能完成数亿元天使+轮,押注 Duplex Reasoning 具身基础模型

家庭场景具身基础模型公司斜跃智能完成数亿元天使+轮融资,线性资本、钧山资本、弘颐资本、隐山资本等参投,资金用于具身基础模型训练、算力与数据基建、团队扩充以及家庭机器人本体研发。公司成立于 2026 年 2 月,由理想前 AI 首席科学家、基座模型部门负责人陈伟与理想前产品线总裁张骁联合创立,团队覆盖大模型算法、AI Infra、机器人运控、产品与供应链。技术主张是 Duplex Reasoning:机器人不是「接指令—执行—返回结果」的单工流程,而是让对话通道与行动通道始终同时打开,任务可被打断、修正、接管。落地节奏上,斜跃计划先在酒店、养老院等半结构化场景验证跨空间泛化与单位经济性,再进入家庭,优先探索洗衣、收纳、清洁等高频长程任务,并宣称 2026 年内跑通从采集、清洗、标注到训练的完整能力。

来源

6. ElevenLabs 发布 Music v2.5:免费档每天 5 首无损下载

ElevenLabs 将 Music v2.5 上线 App 与 API,官方称生成的歌曲更饱满自然。在一场包含 47,885 组对比的盲测中,听众多数情况下更偏好 v2.5,R&B、灵魂乐、嘻哈、摇滚与管弦乐尤为明显。免费档每天可下载 5 首无损,Pro 档每月 400 首;免费档商用需署名,Pro 档按行业与用途放开。平台同时收紧版权边界:禁止下载基于他人歌曲生成的作品,也不允许模仿现有音乐人。公司近期与环球音乐(UMG)签下授权协议,但强调该协议只适用于未来的独立产品,不覆盖 Music v2.5;其模型训练数据表述为「有授权的原始素材与音乐」。v2 版本仍可继续使用。

来源

7. 微软 Codename MDASH 进驻 Azure Government

微软把代号 MDASH 的多模型智能体安全扫描系统部署到 Azure Government,并以预览形式提供给美国政府及授权合作伙伴。这套系统专门用于在软件中主动发现安全漏洞,微软称其目的是把攻防优势交回防守方——因为威胁行为者同样在用 AI 搜寻关键任务软件里的弱点。发布方为微软专业云部门总裁兼 CTO Douglas Phillips。在 CISA 等机构持续强调「AI 驱动攻击面扩大」的背景下,政府云正在成为智能体安全工具的第一批规模化试验场。

来源

8. AWS 开源 Pizza Bot:给后台智能体一个「收件箱」

AWS 把内部工具 Pizza Bot 作为开源项目发布,用于托管那些在用户去忙别的事之后仍在继续跑、需要人工审批或需要事后查看结果的 AI 任务。它把结果按邮件式三栏整理:All(线程历史)、Unread(已完成待查看)、Action(暂停等待批准或回答),任务可由手动、cron 定时或 webhook 触发。服务器端持有调度权,宕机后错过的 cron 周期只补跑 1 次,不会重放全部漏掉的时间点。运行时基于 DeepAgents 与 LangGraph 做有状态执行,Hono API 负责执行与存储,Electron、浏览器与终端客户端共用一套 React 界面并通过 HTTP + SSE 通信,代码以 Apache 2.0 授权。内部版本此前已服务超过 2000 名 Amazon 员工,覆盖会前准备、邮件草拟、Slack 摘要、CRM 记录与调研等场景。

来源

9. 后摩智能 M50 装进绿联 HomeAgent:160 TOPS、10W 的本地家庭 AI 中枢

绿联在 9 月 12 日晚的全球发布会上推出与后摩智能合作的 UGREEN HomeAgent HA100 Pro,把本地 AI 算力、本地存储、家庭看护与全屋设备管理放进同一个家庭中枢,摄像画面识别、家庭影像检索、事件摘要与设备联动都在本地完成数据闭环,不走云端。支撑这套体验的是后摩智能 M50:面向大模型端边推理的存算一体芯片,单芯片 160 TOPS,典型功耗仅 10W。对家庭场景来说,关键不是算力数字,而是让更多 AI 任务从云端下沉到本地——这也是端侧 AI 从「部署在设备上」走向「真正参与家庭生活」的一步。

来源

10. 两年课堂实验:禁用 AI 的学生组,成绩两年都垫底

阿姆斯特丹自由大学法学教授 Thibault Schrepel 在自己的「Law of AI」课上做了两年对照实验:学生随机分成禁止使用 ChatGPT、无指导地接受 ChatGPT 改写建议、以及接受法律提示工程与 AI 建议核查训练三组,任务同样是 20 分钟内小组改进一条《欧盟人工智能法案》条款,评分看实质、清晰度、比例原则与创新性。实验 2024 年 66 人、2025 年扩大到 164 人。禁用 AI 组两年都排名最后:多数小组只做措辞润色,10 到 15 分钟后普遍出现研究者所称的「思路枯竭」。而只享受 AI 建议、没有方法训练的那组几乎照单全收,往往理由是「读起来更好」,每个小组都至少保留了一处误导性或法律上多余的术语。研究者本人写下:「我错了」——他原本假设没有引导地使用 AI 弊大于利。

来源

© 版权声明

相关文章

暂无评论

暂无评论...