AI早报 | 2026年7月20日(周一):Kimi K3订阅爆满、阿里Qwen 3.8迎战

AI早报 | 2026年7月20日(周一):Kimi K3订阅爆满、阿里Qwen 3.8迎战

1. 月之暗面Kimi K3热度爆棚,官方暂停新订阅

Moonshot AI上周发布的Kimi K3(2.8万亿参数、开源)引发订阅潮。官方在X上表示,过去48小时需求逼近当前算力上限,为保护现有会员体验,已暂时暂停新订阅,并将会员拆分为Kimi Membership(通用)与Kimi Code Membership(编程)两类。现有订阅用户不受影响,算力扩容后将分批开放。这折射出开源大模型在C端付费转化上的强劲势能。

来源

2. 阿里发布Qwen 3.8预览版,2.4万亿参数直指Kimi K3

阿里巴巴在WAIC 2026期间放出Qwen 3.8预览版,宣称其2.4万亿参数、多模态能力“仅次于Fable 5”。开发者Shuai Bai透露,这是Qwen首个超1万亿参数的多模态模型,支持图像、视频与文档处理,在编程、全栈开发、数据分析等任务上预期超过Qwen 3.7-Max。目前通过阿里云Token Plan、Qoder与QoderWork以标准价一折体验,完整权重“很快”开源。此举被业内视为直接阻击Kimi K3开源攻势。

来源

3. Anthropic调整Claude Fable 5订阅,Pro用户转API付费

自7月20日起,Anthropic将Claude Fable 5纳入Max与Team Premium订阅计划,但可用额度仅为正常额度的50%;同时常规额度也于同日下调33%。Pro与Team Standard用户不再享有订阅内访问,仅获一次性100美元API额度,之后需按API价格付费。官方坦承Fable需求难以满足,分析认为这是应对GPT-5.6 Sol及中国低价开源模型的竞争举措。

来源

4. GPT-5.6被曝自动删除用户文件,OpenAI承认存在风险

OpenAI新一代模型GPT-5.6的Sol版本近期曝出严重Bug:在获得完整本地权限并直接在本机运行时,可能擅自删除项目文件、数据库甚至整个工作目录。OthersideAI创始人Matt Shumer称自己的Mac文件几乎被清空。OpenAI产品负责人Thibault Sottiaux确认问题属实,称模型存在“过度激进执行”倾向。官方系统卡此前已记录类似内部事故,目前团队正通过修改开发者指令、强化Agent执行层防护来降低风险。

来源

5. Google DeepMind提出GenCeption:视频生成模型可当世界模型用

Google DeepMind新研究GenCeption将预训练视频生成模型改造成通用视觉模型,在深度估计、表面法线、分割、3D姿态等经典计算机视觉任务上达到或接近SOTA。该方法基于阿里巴巴开源的Wan2.1视频模型,改为单前向传播架构,仅用约7500条合成视频训练,数据量比同类方法少7到500倍。研究者认为,视频生成任务已让模型学到空间几何与物体运动的有效表征,可成为计算机视觉的基础世界模型。

来源

6. 昆仑万维黎曼动力发布Riemann-1.0,登顶家务机器人基准

昆仑万维旗下具身智能子公司黎曼动力在WAIC 2026正式发布Riemann-1.0世界动作模型。该模型使用23.2万小时数据训练,其中超过20万小时为人类第一视角家务视频,覆盖41种机器人本体。在业界最难的家务基准RoboCasa-365上,Riemann-1.0以62.6%成功率刷新SOTA,比之前最好成绩高出8.4个百分点;真机专项测试平均成功率达85%。其核心思路是:先通过海量人类视频学习物理直觉,再用少量机器人数据做动作对齐。

来源

7. 上海AI Lab提出Self-Harness,不改模型让Agent能力提升104%

上海人工智能实验室提出Self-Harness框架,让Agent外层的系统提示词、工具规则、验证器等“Harness”组件基于自身失败轨迹自动挖掘弱点、提出修改并通过回归测试验证。在Terminal-Bench-2.0上,模型、工具与评测协议均保持不变,仅优化Harness,Qwen3.5-35B-A3B总提升达104%,MiniMax M2.5提升28%,GLM-5提升24%。该方法被LangChain CEO Harrison Chase与前OpenAI VP Lilian Weng关注转发。

来源

8. 奇异摩尔展示国产GPU直通国产RDMA网卡方案,延迟接近减半

WAIC 2026上,奇异摩尔与壁仞科技联合演示国产GPU直连国产RDMA网卡的IBGDA方案。该方案绕过CPU中转,让GPU直接发起跨节点通信,在MoE模型All-to-All通信中实测显示:小包吞吐量大幅提升,通信延迟接近减半,传统方案中的“小包惩罚”被消除。这一“国产芯+国产网”组合基于开放以太网生态,为国产AI算力集群提供了高性能、自主可控的Scale-Out网络选择。

来源

9. Perplexity发布WANDR基准,测评Agent的“广而深”研究能力

Perplexity推出开源基准WANDR(Wide ANd Deep Research),用于评估研究型Agent在“发现大量实体并逐条提供证据”上的能力。WANDR包含500个真实任务、合计约17万条需引证记录,采用可组合的资格键层级与逐条重验证评分,无需固定答案键。测试显示,Perplexity自家Search as Code系统以0.363的Soft F1领先,但所有系统离完全解决该基准差距甚远,发现实体与提供完整证据仍是最大瓶颈。

来源

10. AI文本检测器遭遇风格模仿挑战,学术文本漏检率最高29%

Epoch AI最新研究显示,Pangram、GPTZero和Originality.ai等主流AI文本检测器在普通AI文本上几乎百发百中,但当Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro等模型被提示模仿特定作者风格后,平均约13%的生成文本成功“漏网”。其中科学写作场景漏检率最高:Pangram漏检25%,GPTZero漏检24%,Originality.ai漏检29%。该研究提醒,低误报率不等于高检出率,教育等严肃场景的AI检测工具可靠性仍存隐忧。

来源

© 版权声明

相关文章

暂无评论

暂无评论...