AI早报 | 2026年7月19日(周日):Kimi K3 2.8T参数开源、商汤银河计划启动、OpenAI GPT-Red 曝光
1. 月之暗面发布Kimi K3,全球首个开源2.8万亿参数模型
Moonshot AI正式发布Kimi K3,成为全球首个开源的2.8万亿参数级模型。它采用稀疏Mixture-of-Experts架构,每次前向传播激活16个、共896个专家,原生支持视觉、文本和视频,上下文窗口达100万token。K3引入Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)两项架构创新,官方称在百万token场景下解码速度最高提升6.3倍,训练效率提高约25%,整体缩放效率比K2高出约2.5倍。API定价为缓存命中0.30美元/百万token、缓存未命中3美元/百万token、输出15美元/百万token。评测中,K3在BrowseComp、SWE Marathon、OmniDocBench等任务上领先,目前已在Kimi.com、Kimi Code和API上线。
2. OpenAI公开GPT-Red自动红队模型,发现“伪造思维链”攻击
OpenAI披露了内部自动红队模型GPT-Red的细节。该模型通过自博弈强化学习训练,专门用于发现提示注入等安全漏洞。在复现的间接提示注入竞技场中,GPT-Red对GPT-5.1的攻击成功率达到84%,而人类红队仅为13%。GPT-Red还发现了一类新的直接提示注入攻击“Fake Chain-of-Thought”,可在目标模型的推理日志中植入伪造条目。值得注意的是,GPT-Red最强的攻击对GPT-5.6的成功率已低于23%,显示出新一代模型防御能力的提升。
3. NVIDIA发布Nemotron 3 Embed,8B版本登顶RTEB
NVIDIA AI发布Nemotron 3 Embed嵌入模型系列,包含8B-BF16、1B-BF16和1B-NVFP4三个开源版本,均基于Mistral模型、采用双向注意掩码,最大序列长度32,768 token。其中8B-BF16在RTEB检索基准的16项公开任务平均NDCG@10上排名第一;1B-BF16较前代基线提升10.4分;1B-NVFP4在Blackwell上可实现约2倍于BF16的吞吐,仅损失0.38分,保留99.5%的精度。该系列面向RAG、Agentic检索、代码检索和Agent记忆等场景。
4. Google Cloud上线Always-On Memory Agent,不用向量库和嵌入
Google Cloud在ADK示例库中发布Always-On Memory Agent,一个基于Gemini 3.1 Flash-Lite的常驻后台Agent。它通过Ingest、Consolidate、Query三个子代理把结构化记忆写入SQLite,完全不需要向量数据库和嵌入。系统默认每30分钟自动整合记忆,支持27种文件类型,并提供HTTP API与可选的Streamlit管理面板。这种“持续LLM整合”模式与RAG的被动检索形成鲜明对比,适合个人知识库、客户支持等需要长期记忆的场景。
5. Netflix披露已在约300部作品中使用生成式AI
Netflix联席CEO Ted Sarandos在Q2财报电话会上表示,2026年至今公司已在约300部影片/剧集中使用生成式AI流程,应用最集中在后期制作。纪录片《The American Experiment》包含17分钟AI辅助镜头,制作速度提升一倍、成本减半。Sarandos强调,AI不会取代创作者,而是给艺术家提供更好的工具,并称节省的成本“很可能”会用于制作更多内容,而非削减Netflix约200亿美元的内容预算。
6. Databricks估值达1880亿美元,五个月涨54%
Databricks宣布由Coatue领投的新一轮融资,公司估值达到1880亿美元,较今年2月的1340亿美元上涨54%,预计本轮融资约30亿美元。Databricks已从大数据公司转型为企业AI平台,推出面向AI Agent的数据库Lakebase、AI网关Unity以及多Agent协调“元工具”Omnigent。CEO Ali Ghodsi近期还公开了内部基准测试结果,称开源模型特别是智谱GLM 5.2,在编程任务上已能以更低成本达到与闭源前沿模型相当的能力。
7. Anthropic调整Claude Fable 5订阅权益,Pro用户需转API付费
Anthropic宣布自7月20日起调整Claude Fable 5的订阅策略:Fable 5将纳入Max和Team Premium计划,但可用额度仅为正常额度的50%;Pro和Team Standard用户将不再享有订阅内访问权限,仅获得一次性100美元API额度,之后需按API价格付费。官方坦承Fable需求远超当前供给,这次调整也被视为对Kimi K3等低成本高性能竞争者的回应。
8. 商汤大装置启动“银河计划”,共建5个万卡级国产智算集群
WAIC 2026期间,商汤大装置联合近20家生态伙伴发布国产AI基础设施“银河计划”,将建设1个Token运营中心和5个万卡级国产智算集群,合作伙伴涵盖寒武纪、华为昇腾、摩尔线程等国产芯片厂商。商汤称其异构混推技术可将主流国产芯片MFU提升85%至152%,整体推理性价比达到NVIDIA H系列的1.25倍;算电协同Agent实现平均电费低于同地区IDC 10%、算力负荷预测准确率96%。此外,商汤与国星宇航达成太空算力合作,计划2030年建成千颗级算力卫星、总算力超万P的“商汤太空算力星座”。
9. 云天励飞公布DeepVerse芯片路线图,剑指“百亿Token一分钱”
云天励飞在WAIC 2026上披露未来AI推理芯片路线图,计划推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款云端推理芯片,分别针对Prefill、Decode和Decode FFN三种负载优化。DeepVerse100P面向百万级上下文Prefill,DeepVerse100D支持1024卡Scale-up及光互联,DeepVerse100L采用3D Memory以提升FFN带宽。三芯将在万卡异构集群中按负载分离部署,并配合IFWA软件栈与“1001计划”,长期目标是实现“百亿Token一分钱”。
10. 百度秒哒发布3.5版,市场份额居中国AI原生无代码平台第一
百度秒哒在WAIC 2026发布3.5版本,新增SEO Agent智能流量优化、iOS App一键打包、多应用共享后端、一句话生成Skill、数据库多环境隔离、后端资源分级等六大能力。沙利文报告显示,2026年上半年百度秒哒以33.4%的市场份额位居中国AI原生无代码应用生成平台第一(按MAU计)。平台累计服务超3500万用户,创造了350万个具有商业价值的应用,每天有近20万人使用这些应用解决真实问题。