AI Intelligence Briefing
AI 情报日报
2026-07-21 · 周一 本期 12 条
算力这周是主角的另一面。

英伟达 Vera Rubin 全面投产,把智能体推理的能效拉到 Blackwell 的 10 倍;谷歌一夜三连发,把重点放在「更便宜」而不是「更大」。

当硬件和模型同时学会省钱,AI 工厂才真正像工厂。
Headline
头版
AI 开始管电,但波动仍要人来兜把波动的光伏变成可调度的算力,但真正的硬仗才刚刚开始
NASA 卫星影像:犹他州百万块光伏板组成的太阳能矩阵

加州与得州的数据中心开始用 AI 调度园区用电,把正午过剩的光伏存进储能、在晚高峰释放,单位算力的电费下降约 30%。系统不再按峰值买电,改为跟着太阳和电价走。

当 AI 工厂自己学会省电,「算力自由」的第一步不是更多芯片,是更会用电。

Front Line
前线
Vera Rubin 全面投产,智能体推理能效 10 倍于 Blackwell,但真正的硬仗才刚刚开始

英伟达 Vera Rubin NVL72 进入 full production,单 GPU 配 288 GB HBM4、带宽 22 TB/s,NVLink 6 单 GPU 互连 3.6 TB/s,主打智能体推理。官方称每百万 token 成本约为上一代十分之一。

Rubin 不为跑分设计,为「一直转」设计——agent 反复推理、调工具,吃的就是能效。

英伟达 Vera Rubin 推理架构全面投产

英伟达 Vera Rubin 推理架构全面投产。

Gemini 三连发,3.6 Flash 更便宜,3.5 Cyber 专修漏洞

谷歌 DeepMind 同日发布 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber:3.6 Flash 输出 token 少用 17%,DeepSWE 编码基准最高省 65%,定价 1.5/7.5 美元每百万 token。3.5 Flash Cyber 是修漏洞的安全专用模型,仅向政府与受信伙伴开放。

谷歌这波不打「最大」,打「更便宜」——生产环境里的 agent,先省下来的才是真金。

Google Gemini 3.6 Flash 模型图

谷歌发布新一代 Gemini 3.6 Flash 模型。

Claude Sonnet 4.6 发布,一条命令拉起 8 个子智能体

Anthropic 的 Claude Sonnet 4.6 强化了文件系统工具与子智能体编排 API,父智能体可并行拉起最多 8 个不同类型子智能体,单对话预算从 128 轮提到 256 轮。

单次对话完成一次跨模块重构,不再需要人把上下文拆成四段分头扔进四个会话。

头条 / Anthropic
阿里确认 Qwen 3.8 Max 将开源,2.4 万亿正式版也交权重,不只是预览版

阿里在推文里明确表态,Qwen3.8-Max 的「更完整官方版本」会开放权重给所有人,不只是现在这个 Preview。社区据此解读:最终版 Qwen 3.8 Max 将和 Kimi K3 一样走开源路线,模型规模约为 2.4 万亿参数。

这是卡点,不是跟风。K3 在 716 日发布、27 日交权重,阿里紧接着放「每天在变好、正式版也要开源」——中国开源阵营把「发布即开源」当成了默认动作

把时间线拉平看:GLM、Kimi、Qwen 三家在中国开源里几乎是周更节奏,开源成了每家必须按时交出的常设产品线,不再是「上一代的免费平替」——谁慢一周,谁就在开发者心智里掉一档。

美国对华开源模型动手,不止一纸禁令,是一整套「层层收网」

Axios 报道,美国政府正在考虑对中国先进开源模型(点名 Kimi)实施事实层面的限制,工具包括采购限制、实体清单、安全通告、平台责任条款与舆论施压。

技术圈反应一边倒:Hugging Face 的 Clement Delangue、Palmer Luckey、Margaret Mitchell、Bill Gurley 都反对,理由是「限制开源会伤竞争、伤主权、更伤防守」;

最具象的证据来自 Hugging Face 自曝——一次安全事件里,他们因为闭源 API 的护栏挡住了取证分析,只能改用本地部署的 GLM-5.2 干活。

这让「开源是安全必需品」第一次有了第一手案例:守方需要能改、能本地跑、不被拒答的模型当官方用「国家安全」给开源上锁,防守者先被锁在了门外——禁令的方向,和它宣称的目标正在打架。

AINews · Axios
AI 找到 3D Jacobian 猜想反例,「明显超人类」的数学任务又多了一个实锤

多位数学家与研究者报告,前沿模型帮忙找到了三维 Jacobian 猜想(一个悬置数十年的代数几何问题)的反例。田刚门下、长期研究该问题的数学家 Alexei 说前沿模型「在一些数学任务上已经明显超人类」;OpenAI 内部也承认,一个内部 Codex 变体独立找到了几乎相同的反例并写了完整论证。

这条线今年不是第一次出现——716 日 GPT-5.6 Sol 刚帮宾大教授用 90 分钟推翻一条悬置 30 年的统计猜想。一个月内两起,模型从「复现已知」稳步走向「给出新结论」

真正的冲击在于节奏:当数学家需要的,「算得快」已经不够,要能「给出值得怀疑的方向」。研究者的工作从求解,变成了判断该信哪个解。

AINews · MathOverflow 讨论
OPEN SOURCE · 实用工具前线
开源前线
Gemini 3.5 Flash Cyber 开源思路,漏洞模型先给守方用

3.5 Flash Cyber 定位「修漏洞的特种兵」,谷歌把它放进受限试点,先给政府与安全研究者,而非全盘公开。思路是让防御方先于攻击方拿到能力。

安全模型的开源节奏,比通用模型更讲究「给谁」——能力越强,越不能一把撒出去。

vLLM / SGLang 跟进 K3,开源推理栈连夜适配 2.8 万亿

Kimi K3 发布的同一周,vLLM 与 SGLang 社区就提交对 Stable LatentMoE 的支持补丁,让 896 专家、激活 16 个的架构能在消费级集群跑起来。

模型开源的价值,一半在权重,一半在旁边那群连夜改推理框架的人。

VOICES
声音

「能效才是智能体时代的真瓶颈,不是算力总量,是每度电能出多少 token。」

—— 黄仁勋 · 英伟达 · NVIDIA

「模型便宜下来,agent 才进得了中小企业的后台,而不只是大厂的玩具。」

—— Logan Kilpatrick · Google DeepMind · TechCrunch

CREATE
创造
AlphaFold 3 进药物发现,把蛋白结构预测压到几分钟

DeepMind 把 AlphaFold 3 的接口接进药物发现流水线,研究者上传序列,几分钟内拿到蛋白与分子相互作用的结构假设,原先要几周湿实验。

当结构预测快过写实验申请,生物学的迭代节奏第一次追上了软件。

AlphaFold 3 结构预测大幅提速

AlphaFold 3 结构预测大幅提速。

Google DeepMind
Visual
视觉
用 AI 修复 1960 年的林火影像,黑白胶片长出烟的走向
NASA 卫星影像:澳大利亚林火过后的地貌

一位纪录片导演把 NASA 的野火烟雾卫星图和历史林火胶片一起喂给修复模型,让 1960 年代的黑白画面长出烟的流向与城市轮廓。

创作者第一次能把「当年的火」和「今天的火」放在同一帧里比对——档案活了。

NASA / 创作者
FUNDING
投资与资金流向
Rubin 量产带飞供应链,HBM4 与硅光成新风口

Vera Rubin 全面投产后,HBM4 内存、NVLink 6 交换芯片与硅光互连成为供应链重点,台系与全球代工厂同步扩产。机构预估 AI 服务器本季出货环比走高。

一颗 GPU 的背后,是一整条被重新定价的材料链。

TAKEAWAY
小结

今天的关键词是「省钱」。

Vera Rubin 把智能体推理能效做到 Blackwell 的 10 倍,每百万 token 成本约十分之一;谷歌三连发主打更便宜的 Flash。

AI 开始管园区的电,把正午光伏存进储能、晚高峰释放,单位算力电费降约 30%。

AlphaFold 3 进药物发现,结构预测压到几分钟;编程子智能体一条命令拉起 8 个。

当硬件、模型、用电同时学会省钱,AI 工厂才真的像工厂。

BE CURIOUS
Be Curious

阿拉斯加的火山群,冰川与岩浆共存。

Iliamna Volcano, Alaska, USA · NASA · 60.03°N, 153.09°W
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。