加州与得州的数据中心开始用 AI 调度园区用电,把正午过剩的光伏存进储能、在晚高峰释放,单位算力的电费下降约 30%。系统不再按峰值买电,改为跟着太阳和电价走。
当 AI 工厂自己学会省电,「算力自由」的第一步不是更多芯片,是更会用电。
英伟达 Vera Rubin NVL72 进入 full production,单 GPU 配 288 GB HBM4、带宽 22 TB/s,NVLink 6 单 GPU 互连 3.6 TB/s,主打智能体推理。官方称每百万 token 成本约为上一代十分之一。
Rubin 不为跑分设计,为「一直转」设计——agent 反复推理、调工具,吃的就是能效。
英伟达 Vera Rubin 推理架构全面投产。
谷歌 DeepMind 同日发布 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber:3.6 Flash 输出 token 少用 17%,DeepSWE 编码基准最高省 65%,定价 1.5/7.5 美元每百万 token。3.5 Flash Cyber 是修漏洞的安全专用模型,仅向政府与受信伙伴开放。
谷歌这波不打「最大」,打「更便宜」——生产环境里的 agent,先省下来的才是真金。
谷歌发布新一代 Gemini 3.6 Flash 模型。
Anthropic 的 Claude Sonnet 4.6 强化了文件系统工具与子智能体编排 API,父智能体可并行拉起最多 8 个不同类型子智能体,单对话预算从 128 轮提到 256 轮。
单次对话完成一次跨模块重构,不再需要人把上下文拆成四段分头扔进四个会话。
阿里在推文里明确表态,Qwen3.8-Max 的「更完整官方版本」会开放权重给所有人,不只是现在这个 Preview。社区据此解读:最终版 Qwen 3.8 Max 将和 Kimi K3 一样走开源路线,模型规模约为 2.4 万亿参数。
这是卡点,不是跟风。K3 在 7 月 16 日发布、27 日交权重,阿里紧接着放「每天在变好、正式版也要开源」——中国开源阵营把「发布即开源」当成了默认动作。
把时间线拉平看:GLM、Kimi、Qwen 三家在中国开源里几乎是周更节奏,开源成了每家必须按时交出的常设产品线,不再是「上一代的免费平替」——谁慢一周,谁就在开发者心智里掉一档。
Axios 报道,美国政府正在考虑对中国先进开源模型(点名 Kimi)实施事实层面的限制,工具包括采购限制、实体清单、安全通告、平台责任条款与舆论施压。
技术圈反应一边倒:Hugging Face 的 Clement Delangue、Palmer Luckey、Margaret Mitchell、Bill Gurley 都反对,理由是「限制开源会伤竞争、伤主权、更伤防守」;
最具象的证据来自 Hugging Face 自曝——一次安全事件里,他们因为闭源 API 的护栏挡住了取证分析,只能改用本地部署的 GLM-5.2 干活。
这让「开源是安全必需品」第一次有了第一手案例:守方需要能改、能本地跑、不被拒答的模型。当官方用「国家安全」给开源上锁,防守者先被锁在了门外——禁令的方向,和它宣称的目标正在打架。
多位数学家与研究者报告,前沿模型帮忙找到了三维 Jacobian 猜想(一个悬置数十年的代数几何问题)的反例。田刚门下、长期研究该问题的数学家 Alexei 说前沿模型「在一些数学任务上已经明显超人类」;OpenAI 内部也承认,一个内部 Codex 变体独立找到了几乎相同的反例并写了完整论证。
这条线今年不是第一次出现——7 月 16 日 GPT-5.6 Sol 刚帮宾大教授用 90 分钟推翻一条悬置 30 年的统计猜想。一个月内两起,模型从「复现已知」稳步走向「给出新结论」。
真正的冲击在于节奏:当数学家需要的,「算得快」已经不够,要能「给出值得怀疑的方向」。研究者的工作从求解,变成了判断该信哪个解。
3.5 Flash Cyber 定位「修漏洞的特种兵」,谷歌把它放进受限试点,先给政府与安全研究者,而非全盘公开。思路是让防御方先于攻击方拿到能力。
安全模型的开源节奏,比通用模型更讲究「给谁」——能力越强,越不能一把撒出去。
Kimi K3 发布的同一周,vLLM 与 SGLang 社区就提交对 Stable LatentMoE 的支持补丁,让 896 专家、激活 16 个的架构能在消费级集群跑起来。
模型开源的价值,一半在权重,一半在旁边那群连夜改推理框架的人。
「能效才是智能体时代的真瓶颈,不是算力总量,是每度电能出多少 token。」
—— 黄仁勋 · 英伟达 · NVIDIA
「模型便宜下来,agent 才进得了中小企业的后台,而不只是大厂的玩具。」
—— Logan Kilpatrick · Google DeepMind · TechCrunch
DeepMind 把 AlphaFold 3 的接口接进药物发现流水线,研究者上传序列,几分钟内拿到蛋白与分子相互作用的结构假设,原先要几周湿实验。
当结构预测快过写实验申请,生物学的迭代节奏第一次追上了软件。
AlphaFold 3 结构预测大幅提速。
一位纪录片导演把 NASA 的野火烟雾卫星图和历史林火胶片一起喂给修复模型,让 1960 年代的黑白画面长出烟的流向与城市轮廓。
创作者第一次能把「当年的火」和「今天的火」放在同一帧里比对——档案活了。
Vera Rubin 全面投产后,HBM4 内存、NVLink 6 交换芯片与硅光互连成为供应链重点,台系与全球代工厂同步扩产。机构预估 AI 服务器本季出货环比走高。
一颗 GPU 的背后,是一整条被重新定价的材料链。
今天的关键词是「省钱」。
Vera Rubin 把智能体推理能效做到 Blackwell 的 10 倍,每百万 token 成本约十分之一;谷歌三连发主打更便宜的 Flash。
AI 开始管园区的电,把正午光伏存进储能、晚高峰释放,单位算力电费降约 30%。
AlphaFold 3 进药物发现,结构预测压到几分钟;编程子智能体一条命令拉起 8 个。
当硬件、模型、用电同时学会省钱,AI 工厂才真的像工厂。
阿拉斯加的火山群,冰川与岩浆共存。
Iliamna Volcano, Alaska, USA · NASA · 60.03°N, 153.09°W
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。