128GB DDR5 套件价格较历史最低价涨了近 10 倍,年内 DRAM 均价上涨 500%,单位内存价格退回到 2007 年水平。
据 Tom's Hardware 梳理与 SemiAnalysis 复盘,超大规模买家已预付定金锁走几乎全部 2027 年全球 DRAM 产能,主流 DRAM 芯片按重量计价值已达黄金的一半以上。
这不是单纯的涨价周期:当 AI 把「HBM + 大显存」变成出货前提,内存从成本项变成了战略物资。芯片能靠制程追,产能和交付期追不上。就算英伟达把 Vera Rubin 铺开,卡的利用率也会被内存卡住。
当价格 itself 成为瓶颈,拼的已经不是谁的模型更聪明,拼的是谁先锁住了明年的内存。
OpenAI 宣布暂停部分前沿强化学习训练 2 周,同时按住最大规模的下一轮 RL 运行,期间强化工作负载隔离、网络隔离与红队测试。
官方表述很直白:能力增速已超过安全与对齐的准备度。Greg Brockman 进一步明确,对安全的信心将越来越多地决定前沿扩展的节奏,影响的主要是更远期的发布,已接近交付的模型不在此列。
工程细节比口径更值得看:采样 token 监控可在约 30 分钟内呼叫安全团队,高风险工具调用推理将带实时监控器上线,整体监控开销约 20%。训练与评估基础设施、推理期监控,第一次被公开认定为前沿进展的瓶颈,不再只是算力。
当安全从事后检查变成进度条本身,「快一点」不再是默认答案。
Qwen3.8-27B 在 Artificial Analysis 代理指数上排到 27B 档第 7,在 Vals Index v2 开源权重榜第 6,并在 Cline 本地模型榜 4 天内冲到第一。
参数不大,覆盖面不小:Harvey 法律基准开源权重第一,声称保留视觉、推理、工具调用与 262K 上下文,并出现了可在 Apple Silicon 上以 2/4/6/8-bit 运行的 refusal-removed MLX 构建。
但榜单与体感的分歧也在放大:有开发者在长任务实测中认为,基准胜利并未稳定转化为对 Opus 4.5 的代际超越。当「能在本地跑」与「能可靠跑完长任务」不再同义,成本、可用性与可控性的三角,成了更硬的考核。
可本地部署的「部分无审查、能力可用」模型,已经不再是假设,这是今年本地模型最实质的变化。
Z.ai 以与 GLM-5.2 相同价格上线 GLM-5.3 API,Artificial Analysis 智力指数报 60(与 Kimi K3 并列),GDPval-AA v2 暴涨 246 分至 1770 Elo。
参数面未变:总参 753B、激活 40B 的 MoE,1M 上下文,权重落地后走 MIT 许可,关键变化在训练工程而非参数本身。
提升来自后训练而非基座:据转引的知乎长文分析,核心是异步 RL(SAO)、可执行沙盒训练与同策略蒸馏以缓解灾难性遗忘。当长周期 agent 能力越来越多由 RL 系统与环境质量决定,参数规模不再是唯一的杠杆。
换言之,GLM-5.3 是一次「环境与训练工程」的胜利。
Modular 宣布 Mojo 以 Apache 2.0 开源,并把平台定位为跨加速器的可移植层,涵盖高通数据中心 AI 加速器在内。
对 infra 工程师而言,意义不在「又一门语言」:工具链开放与硬件抽象同时到位,才让性能代码有可能在不同加速器间搬运,而不重写。
当开源不再只是权重,是整条工具链,吸引力会从模型转移到「在哪写、怎么跑」的那层。Mojo 的下一步,看有多少团队愿意把热路径真的迁过去。
Mojo 以 Apache 2.0 开源 · 工具链与硬件可移植性同台交付
RadixArk 发布 Miles v0.1,历时 9 个月、72 位贡献者、1326 次提交、85 项 GPU 端到端 CI,已在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2 等模型上实测。
定位很务实:把 RL 跑起来容易,调对、跑稳、跑满规模才是瓶颈。于是把功夫下在 rollout、CI、可观测性与环境管道。
这与当天的另一条主线呼应:前沿竞争正从「谁有 PPO/GRPO」转向「谁有可复现的工程栈」。当开源 RL 栈开始拼工程,训练自己的模型会从少数人的特技,变成更多团队的常规动作。
「我们刚抹掉了约 20 年的进展,内存现在和 2007 年一样贵。」
— Daniel Lemire · 计算机科学家 · Tom's Hardware
「理解 token 经济学,比理解模型架构更重要。」
— Nathan Lambert · Interconnects · Interconnects
NVIDIA 发布 TensorRT Model Connect 公开预览,承诺从受支持的 Hugging Face 模型两条命令直转端到端 TensorRT 推理,无需中间 ONNX 导出,结果可经原生 C++ API 部署。
值得单独提一句的是自述:该项目本身大量由 Codex agents 在人工 review 下完成实现、调优、测试、集成与文档。当 infra 团队愿意公开承认 agent 参与了核心链路,工具的「可信交付」也在被重写。
当「转模型」从流水线变成两条命令,部署的摩擦第一次被压到接近零。
Cursor 公开一篇 Git 存储设计复盘:把 Git 托管当作数据库来设计,以应对编码 agent 带来的仓库 churn 与分支/会话激增。
这不是模型发布,但与模型同等相关:后台自动化越多,Git 托管就越从通用 DevOps 原语,变成 AI 编程后端的核心依赖。
对搭建编码 agent 后端的团队来说,这篇笔记比一次模型更新更实用,因为它回答了「规模上来后,哪里会先崩」。当 agent 开始成倍制造提交,底层存储的稳,才是上层体验的稳。
DFlash 2 声称在 M5 Max 上以 70 tok/s 运行 Qwen3.8-27B,相比自回归解码最高提速 4.6 倍,且保持相同输出。
若在独立复现中站住,端侧推理的可用阈值会被重写:本来需要排队上云的长上下文任务,有机会在本地一口气跑完。
当速度开始决定「是否可用」,推理加速不再是参数,是产品体验本身。
Cerebras 发布 CS-4,并给出系列性能宣称:10T 模型约 1000 tok/s、GPT-5.6 Sol 约 1300 tok/s,单位兆瓦吞吐最高 10 倍提升。
即便按厂商口径打折,脉络依然清晰:推理速度正同时成为产品体验、经济账与政策筹码。当「更快」能直接换成更低成本与更高并发,硬件发布就不再只是硬件发布。
当 1000 tok/s 被当作产品语言来卖,速度的军备竞赛已经进入定价表。
据多方转引,hyperscale 买家已预付定金几乎锁完 2027 年全球 DRAM 产能,把现货市场逼成期货市场。
对下游而言,价格只是表象,交付期才是约束:模型可以等,交付不能等;前一年没订到的团队,明年可能根本拿不到量。
当内存按「年」预定,AI 的供应链第一次有了类似能源的期货属性。
今天只有一件事:AI 的瓶颈从算力转到了内存:500% 的涨幅把摩尔定律推回 2007 年,超大规模预定把明年的货先锁死了。
前沿训练因为安全按下了暂停。
两条命令就能把 Hugging Face 模型搬上 TensorRT。
Mojo 把可移植性开源,Miles 把 RL 的工程补齐。
本地 27B 模型开始可用,但「本地可用」不等于「长任务可靠」。
推理速度在端侧与数据中心两端同时被拉高。
当最稀缺的资源不再是卡,谁能把内存、节奏与部署摩擦一起管住,谁就先拿到明年的确定性。
峡谷里的地质史,比任何模型训练都久。
Grand Canyon, Arizona, USA · NASA · 36.06°N, 112.14°W
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。