Stripe 超 70 亿美元收购 OpenRouter · 支付巨头握住「AI 收银台」
Stripe 敲定以超 70 亿美元收购 OpenRouter,AI 模型聚合路由平台。此前华尔街日报报道谈判价约 100 亿美元,最终成交低于传闻。
OpenRouter 是干嘛的?一个「模型中转站」:开发者用一个 API 就能调几百个模型,自动路由到最合适的供应商、比价、切换。它不做模型,做的是「模型市场的入口」。
Stripe 为什么买它?Stripe 是支付公司,但正在变成 AI 时代的「钱」,模型调用要按 token 付费,而 OpenRouter 是所有付费的入口。买了 OpenRouter,等于握住「谁为 AI 付钱」的闸门。
当支付公司开始买模型路由器,「AI 的钱往哪流」第一次有了一个明确的收银台,OpenRouter 就是那个收银台。
一位顶尖数学家公开评价 LLM:它是强大的计算器,但缺乏真正的创造性思维。
这给「AI 能解数学难题」的叙事补了一刀清醒剂:AI 擅长的是「已知规则的极致执行」,计算、推导、模式匹配,而数学真正的突破来自「定义新问题」的创造性,这正是 LLM 缺的。
这不是贬低:能算、能推、能验证,已经是数学研究的强大工具。「AI 是计算器不是数学家」,真正的分界,在「会不会问新问题」。
Anthropic CEO 谈当下 AI 反弹:本质上是「信任危机」,不是技术危机。
核心观点:公众对 AI 的抵触,不在它太强或太弱,在于「不知道能不能信它」,数据怎么用、内容是不是 AI 写的、能力边界在哪,这些信任问题正在侵蚀整个行业的公信力。
呼应最近的动向:Anthropic 推水印检测、公布工作原理,都是在「重建信任」这个方向上做文章。当行业从「拼能力」转向「拼信任」,谁能先让用户放心,谁就拿到下一阶段的入场券。
Mojo 开源 · Apache 2.0 · 一次编写跨加速器运行的可移植层
Modular 正式开源 Mojo,采用 Apache 2.0 许可,同时把整个平台定位成「跨加速器可移植层」,覆盖到高通的数据中心 AI 加速器。
对基础设施工程师来说,这件事的重点不在「新语言」本身,而在工具链开放与硬件抽象同时到来:写一次代码,能跑在 NVIDIA、AMD、高通、自研芯片上,不用为每个加速器重写一遍。
为什么现在做?加速器正在碎片化,芯片战争让「为单一硬件优化」变成高风险押注,可移植层反而成了稀缺品。当硬件越来越分裂,谁提供「一次编写、到处运行」的中间层,谁就站在了生态的入口。
NVIDIA 发布 TensorRT Model Connect 公开预览:受支持的 Hugging Face 模型可直接转换成端到端 TensorRT 推理,不再需要中间的 ONNX 导出,产物用原生 C++ API 部署。
部署链路每短一步,从模型到生产的时间成本就降一截。「两条命令」意味着中小团队也能把开源模型快速跑进生产环境,而不必养一个推理优化团队。
更值得注意的细节:NVIDIA 自己说,这个项目大部分由 Codex agent 在人工审查下构建,实现、调优、测试、集成、文档都有 agent 参与。当基建厂商开始公开承认「agent 写了我们的工具链」,AI 开发 AI 从演示变成了日常。
Cursor 发布 Git 托管大规模基建复盘:把 Git 存储当作数据库来设计,可靠性、扩展性、一致性,按数据库的标准要求它。
背景是 agent 的普及:代码仓库的变动频率、后台自动化、分支与会话的激增,都在指数级放大。Git 托管从「通用的开发运维原语」,变成了编码 agent 后端依赖的核心 AI 基础设施。
对普通开发者的含义很直接:你 IDE 里每一次 agent 补全、每一个自动分支,背后都是 Git 在承受新的负载。当代码托管开始为 agent 重新设计,开发工具链的下一轮重构,已经悄悄开始了。
端侧与数据中心同时提速:DFlash 2 声称在 M5 Max 上把 Qwen3.8-27B 跑到 70 tok/s,自回归解码最多快 4.6 倍「同样的输出」;Cerebras 发布 CS-4,声称 10T 参数模型跑到 1000 tok/s、GPT-5.6 Sol 约 1300 tok/s、每兆瓦吞吐高 10 倍。
厂商口径要打折听,但方向很清楚:推理速度正在同时变成产品体验、单位经济学和国家竞争力政策,快,本身就是卖点。
端侧 70 tok/s 的意义在「本地」:不联网、不上传、隐私留在设备上,还能跑出接近实时的速度。当「快」从数据中心卷到笔记本,AI 的使用方式正在被改写。
MiniMax Music 3 · 8B 全局 LLM + 2.4B 流模型,5 分钟立体声本地可跑 · ComfyUI 0.33 原生支持
MiniMax 开放 Music 3.0 权重,上架 Hugging Face(MiniMaxAI/MiniMax-Music3),ComfyUI 0.33 同日原生支持,官方原话:「在 AGI 到来之前,我们将一直保持开源。」
参数上它是个「多模块」模型:8B 全局 LLM(初始化自 Qwen3.5-8B)+ 0.6B 局部 LLM + 2.4B flow-matching 模块 + 123M Flow-VAE,能生成长达 5 分钟的完整歌曲,输出 32kHz 立体声。
API 版 7 月已上线,这次是权重开放,本地能跑,意味着不用上传、不用排队、不用按次付费,创作者第一次能「拥有」自己的 AI 配乐工具。
开源音乐模型的生态位很微妙:闭源有 Suno、Udio 这类商业产品,开源此前只有一些小模型。
Music 3 的 8B 全局 LLM + 2.4B flow-matching 架构,把「能生成 5 分钟完整歌曲」的能力放进了本地可跑的范围,配合 ComfyUI 工作流,一个普通创作者能在自己电脑上搭出完整的 AI 音乐流水线。
MiniMax 的逻辑是「开源换生态」:从 H2 到 Music 3,它一直在把旗舰能力开源,靠开发者生态反哺品牌。
对比 Suno 的付费订阅模式,开源路线赌的是「更多人用 → 更多人改进 → 模型迭代更快」的飞轮。
对创作者来说,这是选择权,不想按次付费、不想上传数据的,本地跑一个。
当中国公司的开源从「模型参数」卷到「创作工具」,开源战场的定义被拓宽了,不再专属开发者,每个创作者都能摸到。
阿里发布 Qwen3.8-Max 开放权重:2.4T 总参 / 95B 活跃 MoE,激活率仅约 4%,API 定价 $2/$6 每百万 token,社区评价「迄今最大的开源权重发布之一」。
第三方评测很硬:Frontend Code Arena #4(Elo 1668,仅次于 Claude Opus 5 和 Kimi K3),Vision Arena #2(1305,只差 Claude Fable 13 分);Vals 综合指数 66.1,开源模型第 2、全部 43 家第 10;SWE-bench 87.3%,压过 GPT-5.5(82.6%)和 GLM-5.2(83.3%)。
更值钱的是提速曲线:Vals 指数从 3.7 Max 的 57.5 涨到 66.1,两个半月涨了 8.6 分,价格还从 $2.5/$7.5 降到 $2/$6。
上线当天生态就位:vLLM day-0 支持 + NVIDIA B300/AMD MI355X 专用 4-bit 量化,Together、Baseten 立刻可跑。
但 Jamin Ball 泼了冷水:K3 光加载权重就超 1TB 内存、至少 8 张 H100,开放权重不等于能本地跑;且首发权重是纯文本版,视觉未放开;许可条款疑似限制美欧英韩下载,阿里当天未澄清。
当 2.4T 的开源模型评测逼近闭源旗舰、价格只有零头,「开源和闭源的差距」正在变成「谁能真正用起来」。
Z.ai 发布 GLM-5.3 API,面向编码、防御性网络安全和长周期 agent,价格与 GLM-5.2 持平;Artificial Analysis 智能指数 60 分追平 Kimi K3,GDPval-AA v2 跳升 246 分到 1770 Elo。
架构没动:仍是 753B 总参 / 40B 激活的 MoE、1M 上下文,权重落地后保持 MIT 许可。同样的骨架,更强的结果,提升来自 post-training。
知乎上的长文解读给出了技术细节:异步强化学习(SAO)、可执行沙箱训练、on-policy 蒸馏防止灾难性遗忘,三者叠加撑起了这次跃升。当模型厂商开始用「训练方法」并非单纯是「参数规模」拉开差距,agent 能力的竞争,正从堆参数转向堆 RL 系统与环境质量。
Gemini 3.7 Flash · 距 3.6 仅三周,100 万上下文 64K 输出 · 一句话出可用 3D 模型约 $0.038
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,100 万 token 上下文、64K 输出,WebDev Arena Elo 1588 分,API 定价输入 $0.75/百万 token(2027 年起涨到 $1.50)。
官方演示里最抓眼球的是 3D 生成:一句话生成可用的 3D 手表模型,成本约 $0.038,不足 4 美分。
过去 3D 建模是设计师按小时收费的活,现在一句话 + 4 美分。
当生成成本低到可以忽略,「会不会建模」不再是门槛,「想不想做」才是。
但更需要留心的是迭代节奏:3.6 到 3.7 只隔三周。
Google 正在把模型发布从「季度」压缩到「月更」,Flash 系列成了试验新能力的快车道:价格便宜、迭代快、能力不断往上加。
同场配套发布 Nano Banana 图像模型和 Gemini Omni,形成完整产品矩阵。
对开发者的直接含义:模型能力按「月」在涨,选型决策也得按「月」重做,三个月前的最优解,可能已经被更便宜的新版本取代。
3D 内容的生产成本塌缩,可能比图像生成的影响更深,因为 3D 是制造业、游戏、电商的地基,而它正在变成一句「帮我做个 XX」的事。
OpenAI 在 ChatGPT Mac 桌面版推出 Computer History(电脑历史)功能,取代此前基于截图的 Chronicle 研究预览,面向 Pro、Business、Enterprise 用户,默认关闭,企业需管理员授权。
它的工作方式:不再截屏,改经 macOS 辅助功能记录你的点击、输入、快捷键、应用切换等事件,生成记忆和时间线供 ChatGPT/Codex 引用。
事件会上传服务器生成记忆,OpenAI 称处理后不保留、不用于训练;交互事件本地保存最长 48 小时,首批不含 EEA、瑞士、英国。
为什么值得注意:这是「AI 记住你」从对话层扩展到屏幕层的第一步。
以前 AI 只记得你说过什么,现在它记得你做过什么,这对 Agent 场景是质变:ChatGPT 可以接着你上次的浏览器操作继续干活,不用你重新交代上下文。
媒体反应很直接:The Register 称它是「友好的键盘记录器」,它能提升个性化,也增加 token 消耗与提示注入风险,OpenAI 文档自己都提示了这一点,建议涉及他人通信时暂停。
批评者指出:提示注入攻击可以借这个记忆通道污染 AI 的长期上下文。
当 AI 开始记录你的屏幕,「便利换隐私」的交易,用户往往还没看清条款就点了同意,这次的条款里,写着「键盘记录器」四个字。
Anthropic 与比特币矿商 Riot Platforms 签订 20 年算力租约(至 2048 年 6 月):191 MW 关键 IT 容量,初始合同收入约 91 亿美元,两次 5 年续约后最高 161 亿。
这笔交易的细节很硬核:Riot 的德州设施 2027 年 12 月交付 96 MW,2028 年 6 月前交付剩余 95 MW;Morgan Stanley 提供过渡贷款;AMD 是同一园区的另一租户,矿场正在变成 AI 算力园区。
为什么找矿商买电?
矿场有现成的工业电力、冷却和场地,转型 AI 数据中心的成本比新建低得多。
Anthropic 一边 60 亿收购补模型,一边 91 亿锁定算力,头部实验室的竞争,已经变成以十年为单位的资本锁定。
AI 的军备竞赛,从「谁更强」变成了「谁先锁死资源」,而这一次,锁的是德州 2048 年之前的电。
DRAM RAMageddon · 128GB DDR5 套件 10 倍于低点,超大规模买家已锁定 2027 年几乎全部产能
Tom's Hardware 用「RAMageddon」形容当下:128GB DDR5 套件比历史最低价贵了整整 10 倍,内存价格 12 个月涨了约 500%。
更硬核的是供给端:超大规模买家据报已锁定 2027 年几乎全部的全球 DRAM 产能,预付定金只为保证供应,主流 DRAM 芯片按重量算,每公斤价值已超过纯金的一半。
Daniel Lemire 的观察最扎心:内存单价回到了 2007 年的水平,抹掉了约 20 年的进步,这是历史级异常。当「摩尔定律」在内存上反向运行,AI 的成本结构正在被悄悄改写,算力之外,存储成了新的稀缺资源。
「扎克伯格写了 6,500 字的 AI 宣言—但几乎什么也没说。」
— Wired 评论 · Zuckerberg AI Manifesto · Wired
「AI 很贵。」
— Ali Ghodsi · Databricks CEO
今天的关键词是「快」:模型提速 14 倍、一句话出 3D、AI 音乐能商用。
基建也在提速:Mojo 开源、两条命令部署、Git 当数据库用。
但内存涨了 500%,回到 2007 年,快,是有代价的。
当能力开始够用,速度、成本和门槛,成了新一轮竞赛的起跑线。
巴塔哥尼亚的安第斯山脉,在 2026 年南半球初秋被一层新雪勾出轮廓。
Snow in the Shadow of the Andes · NASA · 45.00°S, 72.00°W
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。