GPT-5.6 Sol Ultrafast 模式 · 由 Cerebras 驱动 · 14 倍提速
OpenAI 联合 Cerebras 发布 Ultrafast 模式预览:旗舰模型 GPT-5.6 Sol 运行速度最高提升至 Standard 模式的 14 倍,输出速度达 750 token/秒。
这不是新模型,是把现有最强模型「跑得更快」。
750 token/秒是什么概念?
Standard 基线只有约 53 token/秒,据 Artificial Analysis 数据,Ultrafast 比 Fable 5 快 11 倍、比 Opus 4.8 Fast 模式快 5 倍,且官方称无质量损失。
企业客户用同一个模型,响应时间从「等几秒」变成「等零点几秒」。
它面向的是实时场景:语音对话、客服、电商推荐、编程辅助、金融研究、安全响应,这些场景里,速度就是体验,体验就是钱。
而算力来自 Cerebras 的晶圆级芯片,英伟达之外,算力格局第一次多了一个官方认证的名字。
Cerebras 是谁?
一家做晶圆级芯片的公司,把整块晶圆做成一颗芯片,专攻推理加速,之前主要服务医疗和科研机构。
这次被 OpenAI 官方选为 Ultrafast 的算力底座,等于拿到了「大模型推理」赛道的入场券。
对英伟达来说,这是第一次有人在「最顶级模型的官方推荐」里分走一杯羹。
这笔账企业客户算得过来:同样的 GPT-5.6 Sol,输出速度从 53 token/秒拉到 750 token/秒,意味着同一个对话窗口里能塞下更多的多轮交互、更长的上下文处理、更快的 Agent 反馈。
对做实时产品的团队来说,这不是「快一点」,是「能不能做」的区别,之前因为延迟做不了的产品形态,现在有了可能。
当模型能力的差距开始收窄,「谁先出结果」就成了新的分水岭。
不训更强的,但先跑更快的,速度,成了它回击「贵」的方式。
Databricks 官宣完成 50 亿美元战略融资,投后估值 1900 亿美元,从 2 月的 1340 亿涨约 42%。
Coatue 领投,Blackstone、MGX、T. Rowe Price 参投。
CEO Ali Ghodsi 对 TechCrunch 说过一句话:「AI 很贵。」
这轮融资原本计划只融 10 亿美元,但投资人的钱「塞」进来 150 亿,最后定在 50 亿。
为什么拒绝更多?
因为不想过度稀释,也因为公司根本不缺,年化营收已突破 70 亿美元,Q2 同比增长逾 80%,AI 数据产品 Lakebase 年化营收超 1 亿美元。
「想要 10 亿、来了 150 亿」,这个数字差本身就是信号:钱在追着 AI 基建跑。
Databricks 的定位是「AI 时代的数据层」,投资人在为它下注未来十年的数据入口。
当一轮融资能从 10 亿扩到 50 亿还嫌少,说明钱多到开始「通胀」,而通胀的钱,迟早会推高所有 AI 资产的价格。
把时间线拉长看:2025 年 12 月 Databricks 估值 620 亿,2026 年 2 月 1340 亿,现在 1900 亿,半年多涨了两倍。
投资人为什么疯抢?
因为「AI 时代的数据层」是个确定性极强的故事:模型可以换、应用可以换,但企业数据最终要落在一个能管、能查、能喂给 AI 的地方。
Databricks 赌的就是这个入口。
对比同赛道:Snowflake 也在做 AI 数据平台,估值约 800 亿;Databricks 1900 亿几乎是它的两倍。
差距来自执行,Databricks 从湖仓一体做到 Lakebase 实时 AI 数据,把「数据」和「AI」绑得更紧。
当模型能力趋同,谁的底层数据更干净、更实时,谁就更有谈判筹码。
估值半年涨 42%、年化营收 70 亿美元还在融资,AI 数据层的钱,正从「要不要投」变成「抢着投」。
Databricks 想融。
Cursor 官宣 Firetiger 团队加入,这是一次典型的人才收购(acqui-hire),Firetiger 的独立产品将关停,技术并入 Cursor。
Firetiger 由两位前 Cloudflare/Twitch 工程师 Rustam Lalkaka 和 Achille Roussel 创立,此前完成 760 万美元种子轮(Sequoia 领投),核心产品是面向生产环境的 AI agent:监控发布、捕获回归、调查事故,也就是「Change Monitors」。
收购后,这部分能力会并入 Cursor 的 Origin 平台,打通「写代码—生产运行」的完整链路。
为什么是 Cursor?
过去一年,Cursor 从「AI 编辑器」向「Agent 平台」转型:Origin 让 AI 独立跑任务,Change Monitors 让 AI 盯生产环境。
Firetiger 的监控、回归捕获能力,正好补上「代码写完之后」这一环,写代码、跑起来、出了问题 AI 自己发现,这个完整链路 Cursor 想要完整。
对开发者社区来说,这是又一个信号:编码工具的竞争,已经从「谁的补全准」变成「谁能让 AI 从头到尾管住一个项目」。
GitHub Copilot 在做 workspace agent,Cursor 在并购 Agent 团队,终端产品正在吃掉中间层的创业公司,Firetiger 不是第一个,也不会是最后一个。
代价是付费客户:Firetiger 已停止新注册,现有客户收到服务终止通知,数据将被删除。
最顶级的 Agent 人才已经贵到「买比招划算」,而每一次人才收购背后,都有一批被「合并」掉的用户。
Firetiger 团队加入。
Writer 发布新旗舰模型 Palmyra X6,基于北京 Z.ai(原智谱)的开源 GLM-5.2 后训练而成,7440 亿参数 MoE 架构,每 token 约 400 亿活跃参数。
定价直接打价格战:输入 $2/百万 token、输出 $8/百万 token,对比 Claude Opus 4.8 的 15/75 美元,便宜一个数量级。
内部 9 项评测均分 0.87,还略高于 Claude Opus 4.8(0.86)。
更狠的是效率账:Writer Agent 成本平均降 52%、速度提升 48%;harness 优化让各模型任务成本平均降 41%、提速 44%,而后训练只用了 626 条合成轨迹。
当所有模型都在卷「更强」,Writer 卷的是「更省」:企业客户最痛的从来不是模型笨,是 token 账单。
把开源模型调教成「够用且便宜」,正在成为企业市场的新打法。
更深一层看,Writer 的打法是「拿开源模型做商业化」的样板:Z.ai 开源 GLM-5.2,Writer 拿来做后训练调成自己的旗舰,这背后是 2026 年开源模型的通用能力已经追上闭源,给了「二次开发」型公司生存空间。
类似的玩法还有 Together、Fireworks,都在用开源底座做企业定制。
对 Claude、GPT 这些闭源厂商来说,这是压力:当「开源 + 调教」能以 1/5 的价格做到 90% 的效果,企业预算就会分流。
Writer 的评测均分 0.87 略超 Opus 4.8 的 0.86,虽然样本有限,但「够用且便宜」正在成为企业采购的新标准,不是最强的赢,是性价比最高的赢。
「省钱」从运营指标变成了产品卖点,AI 进入精打细算的时代,谁先帮企业省下钱,谁就赢下预算。
Writer 推新模型。
MiniMax 开放 Music 3.0 权重,上架 Hugging Face(MiniMaxAI/MiniMax-Music3),ComfyUI 0.33 同日原生支持,官方原话:「在 AGI 到来之前,我们将一直保持开源。」
参数上它是个「多模块」模型:8B 全局 LLM(初始化自 Qwen3.5-8B)+ 0.6B 局部 LLM + 2.4B flow-matching 模块 + 123M Flow-VAE,能生成长达 5 分钟的完整歌曲,输出 32kHz 立体声。
API 版 7 月已上线,这次是权重开放,本地能跑,意味着不用上传、不用排队、不用按次付费,创作者第一次能「拥有」自己的 AI 配乐工具。
开源音乐模型的生态位很微妙:闭源有 Suno、Udio 这类商业产品,开源此前只有一些小模型。
Music 3 的 8B 全局 LLM + 2.4B flow-matching 架构,把「能生成 5 分钟完整歌曲」的能力放进了本地可跑的范围,配合 ComfyUI 工作流,一个普通创作者能在自己电脑上搭出完整的 AI 音乐流水线。
MiniMax 的逻辑是「开源换生态」:从 H2 到 Music 3,它一直在把旗舰能力开源,靠开发者生态反哺品牌。
对比 Suno 的付费订阅模式,开源路线赌的是「更多人用 → 更多人改进 → 模型迭代更快」的飞轮。
对创作者来说,这是选择权,不想按次付费、不想上传数据的,本地跑一个。
当中国公司的开源从「模型参数」卷到「创作工具」,开源战场的定义被拓宽了,不再专属开发者,每个创作者都能摸到。
阿里发布 Qwen3.8-Max 开放权重:2.4T 总参 / 95B 活跃 MoE,激活率仅约 4%,API 定价 $2/$6 每百万 token,社区评价「迄今最大的开源权重发布之一」。
第三方评测很硬:Frontend Code Arena #4(Elo 1668,仅次于 Claude Opus 5 和 Kimi K3),Vision Arena #2(1305,只差 Claude Fable 13 分);Vals 综合指数 66.1,开源模型第 2、全部 43 家第 10;SWE-bench 87.3%,压过 GPT-5.5(82.6%)和 GLM-5.2(83.3%)。
更值钱的是提速曲线:Vals 指数从 3.7 Max 的 57.5 涨到 66.1,两个半月涨了 8.6 分,价格还从 $2.5/$7.5 降到 $2/$6。
上线当天生态就位:vLLM day-0 支持 + NVIDIA B300/AMD MI355X 专用 4-bit 量化,Together、Baseten 立刻可跑。
但 Jamin Ball 泼了冷水:K3 光加载权重就超 1TB 内存、至少 8 张 H100,开放权重不等于能本地跑;且首发权重是纯文本版,视觉未放开;许可条款疑似限制美欧英韩下载,阿里当天未澄清。
当 2.4T 的开源模型评测逼近闭源旗舰、价格只有零头,「开源和闭源的差距」正在变成「谁能真正用起来」。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,100 万 token 上下文、64K 输出,WebDev Arena Elo 1588 分,API 定价输入 $0.75/百万 token(2027 年起涨到 $1.50)。
官方演示里最抓眼球的是 3D 生成:一句话生成可用的 3D 手表模型,成本约 $0.038,不足 4 美分。
过去 3D 建模是设计师按小时收费的活,现在一句话 + 4 美分。
当生成成本低到可以忽略,「会不会建模」不再是门槛,「想不想做」才是。
但更需要留心的是迭代节奏:3.6 到 3.7 只隔三周。
Google 正在把模型发布从「季度」压缩到「月更」,Flash 系列成了试验新能力的快车道:价格便宜、迭代快、能力不断往上加。
同场配套发布 Nano Banana 图像模型和 Gemini Omni,形成完整产品矩阵。
对开发者的直接含义:模型能力按「月」在涨,选型决策也得按「月」重做,三个月前的最优解,可能已经被更便宜的新版本取代。
3D 内容的生产成本塌缩,可能比图像生成的影响更深,因为 3D 是制造业、游戏、电商的地基,而它正在变成一句「帮我做个 XX」的事。
前沿实验室 在 ChatGPT Mac 桌面版推出 Computer History(电脑历史)功能,取代此前基于截图的 Chronicle 研究预览,面向 Pro、Business、Enterprise 用户,默认关闭,企业需管理员授权。
它的工作方式:不再截屏,改经 macOS 辅助功能记录你的点击、输入、快捷键、应用切换等事件,生成记忆和时间线供 ChatGPT/Codex 引用。
事件会上传服务器生成记忆,前沿实验室 称处理后不保留、不用于训练;交互事件本地保存最长 48 小时,首批不含 EEA、瑞士、英国。
为什么值得注意:这是「AI 记住你」从对话层扩展到屏幕层的第一步。
以前 AI 只记得你说过什么,现在它记得你做过什么,这对 Agent 场景是质变:ChatGPT 可以接着你上次的浏览器操作继续干活,不用你重新交代上下文。
媒体反应很直接:The Register 称它是「友好的键盘记录器」,它能提升个性化,也增加 token 消耗与提示注入风险,前沿实验室 文档自己都提示了这一点,建议涉及他人通信时暂停。
批评者指出:提示注入攻击可以借这个记忆通道污染 AI 的长期上下文。
当 AI 开始记录你的屏幕,「便利换隐私」的交易,用户往往还没看清条款就点了同意,这次的条款里,写着「键盘记录器」四个字。
Suno 发布 Studio 2.0,新增 MIDI 导入/录制/编辑(可当生成提示)、双振荡器波表合成器、轨道自动化曲线、内置效果器(失真、延迟、混响、压缩、EQ),当日向 Premier 用户开放。
最值得注意的更新是 Chat 栏:用自然语言就能创建自定义插件,上线初期不消耗 credits,AI 音乐工具开始把「调音」也变成对话。
Premier 用户可无限导出 32-bit/48kHz 多轨与分轨,高级分轨分离也来了。
Suno 说 MIDI 是 Studio 最受需求的功能,2.0 基于过去一年用户反馈开发,目标是把 Studio 从「简易 AI 编辑器」升级为「完整 DAW 式制作环境」。
MIDI 加入意味着什么?
你可以把亲手弹的旋律导入,AI 在此基础上编曲,人机协作从「给一句话」变成「给一段真实的演奏」。
对创作者的分层是清晰的:Pro 用户能用新合成器和效果器精修;Premier 用户拿无限多轨导出做商用级混音。
AI 音乐工具的竞争,正在从「谁能生成更长的歌」转向「谁能接进专业工作流」,DAW 式能力成了分水岭。
当 AI 音乐开始对标专业制作工具,「灵感到成曲」被压缩到分钟级,会写旋律的不再是稀缺,会「指挥 AI」的才是。
Suno Studio 2.0:AI 音乐走向专业 DAW 式制作。
图:Suno 官方。
Anthropic 与比特币矿商 Riot Platforms 签订 20 年算力租约(至 2048 年 6 月):191 MW 关键 IT 容量,初始合同收入约 91 亿美元,两次 5 年续约后最高 161 亿。
这笔交易的细节很硬核:Riot 的德州设施 2027 年 12 月交付 96 MW,2028 年 6 月前交付剩余 95 MW;Morgan Stanley 提供过渡贷款;AMD 是同一园区的另一租户,矿场正在变成 AI 算力园区。
为什么找矿商买电?
矿场有现成的工业电力、冷却和场地,转型 AI 数据中心的成本比新建低得多。
Anthropic 一边 60 亿收购补模型,一边 91 亿锁定算力,头部实验室的竞争,已经变成以十年为单位的资本锁定。
AI 的军备竞赛,从「谁更强」变成了「谁先锁死资源」,而这一次,锁的是德州 2048 年之前的电。
Anthropic 锁定 20 年算力。
「扎克伯格写了 6,500 字的 AI 宣言—但几乎什么也没说。」
— Wired 评论 · Zuckerberg AI Manifesto · Wired
「AI 很贵。」
— Ali Ghodsi · Databricks CEO
今天的关键词是「快」:模型提速 14 倍、一句话出 3D、AI 音乐能商用。
钱也在追:想融 10 亿来了 150 亿,数据层的估值被抬到 1900 亿。
当能力开始够用,速度、成本和门槛,成了新一轮竞赛的起跑线。
大堡礁的珊瑚礁,比任何数据中心的冷却塔都古老。
Great Barrier Reef, Australia · NASA · 20.30°S, 148.90°E
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。