Simon Willison 发布 LLM 0.32,称这是项目初始发布以来最重要的一次升级。
推理轨迹可以输出到 stderr,不污染标准输出;新增 OpenAI Responses、服务端工具、content-addressable SQLite logs;默认模型切到 GPT-5.6 Luna。
对开发者来说,这意味着三件事同时落地:能看到模型「怎么想的」(推理轨迹)、能接服务端工具(不只是本地)、能查历史(SQLite 日志)。
以前模型是黑箱,现在从思考到调用到记录,全链路可查。
Simon Willison · 官方图 · LLM 工具链全链路可查
Simon Willison 在 M5 Max MacBook Pro 上跑通了 MiniMax H3(PipeNetwork/minimax-h3-mlx)。
下载约 115GB,生成一个视频接近 45 分钟。
视频效果不错,但音频因为没给提示,变成了「怪异的语音噪声」。
这是本地跑的常态:权重拿到了,提示词还得自己调。
当开源视频模型能本地跑,调参的乐趣和烦恼,都回到了用户手里。
MiniMax H3 跑进 MacBook:下载 。
阿里把 Qwen3.8-Max 的开源时间定在下周:2.4T 总参数、95B 激活,API 定价 $2 输入 / $6 输出每百万 token,同批开源的还有 27B 的小旗舰 Qwen3.8-27B。
第三方评测把它的位置摆得很清楚。
Frontend Code Arena 上 1668 Elo 排第 4,只落后 Claude Opus 5 Max(1705)和 Kimi K3 Max(1676);Vision Arena 1305 排第 2。
Vals 综合指数 66.1,是开源模型第 2、全部 43 家第 10。
SWE-bench 87.3%,压过 GPT-5.5(82.6%)和 GLM-5.2(83.3%)。
更值得看的是提速曲线:Vals 指数从 3.7 Max 的 57.5 涨到 66.1,两个半月涨了 8.6 分,价格还从 $2.5/$7.5 降到 $2/$6。
分数在涨,价格在跌,两个方向第一次一起动。
这份规格把「开源」和「能跑」之间的距离拉到史上最大。
95B 激活对上 2.4T 总量,激活率只有约 4%,比 Qwen3-235B 更极端的稀疏 MoE。
Jamin Ball 算了笔账:K3 光加载权重就超过 1TB 内存,至少 8 张 H100 起步,开放权重不等于能本地跑,真正的价值在生态影响力。
还有一层悬案,有开发者指出许可条款疑似禁止在美、欧、英、韩下载使用,阿里当天没有澄清。
开放权重可能只是「能下载」,不等于「能合法用」。
当开源旗舰从「别人服务器上能调」变成「权重发到你手里」,竞争的第一性问题从模型多聪明,变成了谁能真正用起来。
Qwen3.8-Max 宣布开源 2.4T 旗舰:。
Simon Willison 继续围绕 MCP 工具链做实验,说明 7 月 31 日的规范变化已经开始带动工具链更新。
他已经在 LLM、Datasette、MCP 之间打通更多工作流。
对开发者来说,这意味着 agent 工具接入会更像普通 Web 服务,并非单纯是复杂的协议握手。
「这是项目初始发布以来最重要的一次升级。」
— Simon Willison · LLM 作者 · simonwillison.net
「coding agent 的价值,不在会写代码,而在能自己验证代码。」
— Steve Yegge · 软件工程师 · simonwillison.net
LLM 0.32 把推理轨迹、服务端工具、SQLite 日志一起搬上桌。
MiniMax H3 第一次在 MacBook 上本地跑通,下载 115GB、生成 45 分钟。
MCP 工具链围绕「无状态」重组,agent 接工具越来越像接 Web 服务。
这一天的主角是开发者工具,AI 的价值,正在从「模型多聪明」转向「工具多顺手」。
峡谷里的地质史,比任何模型训练都久。
Grand Canyon, Arizona, USA · NASA · 36.06°N, 112.14°W
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。