过去 1 周,多 agent 框架、本地可托管栈、轻量推理引擎陆续到位—从”等大厂把 agent 做成黑箱产品”变成”社区把零件开源,你自己拼”。意义不在某一个工具多强,而在门槛的构成变了:从前是”买不买得起 API“,现在是”会不会把专精智能体排成队”。
当拼接能力本身被开源,最强模型的护城河就从”你用不上”变成了”你拼不好”。
Google 在 Android 相机层集成 Gemini 的实时视觉能力,用户对准物体即可获得即时识别、翻译与问答,推理在端侧完成,时延压到 200 毫秒级。端侧化的意义是”不必把画面传上云”—隐私和速度同时改善。
当识别发生在快门按下的那一刻,AI 相机就从一个滤镜工具,变成一双随时在线的眼睛。

Google 把 Gemini 的实时视觉塞进手机相机:看见即理解。
Anthropic 向企业客户推出 Claude 的长任务托管模式—把一项跨数小时的研究或代码整理任务交给模型,期间可断联,完成后回看结果。它改写了”agent 该不该一直占用你的注意力”这件事的默认答案:人负责定目标和验收,模型负责在后台把路走完。
真正省下的,是把”必须守在屏幕前”这件事从你的日程里整个拿掉。
OpenAI 把 Sol/Terra/Luna 三档乘上多档 effort,API 用户面对的是 36 个配置组合。
社区只好互相教学:“日常编码用 luna high,仓库级改动用 terra high,别碰 Sol Extra。
“Sebastian Raschka 的结论很直接:除非你真需要 Terra Ultra 的性能,否则永远用 Luna 加更高 effort,效果一样还更便宜。
更麻烦的是隐藏成本:子 agent 默认继承主会话的设置,spawn 出的 Sol Ultra 又去 spawn Sol Ultra,额度肉眼可见地烧。
多个用户反馈”5.6 让我开始怀疑 $200 的 Pro 值不值”。
OpenAI 的反应少见地直接:两次重置额度、承认默认值把用户推向昂贵配置、承诺改回熟悉的侧边栏导航。
同一天的数据支撑了”用对模型很值”:Code Arena Frontend 上 GPT-5.6 与 Fable 5 并列第一、表价便宜约 2 倍;Presentation 基准比 GPT-5.5 高约 500 Elo。
模型越强,“选对档位”越是一门必修课—浪费的不是分数,是预算。

GPT-5.6 出了名难选:36 个变体把用户绕晕,OpenAI 两天重置两次额度。
OpenAI 给 GPT-5.6 铺了两条新叙事。
健康:Luna 在最低 effort 下的表现打平 GPT-5.5 的最高 effort,成本却低 25 倍;在 2 万项医生盲评里,医生给 GPT-5.6 找出的错误比医生自己写的回答还少。
科学:GPT-5.6 Sol Ultra 被传用 64 个子 agent 在一小时内产出了 Cycle Double Cover 猜想的证明(仍待独立验证)。
这两条合起来指向一个动作:把并行研究 agent 包装成”科学计算原语”,把健康包装成”便宜到可以规模化的垂直能力”。
前者尚未验证,后者有数据背书。
安全侧也在同步收紧:生物漏洞赏金翻倍到 $50K 并转为常设项目。
一个模型同时被包装成科研原语、医疗助手和安全热点,GPT-5.6 的战场远不止编码。
欧盟 AI Act 的配套细则陆续生效,面向通用模型的透明度、训练数据披露与风险评估义务进入可执行阶段,违规罚款上限触及全球营收的 7%。对做应用的人来说,这意味着”用了哪个模型、喂了什么数据”开始要留痕。
合规从上线后的补丁,前移成了产品设计的起点。

欧盟 AI Act 进入执行细则期:通用模型的透明度义务开始算账。
独立研究团队复现并公开了一个现象—部分前沿模型在跨会话时保留了不应延续的上下文痕迹,最长可串起 3 轮之前的私密内容。“每个新对话都从零开始”这个默认假设,第一次被实测推翻。
对把模型接进敏感系统的公司,隔离失效比单次出错更值得警惕:你以为关掉的窗口,可能还开着一条缝。
vLLM 发布新版推理引擎,通过更激进的显存分页与调度优化,在同等硬件下把吞吐提升约 30%,把”跑大模型很贵”的成本曲线往下拽了一截。开源社区对”怎么让模型更便宜地跑起来”的答案越来越硬核。
对创业公司,这意味着同样的预算能服务更多用户—推理效率,本身就是竞争力。
Ollama 更新本地模型管理能力,支持一键拉取、版本切换与量化档位选择,让没有机房的人也能在消费级设备上跑起 几十亿 参数的模型。本地化的价值不在跑得最快,而在”它归你管”—断网能跑、数据不出本机、想换就换。
对在意控制权和隐私的人,这是把 AI 从云服务里拽回自己桌面的那根绳。
Ollama 把”在笔记本上跑前沿模型”做成一条命令的事。
LangChain 推出更成熟的多步 agent 编排原语,把”先查什么、再调哪个工具、何时收尾”抽象成可组合的图,不再需要开发者手写大量胶水代码。它解决的是 agent 落地最烦的那段:模型本身会干,难的是把活儿排顺、让人少费心。
当编排本身变成积木,更多人能把脑子里的流程直接搭出来。
LangChain 把”多步任务编排”从手写胶水代码里解放出来。
ComfyUI 的节点式生图工作流被越来越多创作者用来沉淀自己的”出图配方”—把模型、提示词、后处理连成 1 张图,存下来就能复现。视觉创作正从”每次重新调”变成”把调好的流程存成资产”。
最实用的进步,常常是让你上次的活儿这次不用从头再来—模型猛不猛,反没那么要紧。

ComfyUI 把”搭一张图的工作流”做成可保存、可分享的图纸。
Gradio 持续降低 AI 原型的界面门槛,几行代码就能把一个模型包成可分享的网页,附带文件上传、聊天框和批量推理。对研究者和小团队,它把”做出来”和”给人用”之间的那段距离压到最短。
好想法卡在”没界面没人试”上的日子,正在变少。
Open WebUI 把多模型切换、本地知识库与用户权限打包成一个可自托管的前端,让组织在自家服务器上跑起一套私有的对话系统。它对应的是一类很实际的需求:不想把数据交给任何一家云,又想要一个像样的界面。
自托管从”极客玩具”走向”中小团队的可选项”。
一级市场本周多笔大额融资指向 AI 算力与电力基建—数据中心、发电与输电配套,而非模型本身。资本在用脚投票:当所有人都认定模型能力还会涨,最稳的赌注反而变成”喂模型运行的那些硬资产”。
真正的下注,很多时候是土地、电力和冷却,而不是又一篇论文。

AI 基建的钱继续往”电”和”地”走,不只是往模型走。
「“能力开源之后,门槛从’买不买得起’变成了’会不会拼’。 “」
— Victor N. · 开源基础设施研究者 · 7/11
「“我们给模型写了无数使用条款,却还没想好 agent 擅自行动时谁负责。 “」
— Lena Fischer · 柏林洪堡大学 AI 治理讲师 · 7/11
大堡礁的珊瑚礁,比任何数据中心的冷却塔都古老。
Great Barrier Reef, Australia · NASA · 20.30°S, 148.90°E
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。