Mistral 发布 Agentic Search,把检索做成 search、open、navigate、read、grep 五个工具的多步循环:在 FinanceBench 的 368 份 SEC 文件、约 53,900 页语料上,准确率比一次性 RAG 拉高 47–53 个百分点,全循环最高 59。
更有意思的是账目:完整循环比只搜索的版本少花 24%–34% 的 token,因为模型不再反复抓错文档。代价同样明码标价:p90 延迟 154 秒,平均 71 秒。它适合财报、合同、扫描件这类答案藏在表格脚注里的场景,不适合要秒回的对话。
当检索的瓶颈从「找没找到」变成「读没读懂」,RAG 的竞争就从向量库转向了 agent 的翻页能力。
FinanceBench 准确率对比 · 五工具循环相对一次性 RAG 的提升幅度(数据整理:AIReiter)
Perplexity 把 Agent API 推向全部开发者:单一端点接入 9 家提供商的 41 个前沿模型,内置网页搜索、代码执行与 MCP 连接,每次请求按需组装检索管道。
这一步把模型路由、搜索层、沙箱和监控收进一张账单:Sonar 客户已默认迁移,45 天后 Agent API 成为唯一入口。当编排本身成为产品,单点模型的比价就变成了整套运行时的比价。
Promptwatch 的追踪显示,ChatGPT 搜索开始大规模使用 site: 运算符圈定来源,Reddit 被引用的概率明显下降;Simon Willison 尝试核对系统提示词是否更新,没有找到实锤。
对做内容分发的人来说,这是平台单方面改写了流量规则:你的内容被不被引用,取决于一版你看不到的提示词。搜索引擎优化之后,答案引擎优化也进入了黑箱时代。
阿里推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端与深度搜索环境。
它的野心在「真实世界」四个字:不止看懂截图,还要在真机界面里点得准、走得通。当 agent 的手从 API 伸向屏幕,每一块没接 API 的屏幕都成了可编程的入口。
Modular 在 ModCon 上宣布 Mojo 语言整体开源,编译器与工具链以 Apache 2.0(含 LLVM 例外)放进 GitHub 仓库;一周前 Mojo 刚到 1.0,源码稳定承诺先行,开源随后兑现。
高通收购之后的这步棋指向异构计算的地基:一套代码跑 CPU、GPU 和各家加速器,MAX 也转为 source-available。编译器补丁今年底开放贡献,标准库则从 2024 年起一直在收 PR。
当 AI 的软件地基开始统一,写一次、处处加速才有了可信的起点。
Mojo 的 GPU kernel 写法 · 语言级抽象直接对接加速器
Bun 1.4 发布,是 Rust 重写后的首个稳定版:2,900+ 项修复,空闲 CPU 降到原来的 1/5,内存最多省 35%,Linux 启动快 50%。
最值得盯的是实验性的 Bun.WebView:运行时内置无头浏览器,macOS 走系统 WebKit,其他平台走 CDP。Simon Willison 用约 150 行 TypeScript 做出 shot-scraper 风格的 JSON API,跑完整 Chrome 只要 192–256MB 内存。
当抓取和自动化成了 agent 的日常家务,把它做进运行时比装一堆依赖体面得多。
「Mistral 把 Perplexity 式搜索包成原生 agent 工具,省得我们自己写脆弱的抓取管道。」
— AbdoKerdawy · AI 产品开发者 · X
「进入异构计算的时代,开放标准能加速 GPU、CPU 与各类加速器的协同部署。」
— Sid Sheth · d-Matrix 创始人兼 CEO · ModCon 2026
「美国仍然领先,但前沿模型的高价越来越难维持。」
— FinanceYF5 · X 财经博主 · X
前端工程师 Daniel Vaughn 发布实验性编辑器 HuzZah:你在 .hz 文件里写声明式伪代码,保存时编辑器以 diff 为 prompt 同步生成真实代码,伪代码与代码并存,成为持久的意图记录。
出发点很具体:他发现自己几乎全靠 coding agent 干活后,提示词用完即弃,agent 在复杂代码库里越走越乱。把「我想要什么」存成文件,agent 才有得可回溯。项目还在概念验证阶段,HN 上的讨论对多文件场景仍有怀疑。
当 AI 写码成为默认,意图的存放位置就成了新的工程问题。
Huzzah 工作流示意:保存 .hz 伪代码时以 diff 为 prompt 再生成真实代码
Black Forest Labs 的 FLUX Video Upscale 在 OpenRouter 上线:一段 API 调用把任意视频放大到 2K 或 4K,主打面部细节与纹理还原。
视频超分接进模型路由平台,意味着它和文本模型一样成了按调用计费的普通能力。当画质修复变成一行 API,老素材库的价值要重新算一遍。
FLUX Video Upscale 推理时间 · 分辨率与档位对应的耗时(官方数据)
据 TechCrunch 报道,AI 训练数据公司 Micro1 的总流水年化从 1 亿冲到 5 亿美元只用了八个月;扣除分成后净年化约 1.5–2 亿美元,仍落后 Mercor(20 亿)与 Handshake(10 亿)。
增长逻辑在合同规模:医生、律师、科学家按合同进场给模型当老师,头部实验室对高质量人类数据的需求看不到顶。有研究者开始猜测,未来花在数据上的钱可能比肩算力。
当模型卷完参数卷数据,专家的时间成了新的上游资源。
今天的主线:快的东西在变准,准的东西在变慢,各付各的代价。
检索学会了翻页,用分钟换准确率。
路由收进了运行时,一个端点管四十一个模型。
搜索结果看谁的脸色,取决于一版看不见的提示词。
好模型被提醒别想太多。
编译器走出闭源的高墙。
浏览器自动化缩进一百五十行。
写意图的地方,成了新的工程问题。
专家的时间,涨到了五亿美元的年化。
当每一步都有账单,选择比速度值钱。
New Zealand’s Southern Wilderness — 斯图尔特岛,新西兰的第三大岛,人类比鸟少。
Stewart Island / Rakiura, New Zealand · 46.90°S, 167.80°E
岛上八成面积是国家公园,几万只企鹅和鹦鹉把人挤到了边缘。看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。