AI Intelligence Briefing
AI 情报日报
2026-08-21 · 周五 本期 5 条
今天的关键词是「账单」:快的东西在变准,准的东西在变慢,每一步都有明码标价。

往下看,谁在为什么付费。
Headline
头版
一次性 RAG 没死,但复杂文档的战场换人了:Mistral 五工具循环把准确率拉高 50 个百分点

Mistral 发布 Agentic Search,把检索做成 search、open、navigate、read、grep 五个工具的多步循环:在 FinanceBench368 份 SEC 文件、约 53,900 页语料上,准确率比一次性 RAG 拉高 47–53 个百分点,全循环最高 59

更有意思的是账目:完整循环比只搜索的版本少花 24%–34% 的 token,因为模型不再反复抓错文档。代价同样明码标价:p90 延迟 154 秒,平均 71 秒。它适合财报、合同、扫描件这类答案藏在表格脚注里的场景,不适合要秒回的对话。

当检索的瓶颈从「找没找到」变成「读没读懂」,RAG 的竞争就从向量库转向了 agent 的翻页能力

FinanceBench 基准柱状图:Mistral Agentic Search 相比一次性 RAG 的准确率提升幅度对比

FinanceBench 准确率对比 · 五工具循环相对一次性 RAG 的提升幅度(数据整理:AIReiter)

Front Line
前线
Perplexity Agent API 全量上线:一个端点接 41 个模型,路由开始并入运行时,但真正的硬仗才刚刚开始

PerplexityAgent API 推向全部开发者:单一端点接入 9 家提供商的 41 个前沿模型,内置网页搜索、代码执行与 MCP 连接,每次请求按需组装检索管道。

这一步把模型路由、搜索层、沙箱和监控收进一张账单Sonar 客户已默认迁移,45 天后 Agent API 成为唯一入口。当编排本身成为产品,单点模型的比价就变成了整套运行时的比价

ChatGPT 搜索悄悄换上 site: 运算符,Reddit 引用大幅下降

Promptwatch 的追踪显示,ChatGPT 搜索开始大规模使用 site: 运算符圈定来源,Reddit 被引用的概率明显下降;Simon Willison 尝试核对系统提示词是否更新,没有找到实锤。

对做内容分发的人来说,这是平台单方面改写了流量规则:你的内容被不被引用,取决于一版你看不到的提示词。搜索引擎优化之后,答案引擎优化也进入了黑箱时代

阿里发布 Qwen-UI-Agent:模型开始学着「会用」每一块屏幕

阿里推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端与深度搜索环境。

它的野心在「真实世界」四个字:不止看懂截图,还要在真机界面里点得准、走得通。当 agent 的手从 API 伸向屏幕,每一块没接 API 的屏幕都成了可编程的入口

OPEN SOURCE · 实用工具前线
开源前线
Mojo 编译器全面开源:Apache 2.0,四年的系统回路到此为止

Modular 在 ModCon 上宣布 Mojo 语言整体开源,编译器与工具链以 Apache 2.0(含 LLVM 例外)放进 GitHub 仓库;一周前 Mojo 刚到 1.0,源码稳定承诺先行,开源随后兑现。

高通收购之后的这步棋指向异构计算的地基:一套代码跑 CPU、GPU 和各家加速器,MAX 也转为 source-available。编译器补丁今年底开放贡献,标准库则从 2024 年起一直在收 PR。

当 AI 的软件地基开始统一,写一次、处处加速才有了可信的起点

Mojo 语言 GPU kernel 示例代码截图(Phoronix)

Mojo 的 GPU kernel 写法 · 语言级抽象直接对接加速器

Bun 1.4 转正:Zig 换 Rust 后的第一个稳定版,浏览器自动化被压进 150 行代码

Bun 1.4 发布,是 Rust 重写后的首个稳定版:2,900+ 项修复,空闲 CPU 降到原来的 1/5,内存最多省 35%,Linux 启动快 50%

最值得盯的是实验性的 Bun.WebView:运行时内置无头浏览器,macOS 走系统 WebKit,其他平台走 CDP。Simon Willison 用约 150 行 TypeScript 做出 shot-scraper 风格的 JSON API,跑完整 Chrome 只要 192–256MB 内存

当抓取和自动化成了 agent 的日常家务,把它做进运行时比装一堆依赖体面得多

VOICES
声音

「Mistral 把 Perplexity 式搜索包成原生 agent 工具,省得我们自己写脆弱的抓取管道。」

— AbdoKerdawy · AI 产品开发者 · X

「进入异构计算的时代,开放标准能加速 GPU、CPU 与各类加速器的协同部署。」

— Sid Sheth · d-Matrix 创始人兼 CEO · ModCon 2026

「美国仍然领先,但前沿模型的高价越来越难维持。」

— FinanceYF5 · X 财经博主 · X

CREATE
创造
HuzZah 把意图写进伪代码:保存时才生成真代码,提示词不再用完即弃

前端工程师 Daniel Vaughn 发布实验性编辑器 HuzZah:你在 .hz 文件里写声明式伪代码,保存时编辑器以 diff 为 prompt 同步生成真实代码,伪代码与代码并存,成为持久的意图记录

出发点很具体:他发现自己几乎全靠 coding agent 干活后,提示词用完即弃,agent 在复杂代码库里越走越乱。把「我想要什么」存成文件,agent 才有得可回溯。项目还在概念验证阶段,HN 上的讨论对多文件场景仍有怀疑。

当 AI 写码成为默认,意图的存放位置就成了新的工程问题

Huzzah 工作流示意:保存 .hz 伪代码时以 diff 为 prompt 再生成真实代码

Huzzah 工作流示意:保存 .hz 伪代码时以 diff 为 prompt 再生成真实代码

VISION
视觉
FLUX Video Upscale 上线 OpenRouter:任意视频放大到 2K/4K,面部更清晰、纹理更干净

Black Forest LabsFLUX Video UpscaleOpenRouter 上线:一段 API 调用把任意视频放大到 2K4K,主打面部细节与纹理还原。

视频超分接进模型路由平台,意味着它和文本模型一样成了按调用计费的普通能力。当画质修复变成一行 API,老素材库的价值要重新算一遍

FLUX Video Upscale 推理时间图表:不同分辨率与档位的耗时对比

FLUX Video Upscale 推理时间 · 分辨率与档位对应的耗时(官方数据)

FUNDING
投资与资金流向
Micro1 八个月从 1 亿冲到 5 亿美元流水:人类专家数据仍是硬通货

TechCrunch 报道,AI 训练数据公司 Micro1 的总流水年化从 1 亿冲到 5 亿美元只用了八个月;扣除分成后净年化约 1.5–2 亿美元,仍落后 Mercor(20 亿)与 Handshake(10 亿)。

增长逻辑在合同规模:医生、律师、科学家按合同进场给模型当老师,头部实验室对高质量人类数据的需求看不到顶。有研究者开始猜测,未来花在数据上的钱可能比肩算力

当模型卷完参数卷数据,专家的时间成了新的上游资源

TechCrunch
TAKEAWAY
小结

今天的主线:快的东西在变准,准的东西在变慢,各付各的代价。

检索学会了翻页,用分钟换准确率。
路由收进了运行时,一个端点管四十一个模型。
搜索结果看谁的脸色,取决于一版看不见的提示词。
好模型被提醒别想太多。
编译器走出闭源的高墙。
浏览器自动化缩进一百五十行。
写意图的地方,成了新的工程问题。
专家的时间,涨到了五亿美元的年化。

当每一步都有账单,选择比速度值钱。

BE CURIOUS
Be Curious

New Zealand’s Southern Wilderness — 斯图尔特岛,新西兰的第三大岛,人类比鸟少。

NASA 卫星影像:新西兰斯图尔特岛与周边海域

Stewart Island / Rakiura, New Zealand · 46.90°S, 167.80°E
岛上八成面积是国家公园,几万只企鹅和鹦鹉把人挤到了边缘。看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。