AI 情报日报 · 前沿信号流

AI 情报日报

2026-07-03 星期五 9 条现场

今天是美国 7 月 4 日长假前一天,前沿新闻本就稀薄—但我们没有为了凑数放旧料。今天的四条主线是:

算力想摆脱英伟达(Anthropic 找三星造芯片)、价值从模型移到落地(微软 25 亿新公司)、小模型反超大模型(微调打败前沿)、Agent 开始自我进化了(快手 AgentX 三周产出 10 个可发布结果)。再附两张越来越贵的环境账单。

HEADLINE
今日头版

Anthropic 找上三星,想造一块属于自己的 AI 芯片

Anthropic 正在和三星接触,探讨合作生产一块自研 AI 芯片。The Information 7 月 2 日独家报道了这个还在早期的项目,尚未敲定芯片用途、性能规格、甚至是否最终推进。但方向已经清楚:每一家前沿 AI 公司都在减少对英伟达的依赖。

Anthropic 从 OpenAI 挖来的芯片工程负责人 Clive Chan,正在组建自己的芯片团队。三星的 2nm 工艺和先进封装能力是吸引 Anthropic 的关键。三星、SK 海力士、美光此前全部参投了 Anthropic 5 月的 650 亿美元 H 轮融资。

算力高度依赖单一供应商的局面正在解体。从 OpenAI 的 Jalapeño 到 Anthropic 的自研芯片,每家公司都在给自己加一条后路。

Anthropic 与三星探讨自研 AI 芯片渲染图

Anthropic 正在探讨与三星合作生产自研 AI 芯片,加入 OpenAI 等公司行列,减少对英伟达的单一依赖。图:The Decoder。

The Information · theinformation.com / TechCrunch

DISPATCH
前线

微软掏 25 亿美元、6000 名工程师,专门帮大公司把 AI 真正用起来

Microsoft Frontier Company,7 月 2 日宣布,投入 25 亿美元、6000 名行业和工程专家,专门做一件事:派工程师上门,把 AI 在企业里跑通。

微软商业业务 CEO Judson Althoff 特意撇清了「前线部署工程师」(FDE)标签,称它是「业界规模最大、以结果为导向的工程组织」。首批客户包括伦敦证交所集团、联合利华、Land O'Lakes、埃森哲。此前 AWS 刚在两天前宣布了 10 亿美元的同类计划。

AI 当前的真正瓶颈是「落地那一步」有没有人帮你跑通。巨头开始把「派人上门做 AI」当成一门独立的生意来投。

微软 Frontier Company 宣布投入 25 亿美元部署 AI 工程师

微软 Frontier Company:25 亿美元 + 6000 名工程师,专门派驻客户现场做 AI 落地。图:Getty Images via TechCrunch。

TechCrunch / GeekWire · geekwire.com

Claude Fable 5 回归,带着一条「安全回退」的新规矩

时隔一天,Claude Fable 5 恢复供应,但这次 Anthropic 同步亮明了底线:升级后的网络安全防护可能把部分请求路由到 Opus 4.8,生物与化学分类器仍偏保守。价格没变,规矩变了。

工具链反应最快。Cursor 说 Fable 5 领跑它的评测、但单任务成本也是最高的;Devin 在 Cloud/Desktop/CLI 全线接入;Perplexity 恢复它当编排模型。Anthropic 同时重置了用户的速率限制。这一轮真正值得看的不是「模型回来了」,是「人们怎么适应前沿模型的约束」

多位一线构建者收敛到同一个答案:多模型编排取代单模型依赖。有人只让 Fable 干高价值的推理与规划,把实现、验证、电脑操作交给其他模型,端到端 PR 产出率明显提升;也有人提醒,靠预分类器路由并不总是可靠,有些任务得先解出来才知道该交给谁。

Fable 5 在 Remote Labor Index 上拿了 16.10%,Sonnet 5 在 AA-Briefcase 排第二但回合数更高、低档位性价比更差,单看榜单,已经看不出「谁该干哪一段」

前沿模型恢复供应不是终点。真正的新常态是:没有哪个模型再能包办一切,把对的活交给对的模型,正在成为新的工程能力

Anthropic · x.com/@anthropicai / Cursor · cursor.com/blog / Artificial Analysis · artificialanalysis.ai/news

NVIDIA 的 TwoTower:生成提速 2.42 倍,质量保住 98.7%

NVIDIA 开源 Nemotron-Labs-TwoTower:把一个 30B 模型改造成扩散式语言模型,双副本并行写 token,一个冻结的上下文模型 + 一个训练过的写作模型,不用从头重训

官方数字是生成快 2.42 倍、保留原模型 98.7% 的质量。原理拆开并不复杂:把「理解上下文」和「生成输出」拆成两个职责,前者固定、后者专训,省掉每次生成时重复的前向计算。

对应用层的含义更直接:速度和质量不再非此即彼。当架构工程能同时拿到快和好,推理成本还有继续下探的空间,模型的竞争也开始从「谁能训出来」延伸到「谁能把它跑得更便宜」

NVIDIA · x.com/@NVIDIAAI / 技术解读 · x.com/@LiorOnAI

THE BIGGER PICTURE
认知 · 这轮 AI 的新解法与真实代价

一个微调过的小模型,在金融判断上击败了所有前沿大模型—还便宜近 14

Mira Murati 的 Thinking Machines Lab 与桥水基金合作的研究,给出了一个挑战直觉的结果:用高质量专家标注数据微调出的专用小模型,在真实投资判断任务上,击败了所有测试过的前沿大模型。

前沿模型(Gemini、Claude、GPT 各版本)精心调过提示词后,平均准确率仅 78%,够不到投资员愿意信赖的 80% 门槛。而微调专用小模型达到 84.7%,错误率比最强前沿模型低 29.8%,每次调用成本却只有其 1/13.8

「越大越强、追最新前沿就对了」这个直觉正在被挑战。对很多具体活儿,一个自己调过的小模型,可能又准又便宜。

微调专用小模型 84.7% vs 最强前沿模型 78.2%

微调专用小模型 84.7% vs 最强前沿模型 78.2%,且成本仅为 1/13.8。数据:Thinking Machines Lab / Bridgewater AIA Labs。

Thinking Machines Lab 官方 · 原文 2026-06-30(本周被广泛讨论)

快手出了 AgentX:推荐系统开始自我迭代了

快手 AgentX,面向工业推荐系统的 Agent 驱动研发。它把推荐迭代拆成 4 个 Agent 模块:Brainstorm Agent 把模糊业务目标变成可落地方案;Developing Agent 把方案写成生产代码,经过特征校验、DSL 检查、dryrun 验证后才上线;

Evaluation Agent 上 A/B 实验,安全部署、流量分桶、guardrail veto,输出 KEEP / EXTEND / DISCARD;

最关键是第四个,Harness Evolution,它把每次失败诊断成「语义梯度」,用一套叫 SGPO(Semantic-Gradient-based Prompt Optimization)的机制修改 Agent 自身的工作规则和 Prompt,再用历史实验 replay 对比,新版确实好了,才进生产。

Agent 不只是帮你写代码的工具,它正在变成能自我进化的研发系统。

三周生产数据:3 个 AgentX worker 推进 374 个想法,106 个通过方案审核,100 个完成上线,10 个获得正向评估达到可发布标准。

漏斗自然收敛:28.34% idea pass rate → 94.3% code-launch rate → 9.9% positive eval rate。业务收益:主站消费时长 +0.561%,生活服务年化超 1 亿元人民币。

更有价值的信号是自我加速,周并发从 15 增至 60,idea 通过率 15%45%,周可发布结果 25。PCV 两轮实验展示了「自我迭代」的真实运作:第一轮 PCV boosting 弱正向但显著性不够,第二轮加入质量门控和自适应权重后拿到 +0.071% 观看时长。每一次实验都变成下一次更好的假设。

快手出了 AgentX:推荐系统开始自我迭代了

快手出了 AgentX:推荐系统开始自我迭代了。

池建强 / MacTalk · 微信公众号

谷歌、亚马逊最新财报,暴露了这轮 AI 的真实环境账单

Google 总碳排放同比上升 25%Amazon 上升 16%。绿电买得不错,直接用电排放控制得还行;真正在涨的是 Scope 3(供应链间接排放),Google 这块去年增加了 210 万吨,已是 2019 年的两倍,主因指向数据中心。Amazon 光去年 Q4 就新增了超过 1.2 吉瓦数据中心容量。

每次你调用 AI,背后都有一座正在盖、正在耗电的数据中心。这份账单第一次被拆得这么清楚。

Google 碳排放 +25%、Amazon +16%

Google 总碳排放同比 +25%、Amazon +16%;Google Scope 3 已是 2019 年的两倍。数据:Google / Amazon 可持续报告,经 TechCrunch 整理。

TechCrunch

VOICES · 本周声音
声音

「我现在大部分编码工作都在手机上做。」

Boris Cherny · Anthropic Claude Code 负责人

「AgentX:把推荐系统最耗时、依赖经验的过程,变成持续运转的—让正确的事持续发生。」

池建强 · MacTalk 评快手 AgentX

MAKERS · AI 产出了什么
创造

Cursor 出了 iPhone 版:在手机上启动 AI 编程 agent,出门也能写代码

Cursor(最近被 SpaceX 收购的 AI 编程平台)发布了首个 iOS 原生应用,公测版上线 App Store。你可以在手机上启动云端 agent,或者在电脑上跑了 agent 之后用手机远程指挥,查看 diff、审批 PR、用语音描述需求。

Anthropic Claude Code 负责人 Boris Cherny 近期公开说「我现在大部分编码工作都在手机上做」,六个月前他还觉得这不可思议。Cursor 的移动端让这个场景对更多开发者变成了现实。

AI 编程从「坐在电脑前写代码」变成了「哪里都能启动 agent、审批 PR」。开发者工作流的地点在消失。

Cursor iOS 手机应用界面

Cursor 首款 iOS 原生应用:手机上启动 AI 编程 agent,随时随地 review 和 merge PR。图:Cursor 官方。

Cursor 官方 · cursor.com / The Verge

MONEY · 钱在流动
投资与资金流向

手里算力太多,Meta 想开个云服务卖给别人

Bloomberg 7 月 1 日报道,Meta 正在筹划一个名为 Meta Compute 的云基础设施业务,把过剩的 AI 算力卖给外部客户。两条路线都在考虑:一是类似 AWS Bedrock 的托管模型 API 服务(包括自家 Muse Spark 模型),二是在卖「裸算力」(raw GPU compute)。

Zuckerberg 在 5 月股东会上说过:「几乎每周都有外面公司来找我们,问能不能卖算力给他们。」Meta 已承诺未来几年投入 1829 亿美元建 AI 基础设施,俄亥俄州项目「规模相当于曼哈顿」。卖算力是给这笔天价投资找一个变现出口。

AI 基础设施的过剩产能正在变成一门新生意。继 SpaceX 之后,Meta 也在走这条路,谁是未来 AI 的房东,比谁造了最强的模型更值得关注。

手里算力太多,Meta 想开个云服务卖给别人

手里算力太多,Meta 想开个云服务卖给别人。

Bloomberg · bloomberg.com / TechCrunch

THE WRAP
今日小结

今天的主线是三件更结构性的事:

算力想摆脱英伟达,Anthropic 找三星造自研芯片,加入 OpenAI(Jalapeño)、Google(TPU)、Amazon(Trainium)等自研芯片阵营。产业链在去中心化。

价值从「模型多强」移到「能不能落地」,微软 25 亿美元新公司专门派人上门做 AI 落地,AWS 两天前也投了 10 亿。卖模型不如帮人把模型跑起来值钱。

「更大更前沿」未必最优,Thinking Machines Lab + Bridgewater 的研究证明:微调小模型 84.7% 准确率 vs 前沿模型 78%,成本仅 1/14。对具体场景,自己调的小模型可能更实用。

Agent 正在变成能自我进化的研发系统,快手 AgentX 用 4 个 Agent 模块跑完推荐实验全,SGPO 用「语义梯度」让 Agent 自己改 Prompt。3 周 374 想法 → 10 可发布,周产出从 2 到 5。

最后附一张越来越贵的环境账单,Google 碳排放 +25%、Amazon +16%。AI 的能力在涨,账单也在涨。

今天是美国长假前最后一个工作日,新闻稿少但我们没放水,5 条真新闻 + 2 张数据图表,每条都经过现场信源核实。
Stratechery
BE CURIOUS 🌌
保持好奇
从卫星高度俯瞰极地纹理

Greenland · 71.71°N, 42.28°W
极地荒原在夏日阳光下显露出冰与岩石交织的纹理。
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。让我们保持好奇、继续探索。