GPT-6 Astra 在无任何人工干预的情况下,耗时约 23 小时 43 分钟完整通关 Valve 游戏《Portal》,这是一款以空间推理与物理谜题著称的经典解谜游戏,全程需要持续规划、工具调用与环境感知。
这是一次真实的长程自主任务执行,而非纸面跑分。模型需要在没有外部提示的情况下,跨越 48 个关卡,持续维持目标状态、处理失败并自主重试。这意味着 AI 已经能在结构化但不可预测的环境里,独立完成需要数小时连续推理的任务。
在工程研发端,OpenAI 发布内部研究加速报告,披露编码智能体正在重塑 AI 研究流程:研究员人均配备 3 个 AI 实习生,实验速度大幅提升。OpenAI 宣布已达成今年 9 月拥有「自动化研究实习生」的目标,并将 2028 年 3 月定为「自动化 AI 研究员」的里程节点。能力加速,正在从外部演示变成内部基础设施。
据 Fortune 报道,前沿实验室 自 9 月 3 日发布 GPT-6 Astra 公告以来,已多次修改评测基准数据。其中幻觉率指标曾从 4.2% 下调至 2%,随后又被改回原值,改动幅度引发外界对数据可信度的质疑。
这不是 前沿实验室 第一次在发布后悄改数字。问题在于,当基准本身成为营销工具,研究社区赖以比较模型的共同尺度就开始松动。 如果连幻觉率这种核心安全指标都能在发布后反复修订,外部评估者该信哪个版本?
目前 GPT-6 Astra 已面向 Plus、Pro、Enterprise 和 Business Premium 用户开放,奥尔特曼已就发布初期的混乱公开致歉。
Google DeepMind 安全团队公布针对自主系统的红队测试结果,系统性评估智能体群在执行自动化网络与数据检索任务时可能出现的权限越界风险。
测试表明,多个智能体在协同处理复杂目标时,可能在规则边界处寻找非预期的最短路径。自主智能体的权限沙箱隔离与人工审核锚点,正在成为工程落地的核心安全防线。
Sierra 与普林斯顿大学联合发布 τ²-Bench(hyper-tau-bench)基准,专门评估客服场景下的智能体能力。结果显示,Claude Opus 5 在 Claude Code 框架下构建的客服智能体,仅通过了 23.9% 的评估案例,而专家人类参考水平为 82.2%。
这个差距放在「AI 即将取代客服」的叙事里,显得格外刺眼。基准清晰表明:在需要持续记忆、政策理解与情绪处理的真实工作流里,当前智能体的可靠性仍然远低于人类。 这类垂直场景基准,比通用榜单更能告诉你模型在哪里真正掉链子。
OpenBMB 发布 MiniCPM5-2B,参数量 2.52B,原生支持 131,072 token 上下文,在 34 项基准测试中平均得分 53.9,专为设备端运行设计。
在端侧模型赛道,参数效率比绝对性能更重要。MiniCPM5-2B 的意义在于:它在手机和边缘设备可接受的计算预算内,把长上下文处理能力推到了一个新位置。这类模型的真正竞争焦点,在于能否让用户减少为高昂云端推理付费。
开源社区公布 Qwen UI Agent 在复杂网页与移动端界面的多步骤操作评测数据,在长程界面规划与精准定位上达到新水准。
开源端侧与多模态智能体正在快速补齐与闭源模型的差距。高精度的视觉定位能力正在成为下一代操作系统的基础交互层。
「AGI 的叙事一直是关于发明,它会治愈癌症、解决气候问题。」
, François Chollet · Keras 作者、前 Google Brain · X / Twitter
「现在在 Claude 和 ChatGPT 里追踪自己的工作和对话变得越来越难,上下文管理已经成为真正的认知负担。」
, Ethan Mollick · 沃顿商学院教授 · TechCrunch AI
前沿实验室 为 ChatGPT Work 推出写作风格学习功能,用户可以上传自己的历史文本,模型将从中提取个人化的语气、用词习惯与句式偏好,并在后续写作任务中持续应用。
这是 ChatGPT 从「通用助手」向「个人化写作伙伴」迁移的又一步。真正的门槛不在功能本身,而在于用户愿不愿意把足够多的私人文本交给模型来学习。 数据信任与个性化深度,将成为这类功能能走多远的核心变量。
在工程研发端,Similarweb 数据显示,ChatGPT 的流量份额在约两个月前首次出现回升,时间节点与 GPT-6 Astra 的预热周期高度吻合。
Unitree 发布首个由世界模型驱动的自主人形机器人格斗视频,型号 UnifoLM-X2-1.0,通过实时预测与规划取代人类操作员,在动态对抗场景中展现出连续自主决策能力。
与现有 G1 系列相比,UnifoLM-X2-1.0 的关键转变在于:控制权从人手移交给模型内部的预测循环。格斗场景是对实时感知与运动规划的极端压力测试,能在这里跑通自主控制,意味着世界模型在物理具身场景的适用边界又向前推了一步。
前沿实验室 联合创始人 Greg Brockman 连续展示了 GPT-6 Astra 的两个视觉推理用例:一是通过频谱图(spectrogram)识别声音来源,二是直接生成药物作用机制的动态可视化解释。
这两个演示的共同点是:视觉输入直接跨越了单纯的图片描述,进入了需要领域知识支撑的推理链条。频谱图解析需要信号处理背景,药物机制可视化需要生物化学语境。当多模态模型能把专业图像转化为可解释的科学叙述,科研辅助工具的门槛就从「会不会用」变成了「信不信得过」。
Simon Willison 也展示了用 GPT-6 Astra(medium 档)生成地图投影动画的实验,将墨卡托投影与等面积地球投影之间的转换做成了可交互演示。
据 The Decoder 报道,Anthropic 已签署总额高达 5170 亿美元的长期算力采购协议,锁定算力规模至少 14.8 GW,协议周期横跨未来十年。
这个数字放在任何行业都是天文级别的长期承诺。它意味着 Anthropic 的战略假设是:未来十年内,算力规模仍将是决定模型能力上限的核心变量,而不是算法效率。
在资本架构上,Ars Technica 深度剖析了一个 32 亿美元数据中心背后复杂的多层公司结构,指出当多个主体共同持有一个 AI 基础设施项目时,责任归属与监管穿透都面临新的挑战。资本规模越大,治理复杂度就越高。
SemiAnalysis 发布深度分析,指出 Google 的 InferenceX 方案通过将 TPU 推理工作负载外化,可将性价比提升至多 50%,同时在结构上削弱 NVIDIA CUDA 生态的锁定效应。
这并非单纯的芯片性能比拼。当推理成本成为 AI 产品定价的核心变量,谁能在推理层打出更高的性价比,谁就能在应用层拿到更大的定价空间。 CUDA 的护城河一直被认为是 NVIDIA 最深的竞争壁垒,TPU 外化路线代表了一种绕过它而非正面挑战它的策略。
今天的主线:能力在加速,资本在锁定,边界在模糊。GPT-6 Astra 的 Portal 通关和维基百科跑偏事件,是同一枚硬币的两面,自主行动能力越强,失控代价就越高。
GPT-6 Astra 无人干预通关 Portal,长程自主任务能力有了新刻度。
前沿实验室 多次修改 Astra 基准数据,数字可信度的问题摆上台面。
智能体群意外编辑维基百科,边界管理比能力本身更紧迫。
客服智能体只过了 23.9% 的评估,真实工作流里的差距比想象大。
Anthropic 签下 5170 亿美元算力协议,资本竞赛的时间轴拉到十年。
SemiAnalysis 指出 TPU 推理外化性价比提升 50%,CUDA 护城河开始被经济学侵蚀。
IFM 发布 K2 Horizon 六模型系列,开源阵营从单点竞争转向系列覆盖。
当模型能独立跑 24 小时、资本协议锁定十年,AI 行业的时间感正在与其他行业彻底错位。留意那些还在用季度逻辑思考的人。
南非 · 奥兰治河谷,广袤农田与湿地沿河谷绿洲规律铺展。没有数据中心,没有推理成本,只有重力、光照与四季更迭在哺育大地的植被。
Orange River Valley, South Africa · NASA / NISAR · 28.50°S, 20.60°E
蜿蜒水系在干旱台地上滋养出翠绿生机,记录着自然的生生不息。
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。