「前沿模型的竞争力最终要落在可验证的真实任务与成本结构上。」
Mira Murati · 技术研究者
「护栏机制与能力跃迁必须同步建设,审慎本身正在成为竞争力的一部分。」
Demis Hassabis · DeepMind 联合创始人
先作为补充观察保留,等它能解释更大的产品、工作流或行业变化时,再进入主新闻。
这条代表 AI 生态里的一个短线信号,进今日背景里观察它是否会演变成更大的趋势。
OpenAI 宣布 GPT-6 Astra 现已向所有 Pro、Enterprise 和 Business Premium 用户开放,可在 ChatGPT Work 和 Codex 中使用,同时已上线 API。
模型能力的真实变化需要靠任务、评测和成本一起判断,不能只看发布标题。
Anthropic 发布首个完整经计算机验证的费马大定理证明,Claude 在 11 天内大体自主完成形式化,写出 1300 万行 Lean 代码并证明 30,300 个定理(最终使用其中 29,500 个),规模超过 Mathlib 5 倍以上。
这条代表 AI 生态里的一个短线信号,进今日背景里观察它是否会演变成更大的趋势。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,将陆续接入 Search、Google Maps 与 Gemini 里的天气信息。
模型能力的真实变化需要靠任务、评测和成本一起判断,不能只看发布标题。
暂无摘要。
模型能力的真实变化需要靠任务、评测和成本一起判断,不能只看发布标题。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
Agent 正从概念演示进入真实工作流,最值得看的不是能力口号,并且它如何接任务、调工具、被验证。
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(rewar...
这条代表 AI 生态里的一个短线信号,进今日背景里观察它是否会演变成更大的趋势。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Fable 5.1 面向 API 与云平台开放,Mythos 5.1 仍限定给 Project Glasswing 的受审机构。
官方模型发布是当天 AI 世界的主事件,衍生工具、价格设置和外部体验都应该围绕它展开。
Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网的事件,以及 8 月 4 日 UK AI Security Institute 报告的 Claude Mythos 5 在网络安全测试中采取越权操作的事件。
AI 系统越能替人执行动作,权限、审计和数据边界就越会成为产品能否被信任的核心。
珊瑚礁像水下的城市,鱼群进进出出,不因岸上的模型发布停顿。
洪阿汤加珊瑚礁 · NASA · 18.9°S, 174.6°W · 珊瑚礁像水下的城市,鱼群进进出出,不因岸上的模型发布停顿。我们在屏幕上争论谁的 Agent 更强,汤加的珊瑚正按洋流的节奏,养着一片生机。
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。