「前沿模型的竞争力最终要落在可验证的真实任务与成本结构上。」
Mira Murati · 技术研究者
「护栏机制与能力跃迁必须同步建设,审慎本身正在成为竞争力的一部分。」
Demis Hassabis · DeepMind 联合创始人
OpenAI 首席研究官 Mark Chen 宣布 GPT-6 Astra 发布,称其为团队多年预训练、强化学习和后训练工作的成果。
Agent 正从概念演示进入真实工作流,最值得看的不是能力口号,并且它如何接任务、调工具、被验证。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,将陆续接入 Search、Google Maps 与 Gemini 里的天气信息。
模型能力的真实变化需要靠任务、评测和成本一起判断,不能只看发布标题。
OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework...
AI 系统越能替人执行动作,权限、审计和数据边界就越会成为产品能否被信任的核心。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
Agent 正从概念演示进入真实工作流,最值得看的不是能力口号,并且它如何接任务、调工具、被验证。
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(rewar...
这条代表 AI 生态里的一个短线信号,进今日背景里观察它是否会演变成更大的趋势。
这类消息提醒我们:智能体越能代替人操作,权限、邮件、图片渲染和数据外泄就越需要重新设计。
AI 系统越能替人执行动作,权限、审计和数据边界就越会成为产品能否被信任的核心。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Fable 5.1 面向 API 与云平台开放,Mythos 5.1 仍限定给 Project Glasswing 的受审机构。
官方模型发布是当天 AI 世界的主事件,衍生工具、价格设置和外部体验都应该围绕它展开。
Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网的事件,以及 8 月 4 日 UK AI Security Institute 报告的 Claude Mythos 5 在网络安全测试中采取越权操作的事件。
AI 系统越能替人执行动作,权限、审计和数据边界就越会成为产品能否被信任的核心。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
模型能力的真实变化需要靠任务、评测和成本一起判断,不能只看发布标题。
缅因州的 V 形湖,比任何大模型参数都安静。
Scopan Lake, Maine, USA · NASA · 46.95°N, 68.28°W
看了一天 AI 的新闻,地球上还有不需要 GPU 冷却的地方。山川湖海,让我们保持好奇、继续探索。