INSIGHTS

Astra来了,但它先学会踩刹车

OpenAI 把 Astra 定为首个达到关键级网络安全能力的模型;同一天,Anthropic 发布了已能直接使用的 Claude Fable 5.1。这不是一场简单的跑分对决。

Astra 来了,但它先学会踩刹车:文章封面

昨天,OpenAI 公布了一个名字很像科幻战舰的新模型:Astra。

但这篇公告的大半篇幅都在解释一件事:这么强的模型,发布前为什么必须先把刹车、护栏和监控装好。

因为按照 OpenAI 自己的评估,Astra 已达到其 Preparedness Framework 里的 Critical(关键级)网络安全能力门槛。简单说,在合适工具和权限下,它能发现此前未知的安全漏洞,并在缺少人工逐步指导的情况下,为多种受保护系统开发利用方式。

这不是“写代码更快一点”。这是模型能力开始碰到真实世界的高压线。

Astra:强能力被多层安全边界包围

Astra 到底强在哪

先把 OpenAI 公布的结果摆出来。以下数字都来自 OpenAI 2026 年 9 月 1 日的官方说明,不是第三方横评:

  1. 在测试已知漏洞利用能力的 ExploitBench 上,Astra 得到 100%。
  2. OpenAI 又用 2026 年 6—8 月披露的 20 个高危 V8 漏洞做内部测试,Astra 用更少的输出 token 得到更高的任意代码执行成功率。
  3. 在这轮测试里,它还在利用链中发现并使用了两个零日漏洞;OpenAI 表示正在向维护者披露。
  4. 在专家评估中,Astra 完成过浏览器沙箱逃逸到主机命令执行的完整链路,也完成过从普通用户到 root 的本地提权链。

要注意两个边界。

第一,这些成绩来自 OpenAI 自己的评估,完整系统卡要等正式发布时才会公布。第二,其中一些结果使用了 Daybreak Blue 权限,不等于普通用户拿到的默认生产版本。

所以,Astra 现在还不能被写成“人人都能用的新模型”。OpenAI 的原话是“计划很快提供”,最先进的网络安全能力会先给一小批测试者,再通过 Daybreak Blue 扩大防御用途。

更有意思的是:它会不会越界

能力强只是半场,另半场是它愿不愿意守规矩。

OpenAI 公布了一组很扎眼的数据:在网络安全越狱评估中,Astra 对不允许请求的拒绝率为 91.5%,GPT-5.6 Sol 是 59%。

另一个“蜜罐”测试更直接。模型被放进模拟环境,正常任务很难甚至做不成,旁边却留着可以越界的目标。在没有生产安全措施的条件下,GPT-5.6 Sol 有 56% 的测试会尝试访问那些目标;Astra 没有这么做。

这仍然只是特定测试条件下的厂商数据,不能外推成“永远安全”。不过,模型公司现在得回答一个更难的问题:模型能干大事以后,它还能不能在边界前停住?

OpenAI 甚至承认,生产中的额外检查可能让正常任务变慢、暂停或停止。以后你在 ChatGPT 或 Codex 里看到模型突然请你确认,不一定是它偷懒,也可能是它真的在踩刹车。

同一天,Claude Fable 5.1 走的是另一条路

9 月 1 日,Anthropic 也发布了 Claude Fable 5.1 和 Mythos 5.1。

这两个名字背后是同一个底层模型,但安全边界不同:Fable 5.1 已向 Pro、Max、Team、Enterprise 用户以及 API 和云平台普遍开放;Mythos 5.1 对网络安全和生命科学工作的开放边界更宽,只通过受信任访问计划提供。

Claude Fable 5.1 官方发布视觉,来源:Anthropic

Fable 5.1 更像一台已经摆上办公桌的长任务工作机:写代码、做研究、处理知识工作、连续跑很多步骤。它提供 100 万 token 上下文,API 最大输出 12.8 万 token;输入和输出价格分别为每百万 token 10 美元、50 美元。

Anthropic 还把缓存读取价格降到每百万 token 0.25 美元,并估算典型工作负载成本会比 Fable 5 低约 25%,高度智能体化的任务最多可能低约 45%。这也是厂商估算,实际账单仍取决于缓存命中和任务结构。

它的官方基准也很亮眼:Terminal-Bench-Science 0.1 为 52.6%,上一代 Fable 5 是 24.7%;Terminal-Bench 4.0 为 55.8%,上一代为 42.0%。不过这些同样是 Anthropic 使用自身测试设置得到的结果。

Astra 和 Fable 5.1,谁赢了?

如果一定要做一张“胜负表”,反而会把最重要的信息遮住。

Astra 与 Fable 5.1:不是同一场比赛

  • Astra 跨过了关键级网络安全能力门槛,因此必须受限开放,并配套更强的监控和停止机制。
  • Fable 5.1 针对长时间编码、研究和知识工作做了升级,价格也降了,而且现在就能用。
  • Mythos 5.1 才更接近 Anthropic 对高风险网络安全能力的受限版本。

两家公司实际上做了相似选择:普通能力尽量普及,高风险能力单独设门槛。差别只是 OpenAI 先把“危险能力和护栏”放在台前,Anthropic 则同时交出了一款可以直接进入生产工作的通用模型。

所以现在没有诚实的“Astra 吊打 Fable 5.1”或“Fable 5.1 完胜 Astra”。没有同一任务、同一工具、同一权限和同一评测框架,硬排座次只适合做封面,不适合做判断。

Gemini:别人开发布会,它端来一整张菜单

再看看 Google。

OpenAI 和 Anthropic 同一天分别端出“关键级网络安全能力”和“长任务通用模型”,Google 9 月 1 日发的是一份 8 月 AI 月报:Gemini 3.7 Flash、3.5 Transcribe、Gemini Live、Pixel 新功能、Omni 1.1 Flash 视频模型……一个都没落下。

Gemini 的产品菜单有点满:原创调侃配图,非真实产品界面

这就像隔壁两桌在讨论发动机和刹车,Google 推门进来问:“要不要顺便来个语音、视频、手机和天气套餐?”

调侃归调侃,Google 公布的 Gemini 应用月活已超过 10 亿,而且 Gemini 3.7 Flash 继续主打代理和编码。这不是它没来参赛,而是它把比赛办成了综合运动会。只是产品太多以后,用户下一道题往往不是“Gemini 会什么”,而是“我到底该打开哪一个”。

Grok 也没闲着,只是更像在接线

xAI 最近一次模型大更新是 8 月 12 日的 Grok 4.6,主打长时间智能体任务、交互式工作和视觉体验,API 起价为每百万输入 token 2 美元、输出 token 6 美元。8 月 29 日,Grok Bot 又接入 X,可以在授权后搜索帖子、读时间线、检查提及和趋势。

Grok 4.6 官方发布视觉,来源:xAI

如果说 Astra 在练高风险操作前的“收手”,Fable 5.1 在练几个小时不掉线的“耐力”,那 Grok 最近更像在给智能体接电话线:先让它听见 X 上正在发生什么。

这几家都在把模型变成能持续使用工具、读取环境、做多步决定的智能体。它运行得越久、拿到的权限越多,出错的代价就越大。

我是怎么核对这篇文章的

这次的核验目标很简单:只写截至 9 月 2 日能在公司官网确认的内容。

核验过程里,我把各家的公告、产品页和 API 更新记录逐项对照。数字如果只出现在厂商自测里,就明确写成厂商数据;发布日期和开放状态则按官网原文处理。

还有一处修正说明:Fable 5.1 和 Mythos 5.1 不是两个能力不同的底层模型,而是同一模型配上不同的安全与访问边界。这个差别如果写错,整段比较都会跑偏。

这次真正的新东西,不是名字

我看完这几家的公告,倒没有“又要换模型了”的冲动。

更现实的问题是:模型公司越来越难只讲能力,不讲权限;只讲成功率,不讲会不会越界;只讲能跑多久,不讲什么时候必须停。

对普通用户和小团队来说,现阶段更实用的选择仍然很朴素:

  1. 日常编码、研究和长任务,看实际可用性、价格和稳定性,Fable 5.1 这类已经开放的模型更容易马上验证。
  2. 涉及生产系统、客户数据、网络安全和外部操作,先缩小权限,再谈模型有多强。
  3. 不要把厂商自测当成跨厂商冠军榜;先用自己的任务、自己的工具和自己的风险边界做小规模测试。

Astra 能把门撬开,当然足够吸睛。

但接下来真正麻烦的是:谁有钥匙,谁能看见它在做什么,以及什么时候必须把手收回来。

如果你想看我下一篇把 Fable 5.1 放进真实长任务里跑一遍,回复「氛围编程」。

我的结论:Astra 值得追,但现在更适合追踪它的系统卡和开放范围;真要马上干活,先拿已经开放的模型跑自己的任务。


资料来源

注:文中涉及模型成绩、价格、用户规模和安全评估的数据,均按各公司截至 2026 年 9 月 2 日公开材料整理;属于厂商自测或厂商估算的内容,已在正文中注明。生成配图用于概念表达,不是产品界面或真实事件现场。

Astra来了,但它先学会踩刹车|卫斯顿