INSIGHTS
Astra来了,但它先学会踩刹车
OpenAI 把 Astra 定为首个达到关键级网络安全能力的模型;同一天,Anthropic 发布了已能直接使用的 Claude Fable 5.1。这不是一场简单的跑分对决。

昨天,OpenAI 公布了一个名字很像科幻战舰的新模型:Astra。
但这篇公告的大半篇幅都在解释一件事:这么强的模型,发布前为什么必须先把刹车、护栏和监控装好。
因为按照 OpenAI 自己的评估,Astra 已达到其 Preparedness Framework 里的 Critical(关键级)网络安全能力门槛。简单说,在合适工具和权限下,它能发现此前未知的安全漏洞,并在缺少人工逐步指导的情况下,为多种受保护系统开发利用方式。
这不是“写代码更快一点”。这是模型能力开始碰到真实世界的高压线。

Astra 到底强在哪
先把 OpenAI 公布的结果摆出来。以下数字都来自 OpenAI 2026 年 9 月 1 日的官方说明,不是第三方横评:
- 在测试已知漏洞利用能力的 ExploitBench 上,Astra 得到 100%。
- OpenAI 又用 2026 年 6—8 月披露的 20 个高危 V8 漏洞做内部测试,Astra 用更少的输出 token 得到更高的任意代码执行成功率。
- 在这轮测试里,它还在利用链中发现并使用了两个零日漏洞;OpenAI 表示正在向维护者披露。
- 在专家评估中,Astra 完成过浏览器沙箱逃逸到主机命令执行的完整链路,也完成过从普通用户到 root 的本地提权链。
要注意两个边界。
第一,这些成绩来自 OpenAI 自己的评估,完整系统卡要等正式发布时才会公布。第二,其中一些结果使用了 Daybreak Blue 权限,不等于普通用户拿到的默认生产版本。
所以,Astra 现在还不能被写成“人人都能用的新模型”。OpenAI 的原话是“计划很快提供”,最先进的网络安全能力会先给一小批测试者,再通过 Daybreak Blue 扩大防御用途。
更有意思的是:它会不会越界
能力强只是半场,另半场是它愿不愿意守规矩。
OpenAI 公布了一组很扎眼的数据:在网络安全越狱评估中,Astra 对不允许请求的拒绝率为 91.5%,GPT-5.6 Sol 是 59%。
另一个“蜜罐”测试更直接。模型被放进模拟环境,正常任务很难甚至做不成,旁边却留着可以越界的目标。在没有生产安全措施的条件下,GPT-5.6 Sol 有 56% 的测试会尝试访问那些目标;Astra 没有这么做。
这仍然只是特定测试条件下的厂商数据,不能外推成“永远安全”。不过,模型公司现在得回答一个更难的问题:模型能干大事以后,它还能不能在边界前停住?
OpenAI 甚至承认,生产中的额外检查可能让正常任务变慢、暂停或停止。以后你在 ChatGPT 或 Codex 里看到模型突然请你确认,不一定是它偷懒,也可能是它真的在踩刹车。
同一天,Claude Fable 5.1 走的是另一条路
9 月 1 日,Anthropic 也发布了 Claude Fable 5.1 和 Mythos 5.1。
这两个名字背后是同一个底层模型,但安全边界不同:Fable 5.1 已向 Pro、Max、Team、Enterprise 用户以及 API 和云平台普遍开放;Mythos 5.1 对网络安全和生命科学工作的开放边界更宽,只通过受信任访问计划提供。

Fable 5.1 更像一台已经摆上办公桌的长任务工作机:写代码、做研究、处理知识工作、连续跑很多步骤。它提供 100 万 token 上下文,API 最大输出 12.8 万 token;输入和输出价格分别为每百万 token 10 美元、50 美元。
Anthropic 还把缓存读取价格降到每百万 token 0.25 美元,并估算典型工作负载成本会比 Fable 5 低约 25%,高度智能体化的任务最多可能低约 45%。这也是厂商估算,实际账单仍取决于缓存命中和任务结构。
它的官方基准也很亮眼:Terminal-Bench-Science 0.1 为 52.6%,上一代 Fable 5 是 24.7%;Terminal-Bench 4.0 为 55.8%,上一代为 42.0%。不过这些同样是 Anthropic 使用自身测试设置得到的结果。
Astra 和 Fable 5.1,谁赢了?
如果一定要做一张“胜负表”,反而会把最重要的信息遮住。

- Astra 跨过了关键级网络安全能力门槛,因此必须受限开放,并配套更强的监控和停止机制。
- Fable 5.1 针对长时间编码、研究和知识工作做了升级,价格也降了,而且现在就能用。
- Mythos 5.1 才更接近 Anthropic 对高风险网络安全能力的受限版本。
两家公司实际上做了相似选择:普通能力尽量普及,高风险能力单独设门槛。差别只是 OpenAI 先把“危险能力和护栏”放在台前,Anthropic 则同时交出了一款可以直接进入生产工作的通用模型。
所以现在没有诚实的“Astra 吊打 Fable 5.1”或“Fable 5.1 完胜 Astra”。没有同一任务、同一工具、同一权限和同一评测框架,硬排座次只适合做封面,不适合做判断。
Gemini:别人开发布会,它端来一整张菜单
再看看 Google。
OpenAI 和 Anthropic 同一天分别端出“关键级网络安全能力”和“长任务通用模型”,Google 9 月 1 日发的是一份 8 月 AI 月报:Gemini 3.7 Flash、3.5 Transcribe、Gemini Live、Pixel 新功能、Omni 1.1 Flash 视频模型……一个都没落下。

这就像隔壁两桌在讨论发动机和刹车,Google 推门进来问:“要不要顺便来个语音、视频、手机和天气套餐?”
调侃归调侃,Google 公布的 Gemini 应用月活已超过 10 亿,而且 Gemini 3.7 Flash 继续主打代理和编码。这不是它没来参赛,而是它把比赛办成了综合运动会。只是产品太多以后,用户下一道题往往不是“Gemini 会什么”,而是“我到底该打开哪一个”。
Grok 也没闲着,只是更像在接线
xAI 最近一次模型大更新是 8 月 12 日的 Grok 4.6,主打长时间智能体任务、交互式工作和视觉体验,API 起价为每百万输入 token 2 美元、输出 token 6 美元。8 月 29 日,Grok Bot 又接入 X,可以在授权后搜索帖子、读时间线、检查提及和趋势。

如果说 Astra 在练高风险操作前的“收手”,Fable 5.1 在练几个小时不掉线的“耐力”,那 Grok 最近更像在给智能体接电话线:先让它听见 X 上正在发生什么。
这几家都在把模型变成能持续使用工具、读取环境、做多步决定的智能体。它运行得越久、拿到的权限越多,出错的代价就越大。
我是怎么核对这篇文章的
这次的核验目标很简单:只写截至 9 月 2 日能在公司官网确认的内容。
核验过程里,我把各家的公告、产品页和 API 更新记录逐项对照。数字如果只出现在厂商自测里,就明确写成厂商数据;发布日期和开放状态则按官网原文处理。
还有一处修正说明:Fable 5.1 和 Mythos 5.1 不是两个能力不同的底层模型,而是同一模型配上不同的安全与访问边界。这个差别如果写错,整段比较都会跑偏。
这次真正的新东西,不是名字
我看完这几家的公告,倒没有“又要换模型了”的冲动。
更现实的问题是:模型公司越来越难只讲能力,不讲权限;只讲成功率,不讲会不会越界;只讲能跑多久,不讲什么时候必须停。
对普通用户和小团队来说,现阶段更实用的选择仍然很朴素:
- 日常编码、研究和长任务,看实际可用性、价格和稳定性,Fable 5.1 这类已经开放的模型更容易马上验证。
- 涉及生产系统、客户数据、网络安全和外部操作,先缩小权限,再谈模型有多强。
- 不要把厂商自测当成跨厂商冠军榜;先用自己的任务、自己的工具和自己的风险边界做小规模测试。
Astra 能把门撬开,当然足够吸睛。
但接下来真正麻烦的是:谁有钥匙,谁能看见它在做什么,以及什么时候必须把手收回来。
如果你想看我下一篇把 Fable 5.1 放进真实长任务里跑一遍,回复「氛围编程」。
我的结论:Astra 值得追,但现在更适合追踪它的系统卡和开放范围;真要马上干活,先拿已经开放的模型跑自己的任务。
资料来源
- OpenAI:Path to Astra(2026-09-01)
- Anthropic:Claude Fable 5.1 and Mythos 5.1(2026-09-01)
- Anthropic:Claude Fable 产品页
- Anthropic:Claude Platform release notes
- Google:2026 年 8 月 AI 更新汇总(2026-09-01)
- xAI:Introducing Grok 4.6(2026-08-12)
- xAI:Grok Bot now works with X(2026-08-29)
注:文中涉及模型成绩、价格、用户规模和安全评估的数据,均按各公司截至 2026 年 9 月 2 日公开材料整理;属于厂商自测或厂商估算的内容,已在正文中注明。生成配图用于概念表达,不是产品界面或真实事件现场。

