首页 > 资讯 > 最强模型Fable 5.1发布,Anthropic要用降价换IPO

最强模型Fable 5.1发布,Anthropic要用降价换IPO

钛媒体 2026-09-03 11:27 1 阅读 查看原文

(本文作者为 AIX财经,钛媒体经授权发布)

文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠

9月1日凌晨,Anthropic正式发布Claude Fable 5.1和Claude Mythos 5.1。

和上一代一样,两款模型共享同一套底层模型,区别主要在安全权限和开放范围。Fable 5.1面向普通用户和企业,已经上线Claude、Claude Code和API;Mythos 5.1则继续走“专业版”路线,只向经过审核的美国机构的网络安全与生命科学专业人士开放,在部分敏感任务上的限制更少。

从能力来看,在官方公布的多项测试中,新模型全面超过上一代,在科研Agent、终端编程、企业工作流和计算机操作等长链条任务上明显提升。在第三方Artificial Analysis最新综合智能指数中,Fable 5.1 Max档拿到66分,超过Opus 5的63分,排名第一。

图源 / Artificial Analysis官网

价格上,两款模型也保持一致,每百万Token输入和输出分别为10美元和50美元,与上一代Fable 5持平。不过,Max会员和部分企业高级席位可以在套餐额度内使用Fable 5.1,而Pro等部分用户则需要额外购买积分按量调用。

可以看出,Fable 5.1一边继续强化长程Agent能力;一边通过降低Agent场景成本、调整安全机制,让这套旗舰能力进入更多企业工作流。

当各家旗舰模型之间的能力差距越来越小,Anthropic为什么还要继续投入最贵、最强的模型?它又能不能把这份领先,变成足以支撑IPO的收入和利润?

01.新模型,强在哪儿?

我们先来看看Fable 5.1进步最明显的几个方面。

图源 / Anthropic官网

科研Agent是提升最明显的方向之一。在Terminal-Bench-Science 0.1中,Fable 5.1从上一代的24.7%提高到52.6%,成绩超过翻倍。这说明它在需要长期规划、工具调用和结果验证的科研任务中,执行能力明显增强。

类似的变化也出现在长程工作任务中。AutomationBench中,Fable 5.1从17.1%提高到31.4%;Terminal-Bench 4.0则从42%提升到55.8%。相比上一代更擅长处理步骤多、持续时间长,并且需要根据环境变化不断调整的任务。

Anthropic给出的一个案例也体现了这一点。在Ramp测试中让Fable 5.1处理一项机器学习任务,模型连续自主运行38小时。过程中,它发现原有实验受到标签问题影响,随后修正方案、重新启动实验,并继续根据结果推进任务。

相比之下,Fable原本就比较强的编程和通用推理能力,这次更多是在高位继续提升。

除了面向企业用户的Fable 5.1,Anthropic也通过Mythos 5.1展示了模型在专业领域的能力。在蛋白质设计任务中,Mythos 5.1生成的结合蛋白方案经过外部实验验证,在12个目标测试中的命中率接近50%,高于行业常见的10%至15%;在计算生物学场景中,它还优化了7个开源模型的GPU Kernel,使推理速度最高提升2.5倍,并降低30%至60%的GPU成本。

整体来看,Fable 5.1强化的是Agent执行能力,让模型能够处理更长、更复杂的任务;Mythos 5.1则进一步拓展了模型在科研等专业场景中的能力边界。

跑分之外,我们也用三道题测试Fable 5.1的实际能力如何。这三个任务分别考察复杂交互设计、大规模场景生成以及动态效果模拟。

第一个任务,我们要求它生成一个可交互的城市拆除场景,用户可以控制吊车、炸药等工具,对建筑进行破坏,并支持慢动作和时间回溯。

Fable 5.1搭建出了包含办公楼、街道、车辆和起重机的城市场景,要素比较齐全。吊车撞击、炸药爆破、慢动作和回放等我们要求的功能都能正常运行。建筑倒下时,会伴随碎片飞散、烟尘扩散等视觉效果,整体完成度比较高。

Fable 5.1生成的可交互城市

第二个任务,我们要求它生成一片覆盖大量蝴蝶的森林,并通过一个按钮触发蝴蝶从树枝上集体飞起。这个任务更考验模型对大规模场景的处理能力。

Fable 5.1的表现相对一般。它生成了森林和蝴蝶等基础元素,但没有还原“森林被蝴蝶覆盖”的效果。大量蝴蝶集中堆叠在几棵树上,视觉上更像蜂巢。

Fable 5.1生成的蝴蝶森林

第三个任务是火山喷发模拟,相比前两个场景,火山更考验模型对动态过程和物理效果的理解。我们要求它实现从喷发前烟雾积累,到岩浆喷射、碎石飞散,再到火山冷却的完整过程。成品中的火山地形、岩浆流动和爆炸效果都比较写实、自然,能够随着时间变化推进不同阶段。不过,烟雾扩散形态比较像“直筒上升”,与真实火山喷发时的扩散形态有差距。

Fable 5.1生成的火山喷发模拟

这三次测试中,Fable 5.1展现出的变化和跑分结果比较一致,它可以理解一个完整项目需要哪些组成部分,并将不同模块组合起来。不过,在涉及大量元素同时运动、复杂视觉效果控制时,稳定性不足。

02.降成本和提性能,能否兼顾?

性能继续往上走的同时,Anthropic也开始降低Fable的使用成本。

Anthropic这次选择降低长任务中更关键的Cache Read成本。模型重复读取已经处理过的上下文的价格,从每百万Token 1美元降至0.25美元。按照官方测算,Fable 5.1在典型工作负载中的整体成本可以下降约25%,在高频调用工具的Agent任务中最高下降约45%。

原因在于,Agent任务通常需要持续读取此前的上下文。一项持续数小时的任务里,模型可能需要反复调用已有信息,Cache Read成本会随着任务长度增加。

这项调整瞄准的是Agent任务中的实际使用成本。对于需要持续调用工具、反复读取上下文的长任务来说,降低推理成本,能够降低企业使用高级模型的门槛。

Anthropic也在提高Fable 5.1被“复制”的门槛。

从Fable 5.1开始,对于8月31日之后创建的新API账户,模型生成的thinking block会与产生它的整段对话绑定。如果开发者修改此前的系统提示词、工具列表或历史消息,再把原来的推理内容放回新请求中,API默认会直接拒绝,或者根据设置丢弃已经失效的推理块。

Anthropic解释,这套机制主要用于防止模型推理过程被大规模提取,并用于训练其他模型。过去一些开发者可以通过反复调用高级模型、获取输出结果,再用这些数据训练低成本模型,新的限制提高了这类蒸馏行为的难度。

这反映出头部模型公司正在面对的矛盾,一方面,需要开放模型能力,扩大调用量和商业收入;另一方面,也需要保护高成本训练形成的技术优势。

Anthropic想降低企业使用Claude的门槛,同时减少领先能力被快速复制的可能。它需要把领先的模型能力变成更大的调用量,同时避免这份领先太快被同行复制。

03.冲刺IPO,Anthropic还什么?

Anthropic也已经进入上市前的关键阶段。

5月28日,Anthropic完成650亿美元Series H融资,投后估值达到9650亿美元;四天后,公司向美国证券交易委员会秘密提交S-1文件,进入IPO筹备阶段。

8月底,有消息称Anthropic计划在9月初公开招股书,最快可能在9月底或10月初上市。不过,目前发行规模和最终估值仍未确定。

支撑Anthropic走上IPO的关键在于过去一年快速增长的收入。

2025年底,Anthropic年化收入运行率(run-rate)约90亿美元。今年5月已经超过470亿美元,7月底进一步突破650亿美元。据彭博社披露,Anthropic今年二季度初步收入超过115亿美元,实现调整后经营利润转正,高于OpenAI同期水平。Anthropic已经证明了顶级模型能力能变成企业愿意付费的产品。

其中,Coding是Anthropic最成熟的商业化场景。

Claude Code在2025年5月正式上线,到今年2月年化收入已经超过25亿美元,较年初增长超过一倍。企业客户贡献了超过一半收入,同时年化消费超过100万美元的大客户数量也持续增长。今年4月,这类客户已经超过1000家。

这一场景的成功也让Anthropic看到了更大的商业空间。过去,模型公司主要通过API调用获得收入,但Agent产品正在改变这种模式。当模型能够长期理解项目、调用工具并持续完成任务,它提供的是一套嵌入工作流程的生产力工具。

Anthropic继续强化Fable系列,也是希望Claude能够进入更多代码维护、数据分析和企业自动化场景。

但Fable 5此前的表现也提醒Anthropic,最强模型和最好卖的模型并不是一回事。Ramp数据显示,Fable 5上线一个月后,仅占Anthropic企业客户Token消耗量的6%,贡献支出占比为11.4%。相比之下,GPT-5.6 Sol占OpenAI Token消耗量的25%。

对于企业用户来说,模型能力只是选择因素之一,价格、稳定性以及任务成本同样影响最终采用。Fable 5.1降低Agent调用成本,本质上是在解决旗舰模型商业化的问题,要让领先能力从少数高价值任务,扩展到更大规模的企业工作流。

Anthropic还需要面对基础设施的成本压力和模型竞争。

为了满足训练和推理需求,Anthropic正在提前锁定算力,今年4月,Anthropic宣布未来十年将在AWS投入超过1000亿美元。近期又分别与Nscale和Lambda签署450亿美元和350亿美元的算力协议。

大规模算力投入也把Anthropic推向了一个越来越重的商业模式。模型越强,需要的训练和推理算力越多,用户越多,又需要提前采购更多基础设施。

如今,模型领先的周期也在缩短,Anthropic几乎没有太多慢下来的空间。Fable 5.1发布后不久,OpenAI就公布了下一代模型Astra的最新进展。按照OpenAI的说法,Astra已经成为公司首个达到“Critical”网络安全能力门槛的模型,可以在较少人工干预的情况下发现未知漏洞并开发利用方式。

这个动作很容易让人想到Fable 5发布之前的节奏,模型还没正式亮相,就已经传出安全评估和防护机制调整。

此外,OpenAI已经在6月秘密提交IPO申请,继续依靠ChatGPT、Codex和完整的模型矩阵竞争;Google则拥有Gemini、TPU、Google Cloud和Workspace等完整生态。Grok也在快速追赶头部模型。过去更强的模型可以形成的技术优势,现在后来者可以通过更快的迭代和更多资源的投入缩小差距。

另一边,低价模型也正在削弱旗舰模型的溢价空间。企业确实愿意为更强能力支付更高价格,但并非所有任务都需要调用最强模型。随着Kimi、DeepSeek等定价更低的模型不断提升能力,越来越多中低复杂度任务开始有了替代选择。

Anthropic现在的优势是模型处在第一梯队,Coding已经跑出商业化,企业采用率和收入还在快速增长。

但Fable 5.1之后,还需要关注降价后的最强模型能否带来更大的使用规模。想要支撑起近万亿美元的估值,还要关注企业调用能否带来足够的收入增长,以及增长能否覆盖越来越重的算力投入。

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App