梁文锋、马斯克“同日双发”:当顶级模型性能价格双杀,谁先被推进“斩杀区”?

搜狐焦点华北区 2026-08-13 16:57:48
用手机看
扫描到手机,新闻随时看

扫一扫,用手机看文章
更加方便分享给朋友

中美AI巨头同步更新旗舰模型,DeepSeek V4 Pro与Grok 4.6分别突破Claude Fable 5性能边界,争夺AI旗舰赛道“斩杀线”。

出品|搜狐科技

作者|郑松毅

“梁圣”梁文锋和马斯克,盯上了同一座高地。

数小时前,AI行业上演极具戏剧性的一幕:DeepSeek悄然发布V4 Pro正式版,几乎同一窗口,SpaceXAI火速放出Grok 4.6旗舰模型。没有提前串通,分属中美两大阵营的两款顶级模型,不约而同完成重磅迭代。

从两款模型的对标测试结果来看,业界普遍将这场同步更新视作对Claude Fable 5的双线夹击,且直接刷新了AI旗舰赛道的“斩杀线”。

Fable 5被推进“斩杀区”?

所谓“斩杀线”,脱开游戏圈放到AI产业,指的是一条残酷的性能和成本生死边界:当一款模型拿到某一档能力,同时维持足够低的调用成本,那些能力不如它、价格却更高的竞品,就会落入“斩杀区”。

作为Anthropic推出的顶级Mythos级旗舰模型,Claude Fable 5是当下AI行业公认的复杂智能体能力天花板:凭借顶尖的长链路任务处理、超大工程代码重构等能力,长期霸占Agent赛道跑分榜首。

从基准跑分来看,如今两款新模型已经站到Fable5的眼皮底下。

先来看DeepSeek V4 Pro,可以说是完成了Agent能力的质变升级。其中,CyberGym网络安全智能体拿到83.3分,AutomationBench自动化任务31.8分,两项指标实现对Fable5局部反超。

在业内尤为看重的“Terminal Bench 2.1”(考核模型自主敲命令、操作服务器、排错运维的真实工程实操能力)和“DeepSWE”(模型理解代码项目并自己处理复杂问题)两项指标上,DeepSeek V4 Pro正式版对比此前预览版分别大幅提升21.9%和390%。

值得一提的是,DeepSeek V4 Pro的“Terminal Bench 2.1”测试能力与Fable 5仅有0.1的差距。

相较于DeepSeek V4 Pro的稳步赶超,Grok 4.6的亮眼成绩来自业内公认的实战向基准测试GDPVal‑AA v2(专注考核AI处理真实职场、复杂业务、多步骤工作流的综合能力)。Grok 4.6在此榜单拿下1753 Elo的高分,不仅超越Claude Fable 5的1741分,同时碾压GPT‑5.6 Sol Max的1728分,跻身全球第一梯队。

纸面跑分之外,一众开发者晒出真实实测评价。

有开发者在同一代码项目上同时调用两款模型:DeepSeek V4 Pro成本低廉,但耗时实在太久,闷头跑二三十分钟命令,完全不知是否卡住了以及还需多久。相比之下,Grok4.6速度很快,输出结果稳定性更好,但单次任务成本更高。

至于Fable 5是否被推进了“斩杀区”,搜狐科技把模型性能和成本拉到一起算了笔账。

Claude Fable5定价为输入10美元/百万token,输出高达50美元/百万token,属于目前市面最贵的闭源旗舰。

DeepSeek V4 Pro当前定价为输入0.43美元/百万token,输出0.87美元/百万token,缓存命中输入只有0.0036美元。

可见,DeepSeek V4 Pro普通输入比Fable5便宜23倍,输出便宜57倍,缓存命中差距276倍。

然后是Grok 4.6,输入2美元/百万token,比Fable 5便宜5倍;输出6美元/百万token,比Fable 5便宜8倍多。

这就构成了最现实的商业压力——性能与成本还是无法兼得。

虽然现在两套备选方案摆在台面上,绝大多数通用开发场景,已经不需要为极限能力支付数十倍溢价。但理性来看,无论是DeepSeek V4 Pro还是Grok 4.6,仍在实测性能表现上与Fable 5尚存差距。对于少部分高价值企业客户,仍愿意为强安全约束的重度任务溢价付费。

由此看来,进了“斩杀区”的还不是Fable 5,而是一众夹在中间的老一代旗舰(如Gemini 3.1 Pro、GPT-5.5 Pro等),能力追不上Fable5,定价又下不来,如今被两头挤压,生存空间进一步压缩。

Agent精细化内卷拉开序幕

而在“斩杀线”背后,行业格局的隐形变化鲜被人挖掘。

从近期发布的一系列模型不难看出,评价体系正在完成范式转移——从“选择题跑分时代”走入了“任务交付时代”。

过去评判模型,大家更多看MMLU、数学测试得分,比拼的是静态知识储备与基础推理能力。而现在Agent成为核心战场,评判标准彻底落地到实用维度:能不能自己敲终端命令、安装环境、调试报错、理解并解决代码工程问题,完整交付可用结果。

这意味着,很多榜单高分,但调用成本高昂、落地效率低下的模型,将会加速被市场过滤。

未来的生存逻辑,不再局限于“综合评分”,而是要清晰向市场证明,用户花费成本的背后,究竟买到了哪些竞品无法复刻的独特价值,以及能实际解决现实世界中的哪些问题。

业内有消息透露,DeepSeek Harness Agent框架即将正式发布,马斯克也放出狠话:“Grok 4.7将超越当前所有模型。”接下来,Anthropic必须在技术路径与定价策略上做出抉择。

而全行业的Agent精细化内卷,才刚刚拉开序幕。

声明:本文由入驻焦点开放平台的作者撰写,除焦点官方账号外,观点仅代表作者本人,不代表焦点立场。