6月9日,Anthropic发布Claude Fable 5,登顶Artificial Analysis智能指数榜首。6月27日,OpenAI跟进发布GPT-5.6,两家美国AI巨头的竞争进入白热化。
差不多同一时间,Anthropic CEO达里奥·阿西莫迪亚(Dario Amodei)在Bloomberg的采访镜头前,对中国AI现状抛出了一组相当尖锐的判断。
阿西莫迪亚几个观察:中国AI"从未真正赶上"
采访核心可以归纳为三个观察。

51
第一个,技术差距从未真正消失。阿西莫迪亚的原话是,中国AI"从未真正赶上"美国(never really caught up)。他认为DeepSeek引发的那波热潮,更多是表象,不是实质性的追平。
这话听着刺耳,但它针对的其实是"大模型测评"这个层面。斯坦福大学《2026年AI指数报告》的数据确实显示,中美AI模型性能差距缩小到了2.7%,几乎为零。
富瑞的报告也说,中国开源模型只落后美国闭源领先模型3到6个月。在全球最大的AI流量聚合平台上,2025年5月排名前五的模型有三个来自中国,中国模型的使用占比从2024年的1%涨到了今年的40%以上。
这些数据都是真的。但它们说的是"测评分数"层面的差距,不是"产品竞争力"层面的差距。
第二个,测评优化存在局限。阿西莫迪亚提到,中国模型普遍针对特定测评指标做了极致优化。用他的原话,"针对有限测评列表优化模型其实很容易"(it's relatively easy to optimize for a limited list of benchmarks)。
这不是在质疑测评机构的专业性,而是封闭测试和真实商业环境之间有一道鸿沟。在封闭测试中表现好,不代表在开放环境中同样出色。测评分数反映的是模型在特定条件下的表现,市场竞争力取决于用户在真实场景中的体验。
第三个,商业战场上几乎碰不到中国对手。阿西莫迪亚说,在企业级市场竞争中,实际遇到的竞争对手只有谷歌和OpenAI,"几乎从未因中国模型而丢失任何商业合同"(almost never lost a commercial contract because of a Chinese model)。偶尔遇到的竞争者也全是美国厂商。
注意这里的前提:排除价格因素。也就是说,即便不考虑成本优势,在真实的企业级采购决策中,中国模型也没有对Anthropic构成实质性的竞争压力。
这说明什么?测评分数和用户买单之间,是两个完全不同的游戏。
Fable 5与GPT-5.6:Agent能力差距正在具象化
Fable 5的发布,恰恰把这个差距具象化了。它的核心突破不在聊天能力,而在Agent能力——长时、多步任务的可交付性。
几个硬数字:SWE-Bench Pro(智能体编码基准测试)上,Fable 5得分80.3%,比Anthropic自家前代旗舰Opus 4.8的69.2%高出11个百分点,比GPT-5.5的58.6%大幅领先。

在Cognition的FrontierCode Diamond评估中,Fable 5得分29.3%,是Opus 4.8的13.4%的两倍多。在Hebbia金融基准测试中,Fable 5在所有参测模型中排第一。贸易公司IMC的报告说,Fable 5在他们的评估套件上表现接近完美,覆盖事实查找、根本原因分析和期望值计算。
一个更有说服力的实战案例来自Stripe。Fable 5早期测试中,Stripe用它完成了一个5000万行Ruby代码库的全库迁移,只用了一天。工程团队原本预估这个任务要两个月以上。
这不仅仅是"变快了"。Fable 5真正的突破在于,它能处理复杂的、需要连续推理和行动的、跨多个系统的真实工作任务。它不只是"能聊天",而是"能干活"。
6月27日OpenAI发布的GPT-5.6 Sol也聚焦这个方向。在Terminal-Bench 2.1测试中,Sol的ultra模式得分91.91%,协调并行子智能体完成复杂任务的能力领先。OpenAI还推出了Sol、Terra、Luna三款产品分层,满足不同场景需求。
大模型的核心能力是"推理"——给定输入后产生优质输出。Agent的核心能力是"行动"——在开放环境中自主分解任务、调用工具、处理异常、持续推进直到完成目标。这两者之间的差距,远比"模型参数大小"或"测评分数高低"更难以量化,也更难以追赶。
这场竞争已经从"人工智能"演变为"没有人工的智能"。在前一个阶段,中国模型已经达到或接近美国顶尖水平;在后一个阶段,差距仍然很明显。
"硅和平"联盟半年扩容:全球AI版图加速分化
与此同时,一个值得关注的产业信号正在浮现。由美国国务院主导推动的"硅和平"联盟(Pax Silica)正在快速扩容。
2025年12月12日,联盟在华盛顿正式启动,首批成员只有7个国家:美国、以色列、日本、韩国、新加坡、英国、澳大利亚。但六个月后的2026年6月25日至26日第二届峰会上,欧盟、荷兰、德国、希腊正式加入,阿根廷、智利、哈萨克斯坦等10个国家宣布即将完成签署,成员总数将达到24个。印度在2026年2月20日新德里的AI Impact Summit上签署加入。
中国台湾虽未以正式成员身份签署《硅和平宣言》,却以特殊参与方形式出现在联盟舞台上。

2025年12月11日,在硅和平峰会前一天,美国国务院主管经济事务副国务卿雅各布·赫尔伯格(右)和来自日本的代表签署了联合序言
从7国到24国,只用了半年。这个速度超过很多人预期。
"硅和平"由美国国务院主管经济事务的副国务卿雅各布·赫尔伯格(Jacob Helberg)主导推动,表面聚焦半导体和AI基础设施的供应链安全合作,实质上正在以"可信技术"之名重塑全球科技版图。
它覆盖的不是单一环节,而是从矿产资源到技术创新、再到生产制造和市场销售的全产业链。这种全产业链的系统性封堵,比单一的芯片出口管制更难绕过。
更值得警惕的是,"硅和平"目前机制虚、约束弱,但未来可能通过技术标准、采购规范和合规体系逐步固化为排华性的技术壁垒。一旦形成相对成熟的运转机制,中国在未来的全球AI竞争中,连"入场券"都可能受到威胁。
从"测评导向"到"应用导向":中国AI的下一步
阿西莫迪亚的采访,真正想表达的其实是一个技术层面的清醒判断。
测评高分不等于市场认可,模型接近不等于产品竞争力。真正决定胜负的,不是某个Benchmark上的分数,而是Agent能力——也就是在真实商业环境中解决复杂问题的能力。
大模型层面的差距正在收窄,这是真的。Agent层面的差距正在拉大,这也是真的。两件事同时为真,因为它们描述的是两场不同的竞争。
对中国AI产业来说,接下来的关键课题很明确:在保持大模型能力持续提升的同时,如何把技术能力转化为真实商业场景中的产品竞争力。这不是一朝一夕能解决的问题,但方向必须清晰——从做"会考试的模型",转向做"会干活的智能体"。
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有