旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

刚刚!Claude Fable 5,又拿第一了

Claude的Fable 5在MirrorCode排行榜登顶,用不同语言成绩稳定,这表明前沿模型能独立完成部分中大型软件,工作方式将改变。
·微信公众号:新智元 ASI启示录 ASI启示录

AI投资人解读

· Claude Fable 5在MirrorCode排行榜上以64%的成功率登顶,使用冷门语言Ada时成绩仅下降3个百分点。这表明其已摆脱具体语料牵引,开始学会从零构建完整软件项目。
· 模型需在隔离环境完成任务,测试完成率达100%才算通过,任务成本高。
总结:Claude Fable 5展现出强大的编程能力,具备独立完成中大型软件的潜力,对软件开发行业影响深远,但高成本的测试方式可能限制其应用推广,仍需关注其长期稳定性与成本控制能力。

Claude这次,真把AI编程榜单打出断层了!

就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的*成功率再次登顶。

紧追其后的GPT-5.6 Sol,分数只有它的三分之一!

排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。

更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。

要知道,在开源世界里,Python语料大约是Ada的230倍。

但到了Fable 5这里,成绩居然只下降3个百分点。

这就有意思了。

如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。

而现在的结果,却指向另一种可能——

最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。

01、卡死在100%通关线,100亿Token极限测试

具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。

在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。

接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。

最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。

并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。

只要漏掉一个边缘案例,整次运行仍然按失败计算。

为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。

论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。

在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。

整个过程,更像一场持续数天的调试,而不是一次生成。

gotree的例子最直观。

这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。

Claude Opus 4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。

虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——

Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。

02、语料荒漠里,Fable 5只掉了3分

MirrorCode论文曾用StarCoder的公开训练混合作为参照。

其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。

当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。

这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。

而Fable 5显然不是在把Go代码逐句翻译成Ada。

它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。

相比之下,其他模型就没这么稳了。

GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。

03、把整个项目交给AI

如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。

Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。

OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。

人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。

MirrorCode的64%,正是对这种「项目级委托」的一次量化。

它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。

对每一个正在把工作交给AI的人来说,变化已经近在眼前——

以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。

代码会越来越便宜。

而那些能把问题说清楚、把结果验明白的人,会越来越值钱。

【本文由投资界合作伙伴微信公众号:新智元授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。