【导语第67届国际数学奥林匹克中国队夺冠与此同时GitHub上一场AI横评引发关注Claude Fable 5、GPT - 5.6 Sol等7个前沿大模型单挑IMO 2026全部6道题四方势力满分登顶成绩碾压人类其背后展现出AI在数学领域的巨大进步。】AI奥数成绩四方满分断层碾压人类在这场AI挑战IMO 2026的测试中Claude Fable 5狂揽42分满分耗时2.5小时花费51美元GPT - 5.6 Sol的xhigh版本同样满分用时3.8小时成本仅20美元Kimi K3历经17.4小时鏖战花费31美元拿下满分AxiomProver也独立获得满分。作为参照过去七年IMO4347名人类选手参赛只有30人拿过满分比例仅0.69%AI成绩实现了断层式碾压。解题策略模型各显神通在P1题目上Claude Fable 5直接生造了一个每步必定缩水的计数器Φ T N证明每执行一步操作Φ至少减少1从而得出过程会在有限步内终止。而GPT - 5.6 Sol则追踪乘积P和大于1的数的个数K证明(P, K)这个二元组在字典序下严格递减进而得出终止结论。到了题目(b)部分三个模型都证明了对每个素数p黑板上所有数被p整除次数的最大公约数在操作中不变最终公式一致。在全场最廉价的白卷P6题上Claude Fable 5用26分钟、两轮获得满分GPT - 5.6 Sol 60分钟、两轮满分Kimi K3 381分钟、四轮满分而Grok 4.5只挤出7053个token提交未完成证明且在测试中反复出现工具调用问题这并非数学能力问题而是agent能力问题。三年进化硅基大脑飞速提升2024年DeepMind的AlphaProof首次在IMO级别摸到银牌门槛2025年OpenAI未公开模型和解5题拿下35分金牌Gemini Deep Think达到同等段位2026年三个通用大模型直接拿下满分且未经过任何专项数学训练还有一个是开源的。这体现了硅基大脑在短短三年里的恐怖进化。背后功臣年轻团队助力测试整场测试的起点是Axiom Math公司其创始人洪乐彤年仅25岁她打造的AxiomProver去年拿下Putnam数学竞赛满分。该公司将IMO 2026的全部6道考题翻译成机器能够理解的Lean 4形式化题面Deedy Das迅速搭建起全自动化的测试框架各大模型才得以完成挑战AxiomProver也独立斩获满分今年3月该公司完成2亿美元A轮融资估值直冲16亿美元。生活重构长链条逻辑推导走进大众能写4229行严格证明的模型掌握的是长链条逻辑推导能力。在合同条款核验、保险理赔条件判断、税务方案合规检查等方面过去只有专业人士能按小时计费完成如今随着这种能力铺进消费级产品普通人遇到棘手问题只需打开手机就能解决。编辑观点AI在奥数测试中的出色表现不仅展示了其强大的逻辑推导能力也预示着将在更多领域发挥重要作用。年轻团队的创新推动值得关注未来其在大众生活中的应用前景广阔但也需关注可能带来的挑战。