首页 > 资讯 > 1万亿参数「肥猫」单挑GPT-6和Claude!多项测试赢了

1万亿参数「肥猫」单挑GPT-6和Claude!多项测试赢了

新智元 2026-10-08 06:03 7 阅读 查看原文

  新智元报道  


刚刚,欧洲最强AI杀回来了!


法国AI独角兽Mistral突然放出新旗舰Mistral Large 4,总参数1万亿,权重月底全部开源。



在第三方评测Artificial Analysis的智能指数里,它拿下38分,追平GPT-6 Luna。

这是欧美开源模型的第一名,第二名Thinking Machines的Inkling只有25分。用Artificial Analysis的话说,中美之外,它是全球最聪明的模型。

甚至在几项硬核测试上,Mistral Large 4还压过了GPT-6和Claude——

  • 法律Agent测试的分数是GPT-6 Astra的近3倍
  • 金融、视觉定位都赢了GPT-6 Astra
  • 科学编程赢了Claude Opus 5

在一道修漏洞的网安考题上,它更是拿下82%,全场最高。Claude Opus 5.5和GPT-6 Astra直接拒答,几乎交了白卷。

闭源巨头不敢接的活,这只「肥猫」全接了。



GPT-6交白卷的考题,它拿了82分


安全工程师修一个漏洞,第一步必须先把攻击打出来。打不出来,就没法确认漏洞在哪,更没法验证补丁到底管不管用。


所以「复现漏洞」听起来像在搞破坏,其实是修补的前一半。如果模型一看到「复现漏洞」就拒绝回答,等于把后一半也一起扔掉了。


在整个网安指数里,Mistral Large 4成功了50次,排进全球前五。


GPT-6 Astra成功33次,另有38次被自家安全机制拦下。Claude Opus 5.5成功29次,被拦下36次。


两家闭源旗舰被拦下的次数,比做成的还多


Mistral在博客里直言,OA两家一刀切地拒答,挡住的恰恰是正当的漏洞研究和应急响应。


黑客早就在越狱闭源模型帮自己搞攻击,防守的一方却被同一套拒答捆住了手脚。


更要命的是,安全事故处理到一半,模型的能力突然被收走,本身就会变成一个重大的安全风险。


相比之下,Mistral Large 4不会卡在拒答上。


在收录了40道安全竞赛真题的Cybench上,它解出了93%。



在Mistral内部一套19道的网安挑战题里,它解出了16道。



在内部测试里,它还能分析恶意软件、给漏洞排优先级、写检测规则,这些活它都没专门练过。


Mistral给它扔了一个黑客常拿来作恶的CobaltStrike加载程序,没贴任何标签,全程没人插手。


它自己反编译、顺藤摸瓜找到命名管道,追出藏起来的加密载荷,最后把XOR加密破解开。



与此同时,面对越狱攻击和恶意Agent任务,它的拒绝率比所有开源模型都高。



在Lakera公开的B3 AI安全基准里,它挡住了93.3%的攻击,对手里没有更高的分数。




从写代码到看卫星图,样样能打


能复现漏洞、亲手补漏洞,靠的是写代码的能力。


单论写代码,它在DeepSWE v1.1上拿到61.7%,SWE-Atlas-QnA拿到59.4%,Terminal-Bench 4拿到28.3%。综合编程Agent指数拿到49.8%,压过了两款顶级开源模型。


左右滑动查看


AutomationBench测试收录了657个真实的业务流程,模型要在Gmail、Google表格、Slack、Salesforce之间来回切换,把活一步步干完。Mistral Large 4在这项测试里拿到59.9%。



AA-Briefcase考的是做表格、改PPT、出PDF这类长线知识工作,Mistral Large 4的Elo分达到1393。


第三方评测机构Vals AI拿真实的法律、金融任务去考,Mistral Large 4的表现超过了GPT-6 Astra。在法律AI公司Harvey的法律Agent基准上,它压过了所有开源模型。



代码、法律、金融之外,它也很会看图。


在十亿像素级的卫星图里,它能一点点找出目标,帮救灾队伍抢时间;对着工程图纸,它也能反复放大、检查、核对零件,直到答案准确为止。


给它一张真空翻转夹爪的装配图,问压缩弹簧会不会碰到滑动轴承。它在图里找到这两个零件,回答不会,因为中间隔着3号真空销。



在视觉定位测试Dense 200上,它拿到42%,GPT-6 Astra是41.5%,连闭源旗舰都被它压了一头。



在科学编程测试SciCode-Verified上,它拿到91.8%,是欧美开源模型里的最高分,还压过了Claude Opus 5的91.3%。



放到实际科研里,它能一次写出完整的Hartree-Fock模拟代码。这是量子化学里计算分子电子结构的方法,要串起一长串复杂的计算步骤。



3800块Blackwell,从零喂出一只「肥猫」


Mistral给这个模型起的官方代号叫le Chonk。


chonk是网上形容超大号胖猫的梗,CEO Arthur Mensch还在X上亲自接梗:其实是「le gros chaton」,一只大胖猫。


它确实胖。


总参数1万亿,用的是混合专家架构,每生成一个token只叫醒其中490亿参数干活,所以胖而不慢。


它把指令、推理和Agent能力塞进了同一个模型,还能说160多种语言,欧盟所有官方语言全覆盖。


Mistral在欧洲自家机房里,用3800块英伟达Grace Blackwell从零训练了它,现在开放的预览版也跑在同一批机器上。



后训练靠的是大规模强化学习。


一套会自动扩缩的集群同时跑几万条尝试,单条任务轨迹能用掉几百万token,模型从自己每一次尝试的结果里学。


按现在的规模,一次训练每天能产出330亿token,过滤之后还剩约160亿可以直接拿来练。



在客服Agent、跨应用业务流程、Excel表格编辑、事实问答这四类任务上,训练奖励都在持续上升。


而且,这轮强化学习还没跑完,模型也完全没有到顶的迹象。Mistral的原话是,接下来几周到几个月,它还会有大幅、快速的提升。


模型还在练,预览版API已经在Mistral Studio上线,每百万token输入1.36美元、输出4.18美元。


完整权重月底放出,到时企业可以把它搬进私有云,或者直接装在自己的机房里。



万亿大脑的开关,交回用户手里


越往ASI走,模型能做的事越多,「谁来决定它能做什么」就越要紧。


过去两年,这个决定一直写在几家闭源厂商的安全策略里。同一个漏洞,GPT-6和Claude说不碰,靠它们干活的安全工程师就只能停手。


Mistral Large 4把一颗能和闭源旗舰掰手腕的万亿大脑,连同开关一起交了出去。


权重在自己手里,模型部署在哪、什么时候用,就不再由厂商说了算,也不会在关键时刻被一刀切断。


而它还只是一个没练完的预览版。


Mistral手握30亿欧元D轮融资,这是欧洲科技公司史上最大的一笔股权融资。这笔钱正用来扩建欧洲自家机房的算力,Mistral Large 4只是这条路线上的第一站。


参考资料:

https://mistral.ai/news/mistral-large-4/

编辑:摩西


秒追ASI
⭐点赞、转发、在看一键三连⭐
点亮星标,锁定新智元极速推送!