一句话结论:Mistral 于 2026 年 10 月 6 日放出 Mistral Large 4 预览版,总参数 1 万亿、单次推理激活 490 亿,在 Artificial Analysis 智能指数上从上代的 9 分跳到 38 分,但仍落后榜首 Claude Opus 5.5(Max)的 58 分整整 20 分。
10 月 6 日,法国 AI 公司 Mistral 发布了其历史上规模最大的模型 Mistral Large 4,内部代号 le Chonk。这一轮放出的是公开预览版,API 已通过 Mistral Studio 开放,模型权重按官方口径要等到 10 月底才会公开。在这段空窗期内,Mistral 会与网络安全公司、经过审核的合作方以及政府机构一同做红队测试,这批参与者拿到的是审核限制更少、网络攻防能力更强的版本。
Mistral 给这个模型的定位很清楚。它不打算在通用智能上正面挑战 Claude 或 GPT-6,而是把主战场选在网络安全这一块:那些闭源模型因为安全过滤而拒绝处理的任务,Mistral Large 4 愿意接。
参数与训练:1 万亿总参数,490 亿激活
Mistral 官方称 Mistral Large 4 是原生多模态模型,总参数量 1 万亿,其中 490 亿在单次推理中被激活。这个比例延续了稀疏架构的思路,把推理成本压在可控区间,同时让总容量撑到万亿量级。训练全部在 Mistral 自有的欧洲数据中心完成,这一点对欧洲客户的合规诉求来说是硬指标。
在 X 平台上,Mistral 称 Mistral Large 4 是美国或欧洲最好的开放权重模型(按聚合基准计算),并宣称在网络防御、制造与金融三类场景达到业界最佳,视觉定位能力甚至超过闭源前沿模型。需要说明的是,这些说法目前都来自 Mistral 自己,权重尚未公开,第三方无法复核。
智能指数 38 分:从 9 分到 38 分,仍差 20 分
相对客观的成绩来自 Artificial Analysis 的智能指数。该指数聚合十个不同领域的基准测试,Mistral Large 4 拿到 38 分。对 Mistral 而言这是一次大跨步:上一代 Mistral Large 3 只有 9 分,最近的 Mistral Medium 3.5 也仅 14 分。38 分还让它超过了 Mistral 自家平台上架的 GLM-5.2。
但离顶部依然很远。Claude Opus 5.5(Max)以 58 分领跑,两者相差 20 分。除 Anthropic、OpenAI、Google 的闭源旗舰外,几个来自中国的开放权重模型也排在 Mistral Large 4 之前。由于权重未发布,该模型在指数里仍被列为专有模型。
网络安全是主打:漏洞复现测试 82 分,对手因拒答近零分
Mistral 把公告的大部分篇幅留给了 IT 安全。按公司说法,Mistral Large 4 在 Artificial Analysis 网络指数上位列全球前五,在中国以外开发的开放权重模型中领先优势明显。
最能说明问题的一项测试要求模型复现开源软件中的真实漏洞,然后再把它修补掉。Mistral Large 4 拿到 82% 的得分,是所有模型里最高的。但这个第一名的成因有点特殊:Mistral 指出,Claude Opus 5.5 和 GPT-6 Astra 在这项测试上得分接近零,原因是它们直接拒绝执行任务。换句话说,这项测试测的不只是模型能力,也在测厂商的安全策略。
Mistral 把这个差异做成了卖点。它的论证是,软件防御往往要从证明漏洞真实存在开始,而闭源模型的安全过滤恰好挡住了这类工作,攻击者却总能想办法绕过同样那些模型。此外,在安全事件处置中途失去模型供应商的访问权限,本身也会变成一种风险。Mistral Large 4 支持部署在私有云或本地机房,这一点对企业安全团队有实际吸引力。
与此同时 Mistral 也强调模型的高拒答率。在 JailbreakBench、StrongREJECT 和 AgentHarm 的恶意网络提示集上,Mistral Large 4 的拒答频率高于其他任何开放模型;在 Lakera 的 B3 AI 安全基准中,它拦截了 93.3% 的攻击。至于模型如何稳定区分合法的漏洞研究和攻击准备,Mistral 没有给出解释。
编程与视觉:编码智能体 49.8%,视觉基准险胜 GPT-6 Astra
在编程方面,Mistral Large 4 在 Artificial Analysis 编码智能体指数上拿到 49.8%,排在 DeepSeek V4 Pro 和 Qwen3.8 Max 之前。Mistral 还与 Surge AI 做了一轮盲评,由专业标注者在不知道模型归属的前提下给代码质量打分,Mistral Large 4 在五个模型中位列第二,得分 3.74 分(满分 5 分),高于 GLM-5.3 和 Kimi K3,Claude Opus 5 以 4.22 分领先。人工评审在 STEM 与 CAD 任务上更偏好 Mistral Large 4,金融与代码两类任务上两者大致持平。
科学编程方面 Mistral Large 4 接近榜首,但 GPT-6 Astra 和 Qwen3.8 的数字更高。视觉理解是官方宣传的另一个重点,模型据称能分析文档、图表、十亿像素级卫星影像和技术图纸,并自主放大核对细节。不过领先幅度很薄:Dense 200 基准上 Mistral Large 4 得 42%,GPT-6 Astra 为 41%。按 Vals.ai 的评测,Mistral Large 4 在法律与金融任务上也超过 GPT-6 Astra。自动化业务流程方面,它略逊于 GLM-5.3,但优于 Kimi K3 和 DeepSeek V4 Pro。
关键数据一览
| 指标 | Mistral Large 4 | 对比对象 |
|---|---|---|
| 总参数 / 激活参数 | 1 万亿 / 490 亿 | Mistral Large 3 未公开同口径 |
| Artificial Analysis 智能指数 | 38 分 | Large 3 为 9 分,Medium 3.5 为 14 分,Claude Opus 5.5(Max)为 58 分 |
| 漏洞复现并修补测试 | 82% | Claude Opus 5.5、GPT-6 Astra 接近 0(拒答) |
| 编码智能体指数 | 49.8% | 高于 DeepSeek V4 Pro、Qwen3.8 Max |
| Surge AI 盲评(满分 5 分) | 3.74 分,五模型中第二 | Claude Opus 5 为 4.22 分 |
| Dense 200 视觉基准 | 42% | GPT-6 Astra 为 41% |
| Lakera B3 安全基准拦截率 | 93.3% | 拒答率高于其他开放模型 |
FAQ:三个关键问题
现在就能用上 Mistral Large 4 吗?
能用,但用的是预览版。API 已通过 Mistral Studio 开放,模型权重预计 10 月底发布。在权重公开前,完整能力只向参与红队测试的安全公司、审核合作方和政府机构开放,他们拿到的是审核限制更少、网络能力更强的版本。
为什么它在网络安全测试上比 Claude、GPT-6 高出这么多?
不完全是能力差距。以漏洞复现测试为例,Claude Opus 5.5 和 GPT-6 Astra 得分接近零,原因是安全过滤让它们直接拒绝任务,而 Mistral Large 4 选择执行。所以这项测试同时衡量了模型能力和厂商的安全策略边界,两者不能直接划等号。
权重发布后格局会变吗?
会有一部分变化。权重公开后第三方可以独立复核 Mistral 给出的各项成绩,也能做微调与本地部署。但智能指数 38 分与榜首 58 分的 20 分差距属于模型能力层面,不会因为开源而消失。真正的变量在于开源之后社区能否把网络安全这个差异化优势放大。
小结
Mistral Large 4 是一次定位清晰的发布。它没有在通用能力上硬碰闭源旗舰,而是抓住了对手因安全策略留下的空档,把网络安全做成主打场景,同时用欧洲本地训练、私有云与本地部署这套组合去接欧洲主权 AI 的需求。
它的短板同样明确。38 分距离 58 分还有 20 分,这个差距不是换个卖点就能抹平的;网络安全上的领先又部分建立在竞品主动拒答之上,一旦对手调整策略,优势可能被稀释。权重在 10 月底公开,届时第三方复现的结果才是真正的检验点。
相关阅读:Mistral 完成 3 亿欧元 D 轮融资、估值超 210 亿欧元;Reflection AI 发布 Beam,5010 亿参数 MoE 开源模型;Cohere 200 亿美元收购 Aleph Alpha,欧洲主权 AI 博弈。
延伸阅读
- DeepSeek-V4-Flash-Vision-Exp 权重开源:168GB、MIT 协议,48 个 Safetensors 分片可私有化部署2 周前
- DeepSeek V4 Flash 正式版来了:Terminal Bench 2.1 冲到 82.7,Agent 能力大幅超越预览版2 月前
- 智谱 GLM-5.3-Flash 夜间免费用:9月3日至20日每晚23点至次日9点全免1 月前
- Black Forest Labs 发布 FLUX 3:首个能生成带音效视频的多模态模型,支持20秒片段3 月前
