Request a pilot
‹ PublicAI Index

The LLM benchmark aggregator.

Mistral Large

Mistral

Strongest in Fairness (#8 of 300, on 1 of its 2 boards), weakest in Harm refusal (#223 of 300). Above par in 6 of 19 scopes. Among the models it meets almost everywhere, it finishes behind Claude Sonnet 5 and Grok 4.6 and ahead of Gemini 1.5 Flash and Claude 3.5 Haiku.

§ 1 · Profile

What it is good at

Bars run from 50 — the average of the models each source lists — so right of the line is above par. The middle column is the gap to whoever leads that scope.

Professional47.2#110/168
Medical46.1#106/140
Finance45.8#111/151
Safety52.7#111/337
Fairness70#8/300
Factual grounding63.8#8/101
Jailbreak resistance51.2#175/272
Secure code44#199/274
Toxicity avoidance48#215/272
Harm refusal46.3#223/300
Agents50.2#114/268
Tool use50.4#34/81
Knowledge38#122/138
Academic knowledge35.6#107/123
Reasoning36#168/178
Science30.3#111/122
Mathematics34.8#131/140
Human preference48#216/342
Human preference48#216/342

§ 2 · Head to head

What it beats, and what beats it

The same models turn up scope after scope. Counted once: where both were placed, who finished higher. Bars run right for Mistral Large, left for the other.

Command R Pluswon 13 · lost 2
Jamba 1.6 Miniwon 12 · lost 2
Jamba 1.6 Largewon 10 · lost 4
Mistral Smallwon 13 · lost 6
Llama 4 Scout Instructwon 12 · lost 7
Claude 3.5 Haikuwon 10 · lost 6
Gemini 1.5 Flashwon 8 · lost 7
Ling 3.0 Flashwon 7 · lost 7
GPT-4o Miniwon 8 · lost 9
GPT-4.1 Nanowon 8 · lost 10
GPT OSS 20Bwon 7 · lost 10
Grok 3won 7 · lost 10
DeepSeek R1won 7 · lost 10
DeepSeek V3won 7 · lost 11
Gemma 4 31Bwon 6 · lost 10
Command Awon 7 · lost 12
Grok 4.1 Fastwon 7 · lost 12
GPT-6 Solwon 5 · lost 10
MiniMax M3won 6 · lost 12
DeepSeek V3.2won 6 · lost 13
Gemini 1.5 Prowon 5 · lost 11
Gemini 2.5 Flash Litewon 5 · lost 11
Gemini 3.1 Flash Litewon 4 · lost 9
Grok 4.3won 5 · lost 12
GPT OSS 120Bwon 5 · lost 13
Gemini 2.5 Prowon 5 · lost 13
Kimi K2.6won 5 · lost 13
Gemini 2.5 Flashwon 5 · lost 14
Kimi K2won 5 · lost 14
GLM-4.6won 5 · lost 14
Qwen3.5 Flashwon 3 · lost 9
Mimo V2.6 Flashwon 3 · lost 9
Gemini 2.0 Flashwon 4 · lost 12
GLM-4.5won 4 · lost 12
O3 Miniwon 4 · lost 13
DeepSeek V4 Flashwon 4 · lost 13
Qwen3.7 Maxwon 4 · lost 13
Gemini 3.5 Flashwon 4 · lost 13
Gemini 3.6 Flashwon 4 · lost 13
Mistral Large 3won 3 · lost 10
Gemini 3.1 Prowon 3 · lost 10
Claude Sonnet 4won 4 · lost 14
Grok 4won 4 · lost 14
Kimi K2.5won 4 · lost 14
GLM-5.2won 4 · lost 14
GPT-5 Nanowon 4 · lost 15
Claude Opus 4.6won 3 · lost 12
Claude Sonnet 4.6won 3 · lost 13
Gemini 3 Prowon 3 · lost 13
GPT-4owon 3 · lost 14
Claude 3.7 Sonnetwon 3 · lost 14
MiniMax M2.7won 3 · lost 14
Mimo V2.5 Prowon 3 · lost 14
GLM-5.3 Flashwon 3 · lost 14
Gemini 3.8 Flashwon 3 · lost 14
Grok 4 Fastwon 2 · lost 10
GPT-5.4 Miniwon 2 · lost 10
Claude Opus 4.1won 2 · lost 10
GLM-5won 2 · lost 10
Gemini 3 Flashwon 2 · lost 10
DeepSeek V4 Prowon 3 · lost 15
GPT-5.5won 3 · lost 15
GPT-5.6 Solwon 3 · lost 15
Claude Haiku 4.5won 3 · lost 16
Qwen3 235B A22B Instructwon 3 · lost 16
Claude Sonnet 4.5won 3 · lost 16
GPT-5.4 Nanowon 2 · lost 11
Mimo V2.6 Prowon 2 · lost 11
Kimi K2 Thinkingwon 2 · lost 12
GPT-6 Lunawon 2 · lost 12
Claude Opus 4.5won 2 · lost 12
Claude Opus 4won 2 · lost 15
GPT-4.1 Miniwon 2 · lost 16
GPT-5won 2 · lost 16
Inklingwon 2 · lost 16
GPT-5.1won 2 · lost 16
GPT-5.4won 2 · lost 16
Claude Opus 4.7won 2 · lost 16
GPT-5 Miniwon 2 · lost 17
O4 Miniwon 2 · lost 17
GPT-4.1won 2 · lost 17
GPT-5.2won 2 · lost 17
Qwen3.8 27Bwon 1 · lost 11
Claude 3.5 Sonnetwon 1 · lost 15
O1won 1 · lost 15
GLM-5.1won 1 · lost 16
Grok 4.5won 1 · lost 16
Qwen3.8 Maxwon 1 · lost 16
Claude Opus 4.8won 1 · lost 16
Claude Opus 5won 1 · lost 16
Muse Spark 1.1won 1 · lost 16
O3won 1 · lost 17
GPT-5.6 Lunawon 1 · lost 17
GPT-5.6 Terrawon 1 · lost 17
Grok 4.7won 0 · lost 14
Claude Opus 5.5won 0 · lost 14
Grok 4.6won 0 · lost 17
Claude Sonnet 5won 0 · lost 18

§ 3 · Sources

Where the numbers come from

5 publications, 14 figures. Every one links to the page it was read from.

LMArena Text ↗1 measureread 2026-09-26
LMArena Text 1306
BFCL ↗1 measureread 2026-09-26
BFCL v4 38.37%
Vals.ai ↗5 measuresread 2026-09-26
Vals · TaxEval 63.78%Vals · MedQA 76.22%Vals · GPQA Diamond 47.73%Vals · MMLU Pro 69.71%Vals · AIME 9.17%
Enkrypt AI Safety Leaderboard ↗6 measuresread 2026-09-26
Enkrypt · Jailbreak risk 11.8%Enkrypt · Harmful content risk 61.1%Enkrypt · CBRN risk 9.8%Enkrypt · Toxicity risk 7.7%Enkrypt · Bias risk 39.5%Enkrypt · Insecure code risk 45.8%
Vectara · Factual consistency 95.5%

Badge

PublicAI Index badge for Mistral Large[![PublicAI Index](https://publicai.io/model-index/badge?model=mistral-large)](https://publicai.io/model-index/m/mistral-large)