Skip to main content

Benchmark profile

Artificial Analysis IFBench (AA-IFBench)

A display-only Artificial Analysis IFBench score.

Data verified

Benchmark score on AA-IFBench — July 23, 2026

BenchLM mirrors the published score view for AA-IFBench. MiniMax M3 leads the public snapshot at 82.9% , followed by Nemotron 3 Ultra (81.4%) and Grok 4.3 (81.3%). BenchLM does not use these results to rank models overall.

146 modelsInstruction FollowingCurrentDisplay onlyUpdated July 23, 2026

Benchmark score table (146 models)

Score
1
MiniMax M3MiniMax · Open weight
82.9%
2
Nemotron 3 UltraNVIDIA · Open weight
81.4%
3
Grok 4.3xAI · Closed
81.3%
4
Qwen3.7 MaxAlibaba · Closed
80.5%
5
MiMo-V2.5-ProXiaomi · Closed
79.9%
6
DeepSeek V4 Flash (Max)DeepSeek · Open weight
79.2%
7
Qwen3.5 397BAlibaba · Open weight
78.8%
8
Qwen3.5 397B (Reasoning)Alibaba · Open weight
78.8%
9
Qwen3.7 PlusAlibaba · Closed
78.0%
10
GPT-5.2-CodexOpenAI · Closed
77.6%
11
Gemini 3.1 Flash-LiteGoogle · Closed
77.2%
12
Gemini 3.1 ProGoogle · Closed
77.1%
13
Qwen 3.6 Max (preview)Alibaba · Closed
76.6%
14
DeepSeek V4 Pro (Max)DeepSeek · Open weight
76.5%
15
Gemini 3.5 FlashGoogle · Closed
76.3%
16
GLM-5.1Z.AI · Open weight
76.3%
17
Kimi K2.6Moonshot AI · Open weight
76.0%
18
GPT-5.5OpenAI · Closed
75.9%
19
GPT-5.4 nanoOpenAI · Closed
75.9%
20
Muse SparkMeta · Closed
75.9%
21
Qwen3.5-122B-A10BAlibaba · Open weight
75.7%
22
MiniMax M2.7MiniMax · Open weight
75.7%
23
Qwen3.5-27BAlibaba · Open weight
75.6%
24
Gemma 4 31BGoogle · Open weight
75.6%
25
GPT-5.2OpenAI · Closed
75.4%
26
GPT-5.3 CodexOpenAI · Closed
75.4%
27
GPT-5.3-Codex-SparkOpenAI · Closed
75.4%
28
GPT-5 miniOpenAI · Closed
75.4%
29
Qwen3.6 PlusAlibaba · Closed
75.2%
30
GPT-5.4OpenAI · Closed
73.9%
31
Command A+Cohere · Open weight
73.9%
32
DeepSeek V4 Flash (High)DeepSeek · Open weight
73.5%
33
Gemma 4 12BGoogle · Open weight
73.5%
34
GLM-5.2Z.AI · Open weight
73.3%
35
GPT-5.4 miniOpenAI · Closed
73.3%
36
GLM-5-TurboZ.AI · Closed
73.2%
37
GPT-5 (high)OpenAI · Closed
73.1%
38
GPT-5.1OpenAI · Closed
72.9%
39
GPT-5.6 SolOpenAI · Closed
72.7%
40
Qwen3.5-35B-A3BAlibaba · Open weight
72.5%
41
Gemma 4 26B A4BGoogle · Open weight
72.4%
42
GLM-5Z.AI · Open weight
72.3%
43
MiniMax M2.5MiniMax · Closed
71.6%
44
Nemotron 3 Super 120B A12BNVIDIA · Open weight
71.5%
45
o3OpenAI · Closed
71.4%
46
DeepSeek V4 Pro (High)DeepSeek · Open weight
71.3%
47
GPT-5.6 TerraOpenAI · Closed
71.2%
48
Nemotron 3 Nano 30BNVIDIA · Open weight
71.1%
49
GPT-5 (medium)OpenAI · Closed
70.6%
50
Gemini 3 ProGoogle · Closed
70.4%
51
o1OpenAI · Closed
70.3%
52
Kimi K2.5Moonshot AI · Open weight
70.2%
53
Kimi K2.5 (Reasoning)Moonshot AI · Closed
70.2%
54
GPT-5.1-Codex-MaxOpenAI · Closed
70.0%
55
GPT-5.1-CodexOpenAI · Closed
70.0%
56
Mercury 2Inception · Closed
69.8%
57
GPT-OSS 120BOpenAI · Open weight
69.0%
58
Mistral Medium 3.5 128BMistral · Open weight
68.8%
59
MiMo-V2-ProXiaomi · Closed
68.8%
60
GLM-4.7Z.AI · Open weight
67.9%
61
Qwen3.6-27BAlibaba · Open weight
67.6%
62
GPT-5 nanoOpenAI · Closed
67.6%
63
Step 3.7 FlashStepFun · Open weight
67.3%
64
Step 3.5 FlashStepFun · Open weight
66.5%
65
GPT-OSS 20BOpenAI · Open weight
65.1%
66
K-ExaoneLG AI Research · Closed
64.7%
67
Qwen3.6-35B-A3BAlibaba · Open weight
64.4%
68
Claude Fable 5Anthropic · Closed
63.5%
69
Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight
63.2%
70
Kimi K2.7 CodeMoonshot AI · Open weight
63.1%
71
Claude Opus 4.8Anthropic · Closed
62.2%
72
GLM-5V-TurboZ.AI · Closed
61.1%
73
GLM-4.7-FlashZ.AI · Open weight
60.8%
74
Claude Opus 4.7 (Adaptive)Anthropic · Closed
58.6%
75
Claude Opus 4.5 ThinkingAnthropic · Closed
58.0%
76
Ling 2.6 FlashInclusionAI · Open weight
57.4%
77
Trinity-Large-PreviewArcee AI · Open weight
56.3%
78
Trinity-Large-ThinkingArcee AI · Open weight
56.3%
79
LFM2.5-8B-A1BLiquidAI · Open weight
55.6%
80
Claude 4.1 Opus ThinkingAnthropic · Closed
55.4%
81
Gemini 3 FlashGoogle · Closed
55.1%
82
Grok 4xAI · Closed
53.7%
83
MiMo-V2-OmniXiaomi · Closed
53.5%
84
Claude Opus 4.6 (Adaptive)Anthropic · Closed
53.1%
85
52.7%
86
50.5%
87
DeepSeek V3.2DeepSeek · Open weight
49.0%
88
Gemini 2.5 ProGoogle · Closed
48.7%
89
Mistral Small 4Mistral · Open weight
48.2%
90
Mistral Small 4 (Reasoning)Mistral · Open weight
48.2%
91
LFM2-24B-A2BLiquidAI · Closed
45.9%
92
Claude 4 SonnetAnthropic · Closed
45.4%
93
Claude Opus 4.6Anthropic · Closed
44.6%
94
Gemma 4 E4BGoogle · Open weight
44.2%
95
Qwen3 MaxAlibaba · Closed
44.1%
96
LFM2.5-1.2B-InstructLiquidAI · Closed
43.8%
97
Claude Opus 4.7Anthropic · Closed
43.6%
98
Claude Opus 4.5Anthropic · Closed
43.0%
99
GPT-4.1OpenAI · Closed
43.0%
100
Llama 4 MaverickMeta · Open weight
43.0%
101
MiniMax M1 80kMiniMax · Closed
41.8%
102
LFM2.5-1.2B-ThinkingLiquidAI · Closed
41.8%
103
Kimi K2Moonshot AI · Closed
41.5%
104
DeepSeek V3.1 (Reasoning)DeepSeek · Open weight
41.5%
105
Grok Code Fast 1xAI · Closed
41.4%
106
Claude Sonnet 4.6Anthropic · Closed
41.2%
107
MiMo-V2-FlashXiaomi · Open weight
39.9%
108
DeepSeek-R1DeepSeek · Open weight
39.6%
109
Llama 4 ScoutMeta · Open weight
39.5%
110
Mistral Medium 3Mistral · Closed
39.3%
111
Gemini 2.5 FlashGoogle · Closed
39.0%
112
Llama 3.1 405BMeta · Open weight
39.0%
113
GPT-4.1 miniOpenAI · Closed
38.3%
114
Nemotron Ultra 253BNVIDIA · Open weight
38.2%
115
Nova ProAmazon · Closed
38.1%
116
DeepSeek V3.1DeepSeek · Open weight
37.8%
117
GLM-4.5-AirZ.AI · Closed
37.6%
118
GLM-4.6Z.AI · Open weight
36.7%
119
Grok 4.1 FastxAI · Closed
36.5%
120
Mistral Large 3Mistral · Closed
36.2%
121
Claude 3 HaikuAnthropic · Closed
36.1%
122
Gemma 4 E2BGoogle · Open weight
35.1%
123
DeepSeek V3DeepSeek · Open weight
34.8%
124
Sarvam 105BSarvam · Open weight
34.4%
125
GPT-4oOpenAI · Closed
34.3%
126
Solar Pro 2Upstage · Closed
33.7%
127
Exaone 4.0 32BLG AI Research · Open weight
33.5%
128
LFM2.5-VL-1.6B-ExtractLiquidAI · Open weight
33.1%
129
GPT-4.1 nanoOpenAI · Closed
32.0%
130
Ministral 3 14B (Reasoning)Mistral · Open weight
32.0%
131
Ministral 3 14BMistral · Open weight
32.0%
132
Gemma 3 27BGoogle · Open weight
31.8%
133
Mistral Large 2Mistral · Closed
31.2%
134
GPT-4o miniOpenAI · Closed
31.0%
135
Ministral 3 8B (Reasoning)Mistral · Open weight
29.1%
136
Ministral 3 8BMistral · Open weight
29.1%
137
Ministral 3 3B (Reasoning)Mistral · Open weight
26.8%
138
Ministral 3 3BMistral · Open weight
26.8%
139
Sarvam 30BSarvam · Open weight
26.5%
140
Granite-4.0-H-1BIBM · Open weight
26.2%
141
Exaone 4.0 1.2BLG AI Research · Open weight
25.3%
142
Phi-4Microsoft · Open weight
23.5%
143
DeepSeek R1 Distill Qwen 32BDeepSeek · Open weight
22.9%
144
Granite-4.0-1BIBM · Open weight
20.5%
145
Granite-4.0-H-350MIBM · Open weight
17.6%
146
Granite-4.0-350MIBM · Open weight
16.8%

The published AA-IFBench snapshot places MiniMax M3 first at 82.9%. The third row is 1.6 points behind. The broader top-10 range is 5.3 points, so many of the published results sit in a relatively narrow band.

146 models have been evaluated on AA-IFBench. The benchmark falls in the Instruction Following category. This category carries a 5% weight in BenchLM.ai's overall scoring system. AA-IFBench is currently displayed for reference but excluded from the scoring formula, so it does not directly affect overall rankings.

About AA-IFBench

Year

2026

Tasks

Verifiable instruction constraints

Format

Constraint satisfaction accuracy

Difficulty

Instruction precision

BenchLM stores the Artificial Analysis IFBench result separately from the weighted IFBench lane so AA refreshes remain display-only.

BenchLM freshness & provenance

Version

AA-IFBench 2026

Refresh cadence

Quarterly

Staleness state

Current

Question availability

Public benchmark set

CurrentDisplay only

BenchLM uses freshness metadata to decide whether a benchmark should still be treated as a strong differentiator, a benchmark to watch, or a display-only reference. For the full scoring policy, see the BenchLM methodology page.

FAQ

What does AA-IFBench measure?

A display-only Artificial Analysis IFBench score.

Which model scores highest on AA-IFBench?

MiniMax M3 by MiniMax currently leads with a score of 82.9% on AA-IFBench.

How many models are evaluated on AA-IFBench?

146 AI models have been evaluated on AA-IFBench on BenchLM.

Last updated: July 23, 2026 · BenchLM version AA-IFBench 2026

Choose a model with this week’s evidence

Join 2,000+ readers for ranking moves, pricing changes, and the claims that still need proof.

One email each week. Unsubscribe anytime.