Model / evidenceConfidence / score
●●●●High67.22provisional score
●●●●High64.22provisional score
Kimi K2.5Moonshot AI40 sourced · 40 rankable · 0 generated ●●●●High59.66provisional score
●●●●High65.2provisional score
GLM-5Z.AI35 sourced · 35 rankable · 0 generated ●●●●High66.06provisional score
●●●●High57.01provisional score
Qwen3.7 MaxAlibaba33 sourced · 33 rankable · 0 generated ●●●●High72.84provisional score
●●●●High64.75provisional score
●●●○Good51.47provisional score
Qwen3.6-27BAlibaba37 sourced · 37 rankable · 0 generated ●●●○Good53.82provisional score
●●●○Good68.59provisional score
GPT-5.4OpenAI31 sourced · 31 rankable · 0 generated ●●●○Good74.24provisional score
GPT-5.5OpenAI29 sourced · 29 rankable · 0 generated ●●●○Good73.51provisional score
Kimi K2.6Moonshot AI29 sourced · 29 rankable · 0 generated ●●●○Good56.79provisional score
●●●○Good78.34provisional score
Muse SparkMeta23 sourced · 23 rankable · 0 generated ●●●○Good71.04provisional score
GPT-5.6 SolOpenAI22 sourced · 22 rankable · 0 generated ●●●○Good81.96provisional score
●●●○Good72.57provisional score
●●●○Good67.17provisional score
●●●○Good66.27provisional score
●●●○Good55.3provisional score
●●●○Good65.07provisional score
InklingThinking Machines Lab16 sourced · 16 rankable · 0 generated ●●●○Good67.54provisional score
GPT-5.2OpenAI14 sourced · 14 rankable · 0 generated ●●●○Good58.43provisional score
●●●○Good60.56provisional score
Qwen3.5-27BAlibaba13 sourced · 13 rankable · 0 generated ●●●○Good60.7provisional score
●●●○Good56.97provisional score
●●●○Good56.77provisional score
●●○○Moderate55.47provisional score
●●○○Moderate53.95provisional score
●●○○Moderate60.66provisional score
●●○○Moderate58.88provisional score
●●○○Moderate77.44provisional score
GLM-5.1Z.AI18 sourced · 18 rankable · 0 generated ●●○○Moderate67.74provisional score
MiniMax M3MiniMax16 sourced · 16 rankable · 0 generated ●●○○Moderate69.75provisional score
Grok 4.20xAI16 sourced · 16 rankable · 0 generated ●●○○Moderate54.68provisional score
●●○○Moderate83.93provisional score
●●○○Moderate65.32provisional score
GLM-5.2Z.AI15 sourced · 15 rankable · 0 generated ●●○○Moderate63.96provisional score
●●○○Moderate44.24provisional score
●●○○Moderate83.68provisional score
●●○○Moderate67.73provisional score
●●○○Moderate66.79provisional score
GPT-5.4 ProOpenAI11 sourced · 11 rankable · 0 generated ●●○○Moderate60.89provisional score
Gemma 4 12BGoogle11 sourced · 11 rankable · 0 generated ●●○○Moderate47.29provisional score
●●○○Moderate59.72provisional score
GLM-4.7Z.AI9 sourced · 9 rankable · 0 generated ●●○○Moderate61.16provisional score
●●○○Moderate53.61provisional score
●●○○Moderate59.35provisional score
MiMo-V2.5Xiaomi8 sourced · 8 rankable · 0 generated ●●○○Moderate58.62provisional score
Kimi K3Moonshot AI29 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~80.96provisional score
●○○○Low / Estimated~64.11provisional score
●○○○Low / Estimated~50.87provisional score
●○○○Low / Estimated~66.69provisional score
●○○○Low / Estimated~70.19provisional score
●○○○Low / Estimated~63.69provisional score
Grok 4.5xAI6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~76.72provisional score
●○○○Low / Estimated~71.94provisional score
●○○○Low / Estimated~55.4provisional score
Grok 4.3xAI6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~65.1provisional score
●○○○Low / Estimated~41.42provisional score
●○○○Low / Estimated~61.08provisional score
GPT-4.1OpenAI6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~51.11provisional score
●○○○Low / Estimated~60.49provisional score
o3-miniOpenAI5 sourced · 5 rankable · 0 generated ●○○○Low / Estimated~47.41provisional score
●○○○Low / Estimated~44.19provisional score
●○○○Low / Estimated~57.25provisional score
o1OpenAI4 sourced · 4 rankable · 0 generated ●○○○Low / Estimated~48.1provisional score
●○○○Low / Estimated~56.58provisional score
●○○○Low / Estimated~56.02provisional score
●○○○Low / Estimated~47.2provisional score
●○○○Low / Estimated~57.96provisional score
●○○○Low / Estimated~42.06provisional score
●○○○Low / Estimated~55.94provisional score
●○○○Low / Estimated~52.32provisional score
GPT-5.1OpenAI3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~53.65provisional score
Grok 4xAI3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~60.42provisional score
GLM-4.6Z.AI3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~55.12provisional score
●○○○Low / Estimated~43.87provisional score
Command A+Cohere3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~47.51provisional score
●○○○Low / Estimated~40.44provisional score
●○○○Low / Estimated~45.88provisional score
●○○○Low / Estimated~42.79provisional score
●○○○Low / Estimated~50.83provisional score
●○○○Low / Estimated~49.98provisional score
Kimi K2Moonshot AI2 sourced · 2 rankable · 0 generated ●○○○Low / Estimated~27.19provisional score
o3OpenAI2 sourced · 2 rankable · 0 generated ●○○○Low / Estimated~47.89provisional score
●○○○Low / Estimated~58.01provisional score
●○○○Low / Estimated~48.09provisional score
●○○○Low / Estimated~47.65provisional score
●○○○Low / Estimated~40.43provisional score
●○○○Low / Estimated~47.74provisional score
●○○○Low / Estimated~58.61provisional score
●○○○Low / Estimated~59.1provisional score
●○○○Low / Estimated~55provisional score
●○○○Low / Estimated~52.72provisional score
●○○○Low / Estimated~54.06provisional score
●○○○Low / Estimated~61.31provisional score
DeepSeek V3DeepSeek1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~44.97provisional score
GPT-4oOpenAI1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~41.49provisional score
●○○○Low / Estimated~39.87provisional score
●○○○Low / Estimated~23.49provisional score
●○○○Low / Estimated~64.18provisional score
●○○○Low / Estimated~59.77provisional score
●○○○Low / Estimated~66.89provisional score
●○○○Low / Estimated~67.78provisional score
●○○○Low / Estimated~63.5provisional score
●○○○Low / Estimated~60.51provisional score
●○○○Low / Estimated~63.15provisional score
●○○○Low / Estimated~58.15provisional score
●○○○Low / Estimated~56.59provisional score
●○○○Low / Estimated~59.52provisional score
●○○○Low / Estimated~50.08provisional score
●○○○Low / Estimated~54.48provisional score
●○○○Low / Estimated~42.74provisional score
●○○○Low / Estimated~50.08provisional score
GPT-5 miniOpenAI1 sourced · 1 rankable · 60 generated ●○○○Low / Estimated~43.93provisional score
Qwen3 MaxAlibaba1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~48.16provisional score
●○○○Low / Estimated~57.44provisional score
Grok 4.1xAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~59.97provisional score
●○○○Low / Estimated~59.5provisional score
●○○○Low / Estimated~59provisional score
●○○○Low / Estimated~67.01provisional score
●○○○Low / Estimated~58.9provisional score
●○○○Low / Estimated~51.25provisional score
●○○○Low / Estimated~53.43provisional score
●○○○Low / Estimated~53.64provisional score
●○○○Low / Estimated~50.4provisional score
GLM-4.5Z.AI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~57.56provisional score
DeepSeek-R1DeepSeek0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~51.67provisional score
●○○○Low / Estimated~56.91provisional score
●○○○Low / Estimated~55.1provisional score
o1-previewOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~49.11provisional score
●○○○Low / Estimated~47.7provisional score
●○○○Low / Estimated~51.25provisional score
●○○○Low / Estimated~41.57provisional score
●○○○Low / Estimated~46.23provisional score
●○○○Low / Estimated~54.53provisional score
Mercury 2Inception0 sourced · 0 rankable · 48 generated ●○○○Low / Estimated~51.28provisional score
●○○○Low / Estimated~55.15provisional score
●○○○Low / Estimated~41.13provisional score
●○○○Low / Estimated~52.94provisional score
●○○○Low / Estimated~37.87provisional score
●○○○Low / Estimated~41.77provisional score
●○○○Low / Estimated~52.15provisional score
●○○○Low / Estimated~51.71provisional score
●○○○Low / Estimated~50.97provisional score
●○○○Low / Estimated~50.82provisional score
●○○○Low / Estimated~34.7provisional score
●○○○Low / Estimated~50.28provisional score
Seed 1.6ByteDance0 sourced · 0 rankable · 32 generated ●○○○Low / Estimated~50.23provisional score
●○○○Low / Estimated~35.71provisional score
Phi-4Microsoft0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~22.69provisional score
Qwen2.5-1MAlibaba0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~49.89provisional score
●○○○Low / Estimated~49.89provisional score
●○○○Low / Estimated~49.84provisional score
●○○○Low / Estimated~49.34provisional score
o3-proOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~48.33provisional score
●○○○Low / Estimated~34.47provisional score
Aion-2.0Aion Labs0 sourced · 0 rankable · 32 generated ●○○○Low / Estimated~48.66provisional score
●○○○Low / Estimated~48.54provisional score
●○○○Low / Estimated~38.64provisional score
●○○○Low / Estimated~27.44provisional score
Z-1Z0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~45.13provisional score
●○○○Low / Estimated~45.08provisional score
●○○○Low / Estimated~45.08provisional score
●○○○Low / Estimated~44.99provisional score
Moonshot v1Moonshot AI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~44.79provisional score
●○○○Low / Estimated~44.6provisional score
●○○○Low / Estimated~44.4provisional score
●○○○Low / Estimated~21.78provisional score
●○○○Low / Estimated~21.39provisional score
●○○○Low / Estimated~18.87provisional score
●○○○Low / Estimated~36.55provisional score
●○○○Low / Estimated~40.38provisional score
Nova ProAmazon0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~20.32provisional score
●○○○Low / Estimated~20.96provisional score
●○○○Low / Estimated~39.9provisional score
●○○○Low / Estimated~39.85provisional score
●○○○Low / Estimated~39.8provisional score
●○○○Low / Estimated~16.23provisional score
●○○○Low / Estimated~39.52provisional score
●○○○Low / Estimated~25.12provisional score
●○○○Low / Estimated~18.27provisional score
●○○○Low / Estimated~39.13provisional score
●○○○Low / Estimated~15.52provisional score
Hy3Tencent0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~55.64provisional score
●○○○Low / Estimated~41.82provisional score
●○○○Low / Estimated~43.2provisional score
●○○○Low / Estimated~42.97provisional score
Sarvam 30BSarvam0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~40.7provisional score
●○○○Low / Estimated~43.2provisional score
●○○○Low / Estimated~38.32provisional score
●○○○Low / Estimated~38.32provisional score
GPT-5 nanoOpenAI0 sourced · 0 rankable · 28 generated ●○○○Low / Estimated~46.36provisional score
●○○○Low / Estimated~42.58provisional score
o1-proOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~45.94provisional score
●○○○Low / Estimated~39.06provisional score
K-ExaoneLG AI Research0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~48.45provisional score
●○○○Low / Estimated~41.19provisional score
Sourced = exact-source benchmark coverage. Rankable = non-generated benchmark coverage used by the provisional leaderboard. Generated = inferred from related models and excluded from ranking. Coverage = sourced share of the visible benchmark footprint.