SiteOS benchmarkFrozen benchmark · July 2026

Category leaders

Different questions have different winners.

These badges describe the strongest result in each measured category. They do not replace the qualification rule or establish a universal model ranking.

Reliability winnerGrok 4.5

The only build to clear every mandatory gate. Official score 89.25/100.

Visual winnerGPT-5.6 Sol

Highest blind visual-review result at 19/20. Not qualified because mandatory gates failed.

Raw + code winnerGLM-5.2

Highest raw score at 91.75/100 and highest code score at 8.75/10. Not qualified because one mandatory gate failed.

Qualified · 1 build

Cleared the mandatory bar

Qualified results can receive their full official score.

xAI / SpaceXAIQualified
Reliability winner

Grok 4.5

Raw score
89.25/100

Official score 89.25/100 · uncapped

Auto 55/60Visual 17.5/20Code 6.75/10Verify + efficiency 10/10
Mandatory gatesAll passed

1.9 minutes · $0.3699 USD · 14 steps

Not qualified · 7 builds

Raw performance, with failed gates disclosed

These entries are ordered by raw score for diagnosis, not presented as an official second-through-eighth ranking.

Z.ai / Zhipu AINot qualified
Raw + code winner

GLM-5.2

Raw score
91.75/100

Official score capped at 49/100

Auto 56/60Visual 17/20Code 8.75/10Verify + efficiency 10/10
Failed mandatory gate
  • F05 Form errors and deterministic success

6.8 minutes · $0.1486 USD · 21 steps

AnthropicNot qualified

Claude Fable 5

Raw score
83.25/100

Official score capped at 49/100

Auto 51/60Visual 14/20Code 8.25/10Verify + efficiency 10/10
Failed mandatory gate
  • F04 Dialog focus trap, Escape and focus return

10.3 minutes · $3.9549 USD · 27 steps

OpenAINot qualified
Visual winner

GPT-5.6 Sol

Raw score
77.25/100

Official score capped at 49/100

Auto 41/60Visual 19/20Code 7.25/10Verify + efficiency 10/10
Failed mandatory gates · 4
  • F04 Dialog focus trap, Escape and focus return
  • F05 Form errors and deterministic success
  • R01-tablet No horizontal overflow at 768px
  • A01 No serious or critical axe violations

8.9 minutes · $1.4915 USD · 18 steps

Moonshot AINot qualified

Kimi K2.7 Code

Raw score
74.75/100

Official score capped at 49/100

Auto 40/60Visual 17.75/20Code 8/10Verify + efficiency 9/10
Failed mandatory gates · 2
  • F04 Dialog focus trap, Escape and focus return
  • A01 No serious or critical axe violations

9.2 minutes · $0.3175 USD · 40 steps

Xiaomi MiMoNot qualified

MiMo-V2.5-Pro

Raw score
66.5/100

Official score capped at 49/100

Auto 41/60Visual 10/20Code 5.5/10Verify + efficiency 10/10
Failed mandatory gate
  • F04 Dialog focus trap, Escape and focus return

9.5 minutes · $0.0920 USD · 17 steps

MetaNot qualified

Llama 4 Maverick

Raw score
39.25/100

Official score 39.25/100 · raw result already below the cap

Auto 26/60Visual 8.25/20Code 0/10Verify + efficiency 5/10
Failed mandatory gates · 5
  • F02A Filtering, URL state and direct loading
  • F03 Keyboard-operable service detail
  • F04 Dialog focus trap, Escape and focus return
  • F05 Form errors and deterministic success
  • A02 Page accessibility while modal is open

0.2 minutes · $0.0034 USD · 2 steps

MiniMaxNot qualified

MiniMax-M3

Raw score
31.5/100

Official score 31.5/100 · raw result already below the cap

Auto 18/60Visual 3/20Code 3.5/10Verify + efficiency 7/10
Failed mandatory gates · 6
  • F02A Filtering, URL state and direct loading
  • F03 Keyboard-operable service detail
  • F04 Dialog focus trap, Escape and focus return
  • F05 Form errors and deterministic success
  • A01 No serious or critical axe violations
  • A02 Page accessibility while modal is open

5.4 minutes · $0.0720 USD · 40 steps

Reviewer disclosure

Visual and code scores were produced by two independent blind AI reviewer agents. Neither received model identities or the other reviewer’s scores. This is a limitation of Round 0 and must remain disclosed when results are cited.