LLM leaderboard: benchmark scores from labs and maintainers

An LLM leaderboard of benchmark scores exactly as labs, maintainers and evaluators published them.

45 listings

NameModelBenchmarkScoreUnitSettingReported byPublisherPublishedSourceLabChecked
GPT-6 Astra (high) — ARC-AGI-3 (ARC Prize, Provider Adapter harness)GPT-6 Astra (high)ARC-AGI-399.9%High effort; Provider Adapter harness; Semi-Private setBenchmark maintainerARC Prize Foundationarcprize.orgOpenAI
GPT-6 Astra (max) — ARC-AGI-3 (ARC Prize, Standard harness)GPT-6 Astra (max)ARC-AGI-362.7%Max effort; Standard harness; Semi-Private setBenchmark maintainerARC Prize Foundationarcprize.orgOpenAI
Claude Opus 5.5 (max) — Artificial Analysis Intelligence Index (Sept 22 article)Claude Opus 5.5 (max)Artificial Analysis Intelligence Index58Index pointsMax effort; index as of AA article dated 2026-09-22Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
Gemini 3.8 Flash (high) — Artificial Analysis Intelligence Index (Sept 30 article)Gemini 3.8 Flash (high)Artificial Analysis Intelligence Index41Index pointsHigh reasoning; index as of AA article dated 2026-09-30Independent evaluatorArtificial Analysisartificialanalysis.aiGoogle DeepMind
Gemini 4 Argon (high) — Artificial Analysis Intelligence Index (Sept 30 article)Gemini 4 Argon (high)Artificial Analysis Intelligence Index53Index pointsHigh reasoning; index as of AA article dated 2026-09-30Independent evaluatorArtificial Analysisartificialanalysis.aiGoogle DeepMind
GPT-6 Astra (max) — Artificial Analysis Intelligence Index (Sept 30 article)GPT-6 Astra (max)Artificial Analysis Intelligence Index53Index pointsMax effort; index as of AA article dated 2026-09-30Independent evaluatorArtificial Analysisartificialanalysis.aiOpenAI
GPT-6.1 Sol (max) — Artificial Analysis Intelligence Index (Sept 30 article)GPT-6.1 Sol (max)Artificial Analysis Intelligence Index52Index pointsMax effort; index as of AA article dated 2026-09-30Independent evaluatorArtificial Analysisartificialanalysis.aiOpenAI
Claude Opus 5.5 — AutomationBench (Anthropic, self-reported)Claude Opus 5.5AutomationBench40%As reported in Anthropic's tableLab (self-reported)Anthropicanthropic.comAnthropic
Gemini 4 Argon — AutomationBench (Google, self-reported)Gemini 4 ArgonAutomationBench51.3%As reported in Google's announcementLab (self-reported)Googleblog.googleGoogle DeepMind
Claude Sonnet 5.5 (max) — AutomationBench-AA (Artificial Analysis)Claude Sonnet 5.5 (max)AutomationBench-AA71%Max effort (Artificial Analysis run)Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
Gemini 4 Argon — AutomationBench-AA (Artificial Analysis)Gemini 4 ArgonAutomationBench-AA78%Artificial Analysis runIndependent evaluatorArtificial Analysisartificialanalysis.aiGoogle DeepMind
GPT-5.6 Sol — BrowseComp (OpenAI, self-reported)GPT-5.6 SolBrowseComp90.4%As reported in OpenAI's announcementLab (self-reported)OpenAIopenai.comOpenAI
GPT-6 Astra — BrowseComp (OpenAI, self-reported)GPT-6 AstraBrowseComp91.5%Maximum across effort levelsLab (self-reported)OpenAIopenai.comOpenAI
Kimi K3 (max) — BrowseComp (Moonshot AI, 1M-token context)Kimi K3 (max)BrowseComp90.4%Max reasoning effort; 1M-token context, no context managementLab (self-reported)Moonshot AIkimi.aiMoonshot AI
Claude Opus 5.5 — CursorBench 4.0 (Anthropic, self-reported)Claude Opus 5.5CursorBench 4.057.8%As reported in Anthropic's tableLab (self-reported)Anthropicanthropic.comAnthropic
Claude Sonnet 5.5 — CursorBench 4.0 (Anthropic, self-reported)Claude Sonnet 5.5CursorBench 4.055.5%As reported in Anthropic's tableLab (self-reported)Anthropicanthropic.comAnthropic
Grok 4.7 — CursorBench 4.0 (xAI, self-reported)Grok 4.7CursorBench 4.046.3%As reported in xAI's announcementLab (self-reported)xAIx.aixAI
Gemini 4 Argon — DeepSWE v1.1 (Google, self-reported)Gemini 4 ArgonDeepSWE v1.177.9%As reported in Google's announcementLab (self-reported)Googleblog.googleGoogle DeepMind
GPT-6 Luna (max) — DeepSWE v1.1 (OpenAI, self-reported)GPT-6 Luna (max)DeepSWE v1.166.6%Max effortLab (self-reported)OpenAIopenai.comOpenAI
GPT-6 Sol (max) — DeepSWE v1.1 (OpenAI, self-reported)GPT-6 Sol (max)DeepSWE v1.168.8%Max effortLab (self-reported)OpenAIopenai.comOpenAI
Grok 4.7 (high) — DeepSWE v1.1 (xAI, self-reported)Grok 4.7 (high)DeepSWE v1.171%High effortLab (self-reported)xAIx.aixAI
Kimi K3 (max) — DeepSWE v1.1 (Moonshot AI, mini-SWE-agent harness)Kimi K3 (max)DeepSWE v1.167.3%Max reasoning effort; mini-SWE-agent harness; temperature 1.0, top-p 1.0Lab (self-reported)Moonshot AIkimi.aiMoonshot AI
GPT-6 Astra — FrontierMath Tier 4 (OpenAI, self-reported)GPT-6 AstraFrontierMath Tier 497.6%FrontierMath Tier 4 v2; maximum across effort levelsLab (self-reported)OpenAIopenai.comOpenAI
Claude Opus 5.5 (max) — GDPval-AA v2.1 (Artificial Analysis)Claude Opus 5.5 (max)GDPval-AA v2.11,846EloMax effort (Artificial Analysis run)Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
GPT-6 Astra — GPQA Diamond (OpenAI, self-reported)GPT-6 AstraGPQA Diamond96%Maximum across effort levels (research environment)Lab (self-reported)OpenAIopenai.comOpenAI
Kimi K3 (max) — GPQA Diamond (Moonshot AI model card)Kimi K3 (max)GPQA Diamond93.5%Max reasoning effort; temperature 1.0Lab (self-reported)Moonshot AIhuggingface.coMoonshot AI
Gemini 3.8 Flash — HLE-Verified (Google, self-reported)Gemini 3.8 FlashHLE-Verified54.9%As reported in Google's announcementLab (self-reported)Googleblog.googleGoogle DeepMind
Claude Fable 5.1 — Humanity's Last Exam, no tools (Anthropic, self-reported)Claude Fable 5.1Humanity's Last Exam60.9%No toolsLab (self-reported)Anthropicanthropic.comAnthropic
Claude Opus 5.5 — Humanity's Last Exam, with tools (Anthropic, self-reported)Claude Opus 5.5Humanity's Last Exam67.7%With toolsLab (self-reported)Anthropicanthropic.comAnthropic
Claude Opus 5.5 (max) — Humanity's Last Exam (Artificial Analysis)Claude Opus 5.5 (max)Humanity's Last Exam61.4%Max effort (Artificial Analysis run)Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
Gemini 4 Argon — LVBench (Google, self-reported)Gemini 4 ArgonLVBench91.7%As reported in Google's announcementLab (self-reported)Googleblog.googleGoogle DeepMind
GPT-6 Astra — OSWorld 2.0 (OpenAI, self-reported)GPT-6 AstraOSWorld 2.072.6%Maximum across effort levelsLab (self-reported)OpenAIopenai.comOpenAI
Claude Opus 5.5 — OSWorld 2.1 (Anthropic, self-reported, partial)Claude Opus 5.5OSWorld 2.181.8%Partial-credit scoringLab (self-reported)Anthropicanthropic.comAnthropic
Claude Sonnet 5.5 — OSWorld 2.1 (Anthropic, self-reported, partial)Claude Sonnet 5.5OSWorld 2.180.1%Partial-credit scoringLab (self-reported)Anthropicanthropic.comAnthropic
Claude Opus 5.5 (max) — SciCode (Artificial Analysis)Claude Opus 5.5 (max)SciCode66.9%Max effort (Artificial Analysis run)Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
GPT-5.6 Sol — Terminal-Bench 2.1 (OpenAI, self-reported)GPT-5.6 SolTerminal-Bench 2.188.8%As reported in OpenAI's announcementLab (self-reported)OpenAIopenai.comOpenAI
Kimi K3 (max) — Terminal-Bench 2.1 (Moonshot AI model card)Kimi K3 (max)Terminal-Bench 2.188.3%Max reasoning effort; Kimi Code harnessLab (self-reported)Moonshot AIhuggingface.coMoonshot AI
Claude Fable 5.1 — Terminal-Bench 4.0 (Anthropic, self-reported)Claude Fable 5.1Terminal-Bench 4.055.8%As reported in Anthropic's tableLab (self-reported)Anthropicanthropic.comAnthropic
Claude Opus 5.5 (max) — Terminal-Bench 4.0 (Artificial Analysis)Claude Opus 5.5 (max)Terminal-Bench 4.059.6%Max effort (Artificial Analysis run)Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
Claude Opus 5.5 (xhigh) — Terminal-Bench 4.0 (Anthropic, self-reported)Claude Opus 5.5 (xhigh)Terminal-Bench 4.066.4%xhigh effortLab (self-reported)Anthropicanthropic.comAnthropic
Claude Sonnet 5.5 — Terminal-Bench 4.0 (Anthropic, self-reported)Claude Sonnet 5.5Terminal-Bench 4.070.6%As reported in Anthropic's announcementLab (self-reported)Anthropicanthropic.comAnthropic
Claude Sonnet 5.5 (max) — Terminal-Bench 4.0 (Artificial Analysis)Claude Sonnet 5.5 (max)Terminal-Bench 4.064%Max effort (Artificial Analysis run)Independent evaluatorArtificial Analysisartificialanalysis.aiAnthropic
Gemini 4 Argon — Terminal-Bench 4.0 (Artificial Analysis)Gemini 4 ArgonTerminal-Bench 4.057%Artificial Analysis runIndependent evaluatorArtificial Analysisartificialanalysis.aiGoogle DeepMind
GPT-6 Astra — Terminal-Bench 4.0 (OpenAI, self-reported)GPT-6 AstraTerminal-Bench 4.057.9%Maximum across effort levelsLab (self-reported)OpenAIopenai.comOpenAI
Grok 4.7 — Terminal-Bench 4.0 (xAI, self-reported)Grok 4.7Terminal-Bench 4.037.6%As reported in xAI's announcementLab (self-reported)xAIx.aixAI

This LLM leaderboard lists benchmark scores for current AI models exactly as they were published: by the lab in its model announcement or model card, by the benchmark’s maintainer (such as the ARC Prize Foundation), or by an independent evaluator (such as Artificial Analysis). Each row is one score for one model on one benchmark, with the setting the source states, the publisher, the publication date and a link to the source page.

Read the rows with four caveats:

  • Self-reported and maintainer-run scores are not directly comparable. A lab picks its own harness, prompts and effort level; a maintainer or independent evaluator runs every model the same way. The “Reported by” column tells you which is which.
  • Settings differ. Effort level, tools, harness and context limits change results, sometimes by many points. The “Setting” column copies what the source says.
  • Versions matter. Terminal-Bench 2.1 and 4.0, or OSWorld 2.0 and 2.1, are different tests. An index such as the Artificial Analysis Intelligence Index can also change between articles, so compare index values only within the same article date.
  • Every row links its source. If a number is not on the publisher’s own page, it is not here.

The table is sorted by benchmark; filter by benchmark, lab or source type, or sort by score within one benchmark. Rows are re-checked against their sources three times a week. Model release dates are in AI models, new results are covered in AI benchmark news, and how we pick sources is in our editorial standards.

Source

Every score is copied from the lab’s announcement or model card, the benchmark maintainer’s page or the independent evaluator’s article, linked on each row with the date it was checked. How we pick and check sources: editorial standards.

The Model Press

What are you looking for?

Search by headline, topic or keyword.