TestsBenchmarks · Knowledge
PRBench Finance (Scale)
Expert-rubric graded professional finance reasoning questions (Scale SEAL).
% solvedHigher is betterCounts toward:Weights: Research & analysis ×0.6The test's websiteOfficial page ↗
Measured by independent testersIndependent Reported by the makerVendor-reported
| Thinking levelSetting | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Muse Spark 1.3 | Meta (Meta Superintelligence Labs, Muse) | 59.5% | DefaultMuse Spark 1.3 | Independent testIndependentScale AI (SEAL) ↗ | — | 14 Sep 2026 |
| 2 | Muse Spark 1.1 | Meta (Meta Superintelligence Labs, Muse) | 55.0% | DefaultMuse Spark 1.1 | Independent testIndependentScale AI (SEAL) ↗ | — | 9 Jul 2026 |
| 3 | Claude Fable 5 | Anthropic | 53.9% | Defaultclaude-fable 5 | Independent testIndependentScale AI (SEAL) ↗ | — | 28 Jul 2026 |
| 4 | Claude Opus 4.6 | Anthropic | 53.3% | No reasoningclaude-opus-4-6 (Non-Thinking) | Independent testIndependentScale AI (SEAL) ↗ | — | 17 Feb 2026 |
| 5 | Muse Spark | Meta (Meta Superintelligence Labs, Muse) | 52.4% | DefaultMuse Spark | Independent testIndependentScale AI (SEAL) ↗ | — | 8 Apr 2026 |
| 6 | Claude Fable 5.1 | Anthropic | 50.8% | DefaultFable 5.1 | Independent testIndependentScale AI (SEAL) ↗ | — | 3 Sep 2026 |
| 7 | GPT-5.6 Sol | OpenAI | 50.5% | Maxgpt-5.6-sol (max) | Independent testIndependentScale AI (SEAL) ↗ | — | 28 Jul 2026 |
| 8 | Gemini 3.8 Flash | Google (Gemini / DeepMind) | 49.5% | DefaultGemini 3.8 Flash | Independent testIndependentScale AI (SEAL) ↗ | — | 9 Sep 2026 |
| 9 | GPT-5.1 | OpenAI | 48.0% | Defaultgpt-5.1-thinking | Independent testIndependentScale AI (SEAL) ↗ | — | 11 Dec 2025 |
| 10 | GPT-6 Astra | OpenAI | 47.5% | DefaultGPT 6 Astra | Independent testIndependentScale AI (SEAL) ↗ | — | 9 Sep 2026 |
| 11 | Kimi K2.5 | Moonshot AI (Kimi) | 46.5% | Defaultkimi-k2.5 | Independent testIndependentScale AI (SEAL) ↗ | — | 13 Feb 2026 |
| 12 | GPT-5.2 Pro | OpenAI | 46.3% | Defaultgpt-5.2-pro-2025-12-11 | Independent testIndependentScale AI (SEAL) ↗ | — | 16 Dec 2025 |
| 13 | Claude Opus 4.5 | Anthropic | 46.2% | Defaultclaude-opus-4-5-20251101-thinking | Independent testIndependentScale AI (SEAL) ↗ | — | 26 Nov 2025 |
| 14 | GPT-5.4 | OpenAI | 45.6% | Highgpt-5.4 (High) | Independent testIndependentScale AI (SEAL) ↗ | — | 22 Apr 2026 |
| 15 | Gemini 3.1 Pro (Preview) | Google (Gemini / DeepMind) | 41.9% | Defaultgemini-3.1-pro | Independent testIndependentScale AI (SEAL) ↗ | — | 23 Mar 2026 |