2026-09-10MODELDeepSeek-V4.1-Flash released with extreme agent memory efficiency and evaluated across VALS2026-09-03MODELGPT-6 Astra released by OpenAI - 71.7% on EMB, 63.3% on Tax Agent Bench2026-09-02MODELGoogle Gemini 3.8 Flash takes #1 rank on Finance Agent (v2) with 61.4% and 72.2% on EMB2026-09-02MODELMeta releases Muse Spark 1.3 & 1.3 Max - 59.0%-60.0% on Finance Agent (v2)2026-09-01MODELClaude Fable 5.1 leads Tax Agent Bench (77.6%) and EMB (76.7%) with 75% cheaper cache reads2026-09-11BENCHTax Agent Bench and FAB v2 benchmarks updated with latest frontier model rankings2026-09-15UPDATEPlatform updated: 43 models tracked across 41 independent benchmarks2026-09-10MODELDeepSeek-V4.1-Flash released with extreme agent memory efficiency and evaluated across VALS2026-09-03MODELGPT-6 Astra released by OpenAI - 71.7% on EMB, 63.3% on Tax Agent Bench2026-09-02MODELGoogle Gemini 3.8 Flash takes #1 rank on Finance Agent (v2) with 61.4% and 72.2% on EMB2026-09-02MODELMeta releases Muse Spark 1.3 & 1.3 Max - 59.0%-60.0% on Finance Agent (v2)2026-09-01MODELClaude Fable 5.1 leads Tax Agent Bench (77.6%) and EMB (76.7%) with 75% cheaper cache reads2026-09-11BENCHTax Agent Bench and FAB v2 benchmarks updated with latest frontier model rankings2026-09-15UPDATEPlatform updated: 43 models tracked across 41 independent benchmarks
Tier 3documentQAforensic

LegalBench

Collaboratively built benchmark for measuring legal reasoning in large language models.

Variable tasks
21 models evaluated
Updated 2026
88.6%
Top Score
Top model
Claude Fable 5
Model Rankings
financebenchmark.ai · LegalBench
Anthropic
Anthropic
OpenAI
DeepSeek
xAI
Moonshot AI
Anthropic
DeepSeek
Google
Google
Zhipu AI
OpenAI
OpenAI
xAI
Thinking Machines
Thinking Machines
Ant Group
Meta
Meta
NVIDIA
Alibaba
86.0%
🥇AnthropicAnthropicClaude Opus 587.0%
🥈AnthropicAnthropicClaude Sonnet 583.9%
🥉OpenAIOpenAIGPT-5.6 Sol87.0%
4DeepSeekDeepSeekDeepSeek V4 FlashOPEN77.7%
5xAIxAIGrok 4.686.3%
6Moonshot AIMoonshot AIKimi K3OPEN86.0%
7AnthropicAnthropicClaude Fable 588.6%
8DeepSeekDeepSeekDeepSeek V4 Pro (0813)OPEN82.4%
9GoogleGoogleGemini 3.5 Flash Lite84.1%
10GoogleGoogleGemini 3.6 Flash86.5%
11Zhipu AIZhipu AIGLM 5.2OPEN84.1%
12OpenAIOpenAIGPT-5.6 Luna84.0%
13OpenAIOpenAIGPT-5.6 Terra85.1%
14xAIxAIGrok 4.586.0%
15Thinking MachinesThinking MachinesInklingOPEN83.0%
16Thinking MachinesThinking MachinesInkling SmallOPEN83.0%
17Ant GroupAnt GroupLing 3.0 FlashOPEN79.7%
18MetaMetaMuse Spark 1.185.0%
19MetaMetaMuse Spark 1.285.3%
20NVIDIANVIDIANemotron 3 UltraOPEN82.1%
21AlibabaAlibabaQwen 3.8 MaxOPEN83.6%
Full Results Table
#ModelOverallSourceDate
🥇
AnthropicClaude Fable 5
Anthropic
88.6arXiv:2308.114622026-06
🥈
AnthropicClaude Opus 5
Anthropic
87.0arXiv:2308.114622026-07
🥉
OpenAIGPT-5.6 Sol
OpenAI
87.0arXiv:2308.114622026-07
4
GoogleGemini 3.6 Flash
Google
86.5arXiv:2308.114622026-07
5
xAIGrok 4.6
xAI
86.3arXiv:2308.114622026-08
6
Moonshot AIKimi K3OPEN
Moonshot AI
86.0arXiv:2308.114622026-07
7
xAIGrok 4.5
xAI
86.0arXiv:2308.114622026-07
8
MetaMuse Spark 1.2
Meta
85.3arXiv:2308.114622026-08
9
OpenAIGPT-5.6 Terra
OpenAI
85.1arXiv:2308.114622026-07
10
MetaMuse Spark 1.1
Meta
85.0arXiv:2308.114622026-07
11
GoogleGemini 3.5 Flash Lite
Google
84.1arXiv:2308.114622026-07
12
Zhipu AIGLM 5.2OPEN
Zhipu AI
84.1arXiv:2308.114622026-06
13
OpenAIGPT-5.6 Luna
OpenAI
84.0arXiv:2308.114622026-07
14
AnthropicClaude Sonnet 5
Anthropic
83.9arXiv:2308.114622026-06
15
AlibabaQwen 3.8 MaxOPEN
Alibaba
83.6arXiv:2308.114622026-08
16
Thinking MachinesInkling SmallOPEN
Thinking Machines
83.0arXiv:2308.114622026-07
17
Thinking MachinesInklingOPEN
Thinking Machines
83.0arXiv:2308.114622026-07
18
DeepSeekDeepSeek V4 Pro (0813)OPEN
DeepSeek
82.4arXiv:2308.114622026-08
19
NVIDIANemotron 3 UltraOPEN
NVIDIA
82.1arXiv:2308.114622026-06
20
Ant GroupLing 3.0 FlashOPEN
Ant Group
79.7arXiv:2308.114622026-07
21
DeepSeekDeepSeek V4 FlashOPEN
DeepSeek
77.7arXiv:2308.114622026-07