2026-09-10MODELDeepSeek-V4.1-Flash released with extreme agent memory efficiency and evaluated across VALS2026-09-03MODELGPT-6 Astra released by OpenAI - 71.7% on EMB, 63.3% on Tax Agent Bench2026-09-02MODELGoogle Gemini 3.8 Flash takes #1 rank on Finance Agent (v2) with 61.4% and 72.2% on EMB2026-09-02MODELMeta releases Muse Spark 1.3 & 1.3 Max - 59.0%-60.0% on Finance Agent (v2)2026-09-01MODELClaude Fable 5.1 leads Tax Agent Bench (77.6%) and EMB (76.7%) with 75% cheaper cache reads2026-09-11BENCHTax Agent Bench and FAB v2 benchmarks updated with latest frontier model rankings2026-09-15UPDATEPlatform updated: 43 models tracked across 41 independent benchmarks2026-09-10MODELDeepSeek-V4.1-Flash released with extreme agent memory efficiency and evaluated across VALS2026-09-03MODELGPT-6 Astra released by OpenAI - 71.7% on EMB, 63.3% on Tax Agent Bench2026-09-02MODELGoogle Gemini 3.8 Flash takes #1 rank on Finance Agent (v2) with 61.4% and 72.2% on EMB2026-09-02MODELMeta releases Muse Spark 1.3 & 1.3 Max - 59.0%-60.0% on Finance Agent (v2)2026-09-01MODELClaude Fable 5.1 leads Tax Agent Bench (77.6%) and EMB (76.7%) with 75% cheaper cache reads2026-09-11BENCHTax Agent Bench and FAB v2 benchmarks updated with latest frontier model rankings2026-09-15UPDATEPlatform updated: 43 models tracked across 41 independent benchmarks
Tier 3forensic

ReverseEngBench

Binary analysis, decompilation reasoning, and software reverse engineering.

Variable tasks
4 models evaluated
Updated 2026
30.5%
Top Score
Top model
GPT-5.6 Sol
Model Rankings
financebenchmark.ai · ReverseEngBench
Anthropic
OpenAI
Zhipu AI
xAI
0.8%
🥇AnthropicAnthropicClaude Opus 512.2%
🥈OpenAIOpenAIGPT-5.6 Sol30.5%
🥉Zhipu AIZhipu AIGLM 5.2OPEN0.0%
4xAIxAIGrok 4.50.8%
Full Results Table
#ModelOverallSourceDate
🥇
OpenAIGPT-5.6 Sol
OpenAI
30.5VALS (2026)2026-07
🥈
AnthropicClaude Opus 5
Anthropic
12.2VALS (2026)2026-07
🥉
xAIGrok 4.5
xAI
0.8VALS (2026)2026-07
4
Zhipu AIGLM 5.2OPEN
Zhipu AI
0.0VALS (2026)2026-06