Google · Gemini 3
Google's newest and most capable Flash model (Sep 2026), aimed at low-cost agentic coding and knowledge work with 1M-token multimodal input.
Leader: Claude Opus 5.5 at 58
Leader: Claude Opus 5.5 at 66.9%
Leader: Claude Mythos 5.1 at 60.9%
Leader: Claude Fable 5.1 at 91.4%
Leader: Claude Opus 5.5 at 1846
Leader: Kimi K3 at 84.8%
Leader: GPT-6 Astra at 96.1%
Leader: Claude Opus 5.5 at 61.4%
Leader: GPT-5.6 Sol at 32.3%
Leader: GPT-6 Astra at 95%
Leader: GPT-6 Astra at 62.7%
Leader: Kimi K3 at 88.7%
Leader: Claude Opus 5.5 at 87.7%
Leader: Claude Fable 5 at 1506
Leader: Claude Opus 5.5 at 1818
| Result | Score | Reported by | Source |
|---|---|---|---|
| DeepSWE v1.1 · mini-swe-agent harness, high thinking | 73.7% | vendor | Gemini 3.8 Flash model card (DeepMind) ↗ |
| HLE-Verified · 1,811-item verified set | 54.9% | vendor | Gemini 3.8 Flash model card (DeepMind) ↗ |
| CharXiv Reasoning · no tools | 86.2% | vendor | Gemini 3.8 Flash model card (DeepMind) ↗ |
| LVBench · agentic (87.1% static) | 87.8% | vendor | Gemini 3.8 Flash model card (DeepMind) ↗ |
| Vals Finance Agent v2 | 61.4% | vendor | Gemini 3.8 Flash model card (DeepMind) ↗ |
| AA Coding Agent Index v1.5 · Antigravity SDK harness, high (DeepSWE 65.8 / Terminal-Bench 4.0 14.6 / SWE-Atlas-QnA 45.2) | 41.9% | independent | Artificial Analysis Coding Agent Index ↗ |