Nous Research · Hermes 4
Nous Research's open-weights hybrid reasoning fine-tune of Llama 3.1 405B.
Leader: Claude Opus 5.5 at 58
Leader: Fugu at 92.9%
Leader: GLM-5.2 at 99.1%
Leader: GPT-6 Astra at 96.1%
Leader: Claude Opus 5.5 at 61.4%
Leader: GPT-5.6 Sol at 32.3%
Leader: Kimi K3 at 88.7%
| Result | Score | Reported by | Source |
|---|---|---|---|
| aime-2025 · AIME 2025; reasoning | 69.7% | independent | Artificial Analysis: Hermes 4 - Llama-3.1 405B (Reasoning) ↗ |
| Terminal-Bench Hard (AA) · reasoning | 11.4% | independent | Artificial Analysis: Hermes 4 - Llama-3.1 405B (Reasoning) ↗ |
| IFBench · reasoning | 32.7% | independent | Artificial Analysis: Hermes 4 - Llama-3.1 405B (Reasoning) ↗ |
| AA-Omniscience Index · reasoning | -36 index | independent | Artificial Analysis: Hermes 4 - Llama-3.1 405B (Reasoning) ↗ |