Microsoft · Phi-4
Dense 3.8B open model for local text inference.
Leader: Claude Opus 5.5 at 58
Leader: Claude Fable 5.1 at 91.4%
Leader: Fugu at 92.9%
Leader: GPT-6 Astra at 96.1%
Leader: Claude Opus 5.5 at 61.4%
Leader: GPT-5.6 Sol at 32.3%
Leader: Kimi K3 at 88.7%
| Result | Score | Reported by | Source |
|---|---|---|---|
| aime-2025 · AIME 2025; non-reasoning | 6.7% | independent | Artificial Analysis: Phi-4 Mini Instruct ↗ |
| Terminal-Bench Hard (AA) · non-reasoning | 0% | independent | Artificial Analysis: Phi-4 Mini Instruct ↗ |
| IFBench · non-reasoning | 21.1% | independent | Artificial Analysis: Phi-4 Mini Instruct ↗ |
| AA-Omniscience Index · non-reasoning | -61.1 index | independent | Artificial Analysis: Phi-4 Mini Instruct ↗ |