Thinking Machines Lab · Inkling
Thinking Machines Lab's first open-weights model: a 975B/41B-active multimodal (text, image, audio in) MoE with controllable thinking effort, positioned as a base for fine-tuning on Tinker.
Leader: Claude Opus 5.5 at 58
Leader: Claude Opus 5.5 at 66.9%
Leader: Claude Mythos 5.1 at 60.9%
Leader: Claude Fable 5.1 at 91.4%
Leader: Claude Sonnet 5 at 85.2%
Leader: Claude Opus 5.5 at 89.9%
Leader: Claude Opus 5.5 at 1846
Leader: Kimi K3 at 84.2%
Leader: GPT-6 Astra at 91.5%
Leader: GPT-6 Astra at 96.1%
Leader: Claude Opus 5.5 at 61.4%
Leader: GPT-5.6 Sol at 32.3%
Leader: ERNIE 5.1 at 99.6%
Leader: GLM-5.2 at 92.5%
Leader: GPT-6 Astra at 95%
Leader: Kimi K3 at 88.7%
Leader: Claude Opus 5.5 at 87.7%
| Result | Score | Reported by | Source |
|---|---|---|---|
| tau2-Bench Banking (AA) · xhigh effort | 29.1% | independent | Artificial Analysis: Inkling (xhigh) ↗ |
| AA-Omniscience Index · xhigh effort | 2 index | independent | Artificial Analysis: Inkling (xhigh) ↗ |
| AA Analyst Agent · xhigh effort | 23.8% | independent | Artificial Analysis: Inkling (xhigh) ↗ |
| SimpleQA Verified · effort 0.99 | 43.9% | vendor | Thinking Machines Lab: Inkling: Our Open-Weights Model ↗ |
| IFBench · effort 0.99 | 79.8% | vendor | Thinking Machines Lab: Inkling: Our Open-Weights Model ↗ |
| Toolathlon Verified · effort 0.99 | 45.5% | vendor | Thinking Machines Lab: Inkling: Our Open-Weights Model ↗ |
| tau3-Bench Banking · effort 0.99 | 23.7% | vendor | Thinking Machines Lab: Inkling: Our Open-Weights Model ↗ |
| ARC-AGI-1 · semi-private; ARC Prize verified | 79.5% | independent | ARC Prize leaderboard (evaluations data) ↗ |
| VoiceBench · effort 0.99 | 91.4% | vendor | Thinking Machines Lab: Inkling: Our Open-Weights Model ↗ |
| MMAU · effort 0.99 | 77.2% | vendor | Thinking Machines Lab: Inkling: Our Open-Weights Model ↗ |