Model cards

329 models · catalog 2026-09-14 · each card self-contained and embeddable

Qwen2.5 Turbo Alibaba · 108.6 tok/s · $0.065/M · ii 6.4

Qwen3 14B (Non-reasoning) Alibaba · 63.4 tok/s · $0.455/M · ii 6.7

Qwen3 14B (Reasoning) Alibaba · 62.9 tok/s · $0.735/M · ii 6.4

Qwen3 235B A22B (Non-reasoning) Alibaba · 60.5 tok/s · $0.91/M · ii 8.3

Qwen3 235B A22B (Reasoning) Alibaba · 58.7 tok/s · $1.47/M · ii 9.5

Qwen3 235B A22B 2507 (Reasoning) Alibaba · 62.4 tok/s · $0.437/M · ii 12.7

Qwen3 235B A22B 2507 Instruct Alibaba · 57.6 tok/s · $0.299/M · ii 12

Qwen3 30B A3B (Non-reasoning) Alibaba · 108.5 tok/s · $0.26/M · ii 6.6

Qwen3 30B A3B (Reasoning) Alibaba · 107.4 tok/s · $0.42/M · ii 7.6

Qwen3 30B A3B 2507 (Reasoning) Alibaba · 156.8 tok/s · $0.42/M · ii 9.8

Qwen3 30B A3B 2507 Instruct Alibaba · 138.7 tok/s · $0.26/M · ii 7.5

Qwen3 32B (Non-reasoning) Alibaba · 106.8 tok/s · $0.208/M · ii 7.3

Qwen3 32B (Reasoning) Alibaba · 105.3 tok/s · $0.208/M · ii 7.2

Qwen3 8B (Non-reasoning) Alibaba · 39.2 tok/s · $0.232/M · ii 6

Qwen3 8B (Reasoning) Alibaba · 37.5 tok/s · $0.372/M · ii 5.2

Qwen3 Coder 30B A3B Instruct Alibaba · 89.8 tok/s · $0.63/M · ii 9.6

Qwen3 Coder 480B A35B Instruct Alibaba · 50.3 tok/s · $2.1/M · ii 11.9

Qwen3 Coder Next Alibaba · 110.4 tok/s · $0.435/M · ii 10.1

Qwen3 Max Alibaba · 50.3 tok/s · $0.949/M · ii 15.6

Qwen3 Max (Preview) Alibaba · 58.3 tok/s · $1.68/M · ii 12.6

Qwen3 Max Thinking (Preview) Alibaba · 55.3 tok/s · $1.68/M · ii 16.3

Qwen3 Next 80B A3B (Reasoning) Alibaba · 186.9 tok/s · $0.255/M · ii 11.2

Qwen3 Next 80B A3B Instruct Alibaba · 177.6 tok/s · $0.255/M · ii 9.6

Qwen3 Omni 30B A3B (Reasoning) Alibaba · 101.6 tok/s · $0.322/M · ii 7.8

Qwen3 Omni 30B A3B Instruct Alibaba · 96.8 tok/s · $0.322/M · ii 6

Qwen3 VL 235B A22B (Reasoning) Alibaba · 58.5 tok/s · $0.76/M · ii 13.4

Qwen3 VL 235B A22B Instruct Alibaba · 51.8 tok/s · $0.31/M · ii 9.9

Qwen3 VL 30B A3B (Reasoning) Alibaba · 111.9 tok/s · $0.42/M · ii 9.5

Qwen3 VL 30B A3B Instruct Alibaba · 111.3 tok/s · $0.26/M · ii 7.9

Qwen3 VL 32B (Reasoning) Alibaba · 89.8 tok/s · $0.208/M · ii 11.9

Qwen3 VL 32B Instruct Alibaba · 64.3 tok/s · $0.208/M · ii 8.4

Qwen3 VL 8B (Reasoning) Alibaba · 115.1 tok/s · $0.372/M · ii 8.2

Qwen3 VL 8B Instruct Alibaba · 119.7 tok/s · $0.232/M · ii 7.3

Qwen3.5 122B A10B (Non-reasoning) Alibaba · 138 tok/s · $0.68/M · ii 17.7

Qwen3.5 122B A10B (Reasoning) Alibaba · 126.4 tok/s · $0.68/M · ii 16.2

Qwen3.5 27B (Non-reasoning) Alibaba · 80.1 tok/s · $0.51/M · ii 19.4

Qwen3.5 27B (Reasoning) Alibaba · 76.3 tok/s · $0.51/M · ii 22.9

Qwen3.5 35B A3B (Non-reasoning) Alibaba · 162.9 tok/s · $0.425/M · ii 15.1

Qwen3.5 35B A3B (Reasoning) Alibaba · 149.1 tok/s · $0.359/M · ii 19.3

Qwen3.5 397B A17B (Non-reasoning) Alibaba · 81.7 tok/s · $0.9/M · ii 21.4

Qwen3.5 397B A17B (Reasoning) Alibaba · 79.3 tok/s · $0.637/M · ii 19.1

Qwen3.5 4B (Non-reasoning) Alibaba · 27.6 tok/s · $0.042/M · ii 10.8

Qwen3.5 4B (Reasoning) Alibaba · 26.3 tok/s · $0.042/M · ii 13.1

Qwen3.5 9B (Non-reasoning) Alibaba · 96.3 tok/s · $0.178/M · ii 13.3

Qwen3.5 9B (Reasoning) Alibaba · 92.9 tok/s · $0.146/M · ii 13.7

Qwen3.5 Omni Flash Alibaba · 219.2 tok/s · $0.17/M · ii 12.5

Qwen3.5 Omni Plus Alibaba · 89.7 tok/s · $0.84/M · ii 20.4

Qwen3.6 27B (Non-reasoning) Alibaba · 54.9 tok/s · $0.9/M · ii 19.8

Qwen3.6 27B (Reasoning) Alibaba · 56.3 tok/s · $0.501/M · ii 21.9

Qwen3.6 35B A3B (Non-reasoning) Alibaba · 139.3 tok/s · $0.567/M · ii 15.2

Qwen3.6 35B A3B (Reasoning) Alibaba · 128.8 tok/s · $0.336/M · ii 18.8

Qwen3.6 Max Preview Alibaba · 60.6 tok/s · $1.131/M · ii 28.4

Qwen3.6 Plus Alibaba · 56.1 tok/s · $0.435/M · ii 27

Qwen3.7 Max Alibaba · 141.7 tok/s · $1.6/M · ii 29.9

Qwen3.7 Plus Alibaba · 68.9 tok/s · $0.268/M · ii 25.8

Qwen3.8 2.4T A95B Alibaba · 38.4 tok/s · $1.175/M · ii 40

Qwen3.8 27B (low) Alibaba · 44.3 tok/s · $0.435/M · ii 26.5

Qwen3.8 27B (medium) Alibaba · 46.6 tok/s · $0.435/M · ii 27.8

Qwen3.8 27B (Non-reasoning) Alibaba · 44.8 tok/s · $0.435/M · ii 22.4

Qwen3.8 27B (xhigh) Alibaba · 39.7 tok/s · $0.435/M · ii 33.9

Qwen3.8 Max Alibaba · 37.8 tok/s · $1.175/M · ii 40.3

Qwen3.8-Flash-Next Alibaba · 52.3 tok/s · $0.091/M · ii 39.9

Nova 2.0 Lite (high) Amazon · 144.7 tok/s · $0.52/M · ii 13.4

Nova 2.0 Lite (low) Amazon · 152.3 tok/s · $0.52/M · ii 11.8

Nova 2.0 Lite (medium) Amazon · 142.7 tok/s · $0.52/M · ii 12.5

Nova 2.0 Lite (Non-reasoning) Amazon · 156.6 tok/s · $0.52/M · ii 8.7

Nova 2.0 Pro Preview (low) Amazon · 118.7 tok/s · $2.125/M · ii 12.8

Nova 2.0 Pro Preview (medium) Amazon · 113.7 tok/s · $1.467/M · ii 14.2

Nova 2.0 Pro Preview (Non-reasoning) Amazon · 104 tok/s · $2.125/M · ii 10

Nova Lite Amazon · 169.1 tok/s · $0.043/M · ii 6.7

Nova Micro Amazon · 260.2 tok/s · $0.029/M · ii 5.9

Nova Premier Amazon · 34.1 tok/s · $2.191/M · ii 9.2

Claude 4.5 Haiku (Non-reasoning) Anthropic · 77.4 tok/s · $0.77/M · ii 15.4

Claude 4.5 Haiku (Reasoning) Anthropic · 85 tok/s · $0.77/M · ii 17.6

Claude 4.5 Sonnet (Non-reasoning) Anthropic · 38 tok/s · $2.31/M · ii 19.3

Claude 4.5 Sonnet (Reasoning) Anthropic · 41.7 tok/s · $2.31/M · ii 21.2

Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) Anthropic · 66.8 tok/s · $7.7/M · ii 49.7

Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) Anthropic · 49.2 tok/s · $7.175/M · ii 51.2

Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) Anthropic · 47.4 tok/s · $7.175/M · ii 47

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) Anthropic · 65.8 tok/s · $7.175/M · ii 53.4

Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) Anthropic · 49.6 tok/s · $7.175/M · ii 49.1

Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) Anthropic · 57.3 tok/s · $7.175/M · ii 53.2

Claude Opus 4.5 (Non-reasoning) Anthropic · 43.6 tok/s · $3.85/M · ii 23.7

Claude Opus 4.5 (Reasoning) Anthropic · 44.7 tok/s · $3.85/M · ii 29.1

Claude Opus 4.6 (Adaptive Reasoning, Max Effort) Anthropic · 39.1 tok/s · $3.85/M · ii 31.9

Claude Opus 4.6 (Non-reasoning, High Effort) Anthropic · 36.6 tok/s · $3.85/M · ii 26.4

Claude Opus 4.7 (Adaptive Reasoning, Max Effort) Anthropic · 44.2 tok/s · $3.85/M · ii 40.7

Claude Opus 4.7 (Non-reasoning, High Effort) Anthropic · 43.4 tok/s · $3.85/M · ii 30.9

Claude Opus 5 (Adaptive Reasoning, High Effort) Anthropic · 50.3 tok/s · $3.85/M · ii 48.2

Claude Opus 5 (Adaptive Reasoning, Low Effort) Anthropic · 47.6 tok/s · $3.85/M · ii 39.8

Claude Opus 5 (Adaptive Reasoning, Max Effort) Anthropic · 50.4 tok/s · $3.85/M · ii 50.7

Claude Opus 5 (Adaptive Reasoning, Medium Effort) Anthropic · 48.3 tok/s · $3.85/M · ii 45.1

Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) Anthropic · 49.3 tok/s · $3.85/M · ii 49.7

Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) Anthropic · 53.6 tok/s · $2.31/M · ii 30.5

Claude Sonnet 4.6 (Non-reasoning, High Effort) Anthropic · 42 tok/s · $2.31/M · ii 24.7

Claude Sonnet 4.6 (Non-reasoning, Low Effort) Anthropic · 42.2 tok/s · $2.31/M · ii 23.3

Claude Sonnet 5 (Adaptive Reasoning, High Effort) Anthropic · 58.2 tok/s · $1.54/M · ii 32

Claude Sonnet 5 (Adaptive Reasoning, Low Effort) Anthropic · 55.8 tok/s · $1.54/M · ii 24.7

Claude Sonnet 5 (Adaptive Reasoning, Max Effort) Anthropic · 73 tok/s · $1.54/M · ii 38.4

Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) Anthropic · 57.8 tok/s · $1.54/M · ii 28.4

Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) Anthropic · 62.4 tok/s · $1.54/M · ii 34.7

Claude Sonnet 5 (Non-reasoning, High Effort) Anthropic · 57.5 tok/s · $1.54/M · ii 28.9

Trinity Large Thinking Arcee AI · 309.7 tok/s · $0.182/M · ii 10.9

Seed 2.1 Turbo ByteDance Seed · — tok/s · —/M · ii —

Seed-OSS-36B-Instruct ByteDance Seed · 36.4 tok/s · $0.246/M · ii 12.1

Celeris-1 Celeris · 1411.9 tok/s · $0.25/M · ii 6.3

Command A Cohere · 62.6 tok/s · $3.25/M · ii 7

Command A+ Cohere · 247.8 tok/s · $0/M · ii 13.9

North Mini Code Cohere · 82.5 tok/s · $0/M · ii 12.8

Ornith-1.0-35B DeepReinforce AI · — tok/s · —/M · ii —

Ornith-1.5-35B-A3B DeepReinforce AI · — tok/s · —/M · ii —

DeepSeek R1 Distill Llama 70B DeepSeek · 22.8 tok/s · $0.74/M · ii 7.9

DeepSeek V4 Flash 0731 (Reasoning, Max Effort) DeepSeek · 210.1 tok/s · $0.227/M · ii 34.5

DeepSeek V4 Flash Vision (Reasoning, Max Effort) DeepSeek · 217.1 tok/s · $0.227/M · ii 35

DeepSeek V4 Pro (Non-reasoning) DeepSeek · 66.9 tok/s · $0.474/M · ii 20.8

DeepSeek V4 Pro (Reasoning, High Effort) DeepSeek · 65 tok/s · $0.474/M · ii 30.1

DeepSeek V4 Pro (Reasoning, Max Effort) DeepSeek · 64.7 tok/s · $0.474/M · ii 30.9

DeepSeek V4 Pro 0813 (Reasoning, Max Effort) DeepSeek · 72.3 tok/s · $0.688/M · ii 36.3

DeepSeek V4.1 Flash (Reasoning, Max Effort) DeepSeek · 217.1 tok/s · $0.187/M · ii 39.5

Gemini 2.5 Flash (Non-reasoning) Google · 188.4 tok/s · $0.331/M · ii 9.9

Gemini 2.5 Flash (Reasoning) Google · 211.7 tok/s · $0.331/M · ii 13.1

Gemini 2.5 Flash-Lite (Non-reasoning) Google · 271.5 tok/s · $0.067/M · ii 6.7

Gemini 2.5 Flash-Lite (Reasoning) Google · 334 tok/s · $0.067/M · ii 8.5

Gemini 2.5 Pro Google · 122.7 tok/s · $1.341/M · ii 16.7

Gemini 3 Flash Preview (Non-reasoning) Google · 193 tok/s · $0.435/M · ii 17.9

Gemini 3 Flash Preview (Reasoning) Google · 185 tok/s · $0.435/M · ii 26.3

Gemini 3.1 Flash-Lite Google · 287.6 tok/s · $0.221/M · ii 16

Gemini 3.1 Pro Preview Google · 109.6 tok/s · $1.74/M · ii 30.4

Gemini 3.5 Flash (high) Google · 211.9 tok/s · $1.305/M · ii 33

Gemini 3.5 Flash (medium) Google · 224 tok/s · $1.305/M · ii 33.6

Gemini 3.5 Flash (minimal) Google · 205.1 tok/s · $1.305/M · ii 23.8

Gemini 3.5 Flash-Lite Google · 320.2 tok/s · $0.331/M · ii 22.7

Gemini 3.6 Flash (high) Google · 195.3 tok/s · $0.63/M · ii 34.3

Gemini 3.7 Flash (high) Google · 287.8 tok/s · $0.574/M · ii 39.4

Gemini 3.7 Flash (low) Google · 273.3 tok/s · $0.574/M · ii 36.9

Gemini 3.7 Flash (medium) Google · 272.5 tok/s · $0.574/M · ii 39.6

Gemini 3.8 Flash (high) Google · 261.3 tok/s · $0.574/M · ii 41.2

Gemma 4 12B (Non-reasoning) Google · 102.6 tok/s · $0.12/M · ii 9.4

Gemma 4 12B (Reasoning) Google · 106.5 tok/s · $0.12/M · ii 14.2

Gemma 4 26B A4B (Non-reasoning) Google · 75.4 tok/s · $0.157/M · ii 13.1

Gemma 4 31B (Non-reasoning) Google · 48.6 tok/s · $0.166/M · ii 13.9

Gemma 4 31B (Reasoning) Google · 35.5 tok/s · $0/M · ii 15.4

Gemma 4 E4B (Non-reasoning) Google · 42.5 tok/s · $0.028/M · ii 7.5

Gemma 4 E4B (Reasoning) Google · 42.8 tok/s · $0.028/M · ii 8.9

Granite 3.3 8B (Non-reasoning) IBM · 40.3 tok/s · $0.052/M · ii 4.9

Granite 4.0 H Small IBM · 27.1 tok/s · $0.079/M · ii 6

Granite 4.1 8B IBM · 115.2 tok/s · $0.055/M · ii 6.6

Granite 4.2 30B IBM · 76.8 tok/s · $0.125/M · ii 14.8

Granite 4.2 3B IBM · 213.8 tok/s · $0.025/M · ii 9.1

Granite 4.2 8B IBM · 84 tok/s · $0.044/M · ii 11.8

Mercury 2 Inception · 807.4 tok/s · $0.146/M · ii 11.5

Ling 3.0 Flash InclusionAI · 307.1 tok/s · $0.043/M · ii 24.9

Ling 3.0 Tiny InclusionAI · 161.5 tok/s · $0/M · ii 11.9

Ling-3.0-flash-VL InclusionAI · 144.9 tok/s · $0.008/M · ii 24.8

Ling-flash-2.0 InclusionAI · 3 tok/s · $0.183/M · ii 7.8

Ring-2.6-1T InclusionAI · 121.4 tok/s · $0.52/M · ii 17.3

Kimi K2 Kimi · 39.2 tok/s · $0.743/M · ii 12.7

Kimi K2 0905 Kimi · 39.9 tok/s · $0.79/M · ii 15.3

Kimi K2 Thinking Kimi · 119.4 tok/s · $0.475/M · ii 22

Kimi K2.6 Kimi · 38.7 tok/s · $0.702/M · ii 31.3

Kimi K2.6 (Non-reasoning) Kimi · 38.4 tok/s · $0.702/M · ii 23.6

Kimi K2.7 Code Kimi · 47.7 tok/s · $0.723/M · ii 26.3

Kimi K3 (low) Kimi · 38.2 tok/s · $2.31/M · ii 34.5

Kimi K3 (max) Kimi · 38.1 tok/s · $2.31/M · ii 43.8

LFM2.5-2.6B Liquid AI · 199.8 tok/s · $0/M · ii 8.4

Llama 3.1 Instruct 70B Meta · 59.5 tok/s · $0.56/M · ii 6.6

Llama 3.1 Instruct 8B Meta · 143.2 tok/s · $0.023/M · ii 6.9

Llama 3.2 Instruct 11B (Vision) Meta · 16.3 tok/s · $0.34/M · ii 5.4

Llama 3.3 Instruct 70B Meta · 85.8 tok/s · $0.666/M · ii 7.7

Llama 4 Maverick Meta · 89.9 tok/s · $0.311/M · ii 9.3

Llama 4 Scout Meta · 107.2 tok/s · $0.239/M · ii 6.5

Muse Glimmer (high) Meta · 92.5 tok/s · $0.248/M · ii 18.1

Muse Spark 1.2 (xhigh) Meta · 174.2 tok/s · $0.78/M · ii 39.8

Muse Spark 1.3 (max) Meta · 205.9 tok/s · $0.78/M · ii 48.2

Muse Spark 1.3 (xhigh) Meta · 206.8 tok/s · $0.78/M · ii 45.2

Phi-4 Microsoft · 40.4 tok/s · $0.167/M · ii 5.9

Phi-4 Mini Instruct Microsoft · 44.4 tok/s · $0/M · ii 6.3

Phi-4 Multimodal Instruct Microsoft · 16.8 tok/s · $0/M · ii 5.8

MiniMax-M2 MiniMax · 80.7 tok/s · $0.39/M · ii 18.6

MiniMax-M2.1 MiniMax · 84.1 tok/s · $0.201/M · ii 20.9

MiniMax-M2.5 MiniMax · 82.3 tok/s · $0.201/M · ii 22.8

MiniMax-M2.7 MiniMax · 56.5 tok/s · $0.222/M · ii 23.2

MiniMax-M3 MiniMax · 87.7 tok/s · $0.222/M · ii 29.6

Devstral 2 Mistral · 145.7 tok/s · $0/M · ii 9.4

Devstral Small 2 Mistral · 135.7 tok/s · $0/M · ii 8.4

Ministral 3 14B Mistral · 90.1 tok/s · $0.2/M · ii 6

Ministral 3 3B Mistral · 177.7 tok/s · $0.1/M · ii 4.8

Ministral 3 8B Mistral · 85.7 tok/s · $0.15/M · ii 5.5

Mistral 7B Instruct Mistral · 82.1 tok/s · $0.25/M · ii 5

Mistral Large 3 Mistral · 73.8 tok/s · $0.6/M · ii 9.7

Mistral Medium Mistral · 140.8 tok/s · $2.1/M · ii 5.5

Mistral Medium 3 Mistral · 146.4 tok/s · $0.308/M · ii 9

Mistral Medium 3.1 Mistral · 140 tok/s · $0.308/M · ii 9.9

Mistral Medium 3.5 Mistral · 151.4 tok/s · $1.155/M · ii 14.9

Mistral Small (Feb '24) Mistral · 142.1 tok/s · $0.195/M · ii 5.5

Mistral Small (Sep '24) Mistral · 140.9 tok/s · $0.24/M · ii 5.8

Mistral Small 3 Mistral · 146.2 tok/s · $0.12/M · ii 6.7

Mistral Small 3.1 Mistral · 137.7 tok/s · $0.12/M · ii 7.4

Mistral Small 3.2 Mistral · 149.1 tok/s · $0.12/M · ii 7

Mistral Small 4 (Non-reasoning) Mistral · 144.6 tok/s · $0.195/M · ii 9

Mistral Small 4 (Reasoning) Mistral · 154.8 tok/s · $0.195/M · ii 11.5

HyperNova 60B 2605 (high, based on gpt-oss-120b) Multiverse Computing · 360.5 tok/s · $0.05/M · ii 11.7

Quasar 438B (max, based on GLM-5.2) Multiverse Computing · 177.7 tok/s · $0.72/M · ii 27.1

Hermes 3 - Llama-3.1 70B Nous Research · 29.5 tok/s · $0.7/M · ii 6

Hermes 4 - Llama-3.1 405B (Non-reasoning) Nous Research · 43.3 tok/s · $1.2/M · ii 7.4

Hermes 4 - Llama-3.1 405B (Reasoning) Nous Research · 43.1 tok/s · $1.2/M · ii 7.5

Llama 3.1 Nemotron Instruct 70B NVIDIA · 56.8 tok/s · $1.2/M · ii 6.9

Llama Nemotron Super 49B v1.5 (Non-reasoning) NVIDIA · 42.4 tok/s · $0.4/M · ii 7.4

Llama Nemotron Super 49B v1.5 (Reasoning) NVIDIA · 57.5 tok/s · $0.4/M · ii 9

Nemotron 3 Super 120B A12B (Reasoning) NVIDIA · 154.7 tok/s · $0.236/M · ii 13.6

Nemotron 3 Ultra 550B A55B (Reasoning) NVIDIA · 160.4 tok/s · $0.52/M · ii 23.4

Nemotron 3.5 Lightning NVIDIA · 288.1 tok/s · $0.067/M · ii 13.6

NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) NVIDIA · 159.3 tok/s · $0.065/M · ii 6.8

NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) NVIDIA · 239.5 tok/s · $0.065/M · ii 8.9

NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) NVIDIA · 77.7 tok/s · $0.24/M · ii 5.8

NVIDIA Nemotron Nano 12B v2 VL (Reasoning) NVIDIA · 53.4 tok/s · $0.24/M · ii 7.5

NVIDIA Nemotron Nano 9B V2 (Non-reasoning) NVIDIA · 151.2 tok/s · $0.065/M · ii 6.8

NVIDIA Nemotron Nano 9B V2 (Reasoning) NVIDIA · 105.7 tok/s · $0.052/M · ii 7.4

GPT-4 Turbo OpenAI · 31.1 tok/s · $12/M · ii 7

GPT-4.1 OpenAI · 151.1 tok/s · $1.55/M · ii 12.7

GPT-4.1 mini OpenAI · 106.2 tok/s · $0.31/M · ii 10.2

GPT-4.1 nano OpenAI · 116.7 tok/s · $0.081/M · ii 7.8

GPT-4o (Aug '24) OpenAI · 88.5 tok/s · $2.375/M · ii 7.7

GPT-4o (May '24) OpenAI · 100.4 tok/s · $6/M · ii 7.3

GPT-4o (Nov '24) OpenAI · 138.7 tok/s · $2.55/M · ii 8.4

GPT-4o mini OpenAI · 150.9 tok/s · $0.139/M · ii 6.7

GPT-5 (high) OpenAI · 90.9 tok/s · $1.341/M · ii 23

GPT-5 (low) OpenAI · 74.6 tok/s · $1.341/M · ii 20.8

GPT-5 (medium) OpenAI · 68.9 tok/s · $1.341/M · ii 22.9

GPT-5 (minimal) OpenAI · 76.8 tok/s · $1.341/M · ii 11.4

GPT-5 mini (high) OpenAI · 70.9 tok/s · $0.271/M · ii 17.4

GPT-5 mini (medium) OpenAI · 86.1 tok/s · $0.271/M · ii 20.6

GPT-5 mini (minimal) OpenAI · 75.3 tok/s · $0.271/M · ii 9.9

GPT-5 nano (high) OpenAI · 150.7 tok/s · $0.057/M · ii 13

GPT-5 nano (medium) OpenAI · 130.9 tok/s · $0.057/M · ii 12.5

GPT-5 nano (minimal) OpenAI · 161.7 tok/s · $0.057/M · ii 7.1

GPT-5.1 (high) OpenAI · 99.5 tok/s · $1.341/M · ii 24.7

GPT-5.1 (Non-reasoning) OpenAI · 107.6 tok/s · $1.341/M · ii 13.3

GPT-5.2 (Non-reasoning) OpenAI · 61.3 tok/s · $1.869/M · ii 17

GPT-5.2 (xhigh) OpenAI · 64.7 tok/s · $1.869/M · ii 30.4

GPT-5.3 Codex (xhigh) OpenAI · 127.2 tok/s · $1.869/M · ii 32.5

GPT-5.4 (low) OpenAI · 90.6 tok/s · $2.175/M · ii 27.6

GPT-5.4 (Non-reasoning) OpenAI · 92.1 tok/s · $2.175/M · ii 18.2

GPT-5.4 (xhigh) OpenAI · 131.5 tok/s · $2.175/M · ii 39

GPT-5.4 mini (medium) OpenAI · 175.2 tok/s · $0.649/M · ii 19.7

GPT-5.4 mini (Non-Reasoning) OpenAI · 145.3 tok/s · $0.649/M · ii 11.1

GPT-5.4 mini (xhigh) OpenAI · 186.3 tok/s · $0.649/M · ii 24.6

GPT-5.4 nano (medium) OpenAI · 161.5 tok/s · $0.179/M · ii 20

GPT-5.4 nano (Non-Reasoning) OpenAI · 164.4 tok/s · $0.179/M · ii 11.7

GPT-5.4 nano (xhigh) OpenAI · 154.2 tok/s · $0.179/M · ii 21.2

GPT-5.5 (high) OpenAI · 80.5 tok/s · $4.35/M · ii 37.3

GPT-5.5 (low) OpenAI · 82.3 tok/s · $4.35/M · ii 30.7

GPT-5.5 (medium) OpenAI · 73.1 tok/s · $4.35/M · ii 34.2

GPT-5.5 (Non-reasoning) OpenAI · 77.9 tok/s · $4.35/M · ii 23.2

GPT-5.5 (xhigh) OpenAI · 79.7 tok/s · $4.35/M · ii 38.6

GPT-5.5 Instant (June 2026) OpenAI · 130.8 tok/s · $4.35/M · ii 26.8

GPT-5.6 Luna (high) OpenAI · 101.2 tok/s · $0.174/M · ii 32.4

GPT-5.6 Luna (low) OpenAI · 105.4 tok/s · $0.174/M · ii 21.5

GPT-5.6 Luna (medium) OpenAI · 104.4 tok/s · $0.174/M · ii 25.5

GPT-5.6 Luna (Non-reasoning) OpenAI · 104.3 tok/s · $0.174/M · ii 16.8

GPT-5.6 Luna (xhigh) OpenAI · 108.3 tok/s · $0.174/M · ii 34.8

GPT-5.6 Sol (high) OpenAI · 60.7 tok/s · $3.08/M · ii 42.5

GPT-5.6 Sol (low) OpenAI · 56.3 tok/s · $3.08/M · ii 33.8

GPT-5.6 Sol (medium) OpenAI · 56.6 tok/s · $3.08/M · ii 39.5

GPT-5.6 Sol (Non-reasoning) OpenAI · 61.7 tok/s · $3.08/M · ii 28.3

GPT-5.6 Sol (xhigh) OpenAI · 61.1 tok/s · $3.08/M · ii 44.1

GPT-5.6 Terra (high) OpenAI · 79.1 tok/s · $1.74/M · ii 34.5

GPT-5.6 Terra (low) OpenAI · 81.1 tok/s · $1.74/M · ii 27.9

GPT-5.6 Terra (medium) OpenAI · 85.4 tok/s · $1.74/M · ii 30.4

GPT-5.6 Terra (Non-reasoning) OpenAI · 85.2 tok/s · $1.74/M · ii 22.3

GPT-5.6 Terra (xhigh) OpenAI · 82.6 tok/s · $1.74/M · ii 38.2

GPT-6 Astra (high) OpenAI · 49.8 tok/s · $7.7/M · ii 51

GPT-6 Astra (low) OpenAI · 52.1 tok/s · $7.7/M · ii 46

GPT-6 Astra (medium) OpenAI · 50 tok/s · $7.7/M · ii 49.7

GPT-6 Astra (xhigh) OpenAI · 51.1 tok/s · $7.7/M · ii 52.5

gpt-oss-120b (high) OpenAI · 187.1 tok/s · $0.18/M · ii 12.3

gpt-oss-120b (low) OpenAI · 205.8 tok/s · $0.189/M · ii 10.2

gpt-oss-20b (high) OpenAI · 213.8 tok/s · $0.052/M · ii 9

gpt-oss-20b (low) OpenAI · 243.7 tok/s · $0.083/M · ii 10

o3 OpenAI · 107 tok/s · $1.55/M · ii 20.2

o3-mini OpenAI · 219.1 tok/s · $1.045/M · ii 12.5

o3-mini (high) OpenAI · 220.5 tok/s · $1.045/M · ii 11

o4-mini (high) OpenAI · 135.6 tok/s · $0.856/M · ii 16.7

Agnes 2.5 Pro Alpha Sapiens AI · 169.3 tok/s · $0.187/M · ii 27.8

Agnes 3.0 Flash Sapiens AI · 252.7 tok/s · $0.032/M · ii 35.5

Grok 3 mini Reasoning (high) SpaceXAI · 61.5 tok/s · $0.159/M · ii 14.6

Grok 4.20 0309 v2 (Non-reasoning) SpaceXAI · 94.3 tok/s · $0.64/M · ii 14.2

Grok 4.20 0309 v2 (Reasoning) SpaceXAI · 100.5 tok/s · $0.64/M · ii 25.7

Grok 4.3 (high) SpaceXAI · 119.3 tok/s · $0.64/M · ii 25.4

Grok 4.3 (low) SpaceXAI · 106 tok/s · $0.64/M · ii 24.3

Grok 4.3 (medium) SpaceXAI · 120.2 tok/s · $0.64/M · ii 24.8

Grok 4.3 (Non-reasoning) SpaceXAI · 113.3 tok/s · $0.64/M · ii 14.5

Grok 4.5 (high) SpaceXAI · 54.8 tok/s · $1.21/M · ii 39.1

Grok 4.6 (high) SpaceXAI · 53.6 tok/s · $1.35/M · ii 44.4

Grok 4.6 (low) SpaceXAI · 48.6 tok/s · $1.35/M · ii 35.4

Grok 4.6 (medium) SpaceXAI · 50 tok/s · $1.35/M · ii 43

Grok 4.6 (xhigh) SpaceXAI · 54 tok/s · $1.35/M · ii 44.3

Grok Build 0.1 0616 SpaceXAI · 68.1 tok/s · $0.54/M · ii 27.2

Ox Alpha (stealth) Stealth · — tok/s · —/M · ii —

Step 3.5 Flash StepFun · 192.1 tok/s · $0.12/M · ii 16.6

Step 3.5 Flash 2603 StepFun · 183.2 tok/s · $0.064/M · ii 17

Step 3.7 Flash StepFun · 96 tok/s · $0.183/M · ii 19.5

Hy3 Tencent · 84.8 tok/s · $0.104/M · ii 25.8

Inkling (xhigh) Thinking Machines · 76.2 tok/s · $0.724/M · ii 25.5

Inkling Small Thinking Machines · 150.8 tok/s · $0.222/M · ii 26.1

Solar Pro 3 Upstage · 153 tok/s · $0.097/M · ii 7.8

Solar Pro 4 Upstage · 60.9 tok/s · $0.222/M · ii 28.2

MiMo-V2.5 Xiaomi · 45.2 tok/s · $0.154/M · ii 22.3

MiMo-V2.5-Pro Xiaomi · 44.8 tok/s · $0.176/M · ii 26.4

MiMo-V2.5-Pro (Non-reasoning) Xiaomi · 36.4 tok/s · $0.474/M · ii 18.3

GLM-4.5-Air Z AI · 59.2 tok/s · $0.15/M · ii 11.1

GLM-4.5V (Non-reasoning) Z AI · 34 tok/s · $0.377/M · ii 6.7

GLM-4.5V (Reasoning) Z AI · 35.7 tok/s · $0.72/M · ii 7.6

GLM-4.6 (Non-reasoning) Z AI · 36.9 tok/s · $0.39/M · ii 14.9

GLM-4.6 (Reasoning) Z AI · 27.1 tok/s · $0.715/M · ii 18.5

GLM-4.6V (Non-reasoning) Z AI · 58.8 tok/s · $0.189/M · ii 8.4

GLM-4.6V (Reasoning) Z AI · 64.9 tok/s · $0.36/M · ii 11.2

GLM-4.7 (Non-reasoning) Z AI · 84.8 tok/s · $0.711/M · ii 17.4

GLM-4.7 (Reasoning) Z AI · 84.6 tok/s · $0.76/M · ii 22.2

GLM-4.7-Flash (Non-reasoning) Z AI · 89.2 tok/s · $0.103/M · ii 10.6

GLM-4.7-Flash (Reasoning) Z AI · 79.6 tok/s · $0.103/M · ii 14.9

GLM-5 (Non-reasoning) Z AI · 57.6 tok/s · $0.66/M · ii 21.8

GLM-5 (Reasoning) Z AI · 73.2 tok/s · $0.66/M · ii 27.9

GLM-5.1 (Non-reasoning) Z AI · 49.6 tok/s · $0.898/M · ii 24.2

GLM-5.1 (Reasoning) Z AI · 71.2 tok/s · $0.862/M · ii 26.4

GLM-5.2 (max) Z AI · 67.6 tok/s · $0.902/M · ii 38.6

GLM-5.2 (Non-reasoning) Z AI · 129.7 tok/s · $0.902/M · ii 22.4

GLM-5.3 (max) Z AI · 66.1 tok/s · $0.902/M · ii 44.9

GLM-5.3-Flash Z AI · 103.5 tok/s · $0.101/M · ii 41.9

Model names are trademarks of their respective owners. Not affiliated with, endorsed by, or sponsored by any provider or measurement service. Sources, attribution & corrections.