329 models · catalog 2026-09-14 · each card self-contained and embeddable
Qwen2.5 Turbo Alibaba · 108.6 tok/s · $0.065/M · ii 6.4
Qwen3 14B (Non-reasoning) Alibaba · 63.4 tok/s · $0.455/M · ii 6.7
Qwen3 14B (Reasoning) Alibaba · 62.9 tok/s · $0.735/M · ii 6.4
Qwen3 235B A22B (Non-reasoning) Alibaba · 60.5 tok/s · $0.91/M · ii 8.3
Qwen3 235B A22B (Reasoning) Alibaba · 58.7 tok/s · $1.47/M · ii 9.5
Qwen3 235B A22B 2507 (Reasoning) Alibaba · 62.4 tok/s · $0.437/M · ii 12.7
Qwen3 235B A22B 2507 Instruct Alibaba · 57.6 tok/s · $0.299/M · ii 12
Qwen3 30B A3B (Non-reasoning) Alibaba · 108.5 tok/s · $0.26/M · ii 6.6
Qwen3 30B A3B (Reasoning) Alibaba · 107.4 tok/s · $0.42/M · ii 7.6
Qwen3 30B A3B 2507 (Reasoning) Alibaba · 156.8 tok/s · $0.42/M · ii 9.8
Qwen3 30B A3B 2507 Instruct Alibaba · 138.7 tok/s · $0.26/M · ii 7.5
Qwen3 32B (Non-reasoning) Alibaba · 106.8 tok/s · $0.208/M · ii 7.3
Qwen3 32B (Reasoning) Alibaba · 105.3 tok/s · $0.208/M · ii 7.2
Qwen3 8B (Non-reasoning) Alibaba · 39.2 tok/s · $0.232/M · ii 6
Qwen3 8B (Reasoning) Alibaba · 37.5 tok/s · $0.372/M · ii 5.2
Qwen3 Coder 30B A3B Instruct Alibaba · 89.8 tok/s · $0.63/M · ii 9.6
Qwen3 Coder 480B A35B Instruct Alibaba · 50.3 tok/s · $2.1/M · ii 11.9
Qwen3 Coder Next Alibaba · 110.4 tok/s · $0.435/M · ii 10.1
Qwen3 Max Alibaba · 50.3 tok/s · $0.949/M · ii 15.6
Qwen3 Max (Preview) Alibaba · 58.3 tok/s · $1.68/M · ii 12.6
Qwen3 Max Thinking (Preview) Alibaba · 55.3 tok/s · $1.68/M · ii 16.3
Qwen3 Next 80B A3B (Reasoning) Alibaba · 186.9 tok/s · $0.255/M · ii 11.2
Qwen3 Next 80B A3B Instruct Alibaba · 177.6 tok/s · $0.255/M · ii 9.6
Qwen3 Omni 30B A3B (Reasoning) Alibaba · 101.6 tok/s · $0.322/M · ii 7.8
Qwen3 Omni 30B A3B Instruct Alibaba · 96.8 tok/s · $0.322/M · ii 6
Qwen3 VL 235B A22B (Reasoning) Alibaba · 58.5 tok/s · $0.76/M · ii 13.4
Qwen3 VL 235B A22B Instruct Alibaba · 51.8 tok/s · $0.31/M · ii 9.9
Qwen3 VL 30B A3B (Reasoning) Alibaba · 111.9 tok/s · $0.42/M · ii 9.5
Qwen3 VL 30B A3B Instruct Alibaba · 111.3 tok/s · $0.26/M · ii 7.9
Qwen3 VL 32B (Reasoning) Alibaba · 89.8 tok/s · $0.208/M · ii 11.9
Qwen3 VL 32B Instruct Alibaba · 64.3 tok/s · $0.208/M · ii 8.4
Qwen3 VL 8B (Reasoning) Alibaba · 115.1 tok/s · $0.372/M · ii 8.2
Qwen3 VL 8B Instruct Alibaba · 119.7 tok/s · $0.232/M · ii 7.3
Qwen3.5 122B A10B (Non-reasoning) Alibaba · 138 tok/s · $0.68/M · ii 17.7
Qwen3.5 122B A10B (Reasoning) Alibaba · 126.4 tok/s · $0.68/M · ii 16.2
Qwen3.5 27B (Non-reasoning) Alibaba · 80.1 tok/s · $0.51/M · ii 19.4
Qwen3.5 27B (Reasoning) Alibaba · 76.3 tok/s · $0.51/M · ii 22.9
Qwen3.5 35B A3B (Non-reasoning) Alibaba · 162.9 tok/s · $0.425/M · ii 15.1
Qwen3.5 35B A3B (Reasoning) Alibaba · 149.1 tok/s · $0.359/M · ii 19.3
Qwen3.5 397B A17B (Non-reasoning) Alibaba · 81.7 tok/s · $0.9/M · ii 21.4
Qwen3.5 397B A17B (Reasoning) Alibaba · 79.3 tok/s · $0.637/M · ii 19.1
Qwen3.5 4B (Non-reasoning) Alibaba · 27.6 tok/s · $0.042/M · ii 10.8
Qwen3.5 4B (Reasoning) Alibaba · 26.3 tok/s · $0.042/M · ii 13.1
Qwen3.5 9B (Non-reasoning) Alibaba · 96.3 tok/s · $0.178/M · ii 13.3
Qwen3.5 9B (Reasoning) Alibaba · 92.9 tok/s · $0.146/M · ii 13.7
Qwen3.5 Omni Flash Alibaba · 219.2 tok/s · $0.17/M · ii 12.5
Qwen3.5 Omni Plus Alibaba · 89.7 tok/s · $0.84/M · ii 20.4
Qwen3.6 27B (Non-reasoning) Alibaba · 54.9 tok/s · $0.9/M · ii 19.8
Qwen3.6 27B (Reasoning) Alibaba · 56.3 tok/s · $0.501/M · ii 21.9
Qwen3.6 35B A3B (Non-reasoning) Alibaba · 139.3 tok/s · $0.567/M · ii 15.2
Qwen3.6 35B A3B (Reasoning) Alibaba · 128.8 tok/s · $0.336/M · ii 18.8
Qwen3.6 Max Preview Alibaba · 60.6 tok/s · $1.131/M · ii 28.4
Qwen3.6 Plus Alibaba · 56.1 tok/s · $0.435/M · ii 27
Qwen3.7 Max Alibaba · 141.7 tok/s · $1.6/M · ii 29.9
Qwen3.7 Plus Alibaba · 68.9 tok/s · $0.268/M · ii 25.8
Qwen3.8 2.4T A95B Alibaba · 38.4 tok/s · $1.175/M · ii 40
Qwen3.8 27B (low) Alibaba · 44.3 tok/s · $0.435/M · ii 26.5
Qwen3.8 27B (medium) Alibaba · 46.6 tok/s · $0.435/M · ii 27.8
Qwen3.8 27B (Non-reasoning) Alibaba · 44.8 tok/s · $0.435/M · ii 22.4
Qwen3.8 27B (xhigh) Alibaba · 39.7 tok/s · $0.435/M · ii 33.9
Qwen3.8 Max Alibaba · 37.8 tok/s · $1.175/M · ii 40.3
Qwen3.8-Flash-Next Alibaba · 52.3 tok/s · $0.091/M · ii 39.9
Nova 2.0 Lite (high) Amazon · 144.7 tok/s · $0.52/M · ii 13.4
Nova 2.0 Lite (low) Amazon · 152.3 tok/s · $0.52/M · ii 11.8
Nova 2.0 Lite (medium) Amazon · 142.7 tok/s · $0.52/M · ii 12.5
Nova 2.0 Lite (Non-reasoning) Amazon · 156.6 tok/s · $0.52/M · ii 8.7
Nova 2.0 Pro Preview (low) Amazon · 118.7 tok/s · $2.125/M · ii 12.8
Nova 2.0 Pro Preview (medium) Amazon · 113.7 tok/s · $1.467/M · ii 14.2
Nova 2.0 Pro Preview (Non-reasoning) Amazon · 104 tok/s · $2.125/M · ii 10
Nova Lite Amazon · 169.1 tok/s · $0.043/M · ii 6.7
Nova Micro Amazon · 260.2 tok/s · $0.029/M · ii 5.9
Nova Premier Amazon · 34.1 tok/s · $2.191/M · ii 9.2
Claude 4.5 Haiku (Non-reasoning) Anthropic · 77.4 tok/s · $0.77/M · ii 15.4
Claude 4.5 Haiku (Reasoning) Anthropic · 85 tok/s · $0.77/M · ii 17.6
Claude 4.5 Sonnet (Non-reasoning) Anthropic · 38 tok/s · $2.31/M · ii 19.3
Claude 4.5 Sonnet (Reasoning) Anthropic · 41.7 tok/s · $2.31/M · ii 21.2
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) Anthropic · 66.8 tok/s · $7.7/M · ii 49.7
Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) Anthropic · 49.2 tok/s · $7.175/M · ii 51.2
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) Anthropic · 47.4 tok/s · $7.175/M · ii 47
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) Anthropic · 65.8 tok/s · $7.175/M · ii 53.4
Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) Anthropic · 49.6 tok/s · $7.175/M · ii 49.1
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) Anthropic · 57.3 tok/s · $7.175/M · ii 53.2
Claude Opus 4.5 (Non-reasoning) Anthropic · 43.6 tok/s · $3.85/M · ii 23.7
Claude Opus 4.5 (Reasoning) Anthropic · 44.7 tok/s · $3.85/M · ii 29.1
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) Anthropic · 39.1 tok/s · $3.85/M · ii 31.9
Claude Opus 4.6 (Non-reasoning, High Effort) Anthropic · 36.6 tok/s · $3.85/M · ii 26.4
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) Anthropic · 44.2 tok/s · $3.85/M · ii 40.7
Claude Opus 4.7 (Non-reasoning, High Effort) Anthropic · 43.4 tok/s · $3.85/M · ii 30.9
Claude Opus 5 (Adaptive Reasoning, High Effort) Anthropic · 50.3 tok/s · $3.85/M · ii 48.2
Claude Opus 5 (Adaptive Reasoning, Low Effort) Anthropic · 47.6 tok/s · $3.85/M · ii 39.8
Claude Opus 5 (Adaptive Reasoning, Max Effort) Anthropic · 50.4 tok/s · $3.85/M · ii 50.7
Claude Opus 5 (Adaptive Reasoning, Medium Effort) Anthropic · 48.3 tok/s · $3.85/M · ii 45.1
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) Anthropic · 49.3 tok/s · $3.85/M · ii 49.7
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) Anthropic · 53.6 tok/s · $2.31/M · ii 30.5
Claude Sonnet 4.6 (Non-reasoning, High Effort) Anthropic · 42 tok/s · $2.31/M · ii 24.7
Claude Sonnet 4.6 (Non-reasoning, Low Effort) Anthropic · 42.2 tok/s · $2.31/M · ii 23.3
Claude Sonnet 5 (Adaptive Reasoning, High Effort) Anthropic · 58.2 tok/s · $1.54/M · ii 32
Claude Sonnet 5 (Adaptive Reasoning, Low Effort) Anthropic · 55.8 tok/s · $1.54/M · ii 24.7
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) Anthropic · 73 tok/s · $1.54/M · ii 38.4
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) Anthropic · 57.8 tok/s · $1.54/M · ii 28.4
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) Anthropic · 62.4 tok/s · $1.54/M · ii 34.7
Claude Sonnet 5 (Non-reasoning, High Effort) Anthropic · 57.5 tok/s · $1.54/M · ii 28.9
Trinity Large Thinking Arcee AI · 309.7 tok/s · $0.182/M · ii 10.9
Seed 2.1 Turbo ByteDance Seed · — tok/s · —/M · ii —
Seed-OSS-36B-Instruct ByteDance Seed · 36.4 tok/s · $0.246/M · ii 12.1
Celeris-1 Celeris · 1411.9 tok/s · $0.25/M · ii 6.3
Command A Cohere · 62.6 tok/s · $3.25/M · ii 7
Command A+ Cohere · 247.8 tok/s · $0/M · ii 13.9
North Mini Code Cohere · 82.5 tok/s · $0/M · ii 12.8
Ornith-1.0-35B DeepReinforce AI · — tok/s · —/M · ii —
Ornith-1.5-35B-A3B DeepReinforce AI · — tok/s · —/M · ii —
DeepSeek R1 Distill Llama 70B DeepSeek · 22.8 tok/s · $0.74/M · ii 7.9
DeepSeek V4 Flash 0731 (Reasoning, Max Effort) DeepSeek · 210.1 tok/s · $0.227/M · ii 34.5
DeepSeek V4 Flash Vision (Reasoning, Max Effort) DeepSeek · 217.1 tok/s · $0.227/M · ii 35
DeepSeek V4 Pro (Non-reasoning) DeepSeek · 66.9 tok/s · $0.474/M · ii 20.8
DeepSeek V4 Pro (Reasoning, High Effort) DeepSeek · 65 tok/s · $0.474/M · ii 30.1
DeepSeek V4 Pro (Reasoning, Max Effort) DeepSeek · 64.7 tok/s · $0.474/M · ii 30.9
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) DeepSeek · 72.3 tok/s · $0.688/M · ii 36.3
DeepSeek V4.1 Flash (Reasoning, Max Effort) DeepSeek · 217.1 tok/s · $0.187/M · ii 39.5
Gemini 2.5 Flash (Non-reasoning) Google · 188.4 tok/s · $0.331/M · ii 9.9
Gemini 2.5 Flash (Reasoning) Google · 211.7 tok/s · $0.331/M · ii 13.1
Gemini 2.5 Flash-Lite (Non-reasoning) Google · 271.5 tok/s · $0.067/M · ii 6.7
Gemini 2.5 Flash-Lite (Reasoning) Google · 334 tok/s · $0.067/M · ii 8.5
Gemini 2.5 Pro Google · 122.7 tok/s · $1.341/M · ii 16.7
Gemini 3 Flash Preview (Non-reasoning) Google · 193 tok/s · $0.435/M · ii 17.9
Gemini 3 Flash Preview (Reasoning) Google · 185 tok/s · $0.435/M · ii 26.3
Gemini 3.1 Flash-Lite Google · 287.6 tok/s · $0.221/M · ii 16
Gemini 3.1 Pro Preview Google · 109.6 tok/s · $1.74/M · ii 30.4
Gemini 3.5 Flash (high) Google · 211.9 tok/s · $1.305/M · ii 33
Gemini 3.5 Flash (medium) Google · 224 tok/s · $1.305/M · ii 33.6
Gemini 3.5 Flash (minimal) Google · 205.1 tok/s · $1.305/M · ii 23.8
Gemini 3.5 Flash-Lite Google · 320.2 tok/s · $0.331/M · ii 22.7
Gemini 3.6 Flash (high) Google · 195.3 tok/s · $0.63/M · ii 34.3
Gemini 3.7 Flash (high) Google · 287.8 tok/s · $0.574/M · ii 39.4
Gemini 3.7 Flash (low) Google · 273.3 tok/s · $0.574/M · ii 36.9
Gemini 3.7 Flash (medium) Google · 272.5 tok/s · $0.574/M · ii 39.6
Gemini 3.8 Flash (high) Google · 261.3 tok/s · $0.574/M · ii 41.2
Gemma 4 12B (Non-reasoning) Google · 102.6 tok/s · $0.12/M · ii 9.4
Gemma 4 12B (Reasoning) Google · 106.5 tok/s · $0.12/M · ii 14.2
Gemma 4 26B A4B (Non-reasoning) Google · 75.4 tok/s · $0.157/M · ii 13.1
Gemma 4 31B (Non-reasoning) Google · 48.6 tok/s · $0.166/M · ii 13.9
Gemma 4 31B (Reasoning) Google · 35.5 tok/s · $0/M · ii 15.4
Gemma 4 E4B (Non-reasoning) Google · 42.5 tok/s · $0.028/M · ii 7.5
Gemma 4 E4B (Reasoning) Google · 42.8 tok/s · $0.028/M · ii 8.9
Granite 3.3 8B (Non-reasoning) IBM · 40.3 tok/s · $0.052/M · ii 4.9
Granite 4.0 H Small IBM · 27.1 tok/s · $0.079/M · ii 6
Granite 4.1 8B IBM · 115.2 tok/s · $0.055/M · ii 6.6
Granite 4.2 30B IBM · 76.8 tok/s · $0.125/M · ii 14.8
Granite 4.2 3B IBM · 213.8 tok/s · $0.025/M · ii 9.1
Granite 4.2 8B IBM · 84 tok/s · $0.044/M · ii 11.8
Mercury 2 Inception · 807.4 tok/s · $0.146/M · ii 11.5
Ling 3.0 Flash InclusionAI · 307.1 tok/s · $0.043/M · ii 24.9
Ling 3.0 Tiny InclusionAI · 161.5 tok/s · $0/M · ii 11.9
Ling-3.0-flash-VL InclusionAI · 144.9 tok/s · $0.008/M · ii 24.8
Ling-flash-2.0 InclusionAI · 3 tok/s · $0.183/M · ii 7.8
Ring-2.6-1T InclusionAI · 121.4 tok/s · $0.52/M · ii 17.3
Kimi K2 Kimi · 39.2 tok/s · $0.743/M · ii 12.7
Kimi K2 0905 Kimi · 39.9 tok/s · $0.79/M · ii 15.3
Kimi K2 Thinking Kimi · 119.4 tok/s · $0.475/M · ii 22
Kimi K2.6 Kimi · 38.7 tok/s · $0.702/M · ii 31.3
Kimi K2.6 (Non-reasoning) Kimi · 38.4 tok/s · $0.702/M · ii 23.6
Kimi K2.7 Code Kimi · 47.7 tok/s · $0.723/M · ii 26.3
Kimi K3 (low) Kimi · 38.2 tok/s · $2.31/M · ii 34.5
Kimi K3 (max) Kimi · 38.1 tok/s · $2.31/M · ii 43.8
LFM2.5-2.6B Liquid AI · 199.8 tok/s · $0/M · ii 8.4
Llama 3.1 Instruct 70B Meta · 59.5 tok/s · $0.56/M · ii 6.6
Llama 3.1 Instruct 8B Meta · 143.2 tok/s · $0.023/M · ii 6.9
Llama 3.2 Instruct 11B (Vision) Meta · 16.3 tok/s · $0.34/M · ii 5.4
Llama 3.3 Instruct 70B Meta · 85.8 tok/s · $0.666/M · ii 7.7
Llama 4 Maverick Meta · 89.9 tok/s · $0.311/M · ii 9.3
Llama 4 Scout Meta · 107.2 tok/s · $0.239/M · ii 6.5
Muse Glimmer (high) Meta · 92.5 tok/s · $0.248/M · ii 18.1
Muse Spark 1.2 (xhigh) Meta · 174.2 tok/s · $0.78/M · ii 39.8
Muse Spark 1.3 (max) Meta · 205.9 tok/s · $0.78/M · ii 48.2
Muse Spark 1.3 (xhigh) Meta · 206.8 tok/s · $0.78/M · ii 45.2
Phi-4 Microsoft · 40.4 tok/s · $0.167/M · ii 5.9
Phi-4 Mini Instruct Microsoft · 44.4 tok/s · $0/M · ii 6.3
Phi-4 Multimodal Instruct Microsoft · 16.8 tok/s · $0/M · ii 5.8
MiniMax-M2 MiniMax · 80.7 tok/s · $0.39/M · ii 18.6
MiniMax-M2.1 MiniMax · 84.1 tok/s · $0.201/M · ii 20.9
MiniMax-M2.5 MiniMax · 82.3 tok/s · $0.201/M · ii 22.8
MiniMax-M2.7 MiniMax · 56.5 tok/s · $0.222/M · ii 23.2
MiniMax-M3 MiniMax · 87.7 tok/s · $0.222/M · ii 29.6
Devstral 2 Mistral · 145.7 tok/s · $0/M · ii 9.4
Devstral Small 2 Mistral · 135.7 tok/s · $0/M · ii 8.4
Ministral 3 14B Mistral · 90.1 tok/s · $0.2/M · ii 6
Ministral 3 3B Mistral · 177.7 tok/s · $0.1/M · ii 4.8
Ministral 3 8B Mistral · 85.7 tok/s · $0.15/M · ii 5.5
Mistral 7B Instruct Mistral · 82.1 tok/s · $0.25/M · ii 5
Mistral Large 3 Mistral · 73.8 tok/s · $0.6/M · ii 9.7
Mistral Medium Mistral · 140.8 tok/s · $2.1/M · ii 5.5
Mistral Medium 3 Mistral · 146.4 tok/s · $0.308/M · ii 9
Mistral Medium 3.1 Mistral · 140 tok/s · $0.308/M · ii 9.9
Mistral Medium 3.5 Mistral · 151.4 tok/s · $1.155/M · ii 14.9
Mistral Small (Feb '24) Mistral · 142.1 tok/s · $0.195/M · ii 5.5
Mistral Small (Sep '24) Mistral · 140.9 tok/s · $0.24/M · ii 5.8
Mistral Small 3 Mistral · 146.2 tok/s · $0.12/M · ii 6.7
Mistral Small 3.1 Mistral · 137.7 tok/s · $0.12/M · ii 7.4
Mistral Small 3.2 Mistral · 149.1 tok/s · $0.12/M · ii 7
Mistral Small 4 (Non-reasoning) Mistral · 144.6 tok/s · $0.195/M · ii 9
Mistral Small 4 (Reasoning) Mistral · 154.8 tok/s · $0.195/M · ii 11.5
HyperNova 60B 2605 (high, based on gpt-oss-120b) Multiverse Computing · 360.5 tok/s · $0.05/M · ii 11.7
Quasar 438B (max, based on GLM-5.2) Multiverse Computing · 177.7 tok/s · $0.72/M · ii 27.1
Hermes 3 - Llama-3.1 70B Nous Research · 29.5 tok/s · $0.7/M · ii 6
Hermes 4 - Llama-3.1 405B (Non-reasoning) Nous Research · 43.3 tok/s · $1.2/M · ii 7.4
Hermes 4 - Llama-3.1 405B (Reasoning) Nous Research · 43.1 tok/s · $1.2/M · ii 7.5
Llama 3.1 Nemotron Instruct 70B NVIDIA · 56.8 tok/s · $1.2/M · ii 6.9
Llama Nemotron Super 49B v1.5 (Non-reasoning) NVIDIA · 42.4 tok/s · $0.4/M · ii 7.4
Llama Nemotron Super 49B v1.5 (Reasoning) NVIDIA · 57.5 tok/s · $0.4/M · ii 9
Nemotron 3 Super 120B A12B (Reasoning) NVIDIA · 154.7 tok/s · $0.236/M · ii 13.6
Nemotron 3 Ultra 550B A55B (Reasoning) NVIDIA · 160.4 tok/s · $0.52/M · ii 23.4
Nemotron 3.5 Lightning NVIDIA · 288.1 tok/s · $0.067/M · ii 13.6
NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) NVIDIA · 159.3 tok/s · $0.065/M · ii 6.8
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) NVIDIA · 239.5 tok/s · $0.065/M · ii 8.9
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) NVIDIA · 77.7 tok/s · $0.24/M · ii 5.8
NVIDIA Nemotron Nano 12B v2 VL (Reasoning) NVIDIA · 53.4 tok/s · $0.24/M · ii 7.5
NVIDIA Nemotron Nano 9B V2 (Non-reasoning) NVIDIA · 151.2 tok/s · $0.065/M · ii 6.8
NVIDIA Nemotron Nano 9B V2 (Reasoning) NVIDIA · 105.7 tok/s · $0.052/M · ii 7.4
GPT-4 Turbo OpenAI · 31.1 tok/s · $12/M · ii 7
GPT-4.1 OpenAI · 151.1 tok/s · $1.55/M · ii 12.7
GPT-4.1 mini OpenAI · 106.2 tok/s · $0.31/M · ii 10.2
GPT-4.1 nano OpenAI · 116.7 tok/s · $0.081/M · ii 7.8
GPT-4o (Aug '24) OpenAI · 88.5 tok/s · $2.375/M · ii 7.7
GPT-4o (May '24) OpenAI · 100.4 tok/s · $6/M · ii 7.3
GPT-4o (Nov '24) OpenAI · 138.7 tok/s · $2.55/M · ii 8.4
GPT-4o mini OpenAI · 150.9 tok/s · $0.139/M · ii 6.7
GPT-5 (high) OpenAI · 90.9 tok/s · $1.341/M · ii 23
GPT-5 (low) OpenAI · 74.6 tok/s · $1.341/M · ii 20.8
GPT-5 (medium) OpenAI · 68.9 tok/s · $1.341/M · ii 22.9
GPT-5 (minimal) OpenAI · 76.8 tok/s · $1.341/M · ii 11.4
GPT-5 mini (high) OpenAI · 70.9 tok/s · $0.271/M · ii 17.4
GPT-5 mini (medium) OpenAI · 86.1 tok/s · $0.271/M · ii 20.6
GPT-5 mini (minimal) OpenAI · 75.3 tok/s · $0.271/M · ii 9.9
GPT-5 nano (high) OpenAI · 150.7 tok/s · $0.057/M · ii 13
GPT-5 nano (medium) OpenAI · 130.9 tok/s · $0.057/M · ii 12.5
GPT-5 nano (minimal) OpenAI · 161.7 tok/s · $0.057/M · ii 7.1
GPT-5.1 (high) OpenAI · 99.5 tok/s · $1.341/M · ii 24.7
GPT-5.1 (Non-reasoning) OpenAI · 107.6 tok/s · $1.341/M · ii 13.3
GPT-5.2 (Non-reasoning) OpenAI · 61.3 tok/s · $1.869/M · ii 17
GPT-5.2 (xhigh) OpenAI · 64.7 tok/s · $1.869/M · ii 30.4
GPT-5.3 Codex (xhigh) OpenAI · 127.2 tok/s · $1.869/M · ii 32.5
GPT-5.4 (low) OpenAI · 90.6 tok/s · $2.175/M · ii 27.6
GPT-5.4 (Non-reasoning) OpenAI · 92.1 tok/s · $2.175/M · ii 18.2
GPT-5.4 (xhigh) OpenAI · 131.5 tok/s · $2.175/M · ii 39
GPT-5.4 mini (medium) OpenAI · 175.2 tok/s · $0.649/M · ii 19.7
GPT-5.4 mini (Non-Reasoning) OpenAI · 145.3 tok/s · $0.649/M · ii 11.1
GPT-5.4 mini (xhigh) OpenAI · 186.3 tok/s · $0.649/M · ii 24.6
GPT-5.4 nano (medium) OpenAI · 161.5 tok/s · $0.179/M · ii 20
GPT-5.4 nano (Non-Reasoning) OpenAI · 164.4 tok/s · $0.179/M · ii 11.7
GPT-5.4 nano (xhigh) OpenAI · 154.2 tok/s · $0.179/M · ii 21.2
GPT-5.5 (high) OpenAI · 80.5 tok/s · $4.35/M · ii 37.3
GPT-5.5 (low) OpenAI · 82.3 tok/s · $4.35/M · ii 30.7
GPT-5.5 (medium) OpenAI · 73.1 tok/s · $4.35/M · ii 34.2
GPT-5.5 (Non-reasoning) OpenAI · 77.9 tok/s · $4.35/M · ii 23.2
GPT-5.5 (xhigh) OpenAI · 79.7 tok/s · $4.35/M · ii 38.6
GPT-5.5 Instant (June 2026) OpenAI · 130.8 tok/s · $4.35/M · ii 26.8
GPT-5.6 Luna (high) OpenAI · 101.2 tok/s · $0.174/M · ii 32.4
GPT-5.6 Luna (low) OpenAI · 105.4 tok/s · $0.174/M · ii 21.5
GPT-5.6 Luna (medium) OpenAI · 104.4 tok/s · $0.174/M · ii 25.5
GPT-5.6 Luna (Non-reasoning) OpenAI · 104.3 tok/s · $0.174/M · ii 16.8
GPT-5.6 Luna (xhigh) OpenAI · 108.3 tok/s · $0.174/M · ii 34.8
GPT-5.6 Sol (high) OpenAI · 60.7 tok/s · $3.08/M · ii 42.5
GPT-5.6 Sol (low) OpenAI · 56.3 tok/s · $3.08/M · ii 33.8
GPT-5.6 Sol (medium) OpenAI · 56.6 tok/s · $3.08/M · ii 39.5
GPT-5.6 Sol (Non-reasoning) OpenAI · 61.7 tok/s · $3.08/M · ii 28.3
GPT-5.6 Sol (xhigh) OpenAI · 61.1 tok/s · $3.08/M · ii 44.1
GPT-5.6 Terra (high) OpenAI · 79.1 tok/s · $1.74/M · ii 34.5
GPT-5.6 Terra (low) OpenAI · 81.1 tok/s · $1.74/M · ii 27.9
GPT-5.6 Terra (medium) OpenAI · 85.4 tok/s · $1.74/M · ii 30.4
GPT-5.6 Terra (Non-reasoning) OpenAI · 85.2 tok/s · $1.74/M · ii 22.3
GPT-5.6 Terra (xhigh) OpenAI · 82.6 tok/s · $1.74/M · ii 38.2
GPT-6 Astra (high) OpenAI · 49.8 tok/s · $7.7/M · ii 51
GPT-6 Astra (low) OpenAI · 52.1 tok/s · $7.7/M · ii 46
GPT-6 Astra (medium) OpenAI · 50 tok/s · $7.7/M · ii 49.7
GPT-6 Astra (xhigh) OpenAI · 51.1 tok/s · $7.7/M · ii 52.5
gpt-oss-120b (high) OpenAI · 187.1 tok/s · $0.18/M · ii 12.3
gpt-oss-120b (low) OpenAI · 205.8 tok/s · $0.189/M · ii 10.2
gpt-oss-20b (high) OpenAI · 213.8 tok/s · $0.052/M · ii 9
gpt-oss-20b (low) OpenAI · 243.7 tok/s · $0.083/M · ii 10
o3 OpenAI · 107 tok/s · $1.55/M · ii 20.2
o3-mini OpenAI · 219.1 tok/s · $1.045/M · ii 12.5
o3-mini (high) OpenAI · 220.5 tok/s · $1.045/M · ii 11
o4-mini (high) OpenAI · 135.6 tok/s · $0.856/M · ii 16.7
Agnes 2.5 Pro Alpha Sapiens AI · 169.3 tok/s · $0.187/M · ii 27.8
Agnes 3.0 Flash Sapiens AI · 252.7 tok/s · $0.032/M · ii 35.5
Grok 3 mini Reasoning (high) SpaceXAI · 61.5 tok/s · $0.159/M · ii 14.6
Grok 4.20 0309 v2 (Non-reasoning) SpaceXAI · 94.3 tok/s · $0.64/M · ii 14.2
Grok 4.20 0309 v2 (Reasoning) SpaceXAI · 100.5 tok/s · $0.64/M · ii 25.7
Grok 4.3 (high) SpaceXAI · 119.3 tok/s · $0.64/M · ii 25.4
Grok 4.3 (low) SpaceXAI · 106 tok/s · $0.64/M · ii 24.3
Grok 4.3 (medium) SpaceXAI · 120.2 tok/s · $0.64/M · ii 24.8
Grok 4.3 (Non-reasoning) SpaceXAI · 113.3 tok/s · $0.64/M · ii 14.5
Grok 4.5 (high) SpaceXAI · 54.8 tok/s · $1.21/M · ii 39.1
Grok 4.6 (high) SpaceXAI · 53.6 tok/s · $1.35/M · ii 44.4
Grok 4.6 (low) SpaceXAI · 48.6 tok/s · $1.35/M · ii 35.4
Grok 4.6 (medium) SpaceXAI · 50 tok/s · $1.35/M · ii 43
Grok 4.6 (xhigh) SpaceXAI · 54 tok/s · $1.35/M · ii 44.3
Grok Build 0.1 0616 SpaceXAI · 68.1 tok/s · $0.54/M · ii 27.2
Ox Alpha (stealth) Stealth · — tok/s · —/M · ii —
Step 3.5 Flash StepFun · 192.1 tok/s · $0.12/M · ii 16.6
Step 3.5 Flash 2603 StepFun · 183.2 tok/s · $0.064/M · ii 17
Step 3.7 Flash StepFun · 96 tok/s · $0.183/M · ii 19.5
Hy3 Tencent · 84.8 tok/s · $0.104/M · ii 25.8
Inkling (xhigh) Thinking Machines · 76.2 tok/s · $0.724/M · ii 25.5
Inkling Small Thinking Machines · 150.8 tok/s · $0.222/M · ii 26.1
Solar Pro 3 Upstage · 153 tok/s · $0.097/M · ii 7.8
Solar Pro 4 Upstage · 60.9 tok/s · $0.222/M · ii 28.2
MiMo-V2.5 Xiaomi · 45.2 tok/s · $0.154/M · ii 22.3
MiMo-V2.5-Pro Xiaomi · 44.8 tok/s · $0.176/M · ii 26.4
MiMo-V2.5-Pro (Non-reasoning) Xiaomi · 36.4 tok/s · $0.474/M · ii 18.3
GLM-4.5-Air Z AI · 59.2 tok/s · $0.15/M · ii 11.1
GLM-4.5V (Non-reasoning) Z AI · 34 tok/s · $0.377/M · ii 6.7
GLM-4.5V (Reasoning) Z AI · 35.7 tok/s · $0.72/M · ii 7.6
GLM-4.6 (Non-reasoning) Z AI · 36.9 tok/s · $0.39/M · ii 14.9
GLM-4.6 (Reasoning) Z AI · 27.1 tok/s · $0.715/M · ii 18.5
GLM-4.6V (Non-reasoning) Z AI · 58.8 tok/s · $0.189/M · ii 8.4
GLM-4.6V (Reasoning) Z AI · 64.9 tok/s · $0.36/M · ii 11.2
GLM-4.7 (Non-reasoning) Z AI · 84.8 tok/s · $0.711/M · ii 17.4
GLM-4.7 (Reasoning) Z AI · 84.6 tok/s · $0.76/M · ii 22.2
GLM-4.7-Flash (Non-reasoning) Z AI · 89.2 tok/s · $0.103/M · ii 10.6
GLM-4.7-Flash (Reasoning) Z AI · 79.6 tok/s · $0.103/M · ii 14.9
GLM-5 (Non-reasoning) Z AI · 57.6 tok/s · $0.66/M · ii 21.8
GLM-5 (Reasoning) Z AI · 73.2 tok/s · $0.66/M · ii 27.9
GLM-5.1 (Non-reasoning) Z AI · 49.6 tok/s · $0.898/M · ii 24.2
GLM-5.1 (Reasoning) Z AI · 71.2 tok/s · $0.862/M · ii 26.4
GLM-5.2 (max) Z AI · 67.6 tok/s · $0.902/M · ii 38.6
GLM-5.2 (Non-reasoning) Z AI · 129.7 tok/s · $0.902/M · ii 22.4
GLM-5.3 (max) Z AI · 66.1 tok/s · $0.902/M · ii 44.9
GLM-5.3-Flash Z AI · 103.5 tok/s · $0.101/M · ii 41.9
Model names are trademarks of their respective owners. Not affiliated with, endorsed by, or sponsored by any provider or measurement service. Sources, attribution & corrections.