Model Leaderboard
Compare key performance metrics for LLM APIs.
Updated at: 8/14/2026, 7:03:45 PM
| Model | Provider | |||||||
|---|---|---|---|---|---|---|---|---|
GPT-4o-mini (batch) openai | OpenAI | - | $0.08 | 0.49s | 44.0T/s | 100.00% | ||
GPT-4o-mini openai | OpenAI | - | $0.15 | 0.49s | 44.0T/s | 100.00% | ||
Mistral Nemo mistralai | DeepInfra | - | $0.02 | 0.36s | 30.0T/s | 92.64% | ||
Llama 3.1 8B Instruct meta-llama | NovitaAI | - | $0.05 | 0.51s | 63.0T/s | 99.99% | ||
Llama 3.1 70B Instruct meta-llama | Amazon Bedrock | - | $0.40 | 0.44s | 23.0T/s | 99.99% | ||
Nova Micro 1.0 amazon | Amazon Bedrock | - | $0.04 | 0.44s | 153.0T/s | 92.46% | ||
Llama 3.3 70B Instruct meta-llama | SambaNova Turbo | - | $0.10 | 0.68s | 100.0T/s | 99.98% | ||
DeepSeek V3 deepseek | StreamLake | - | $0.27 | 1.24s | 37.0T/s | 99.69% | ||
Gemma 3 27B google | Nebius Token Factory | - | $0.08 | 0.48s | 39.0T/s | 99.04% | ||
Gemma 3 12B google | DeepInfra | - | $0.05 | 0.34s | 31.0T/s | 58.33% | ||
Llama 4 Scout meta-llama | Groq | - | $0.10 | 0.33s | 179.0T/s | 99.47% | ||
Llama 4 Maverick meta-llama | Google Vertex | - | $0.21 | 0.79s | 99.0T/s | 99.93% | ||
GPT-4.1 Nano (batch) openai | Azure | - | $0.05 | 0.81s | 73.0T/s | 99.99% | ||
GPT-4.1 Nano openai | Azure | - | $0.10 | 0.81s | 73.0T/s | 99.99% | ||
GPT-4.1 Mini (batch) openai | Azure (EU) | - | $0.21 | 0.42s | 61.0T/s | 100.00% | ||
GPT-4.1 Mini openai | Azure (EU) | - | $0.41 | 0.42s | 61.0T/s | 100.00% | ||
GPT-4.1 (batch) openai | Azure (EU) | - | $1.03 | 0.66s | 86.0T/s | 99.98% | ||
GPT-4.1 openai | Azure (EU) | - | $2.06 | 0.66s | 86.0T/s | 99.98% | ||
Qwen3 32B qwen | Groq | - | $0.08 | 0.38s | 130.5T/s | 99.85% | ||
Gemini 2.5 Flash (batch) google | Google Vertex (Global) | - | $0.16 | 0.68s | 84.0T/s | 99.35% | ||
Gemini 2.5 Flash google | Google Vertex (Global) | - | $0.32 | 0.68s | 84.0T/s | 99.35% | ||
Mistral Small 3.2 24B mistralai | DeepInfra | - | $0.10 | 0.37s | 30.0T/s | 98.19% | ||
Qwen3 235B A22B Instruct 2507 qwen | Nebius Token Factory | - | $0.09 | 0.45s | 49.0T/s | 99.51% | ||
Gemini 2.5 Flash Lite (batch) google | Google AI Studio | - | $0.05 | 0.44s | 144.0T/s | 99.74% | ||
Gemini 2.5 Flash Lite google | Google AI Studio | - | $0.10 | 0.44s | 144.0T/s | 99.74% | ||
Qwen3 30B A3B Instruct 2507 qwen | CoreWeave | - | $0.05 | 0.44s | 63.0T/s | 99.97% | ||
gpt-oss-20b (free) openai | Groq | - | $0.00 | 0.36s | 443.0T/s | 99.07% | ||
gpt-oss-20b openai | Groq | - | $0.03 | 0.36s | 443.0T/s | 99.07% | ||
gpt-oss-120b openai | Cerebras | - | $0.03 | 0.27s | 752.0T/s | 99.50% | ||
GPT-5 Nano (batch) openai | OpenAI | - | $0.03 | 2.31s | 101.0T/s | 99.47% | ||
GPT-5 Nano openai | OpenAI | - | $0.05 | 2.31s | 101.0T/s | 99.47% | ||
GPT-5 Mini (batch) openai | OpenAI | - | $0.13 | 2.98s | 90.0T/s | 99.30% | ||
GPT-5 Mini openai | OpenAI | - | $0.27 | 2.98s | 90.0T/s | 99.30% | ||
DeepSeek V3.1 deepseek | Google Vertex | - | $0.26 | 1.18s | 70.0T/s | 99.99% | ||
Qwen3 VL 8B Instruct qwen | Alibaba Cloud Int. | - | $0.12 | 0.36s | 50.0T/s | 94.20% | ||
Claude Haiku 4.5 (batch) anthropic | Azure | - | $0.52 | 0.72s | 97.0T/s | 100.00% | ||
Claude Haiku 4.5 anthropic | Azure | - | $1.04 | 0.72s | 97.0T/s | 100.00% | ||
DeepSeek V3.2 deepseek | Alibaba Cloud Int. | - | $0.27 | 0.66s | 57.0T/s | 99.83% | ||
Gemini 3 Flash Preview (batch) google | Google AI Studio | - | $0.26 | 0.96s | 62.0T/s | 99.89% | ||
Gemini 3 Flash Preview google | Google AI Studio | - | $0.52 | 0.96s | 62.0T/s | 99.89% | ||
Claude Sonnet 4.6 (batch) anthropic | Google Vertex (Global) | - | $1.56 | 1.38s | 50.0T/s | 100.00% | ||
Claude Sonnet 4.6 anthropic | Google Vertex (Global) | - | $3.12 | 1.38s | 50.0T/s | 100.00% | ||
Gemini 3.1 Pro Preview (batch) google | Google AI Studio | - | $1.05 | 3.19s | 111.0T/s | 98.76% | ||
Gemini 3.1 Pro Preview google | Google AI Studio | - | $2.10 | 3.19s | 111.0T/s | 98.76% | ||
Qwen3.5-Flash qwen | Alibaba Cloud Int. | - | $0.07 | 0.52s | 70.0T/s | 100.00% | ||
Gemini 3.1 Flash Lite Preview google | Google AI Studio | - | $0.26 | 0.63s | 96.0T/s | 100.00% | ||
GPT-5.4 (batch) openai | Azure (EU) | - | $1.31 | 2.86s | 60.0T/s | 99.98% | ||
GPT-5.4 openai | Azure (EU) | - | $2.62 | 2.86s | 60.0T/s | 99.98% | ||
GPT-5.4 Mini (batch) openai | OpenAI | - | $0.39 | 0.74s | 59.0T/s | 99.98% | ||
GPT-5.4 Mini openai | OpenAI | - | $0.79 | 0.74s | 59.0T/s | 99.98% | ||
GPT-5.4 Nano (batch) openai | Azure (US) | - | $0.10 | 3.17s | 58.0T/s | 99.91% | ||
GPT-5.4 Nano openai | Azure (US) | - | $0.21 | 3.17s | 58.0T/s | 99.91% | ||
Gemma 4 31B (free) google | ModelRun [by Modular] | - | $0.00 | 0.09s | 167.0T/s | 99.89% | ||
Gemma 4 31B google | ModelRun [by Modular] | - | $0.10 | 0.09s | 167.0T/s | 99.89% | ||
Gemma 4 26B A4B (free) google | Cloudflare | - | $0.00 | 0.50s | 56.0T/s | 99.95% | ||
Gemma 4 26B A4B google | Cloudflare | - | $0.12 | 0.50s | 56.0T/s | 99.95% | ||
Claude Opus 4.7 (batch) anthropic | Google Vertex | - | $2.60 | 0.93s | 63.0T/s | 99.99% | ||
Claude Opus 4.7 anthropic | Google Vertex | - | $5.20 | 0.93s | 63.0T/s | 99.99% | ||
Kimi K2.6 moonshotai | Baseten | - | $0.58 | 4.03s | 147.0T/s | 99.95% | ||
Ling-2.6-flash inclusionai | NovitaAI | - | $0.01 | 0.57s | 86.0T/s | 79.17% | ||
MiMo-V2.5 xiaomi | NovitaAI | - | $0.14 | 1.58s | 59.0T/s | 99.91% | ||
DeepSeek V4 Flash 0423 deepseek | Alibaba Cloud Int. | - | $0.14 | 0.86s | 78.0T/s | 99.65% | ||
DeepSeek V4 Pro deepseek | Baseten | - | $1.19 | 0.42s | 103.0T/s | 99.78% | ||
GPT-5.5 (batch) openai | OpenAI | - | $2.62 | 2.71s | 47.0T/s | 99.95% | ||
GPT-5.5 openai | OpenAI | - | $5.24 | 2.71s | 47.0T/s | 99.95% | ||
Qwen3.6 35B A3B qwen | AkashML | - | $0.16 | 0.79s | 110.0T/s | 99.77% | ||
Grok 4.3 x-ai | SpaceXAI (ZDR) | - | $1.27 | 0.65s | 86.0T/s | 99.96% | ||
Gemini 3.1 Flash Lite (batch) google | Google AI Studio | - | $0.13 | 0.64s | 96.0T/s | 99.92% | ||
Gemini 3.1 Flash Lite google | Google AI Studio | - | $0.26 | 0.64s | 96.0T/s | 99.92% | ||
Gemini 3.5 Flash (batch) google | Google AI Studio | - | $0.79 | 2.13s | 117.5T/s | 99.90% | ||
Gemini 3.5 Flash google | Google AI Studio | - | $1.57 | 2.13s | 117.5T/s | 99.90% | ||
Claude Opus 4.8 (batch) anthropic | Azure (US) | - | $2.60 | 3.57s | 79.0T/s | 99.99% | ||
Claude Opus 4.8 anthropic | Azure (US) | - | $5.20 | 3.57s | 79.0T/s | 99.99% | ||
Step 3.7 Flash stepfun | DeepInfra | - | $0.21 | 0.38s | 130.0T/s | 99.95% | ||
MiniMax M3 (batch) minimax | ModelRun [by Modular] | - | $0.15 | 0.44s | 133.0T/s | 99.70% | ||
MiniMax M3 minimax | ModelRun [by Modular] | - | $0.31 | 0.44s | 133.0T/s | 99.70% | ||
Qwen3.7 Plus qwen | Alibaba Cloud Int. | - | $0.33 | 0.65s | 14.0T/s | 50.00% | ||
GLM 5.2 (batch) z-ai | Crusoe | - | $0.72 | 0.85s | 102.0T/s | 99.96% | ||
GLM 5.2 z-ai | Crusoe | - | $1.22 | 0.85s | 102.0T/s | 99.96% | ||
Claude Sonnet 5 (batch) anthropic | Google Vertex (Europe) | - | $1.04 | 3.47s | 93.0T/s | 99.98% | ||
Claude Sonnet 5 anthropic | Google Vertex (Europe) | - | $2.08 | 3.47s | 93.0T/s | 99.98% | ||
Hy3 tencent | Tencent Cloud | - | $0.14 | 2.11s | 61.0T/s | 99.82% | ||
Grok 4.5 x-ai | SpaceXAI (ZDR) | - | $2.05 | 0.86s | 60.0T/s | 99.98% | ||
GPT-5.6 Sol (batch) openai | Azure (EU) | - | $2.62 | 5.12s | 60.0T/s | 99.80% | ||
GPT-5.6 Sol openai | Azure (EU) | - | $5.24 | 5.12s | 60.0T/s | 99.80% | ||
GPT-5.6 Terra (batch) openai | Azure (US) | - | $1.05 | 0.63s | 76.0T/s | 99.98% | ||
GPT-5.6 Terra openai | Azure (US) | - | $1.05 | 0.63s | 76.0T/s | 99.98% | ||
GPT-5.6 Luna (batch) openai | Amazon Bedrock (US) | - | $0.10 | 0.90s | 115.0T/s | 99.99% | ||
GPT-5.6 Luna openai | Amazon Bedrock (US) | - | $0.10 | 0.90s | 115.0T/s | 99.99% | ||
Kimi K3 moonshotai | Baseten | - | $3.12 | 0.86s | 77.0T/s | 99.48% | ||
Gemini 3.5 Flash Lite (batch) google | Google AI Studio | - | $0.16 | 0.46s | 103.0T/s | 99.94% | ||
Gemini 3.5 Flash Lite google | Google AI Studio | - | $0.32 | 0.46s | 103.0T/s | 99.94% | ||
Gemini 3.6 Flash (batch) google | Google Vertex | - | $0.39 | 1.80s | 83.0T/s | 97.46% | ||
Gemini 3.6 Flash google | Google Vertex | - | $0.78 | 1.80s | 83.0T/s | 97.46% | ||
Ling-3.0-flash inclusionai | NovitaAI | - | $0.02 | 0.72s | 64.0T/s | 87.54% | ||
Claude Opus 5 (batch) anthropic | Google Vertex (Europe) | - | $2.60 | 1.36s | 71.0T/s | 97.28% | ||
Claude Opus 5 anthropic | Google Vertex (Europe) | - | $5.20 | 1.36s | 71.0T/s | 97.28% | ||
Qwen3.7 Flash qwen | Alibaba Cloud Int. | - | $0.03 | 0.84s | 21.0T/s | 100.00% | ||
DeepSeek V4 Flash 0731 deepseek | Wafer Fast | - | $0.14 | 0.84s | 166.0T/s | 99.52% | ||
Grok 4.6 x-ai | SpaceXAI (ZDR) | - | $2.05 | 1.35s | 56.0T/s | 99.90% | ||
DeepSeek V4 Pro 0813 deepseek | Baseten | - | $0.44 | 0.84s | 98.0T/s | 99.66% | ||
Gemini 3.7 Flash (batch) google | Google AI Studio | - | $0.20 | 1.76s | 194.0T/s | 99.97% | ||
Gemini 3.7 Flash google | Google AI Studio | - | $0.39 | 1.76s | 194.0T/s | 99.97% | ||
GPT-4o (batch) openai | OpenAI | - | $1.29 | 0.52s | 49.0T/s | 99.98% | ||
GPT-4o openai | OpenAI | - | $2.58 | 0.52s | 49.0T/s | 99.98% | ||
GPT-4o-mini (2024-07-18) openai | OpenAI | - | $0.15 | 0.51s | 13.0T/s | 95.82% | ||
Qwen2.5 7B Instruct qwen | Together | - | $0.10 | 0.28s | 56.0T/s | 99.52% | ||
Gemma 3 4B google | DeepInfra | - | $0.05 | 0.55s | 22.0T/s | 20.83% | ||
DeepSeek V3 0324 deepseek | Crusoe | - | $0.28 | 0.37s | 33.0T/s | 98.64% | ||
Llama Guard 4 12B meta-llama | Together | - | $0.18 | 0.17s | 11.0T/s | 99.55% | ||
Gemini 2.5 Pro (batch) google | Google Vertex (Global) | - | $0.67 | 2.23s | 86.0T/s | 97.55% | ||
Gemini 2.5 Pro google | Google Vertex (Global) | - | $1.33 | 2.23s | 86.0T/s | 97.55% | ||
Claude Sonnet 4.5 (batch) anthropic | Claude Platform on AWS | - | $1.56 | 2.64s | 48.0T/s | 99.99% | ||
Claude Sonnet 4.5 anthropic | Claude Platform on AWS | - | $3.12 | 2.64s | 48.0T/s | 99.99% | ||
Qwen3 VL 30B A3B Instruct qwen | Alibaba Cloud Int. | - | $0.13 | 0.55s | 27.0T/s | 99.89% | ||
Qwen3 VL 32B Instruct qwen | Alibaba Cloud Int. | - | $0.11 | 1.04s | 44.0T/s | 29.17% | ||
GLM 4.7 Flash z-ai | Venice | - | $0.06 | 0.78s | 56.0T/s | 99.98% | ||
Kimi K2.5 moonshotai | Venice | - | $0.59 | 0.82s | 57.0T/s | 99.94% | ||
Claude Opus 4.6 (batch) anthropic | Google Vertex | - | $2.60 | 1.73s | 38.0T/s | 99.99% | ||
Claude Opus 4.6 anthropic | Google Vertex | - | $5.20 | 1.73s | 38.0T/s | 99.99% | ||
Qwen3.5 397B A17B qwen | AtlasCloud | - | $0.41 | 1.50s | 71.0T/s | 89.89% | ||
Qwen3.5-9B qwen | Venice | - | $0.10 | 0.76s | 109.0T/s | 99.10% | ||
MiniMax M2.7 minimax | Groq | - | $0.31 | 0.26s | 271.0T/s | 99.33% | ||
MiMo-V2.5-Pro xiaomi | DeepInfra | - | $0.44 | 0.38s | 95.0T/s | 99.69% | ||
GPT-5.6 Luna Pro (batch) openai | OpenAI | - | $0.10 | 9.51s | 119.0T/s | 99.98% | ||
GPT-5.6 Luna Pro openai | OpenAI | - | $0.10 | 9.51s | 119.0T/s | 99.98% | ||
Qwen3.8 Max qwen | Alibaba Cloud Int. | - | $2.05 | 1.54s | 47.0T/s | 45.83% | ||
Solar Pro 4 upstage | Upstage | - | $0.03 | 0.79s | 58.0T/s | 4.17% | ||
GPT-4o (2024-08-06) openai | OpenAI | - | $2.58 | 1.56s | 21.0T/s | 100.00% | ||
Llama 3 8B Lunaris sao10k | DeepInfra (Turbo) | - | $0.04 | 0.17s | 74.0T/s | 99.99% | ||
Qwen2.5 72B Instruct qwen | DeepInfra | - | $0.36 | 0.29s | 25.0T/s | 99.47% | ||
Llama 3.2 3B Instruct meta-llama | Parasail | - | $0.05 | 0.39s | 67.0T/s | 99.99% | ||
Sonar perplexity | Perplexity | - | $1.01 | 2.08s | 57.0T/s | 100.00% | ||
Mistral Small 3 mistralai | DeepInfra | - | $0.05 | 0.24s | 49.0T/s | 25.00% | ||
Qwen2.5 VL 72B Instruct qwen | Parasail | - | $0.26 | 1.18s | 18.0T/s | 88.88% | ||
Qwen3 14B qwen | Alibaba Cloud Int. | - | $0.12 | 0.22s | 61.5T/s | 99.98% | ||
Qwen3 8B qwen | Alibaba Cloud Int. | - | $0.12 | 0.61s | 57.0T/s | - | ||
Gemma 3n 4B google | Together | - | $0.06 | 0.25s | 37.0T/s | 99.01% | ||
Claude Sonnet 4 anthropic | Amazon Bedrock | - | $3.12 | 0.99s | 49.0T/s | 99.98% | ||
GPT-5 (batch) openai | Azure | - | $0.67 | 8.41s | 64.0T/s | 99.99% | ||
GPT-5 openai | Azure | - | $1.33 | 8.41s | 64.0T/s | 99.99% | ||
Kimi K2 0905 moonshotai | NovitaAI | - | $0.62 | 0.67s | 22.0T/s | - | ||
Qwen3 Next 80B A3B Instruct qwen | Google Vertex | - | $0.11 | 0.49s | 28.0T/s | 99.85% | ||
Qwen3 VL 235B A22B Instruct qwen | Alibaba Cloud Int. | - | $0.27 | 0.70s | 37.0T/s | 99.64% | ||
DeepSeek V3.2 Exp deepseek | AtlasCloud | - | $0.27 | 2.23s | 31.0T/s | 99.96% | ||
Nano Banana (Gemini 2.5 Flash Image) google | Google AI Studio | - | $0.32 | 0.68s | 177.0T/s | 100.00% | ||
gpt-oss-safeguard-20b openai | Groq | - | $0.08 | 0.30s | 349.0T/s | 100.00% | ||
GPT-5.1 (batch) openai | Azure | - | $0.67 | 1.91s | 73.0T/s | 99.99% | ||
GPT-5.1 openai | Azure | - | $1.33 | 1.91s | 73.0T/s | 99.99% | ||
Mistral Large 3 2512 mistralai | Mistral | - | $0.51 | 0.57s | 43.0T/s | 91.67% | ||
Ministral 3 3B 2512 mistralai | Mistral | - | $0.10 | 0.28s | 57.0T/s | - | ||
Ministral 3 8B 2512 mistralai | Mistral | - | $0.15 | 0.29s | 53.0T/s | 4.17% | ||
Ministral 3 14B 2512 mistralai | Mistral | - | $0.20 | 0.26s | 69.0T/s | - | ||
GPT-5.2 (batch) openai | OpenAI | - | $0.93 | 1.25s | 43.0T/s | 99.97% | ||
GPT-5.2 openai | OpenAI | - | $1.86 | 1.25s | 43.0T/s | 99.97% | ||
Nemotron 3 Nano 30B A3B (free) nvidia | Crusoe | - | $0.00 | 0.28s | 259.5T/s | 99.94% | ||
Nemotron 3 Nano 30B A3B nvidia | Crusoe | - | $0.05 | 0.28s | 259.5T/s | 99.94% | ||
GLM 4.7 z-ai | Cerebras | - | $0.41 | 0.27s | 478.5T/s | 99.93% | ||
Seed 1.6 Flash bytedance-seed | Seed | - | $0.08 | 0.85s | 56.0T/s | - | ||
GLM 5 z-ai | StreamLake | - | $0.97 | 1.72s | 70.0T/s | 99.87% | ||
MiniMax M2.5 minimax | Nebius Token Factory | - | $0.23 | 0.75s | 89.0T/s | 99.98% | ||
Qwen3.5 Plus 2026-02-15 qwen | Alibaba Cloud Int. | - | $0.27 | 1.98s | 52.0T/s | - | ||
Qwen3.5-122B-A10B qwen | DeepInfra | - | $0.31 | 0.46s | 131.0T/s | 98.75% | ||
Qwen3.5-27B qwen | DeepInfra | - | $0.21 | 0.34s | 44.0T/s | 99.92% | ||
Qwen3.5-35B-A3B qwen | CoreWeave | - | $0.24 | 0.53s | 158.0T/s | 99.91% | ||
Seed-2.0-Mini bytedance-seed | Seed | - | $0.10 | 0.35s | 64.0T/s | - | ||
Mercury 2 inception | Inception | - | $0.26 | 0.45s | 209.0T/s | 20.83% | ||
Mistral Small 4 mistralai | Mistral | - | $0.15 | 0.52s | 98.0T/s | 99.73% | ||
Grok 4.20 x-ai | SpaceXAI (ZDR) | - | $1.27 | 0.68s | 61.0T/s | 99.45% | ||
Qwen3.6 Plus qwen | Alibaba Cloud Int. | - | $0.34 | 0.80s | 39.0T/s | 16.67% | ||
GLM 5.1 z-ai | Parasail | - | $1.44 | 0.74s | 109.0T/s | 99.07% | ||
Hy3 preview tencent | GMICloud | - | $0.06 | 2.39s | 54.0T/s | - | ||
Qwen3.6 27B qwen | CoreWeave | - | $0.63 | 0.24s | 76.0T/s | 99.90% | ||
Qwen3.6 Flash qwen | Alibaba Cloud Int. | - | $0.20 | 0.38s | 65.0T/s | 4.17% | ||
Qwen3.7 Max qwen | Alibaba Cloud Int. | - | $1.51 | 1.29s | 39.0T/s | 100.00% | ||
Nemotron 3 Ultra (free) nvidia | Together | - | $0.00 | 1.50s | 83.0T/s | 99.56% | ||
Nemotron 3 Ultra (batch) nvidia | Together | - | $0.31 | 1.50s | 83.0T/s | 99.56% | ||
Nemotron 3 Ultra nvidia | Together | - | $0.63 | 1.50s | 83.0T/s | 99.56% | ||
Claude Fable 5 (batch) anthropic | Google Vertex | - | $5.20 | 3.36s | 53.0T/s | 98.02% | ||
Claude Fable 5 anthropic | Google Vertex | - | $10.40 | 3.36s | 53.0T/s | 98.02% | ||
Kimi K2.7 Code (batch) moonshotai | Together | - | $0.49 | 0.60s | 151.0T/s | 99.81% | ||
Kimi K2.7 Code moonshotai | Together | - | $0.74 | 0.60s | 151.0T/s | 99.81% | ||
Nano Banana 2 (Gemini 3.1 Flash Image) google | Google AI Studio | - | $0.52 | 8.30s | 170.0T/s | 99.97% | ||
Nex-N2-Mini nex-agi | Nex AGI | - | $0.03 | 1.04s | 52.0T/s | - | ||
GPT-5.6 Sol Pro (batch) openai | Azure (EU) | - | $2.62 | 102.14s | 231.5T/s | 99.57% | ||
GPT-5.6 Sol Pro openai | Azure (EU) | - | $5.24 | 102.14s | 231.5T/s | 99.57% | ||
Inkling (batch) thinkingmachines | Baseten | - | $0.52 | 0.42s | 106.0T/s | 99.68% | ||
Inkling thinkingmachines | Baseten | - | $0.98 | 0.42s | 106.0T/s | 99.68% | ||
Muse Spark 1.2 meta | Meta | - | $1.28 | 16.81s | 110.0T/s | 62.50% | ||
Muse Glimmer 30B meta | DeepInfra | - | $0.36 | 0.26s | 123.0T/s | 99.91% | ||
Nemotron 3.5 Lightning (free) nvidia | Venice | - | $0.00 | 1.30s | 120.0T/s | 99.59% | ||
Nemotron 3.5 Lightning nvidia | Venice | - | $0.10 | 1.30s | 120.0T/s | 99.59% | ||
GPT-3.5 Turbo (batch) openai | OpenAI | - | $0.26 | 0.46s | 19.0T/s | 29.17% | ||
GPT-3.5 Turbo openai | OpenAI | - | $0.51 | 0.46s | 19.0T/s | 29.17% | ||
MythoMax 13B gryphe | Mancer | - | $0.06 | 0.48s | 57.5T/s | 99.99% | ||
Claude 3 Haiku anthropic | Amazon Bedrock | - | $0.26 | 0.48s | 66.0T/s | 87.50% | ||
GPT-4 Turbo (batch) openai | OpenAI | - | $5.12 | 1.31s | 6.0T/s | 20.83% | ||
GPT-4 Turbo openai | OpenAI | - | $10.24 | 1.31s | 6.0T/s | 20.83% | ||
WizardLM-2 8x22B microsoft | NovitaAI | - | $0.62 | 1.11s | 11.0T/s | 25.00% | ||
Hermes 3 405B Instruct nousresearch | DeepInfra | - | $1.01 | 0.42s | 17.0T/s | - | ||
Hermes 3 70B Instruct nousresearch | DeepInfra | - | $0.71 | 0.55s | 22.0T/s | 20.83% | ||
GPT-4o (2024-11-20) openai | OpenAI | - | $2.58 | 0.62s | 31.0T/s | 41.67% | ||
Nova Lite 1.0 amazon | Amazon Bedrock | - | $0.06 | 0.64s | 121.0T/s | 100.00% | ||
Phi 4 microsoft | DeepInfra | - | $0.07 | 0.28s | 74.0T/s | - | ||
R1 deepseek | NovitaAI | - | $0.72 | 1.20s | 19.0T/s | - | ||
Qwen-Plus qwen | Alibaba Cloud Int. | - | $0.27 | 0.51s | 41.0T/s | 8.33% | ||
Sonar Pro perplexity | Perplexity | - | $3.12 | 2.78s | 66.0T/s | 75.00% | ||
Mistral Small 3.1 24B mistralai | Cloudflare | - | $0.36 | 0.44s | 29.0T/s | - | ||
o4 Mini (batch) openai | OpenAI | - | $0.57 | 3.66s | 110.5T/s | 66.67% | ||
o4 Mini openai | OpenAI | - | $1.14 | 3.66s | 110.5T/s | 66.67% | ||
Qwen3 235B A22B qwen | Alibaba Cloud Int. | - | $0.47 | 0.62s | 40.0T/s | 4.17% | ||
Qwen3 30B A3B qwen | Alibaba Cloud Int. | - | $0.12 | 0.41s | 84.0T/s | 96.29% | ||
R1 0528 deepseek | StreamLake | - | $0.52 | 3.63s | 43.0T/s | 99.96% | ||
Uncensored cognitivecomputations | Venice | - | $0.21 | 0.72s | 49.0T/s | 29.17% | ||
Kimi K2 0711 moonshotai | NovitaAI | - | $0.59 | 1.49s | 32.0T/s | - | ||
Qwen3 Coder 480B A35B qwen | Google Vertex | - | $0.31 | 0.93s | 67.5T/s | 99.88% | ||
Qwen3 235B A22B Thinking 2507 qwen | Alibaba Cloud Int. | - | $0.25 | 0.81s | 68.0T/s | 99.64% | ||
GLM 4.5 Air z-ai | NovitaAI | - | $0.14 | 0.86s | 31.0T/s | 99.95% | ||
Qwen3 Coder 30B A3B Instruct qwen | Alibaba Cloud Int. | - | $0.07 | 1.10s | 69.0T/s | 99.98% | ||
Mistral Medium 3.1 mistralai | Mistral | - | $0.42 | 0.37s | 73.0T/s | 58.33% | ||
Hermes 4 405B nousresearch | Nebius Token Factory | - | $1.02 | 0.39s | 29.0T/s | - | ||
Hermes 4 70B nousresearch | Nebius Token Factory | - | $0.13 | 0.23s | 75.0T/s | - | ||
Qwen Plus 0728 (thinking) qwen | Alibaba Cloud Int. | - | $0.41 | 0.80s | 67.0T/s | - | ||
Qwen Plus 0728 qwen | Alibaba Cloud Int. | - | $0.27 | 0.80s | 67.0T/s | - | ||
DeepSeek V3.1 Terminus deepseek | DeepInfra | - | $0.28 | 0.64s | 45.0T/s | 100.00% | ||
Qwen3 Max qwen | Alibaba Cloud Int. | - | $0.81 | 1.06s | 54.0T/s | - | ||
Cydonia 24B V4.1 thedrummer | Parasail | - | $0.30 | 0.77s | 45.0T/s | 95.83% | ||
GLM 4.6 z-ai | Z.ai | - | $0.57 | 3.23s | 44.0T/s | 99.94% | ||
Voxtral Small 24B 2507 mistralai | Mistral | - | $0.10 | 0.40s | 22.0T/s | - | ||
Nova Premier 1.0 amazon | Amazon Bedrock | - | $2.60 | 1.58s | 31.0T/s | 79.17% | ||
Kimi K2 Thinking moonshotai | Google Vertex | - | $0.62 | 0.43s | 94.5T/s | 98.06% | ||
Nano Banana Pro (Gemini 3 Pro Image Preview) google | Google AI Studio | - | $2.10 | 3.28s | 81.0T/s | 62.50% | ||
Claude Opus 4.5 (batch) anthropic | Claude Platform on AWS | - | $2.60 | 1.62s | 47.0T/s | 99.98% | ||
Claude Opus 4.5 anthropic | Claude Platform on AWS | - | $5.20 | 1.62s | 47.0T/s | 99.98% | ||
Nova 2 Lite amazon | Amazon Bedrock | - | $0.32 | 0.47s | 27.0T/s | 100.00% | ||
Step 3.5 Flash stepfun | SiliconFlow | - | $0.10 | 1.22s | 57.0T/s | 4.17% | ||
Qwen3 Coder Next qwen | Alibaba Cloud Int. | - | $0.13 | 0.87s | 136.0T/s | 99.99% | ||
Aion-2.0 aion-labs | AionLabs | - | $0.81 | 1.14s | 53.0T/s | - | ||
GPT-5.3-Codex openai | OpenAI | - | $1.86 | 2.05s | 82.0T/s | 99.75% | ||
Nano Banana 2 (Gemini 3.1 Flash Image Preview) google | Google AI Studio | - | $0.52 | 8.07s | 170.0T/s | 93.84% | ||
Nemotron 3 Super (free) nvidia | Nebius Token Factory | - | $0.00 | 1.01s | 71.5T/s | 96.82% | ||
Nemotron 3 Super nvidia | Nebius Token Factory | - | $0.09 | 1.01s | 71.5T/s | 96.82% | ||
GLM 5 Turbo z-ai | Z.ai | - | $1.23 | 0.94s | 23.0T/s | 12.50% | ||
GLM 5V Turbo z-ai | Z.ai | - | $1.23 | 5.59s | 28.0T/s | 50.00% | ||
GPT-5.4 Image 2 openai | OpenAI | - | $8.12 | 0.41s | 45.0T/s | 75.00% | ||
Mistral Medium 3.5 mistralai | Mistral | - | $1.56 | 0.52s | 102.0T/s | 12.50% | ||
Granite 4.1 8B ibm-granite | CoreWeave | - | $0.05 | 0.20s | 70.0T/s | - | ||
Claude Opus 4.8 (Fast) anthropic | Anthropic | - | $10.40 | 0.90s | 81.0T/s | 54.17% | ||
Nano Banana Pro (Gemini 3 Pro Image) google | Google AI Studio | - | $2.10 | 3.05s | 79.0T/s | 96.47% | ||
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) google | Google AI Studio | - | $0.26 | 2.61s | 472.5T/s | 99.95% | ||
Laguna XS 2.1 (free) poolside | Poolside | - | $0.00 | 0.35s | 120.0T/s | 62.50% | ||
Laguna XS 2.1 poolside | Poolside | - | $0.06 | 0.35s | 120.0T/s | 62.50% | ||
Aion-3.0 aion-labs | AionLabs | - | $3.05 | 1.15s | 55.0T/s | - | ||
Aion-3.0-Mini aion-labs | AionLabs | - | $0.71 | 0.88s | 54.0T/s | - | ||
GPT-5.6 Terra Pro (batch) openai | OpenAI | - | $1.05 | 8.63s | 147.0T/s | 99.90% | ||
GPT-5.6 Terra Pro openai | OpenAI | - | $1.05 | 8.63s | 147.0T/s | 99.90% | ||
Muse Spark 1.1 meta | Meta | - | $1.28 | 3.52s | 156.0T/s | 4.17% | ||
LongCat 2.0 meituan | AtlasCloud | - | $0.31 | 1.74s | 29.0T/s | - | ||
Laguna S 2.1 (free) poolside | Poolside | - | $0.00 | 1.22s | 57.0T/s | 50.00% | ||
Laguna S 2.1 poolside | Poolside | - | $0.09 | 1.22s | 57.0T/s | 50.00% | ||
Claude Opus 5 (Fast) anthropic | Anthropic | - | $10.40 | 3.19s | 52.5T/s | 58.33% | ||
Inkling Small thinkingmachines | DeepInfra | - | $0.46 | 0.47s | 128.5T/s | 99.81% | ||
Qwen3.8 2.4T A95B qwen | Together | - | $2.05 | 1.05s | 132.0T/s | 96.12% | ||
Mistral Large mistralai | Mistral | - | $2.05 | 0.59s | 43.0T/s | 41.67% | ||
GPT-4o (2024-05-13) openai | OpenAI | - | $5.12 | 0.72s | 23.5T/s | 100.00% | ||
Rocinante 12B thedrummer | Parasail | - | $0.25 | 0.94s | 31.0T/s | - | ||
UnslopNemo 12B thedrummer | Parasail | - | $0.40 | 0.68s | 49.0T/s | 100.00% | ||
Qwen2.5 Coder 32B Instruct qwen | Cloudflare | - | $0.67 | 0.45s | 30.5T/s | - | ||
R1 Distill Llama 70B deepseek | NovitaAI | - | $0.81 | 0.83s | 24.0T/s | - | ||
o3 Mini (batch) openai | OpenAI | - | $0.57 | 4.39s | 146.0T/s | 100.00% | ||
o3 Mini openai | OpenAI | - | $1.14 | 4.39s | 146.0T/s | 100.00% | ||
o3 (batch) openai | OpenAI | - | $1.03 | 4.43s | 68.5T/s | 100.00% | ||
o3 openai | OpenAI | - | $2.06 | 4.43s | 68.5T/s | 100.00% | ||
Mistral Medium 3 mistralai | Mistral | - | $0.42 | 1.01s | 20.0T/s | 4.17% | ||
UI-TARS 7B bytedance | Parasail | - | $0.10 | 1.34s | 11.0T/s | - | ||
Codestral 2508 mistralai | Mistral | - | $0.31 | 0.36s | 50.0T/s | - | ||
Jamba Large 1.7 ai21 | AI21 | - | $2.06 | -0.00s | -1.0T/s | - | ||
Qwen3 30B A3B Thinking 2507 qwen | Alibaba Cloud Int. | - | $0.22 | 0.34s | 149.0T/s | - | ||
Qwen3 Coder Flash qwen | Alibaba Cloud Int. | - | $0.20 | 1.69s | 56.0T/s | - | ||
Granite 4.0 Micro ibm-granite | Cloudflare | - | $0.02 | 0.37s | 33.0T/s | - | ||
MiniMax M2 minimax | NovitaAI | - | $0.26 | 1.42s | 60.0T/s | 100.00% | ||
Sonar Pro Search perplexity | Perplexity | - | $3.12 | 3.73s | 83.0T/s | 54.17% | ||
GLM 4.6V z-ai | NovitaAI | - | $0.31 | 12.25s | 33.0T/s | 99.96% | ||
GPT Audio Mini openai | OpenAI | - | $0.62 | 0.54s | 73.0T/s | 20.83% | ||
MiniMax M2-her minimax | MiniMax | - | $0.31 | 0.71s | 27.0T/s | - | ||
Seed-2.0-Lite bytedance-seed | Seed | - | $0.27 | 1.85s | 52.0T/s | - | ||
Trinity Large Thinking arcee-ai | Parasail | - | $0.23 | 0.41s | 139.0T/s | 99.99% | ||
Ling-2.6-1T inclusionai | NovitaAI | - | $0.08 | 0.99s | 42.0T/s | - | ||
GPT Chat Latest openai | OpenAI | - | $5.24 | 0.92s | 56.0T/s | 25.00% | ||
Ring-2.6-1T inclusionai | NovitaAI | - | $0.08 | 2.36s | 67.0T/s | - | ||
Perceptron Mk1 perceptron | Perceptron | - | $0.16 | 3.37s | 22.0T/s | - | ||
KAT-Coder-Air V2.5 kwaipilot | StreamLake | - | $0.15 | 1.72s | 73.0T/s | - |