Providers/Venice
Venice logo

Venice

Inference providervenice.ai ↗
MODELS
37
ENDPOINTS
37
MIN INPUT
$0.06
MEDIAN BLENDED
$0.637
AVG UPTIME
97.3%
CHEAPEST FOR
5 models
Models on Venice · prices & measurements for models served by Venice’s APIUSD / MTOK · VERIFIED 23 MINUTES AGO
MODELINPUTOUTPUTCONTEXTQUANTTTFTTPSSMOKEVS BEST ELSEWHERE
Z.ai logoGLM 4.7 FlashZ.aiBEST PRICE$0.06$0.40128Kfp81.5s°34° tok/s—cheapest here
Mistral logoMistral Small 3.2 24BMistral$0.094$0.25256Kfp8✕✕—$0.075 elsewhere
DeepSeek logoDeepSeek V4 Flash 0423DeepSeek$0.097$0.1931M—1s°31° tok/s—$0.017 elsewhere
Qwen logoQwen3.6 35B A3BQwen$0.10$1.00256Kfp80.9s°305° tok/s1/5$0.05 elsewhere
Qwen logoQwen3.5-9BQwen$0.10$0.15256Kfp82.1s°149° tok/s—$0.08 elsewhere
Google logoGemma 4 31BGoogle$0.12$0.36256Kfp4✕✕5/5$0.09 elsewhere
DeepSeek logoDeepSeek V4 Flash 0731DeepSeek$0.13$0.261M—✕✕—$0.01 elsewhere
Google logoGemma 4 26B A4B Google$0.13$0.40256Kbf162.1s°62° tok/s—$0.042 elsewhere
Z.ai logoGLM 5.3 FlashZ.ai$0.15$0.501.05M—4.3s°20° tok/s—$0.032 elsewhere
Qwen logoQwen3 235B A22B Instruct 2507Qwen$0.15$0.75128Kfp8✕✕5/5$0.087 elsewhere
Xiaomi logoMiMo-V2.6-FlashXiaomi$0.175$0.351Mfp842.3s°21° tok/s—$0.10 elsewhere
Cognitive Computations logoUncensoredCognitive Computations$0.20$0.90128Kfp161.3s°72° tok/s—only provider
Qwen logoQwen3 VL 235B A22B InstructQwen$0.21$1.90128Kfp81.4s°102° tok/s—$0.20 elsewhere
DeepSeek logoDeepSeek V3.2DeepSeek$0.268$0.39160K—1.4s°31° tok/s—$0.209 elsewhere
MiniMax logoMiniMax M2.5MiniMaxBEST PRICE$0.27$0.95198K—1.2s°58° tok/s2/5cheapest here
DeepSeek logoDeepSeek V4.1 FlashDeepSeek$0.30$1.201Mfp8✕✕—$0.018 elsewhere
MiniMax logoMiniMax M3MiniMax$0.30$1.20524Kfp81s°157° tok/s—$0.23 elsewhere
Qwen logoQwen3.5-35B-A3BQwen$0.313$1.25256K—1.3s°221° tok/s—$0.08 elsewhere
Qwen logoQwen3.6 27BQwen$0.325$3.25256Kfp81.2s°57° tok/s2/5$0.30 elsewhere
Qwen logoQwen3 Coder 480B A35BQwen$0.35$1.50256Kfp80.72s°94° tok/s—$0.22 elsewhere
Xiaomi logoMiMo-V2.5Xiaomi$0.40$2.001Mfp81.1s°19° tok/s—$0.119 elsewhere
Z.ai logoGLM 4.7Z.ai$0.40$1.93198Kfp41.3s°15° tok/s3/5$0.40 elsewhere
Z.ai logoGLM 4.6Z.aiBEST PRICE$0.43$1.75198Kfp4✕✕3/5cheapest here
Qwen logoQwen3.8 27BQwen$0.45$3.20262Kfp81.4s°106° tok/s4/5$0.024 elsewhere
Qwen logoQwen3 235B A22B Thinking 2507Qwen$0.45$3.50128Kfp8✕✕—$0.23 elsewhere
Moonshot AI logoKimi K2.5Moonshot AI$0.532$3.33256K—1.5s°254° tok/s3/5$0.45 elsewhere
NVIDIA logoNemotron 3 UltraNVIDIA$0.625$3.13256Kfp8✕✕—$0.50 elsewhere
Moonshot AI logoKimi K2.7 CodeMoonshot AI$0.75$3.50256Kint42.4s°90° tok/s5/5$0.671 elsewhere
Moonshot AI logoKimi K2.6Moonshot AI$0.75$3.50256Kint4✕✕—$0.465 elsewhere
Qwen logoQwen3.5 397B A17BQwen$0.75$4.50128K—✕✕—$0.39 elsewhere
Z.ai logoGLM 5Z.ai$1.00$3.20198Kfp80.91s°111° tok/s—$0.60 elsewhere
Z.ai logoGLM 5.3Z.ai$1.40$4.401M—0.9s°188° tok/s—$0.039 elsewhere
Z.ai logoGLM 5.2Z.ai$1.40$4.401Mfp8✕✕—$0.03 elsewhere
Z.ai logoGLM 5.1Z.ai$1.40$4.40200Kfp81.3s°39° tok/s—$0.966 elsewhere
DeepSeek logoDeepSeek V4 Pro 0813DeepSeek$1.65$4.951M—1.2s°85° tok/s—$0.158 elsewhere
DeepSeek logoDeepSeek V4 Pro 0423DeepSeek$1.65$3.301M—✕✕—$0.30 elsewhere
Qwen logoQwen3.8 2.4T A95BQwenBEST PRICE$2.00$6.00262K—0.96s°155° tok/s3/5cheapest here
TTFT/TPS: ModelIndex-measured medians (P50, trailing 21d) for Venice’s endpoints · ° = measured via OpenRouter routing · ✕ = probed, no measurable stream · SMOKE: of 5 capability probes passed · methodology on each model page