Skip to content
llm-speed

RTX 5090 vs RTX 4090

Signed, community-submitted decode tok/s, prefill, and TTFT for RTX 5090 vs RTX 4090 — every number links to the run it came from.

Verdict

RTX 5090 and RTX 4090 both have submitted runs, but no single model has been measured on both yet — so there is no apples-to-apples row. Each side's measured decode tok/s is listed separately below (peaks of 247 and 195 tok/s). Submit a shared workload to turn this into a direct comparison.

hardware
RTX 5090
NVIDIA Ada/Blackwell · 32 GB VRAM
View RTX 5090 page →
hardware
RTX 4090
NVIDIA Ada/Blackwell · 24 GB VRAM
View RTX 4090 page →

RTX 5090 benchmarks — no shared model with RTX 4090 yet

Modeldecode tok/sWorkloadRun
Qwen2.5-7B-Instruct246.7tok/schat-shortr_3yn-4321hp-
Llama-3.1-8B-Instruct232.2tok/schat-shortr_kfrkg-vn376
Qwen3.6-35B-A3B-Q4_K_M.gguf223.8tok/schat-shortr_10yvku19-xt
Qwen3.6-27B-Q4_K_M.gguf73.31tok/schat-shortr_wax_x2ryqhk
Qwen2.5-Coder-32B-Instruct70.96tok/sconcurrent-decoder_v983y0y3r2u
Qwen3-32B69.45tok/schat-shortr_phvxm9dcak0
gemma-2-9b-it69.45tok/schat-shortr_1_xl4zb5-xj
gpt-oss-20b69.42tok/schat-shortr_r9h57uts9lr
gemma-4-31B-it-Q4_K_M.gguf67.37tok/schat-shortr_plujbqnef08

RTX 4090 benchmarks — no shared model with RTX 5090 yet

Modeldecode tok/sWorkloadRun
gemma3195.0tok/schat-shortr_dlanfbgym0h
qwen3-coder179.9tok/sconcurrent-decoder_wjq32z47vlp
qwen2.5-coder161.1tok/sconcurrent-decoder_mv8n8k9wu1e
llama3.1154.4tok/schat-shortr_h1ub_1uxzdh
gpt-oss141.7tok/schat-longr_iu2sfa9ykvw
deepseek-r1133.8tok/sagent-tracer_fg77v2hhohb
glm-4.7-flash129.9tok/sagent-tracer_o636l3cc-rr
qwen3.644.18tok/sagent-tracer_h_659oy695r

See also: RTX 5090 benchmarks · RTX 4090 benchmarks · All hardware · All models · Methodology