Model VRAM guides

Static reference pages covering GPU memory requirements for major open-source LLMs. Every number comes from the same engine as the calculator.

deepseek-ai/DeepSeek-V4-Pro

1599B params, Compressed recurrent state

View guide →

deepseek-ai/DeepSeek-V4-Flash

158B params, Compressed recurrent state

View guide →

zai-org/GLM-5.2

753B params, Sparse multi-head latent attention

View guide →

zai-org/GLM-5.1

754B params, Sparse multi-head latent attention

View guide →

moonshotai/Kimi-K2.7-Code

1059B params, Multi-head latent attention (MLA)

View guide →

MiniMaxAI/Minimax-M3

427B params, Grouped-query attention (GQA)

View guide →

deepseek-ai/DeepSeek-R1

685B params, Multi-head latent attention (MLA)

View guide →

deepseek-ai/DeepSeek-V3

685B params, Multi-head latent attention (MLA)

View guide →

google/gemma-4-31B-it

33B params, Hybrid attention (full + sliding-window layers)

View guide →

zai-org/GLM-4.7

358B params, Grouped-query attention (GQA)

View guide →

openai/gpt-oss-120b

120B params, Hybrid attention (full + sliding-window layers)

View guide →

moonshotai/Kimi-K2.6

1059B params, Multi-head latent attention (MLA)

View guide →

MiniMaxAI/MiniMax-M2

229B params, Grouped-query attention (GQA)

View guide →

mistralai/Mistral-Small-4-119B-2603

119B params, Multi-head latent attention (MLA)

View guide →

Qwen/Qwen3-235B-A22B

235B params, Grouped-query attention (GQA)

View guide →

Qwen/Qwen3-Coder-Next

80B params, Hybrid attention (full + sliding-window layers)

View guide →