Static reference pages covering GPU memory requirements for major open-source LLMs. Every number comes from the same engine as the calculator.
1599B params, Compressed recurrent state
158B params, Compressed recurrent state
753B params, Sparse multi-head latent attention
754B params, Sparse multi-head latent attention
1059B params, Multi-head latent attention (MLA)
427B params, Grouped-query attention (GQA)
685B params, Multi-head latent attention (MLA)
685B params, Multi-head latent attention (MLA)
33B params, Hybrid attention (full + sliding-window layers)
358B params, Grouped-query attention (GQA)
120B params, Hybrid attention (full + sliding-window layers)
1059B params, Multi-head latent attention (MLA)
229B params, Grouped-query attention (GQA)
119B params, Multi-head latent attention (MLA)
235B params, Grouped-query attention (GQA)
80B params, Hybrid attention (full + sliding-window layers)