Model comparison

gemma-4-E4B-it-assistant vs gemma-3-270m-it

At Q4_K_M, gemma-4-E4B-it-assistant is the smaller download — 77,231,200 bytes against 253,115,168. At long context the gap widens: gemma-4-E4B-it-assistant's KV cache at 32K is 1.6× smaller, which usually matters more than the difference in weights.

From the file· summed bytes, KV per layer

Side by side

gemma-4-E4B-it-assistantgemma-3-270m-it
Parameters79M268M
Architecturegemma4-assistantgemma3
Layers418
Native context131,07232,768
Mixture of expertsnono
Quantizations published939
Smallest quantization0.07 GiB0.17 GiB
Q4_K_M0.07 GiB0.24 GiB
Licenceapache-2.0gemma

KV cache by context

the term that decides long-context viability
Contextgemma-4-E4B-it-assistantgemma-3-270m-itRatio
4,0960.01 GiB0.03 GiB1.93×
8,1920.02 GiB0.04 GiB1.77×
16,3840.04 GiB0.06 GiB1.66×
32,7680.07 GiB0.11 GiB1.59×
65,5360.13 GiB0.20 GiB1.54×
131,0720.26 GiB0.39 GiB1.52×