Gemma 4 E4B

Gemma 4 E4B braucht mit der Variante Q4_0 rund 5,6 GB Speicher und läuft auf 509 von 527 geführten Geräten flüssig.

Mit dem wenigsten Speicher schafft es: Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 1000 Blackwell Laptop GPU, 32 GB.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Anbieter
Google
Parameter
7,5 Mrd.
Längster Kontext
131.072 Token
Lizenz
apache-2.0

So starten Sie es mit Ollama:

$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0

Geräte, auf denen es flüssig läuft

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

GerätUrteilTempoSpeicher
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 1000 Blackwell Laptop GPU, 32 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 1000 Blackwell Laptop GPU, 64 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 2000 Blackwell Laptop GPU, 16 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 2000 Blackwell Laptop GPU, 32 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 2000 Blackwell Laptop GPU, 64 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5060 Laptop GPU, 16 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5060 Laptop GPU, 32 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5060 Laptop GPU, 64 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5070 Laptop GPU, 16 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5070 Laptop GPU, 32 GBLäuft gut56 bis 69 Token/s *8 GB
davon 7,2 GB nutzbar

und 499 weitere

Grafikkarten, in die es ganz passt

GrafikkarteUrteilTempoSpeicher
NVIDIA GeForce RTX 3070 Ti, 8 GBLäuft gut86 bis 105 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 5060, 8 GBLäuft gut65 bis 79 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 5060 Ti, 8 GBLäuft gut65 bis 79 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 3060 Ti, 8 GBLäuft gut65 bis 79 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 3070, 8 GBLäuft gut65 bis 79 Token/s8 GB
davon 7,2 GB nutzbar
AMD Radeon RX 9060 XT, 8 GBLäuft gut38 bis 67 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 4060 Ti, 8 GBLäuft gut43 bis 52 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 4060, 8 GBLäuft gut40 bis 49 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 3080, 10 GBLäuft gut105 bis 129 Token/s10 GB
davon 9,2 GB nutzbar
Intel Arc B570, 10 GBLäuft gut45 bis 78 Token/s10 GB
davon 9,2 GB nutzbar

und 50 weitere

Alle Geräte und Grafikkarten für Gemma 4 E4B

Varianten

VarianteDateiSpeicherbedarfStartbefehl
Q4_04,6 GB5,6 GBollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0
Q8_08,0 GB9,1 GBollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q8_0
BF1615,1 GB16,2 GBollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:BF16

Quelle: https://huggingface.co/ggml-org/gemma-4-E4B-it-GGUF