Llama 3.3 70B
Llama 3.3 70B braucht mit der Variante Q4_K_M rund 45,5 GB Speicher und läuft auf 12 von 527 geführten Geräten flüssig.
Mit dem wenigsten Speicher schafft es: Apple Mac Studio (2026), M5 Ultra mit 64-Kern-GPU, 96 GB.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
- Anbieter
- Meta
- Parameter
- 70,6 Mrd.
- Längster Kontext
- 131.072 Token
- Lizenz
- llama3.3
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_MGeräte, auf denen es flüssig läuft
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
und 2 weitere
Grafikkarten, in die es ganz passt
| Grafikkarte | Urteil | Tempo | Speicher |
|---|---|---|---|
| NVIDIA RTX PRO 5000 Blackwell, 48 GB | Läuft gut | 18 bis 23 Token/s | 48 GB davon 47,2 GB nutzbar |
| NVIDIA RTX 6000 Ada Generation, 48 GB | Läuft gut | 14 bis 17 Token/s | 48 GB davon 47,2 GB nutzbar |
| AMD Radeon PRO W7900, 48 GB | Läuft gut | 10 bis 18 Token/s | 48 GB davon 47,2 GB nutzbar |
| NVIDIA RTX A6000, 48 GB | Läuft gut | 11 bis 14 Token/s | 48 GB davon 47,2 GB nutzbar |
| NVIDIA RTX PRO 6000 Blackwell, 96 GB | Läuft gut | 23 bis 29 Token/s | 96 GB davon 95,2 GB nutzbar |
Alle Geräte und Grafikkarten für Llama 3.3 70B
Varianten
| Variante | Datei | Speicherbedarf | Startbefehl |
|---|---|---|---|
| Q3_K_M | 34,3 GB | 37,1 GB | ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q3_K_M |
| Q4_0 | 40,1 GB | 43,1 GB | ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_0 |
| Q4_K_M | 42,5 GB | 45,5 GB | ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_M |
| Q5_K_M | 49,9 GB | 53,1 GB | ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q5_K_M |
| Q6_K | 57,9 GB | 61,2 GB | ollama run llama3.3:70b-instruct-q6_K |
| Q8_0 | 75,0 GB | 78,6 GB | ollama run llama3.3:70b-instruct-q8_0 |
| BF16 | 141,1 GB | 146,1 GB | ollama run llama3.3:70b-instruct-fp16 |
| F16 | 141,1 GB | 146,1 GB | ollama run llama3.3:70b-instruct-fp16 |
Quelle: https://huggingface.co/unsloth/Llama-3.3-70B-Instruct-GGUF