Mac mini für lokale KI: Welche Ausstattung reicht und wann es der Mac Studio sein muss
Beim Mac zählt der Arbeitsspeicher, aber nicht die ganze Zahl. Was die Ausstattungen des Mac mini mit M4, M5 Pro und M6 tragen und wo der Mac Studio anfängt.
Stand: 2026-09-24
Der Mac mini ist ein naheliegender Rechner für lokale KI: klein, leise, und Prozessor und Grafik teilen sich einen Arbeitsspeicher, der bis 64 GB reicht. Eine einzelne Grafikkarte mit so viel Speicher gibt es nur als Profikarte. Die Frage ist deshalb selten, ob ein Mac mini lokale KI kann, sondern welche Ausstattung Sie brauchen: Die Ausstattungen unterscheiden sich im Chip und im Speicher, und beides entscheidet darüber, welche Modelle laufen und wie zügig.
Dieser Text ordnet die Ausstattungen des Mac mini mit M4, M5 Pro und M6 ein und zeigt, wo der Mac Studio anfängt. Alle Zahlen stammen von den Geräteseiten unseres Katalogs, der 527 Geräte führt, darunter 27 Ausstattungen des Mac mini und 37 des Mac Studio. Die Tempowerte dort sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät selbst gemessen.
Beim Mac zählt der Arbeitsspeicher, aber nicht die ganze Zahl
Ein Sprachmodell muss vollständig in einem schnellen Speicher liegen, damit es zügig rechnet. Bei einem Rechner mit Grafikkarte ist das deren Grafikspeicher, beim Mac der gemeinsame Arbeitsspeicher. Den gibt macOS der Grafik aber nur zum Teil frei; wir rechnen bis 36 GB mit zwei Dritteln, darüber mit drei Vierteln. Wie diese Rechnung zustande kommt, erklärt der Ratgeber Lokale KI-Modelle. Die Tabelle nennt die Speichergrößen der Baureihen von 2026.
| Arbeitsspeicher | davon für Modelle nutzbar | gibt es 2026 beim |
|---|---|---|
| 16 GB | 10,7 GB | Mac mini |
| 24 GB | 16,0 GB | Mac mini |
| 32 GB | 21,3 GB | Mac mini |
| 36 GB | 24,0 GB | Mac Studio |
| 48 GB | 36,0 GB | Mac mini, Mac Studio |
| 64 GB | 48,0 GB | Mac mini, Mac Studio |
| 96 GB | 72,0 GB | Mac Studio |
| 128 GB | 96,0 GB | Mac Studio |
| 256 GB | 192,0 GB | Mac Studio |
| 512 GB | 384,0 GB | Mac Studio |
Die zweite Spalte ist die Zahl, an der sich ein Modell messen muss. Ein Mac mini mit 16 GB trägt ein Modell, das 10,7 GB braucht, gerade noch; Qwen3 14B in der verbreiteten Variante Q4_K_M braucht genau so viel. Und die Zahl steht beim Kauf fest: Unser Katalog führt je Chip nur die Speichergrößen, die Apple anbietet, und der Mac mini endet bei 64 GB.
Die Ausstattungen des Mac mini (2026)
Apple bietet den Mac mini seit September 2026 mit zwei Chips an, M6 mit 16 bis 32 GB und M5 Pro mit 24 bis 64 GB. Die Tabelle nennt je Ausstattung, was die Geräteseite beim Ausprobieren, also mit 4.096 Token Kontext, als stärkstes flüssig laufendes Modell ausweist, und wo die Grenze liegt. Der M5 Pro ist mit 16 oder 20 Grafikkernen zu haben; für unsere Rechnung macht das keinen Unterschied, weil beide dieselbe Speicherbandbreite haben.
| Ausstattung | nutzbar | Bandbreite | stärkstes Modell, das flüssig läuft | die Grenze dieses Geräts |
|---|---|---|---|---|
| M6, 16 GB | 10,7 GB | 153 GB/s | Qwen3 14B, 11 bis 15 Token/s | Qwen3 14B läuft noch, Ministral 3 14B scheitert knapp am Speicher |
| M6, 24 GB | 16,0 GB | 170 GB/s | Qwen3 14B, 12 bis 16 Token/s | gpt-oss 20B läuft noch, Mistral Small 3.2 24B nicht mehr, dafür fehlt 1 GB |
| M6, 32 GB | 21,3 GB | 170 GB/s | Qwen3 14B, 12 bis 16 Token/s | Qwen3 30B A3B 2507 läuft noch, Gemma 4 31B nicht mehr, dafür fehlen 0,5 GB |
| M5 Pro, 24 GB | 16,0 GB | 307 GB/s | EuroLLM 22B, 13 bis 17 Token/s | EuroLLM 22B läuft noch, Mistral Small 3.2 24B nicht mehr, dafür fehlt 1 GB |
| M5 Pro, 48 GB | 36,0 GB | 307 GB/s | Gemma 4 31B, 9,2 bis 13 Token/s | Laguna XS 2.1 läuft noch, Llama 3.3 70B nicht mehr, dafür fehlen 9,5 GB |
| M5 Pro, 64 GB | 48,0 GB | 307 GB/s | Gemma 4 31B, 9,2 bis 13 Token/s | Laguna XS 2.1 läuft noch, gpt-oss 120B nicht mehr, dafür fehlen 17 GB |
Ein Token ist ungefähr ein Wortteil. Was die Tabelle je Stufe bedeutet:
16 GB reichen zum Ausprobieren. Qwen3 14B läuft, Ministral 3 14B mit seinen 10,8 GB scheitert knapp. Für Programmieren und Dokumente, die mehr Kontext brauchen, rutscht die Grenze auf Modelle mit 8 bis 12 Milliarden Parametern; die Geräteseite nennt Gemma 4 12B als stärkstes Modell, das dann noch flüssig läuft.
24 GB öffnen die Tür zu gpt-oss 20B. Das Modell braucht 12,8 GB und rechnet auf dem M6 mit rund 32 bis 47 Token je Sekunde, fast dreimal so schnell wie Qwen3 14B auf demselben Gerät. Der Grund ist die Bauart: gpt-oss besteht aus vielen Teilnetzen, sogenannten Experten, von denen je Textstück nur ein Teil rechnet; der Fachbegriff dafür lautet Mixture of Experts. Was das für den Speicher heißt, steht im Ratgeber gpt-oss.
32 GB tragen die 30B-Klasse, aber nicht jede. Qwen3 30B A3B 2507 passt mit 20,1 von 21,3 GB hinein und rechnet mit 30 bis 45 Token je Sekunde; Gemma 4 26B A4B mit 24 bis 36. Mistral Small 3.2 24B passt ebenfalls, ist aber ein dichtes Modell, bei dem für jedes Textstück das ganze Modell rechnet, und kommt auf dem M6 nur auf 7,6 bis 10 Token je Sekunde. Die Geräteseite stuft es deshalb als eingeschränkt ein. Gemma 4 31B passt nicht, dafür fehlen 0,5 GB. Für die 30B-Klasse ist die Frage also weniger, ob das Modell hineinpasst, sondern ob es dicht ist oder aus Experten besteht.
48 GB tragen dichte Modelle bis 31 Milliarden Parameter flüssig. Gemma 4 31B läuft auf dem M5 Pro mit 9,2 bis 13 Token je Sekunde, Laguna XS 2.1 mit 34 bis 50. Llama 3.3 70B braucht 45,5 GB und passt nicht in die 36 GB, die diese Ausstattung nutzbar hat.
64 GB sind die Stufe, auf der 70B-Modelle hineinpassen, aber nicht flüssig laufen. Llama 3.3 70B belegt 45,5 von 48,0 GB und rechnet nach unserer Rechnung mit 4,1 bis 5,6 Token je Sekunde; Apertus 70B 2509 liegt gleichauf. Die Geräteseite stuft beide als eingeschränkt ein. Wer ein 70B-Modell im Alltag nutzen will, ist beim Mac Studio besser aufgehoben, siehe unten. Für Modelle bis zur 30B-Klasse bringt der Schritt von 48 auf 64 GB vor allem Luft für einen längeren Kontext.
Was sich beim Mac mini (2024) mit M4 ändert
Die Speicherstufen sind dieselben: M4 mit 16, 24 oder 32 GB, M4 Pro mit 24, 48 oder 64 GB. Weil der nutzbare Speicher nur von der Speichergröße abhängt, stehen auf den Geräteseiten des Mac mini (2024) beim Ausprobieren dieselben Grenzsätze wie beim Mac mini (2026); bei 32.768 Token Kontext, also beim Auswerten von Dokumenten, weichen sie bei 24, 48 und 64 GB ab, weil ein Modell dort auf dem älteren Chip spürbar langsamer rechnet und die Geräteseite es dann als eingeschränkt einstuft. Was sich ändert, ist das Tempo, und der Unterschied ist kleiner, als der Generationssprung vermuten lässt: Qwen3 14B rechnet auf dem M4 mit 8,8 bis 12 Token je Sekunde, auf dem M6 mit 11 bis 15. Beim Programmieren mit 16.384 Token Kontext kommt Qwen3-Coder 30B A3B auf dem M4 Pro auf 37 bis 54 Token je Sekunde, auf dem M5 Pro auf 41 bis 60.
Der Grund steht in der Spalte Bandbreite: 120 GB/s beim M4 gegen 153 bis 170 beim M6, 273 GB/s beim M4 Pro gegen 307 beim M5 Pro. Wer einen Mac mini mit M4 hat, muss ihn für lokale KI nicht ersetzen; wer neu kauft, sollte das Geld eher in Speicher als in den neueren Chip stecken.
In unserer Rechnung hängt das Tempo an der Bandbreite, nicht an der Kernzahl
In unserer Rechnung entscheidet auf einem Mac der Speicher, ob ein Modell läuft, und die Speicherbandbreite, wie schnell. Das zeigt sich am selben Modell über die Baureihen hinweg: Gemma 4 31B rechnet auf dem Mac mini mit M5 Pro und 64 GB mit 9,2 bis 13 Token je Sekunde, auf dem Mac Studio mit M5 Max und derselben Speichergröße mit 15 bis 20. Der nutzbare Speicher ist in beiden Fällen 48,0 GB; die Bandbreite ist 307 gegen 614 GB/s.
Noch deutlicher wird es beim Programmieren mit Qwen3-Coder 30B A3B: Mac mini mit M5 Pro 41 bis 60 Token je Sekunde, Mac Studio mit M5 Max 69 bis 102, Mac Studio mit M5 Ultra 105 bis 154. Die Zahl der Grafikkerne innerhalb eines Chips ändert daran nichts, wie oben beim M5 Pro gezeigt.
Der Kontext: Was Ollama auf einem Mac von selbst einstellt
Die Tabellen oben gelten für 4.096 Token Kontext, die Werte zum Programmieren für 16.384. Je mehr Text das Modell gleichzeitig im Blick behalten soll, desto mehr Speicher braucht es zusätzlich, und an einer knappen Grenze kippt das: Qwen3 30B A3B 2507 läuft auf dem Mac mini mit 32 GB beim Ausprobieren noch, beim Programmieren mit 16.384 Token scheitert es knapp am Speicher. Llama 3.3 70B passt auf dem Mac mini mit 64 GB bei 4.096 Token hinein, bei 16.384 fehlen 1,5 GB.
Dazu kommt, dass Ollama den Kontext nicht auf jedem Mac gleich wählt. Unsere Geräteseiten nennen bei jedem Startbefehl, was das Programm auf diesem Gerät für dieses Modell von sich aus einstellt: auf dem Mac mini mit 16, 24 oder 32 GB sind das 4.096 Token, mit 48 GB 32.768 und mit 64 GB 262.144, sofern das Modell so viel Kontext zulässt. Ein großer Kontext hält von Anfang an Speicher frei, und ein Modell, das nach unserer Rechnung knapp passt, liegt dann womöglich zum Teil im langsameren Speicher. Die Startbefehle auf unseren Modellseiten setzen den Kontext deshalb nach dem Start mit /set parameter num_ctx auf den Wert unserer Rechnung; dauerhaft legen Sie ihn mit der Einstellung OLLAMA_CONTEXT_LENGTH fest. Ab welchem Speicher Ollama mehr Kontext wählt, nennt der Ratgeber Ornith 1.5.
Wann es der Mac Studio sein muss
Der Mac Studio unterscheidet sich vom Mac mini in zwei Dingen: Er geht beim Speicher weiter, bis 512 GB, und seine Chips haben eine höhere Bandbreite. Der zweite Punkt gilt schon für die kleinste Ausstattung.
Für 70B-Modelle im Alltag. Auf dem Mac Studio mit M5 Ultra und 96 GB läuft Llama 3.3 70B mit 9,0 bis 12 Token je Sekunde und Apertus 70B 2509 mit 8,9 bis 12; die Geräteseite stuft beide als flüssig ein. Das sind die Modelle, die auf dem Mac mini mit 64 GB zwar hineinpassen, aber unter 6 Token je Sekunde bleiben. Auf derselben Ausstattung läuft gpt-oss 120B mit 65,0 von 72,0 GB und 84 bis 123 Token je Sekunde; Qwen3.5 122B A10B passt nicht mehr, dafür fehlen 7 GB.
Für die Klasse um 120 Milliarden Parameter mit Reserve. Der Mac Studio mit M5 Max und 128 GB hat 96,0 GB nutzbar und trägt Qwen3.5 122B A10B; die Grenze liegt bei Laguna S 2.1, dafür fehlen 14,8 GB. Mit 256 GB, also 192,0 GB nutzbar, läuft Laguna S 2.1 noch; Ornith 1.5 397B passt mit 251,1 GB auch dort nicht hinein.
Für die größten offenen Modelle. Erst die Ausstattung mit 512 GB, also 384,0 GB nutzbar, trägt Modelle wie Ornith 1.5 397B mit 251,1 GB oder Intern-S2 397B mit 260,6 GB; GLM-5.3 mit 895,4 GB passt auch dort nicht. Die Tempowerte für diese Modelle tragen auf der Geräteseite ein Sternchen, weil unser Abgleich so weit nicht reicht. Und die Ausstattung selbst ist zum Stand dieses Textes angekündigt, nicht lieferbar:
„Mac Studio with 512GB of unified memory is coming in late October.“
Nicht für mehr Speicher in der kleinsten Stufe. Der Mac Studio mit M5 Max und 36 GB hat 24,0 GB nutzbar, weniger als ein Mac mini mit 48 GB. Er rechnet schneller, Gemma 4 31B mit 12 bis 17 Token je Sekunde statt 9,2 bis 13, trägt aber weniger Modelle: Die Grenze liegt bei Ornith 1.5 35B A3B, für Qwen3.6 35B A3B fehlen 0,4 GB. Wer zwischen beiden schwankt, entscheidet zwischen Speicher und Tempo, nicht zwischen klein und groß.
Der Mac mini als KI-Rechner für mehrere Personen
Ein Mac mini kann im Netz für andere Rechner antworten. Ollama hört ab Werk nur auf Anfragen vom selben Gerät; die Dokumentation beschreibt, wie sich das ändern lässt:
„Ollama binds 127.0.0.1 port 11434 by default. Change the bind address with the OLLAMA_HOST environment variable.“
Zwei Dinge sind dabei zu bedenken. Ollama bearbeitet ab Werk eine Anfrage nach der anderen; dieselbe Dokumentation nennt die Einstellung dafür:
„OLLAMA_NUM_PARALLEL - The maximum number of parallel requests each model will process at the same time, default 1.“
Wer den Wert erhöht, braucht laut derselben Stelle entsprechend mehr Speicher: Der Bedarf wächst mit der Zahl der parallelen Anfragen mal der Kontextlänge. Auf einem Mac mini, dessen Speicher ohnehin knapp bemessen ist, heißt das: Für ein Team, das gleichzeitig arbeitet, muss das Modell deutlich kleiner sein als das größte, das hineinpasst. Und wer den Rechner im Netz freigibt, gibt ihn allen frei, die das Netz erreichen; das gehört in dieselbe Überlegung wie die Wahl des Modells.
Mehrere Geräte zu einem Verbund zusammenzuschalten, damit ihr Speicher zusammenzählt, rechnet unser Katalog nur für wenige Geräte aus, keinen Mac mini darunter, und die Software dafür befindet sich nach Auskunft ihrer Entwickler im Versuchsstadium. Was dabei zu beachten ist, steht im Ratgeber Ornith 1.5 im Abschnitt über den Verbund.
Wer lokale KI für mehrere Personen im Unternehmen aufsetzt, hat neben dem Gerät Fragen zu klären, die keine Technikfragen sind:
Wann der Mac mini nicht die richtige Wahl ist
Wenn Sie den Speicher später erweitern wollen. Beim Mac wählen Sie ihn beim Kauf; bei einem Rechner mit Grafikkarte ist die Karte die Stellschraube, die sich austauschen lässt. Worauf es dabei ankommt, erklärt der Ratgeber Grafikkarte für KI.
Wenn Sie 70B-Modelle flüssig brauchen. Dafür reicht kein Mac mini; der Mac Studio mit M5 Ultra trägt sie ab 96 GB.
Wenn viele Menschen gleichzeitig zugreifen sollen. Für den Betrieb mit vielen Nutzern ist Serversoftware wie vLLM gebaut, die auf Linux-Servern mit passenden Grafikkarten läuft; was sie von Ollama unterscheidet, erklärt der Ratgeber Was ist Ollama.
Alle Ausstattungen des Mac mini und des Mac Studio mit den Modellen, die darauf laufen, finden Sie in unserem Katalog auf den Geräteseiten, mit aktuellen Angeboten der Händler, wo es welche gibt; wie Sie Chip und Speicher Ihres Geräts herausfinden, beschreibt die Anleitung Welches Gerät habe ich? Welche Modelle für Ihren Zweck gebaut sind, zeigen die Seiten je Einsatzzweck, etwa Lokale KI zum Programmieren.
Weitere Ratgeber
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- Deutsche und europäische KI-Modelle: Welche es gibt und was davon lokal läuftTeuken aus Deutschland, EuroLLM aus einem EU-Projekt, Mistral aus Paris, Apertus aus der Schweiz. Lizenz, Größe und auf wie vielen der 527 Geräte sie flüssig laufen.
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Ornith 1.5: Welche der drei Größen auf Ihrem Rechner läuftOrnith 1.5 gibt es in drei Größen. Die kleine läuft nach unserer Rechnung beim Ausprobieren auf 406 von 527 geführten Geräten, die größte auf 9. Was jede Größe braucht und wann ein Verbund aus mehreren Geräten hilft.
- Qwen-Image: KI-Bilder lokal erzeugen und die richtige Fassung wählenQwen-Image erzeugt Bilder auf dem eigenen Rechner. Die neue Fassung 2.1 ist nur für Forschung und Erprobung freigegeben, für Unternehmen ist 2512 die Fassung. Was beide an Speicher brauchen und wie lange ein Bild auf unserer Karte dauerte.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.