Mac mini für lokale KI: Welche Ausstattung reicht und wann es der Mac Studio sein muss

Beim Mac zählt der Arbeitsspeicher, aber nicht die ganze Zahl. Was die Ausstattungen des Mac mini mit M4, M5 Pro und M6 tragen und wo der Mac Studio anfängt.

Stand: 2026-09-24

Der Mac mini ist ein naheliegender Rechner für lokale KI: klein, leise, und Prozessor und Grafik teilen sich einen Arbeitsspeicher, der bis 64 GB reicht. Eine einzelne Grafikkarte mit so viel Speicher gibt es nur als Profikarte. Die Frage ist deshalb selten, ob ein Mac mini lokale KI kann, sondern welche Ausstattung Sie brauchen: Die Ausstattungen unterscheiden sich im Chip und im Speicher, und beides entscheidet darüber, welche Modelle laufen und wie zügig.

Dieser Text ordnet die Ausstattungen des Mac mini mit M4, M5 Pro und M6 ein und zeigt, wo der Mac Studio anfängt. Alle Zahlen stammen von den Geräteseiten unseres Katalogs, der 527 Geräte führt, darunter 27 Ausstattungen des Mac mini und 37 des Mac Studio. Die Tempowerte dort sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät selbst gemessen.

Beim Mac zählt der Arbeitsspeicher, aber nicht die ganze Zahl

Ein Sprachmodell muss vollständig in einem schnellen Speicher liegen, damit es zügig rechnet. Bei einem Rechner mit Grafikkarte ist das deren Grafikspeicher, beim Mac der gemeinsame Arbeitsspeicher. Den gibt macOS der Grafik aber nur zum Teil frei; wir rechnen bis 36 GB mit zwei Dritteln, darüber mit drei Vierteln. Wie diese Rechnung zustande kommt, erklärt der Ratgeber Lokale KI-Modelle. Die Tabelle nennt die Speichergrößen der Baureihen von 2026.

Arbeitsspeicherdavon für Modelle nutzbargibt es 2026 beim
16 GB10,7 GBMac mini
24 GB16,0 GBMac mini
32 GB21,3 GBMac mini
36 GB24,0 GBMac Studio
48 GB36,0 GBMac mini, Mac Studio
64 GB48,0 GBMac mini, Mac Studio
96 GB72,0 GBMac Studio
128 GB96,0 GBMac Studio
256 GB192,0 GBMac Studio
512 GB384,0 GBMac Studio

Die zweite Spalte ist die Zahl, an der sich ein Modell messen muss. Ein Mac mini mit 16 GB trägt ein Modell, das 10,7 GB braucht, gerade noch; Qwen3 14B in der verbreiteten Variante Q4_K_M braucht genau so viel. Und die Zahl steht beim Kauf fest: Unser Katalog führt je Chip nur die Speichergrößen, die Apple anbietet, und der Mac mini endet bei 64 GB.

Die Ausstattungen des Mac mini (2026)

Apple bietet den Mac mini seit September 2026 mit zwei Chips an, M6 mit 16 bis 32 GB und M5 Pro mit 24 bis 64 GB. Die Tabelle nennt je Ausstattung, was die Geräteseite beim Ausprobieren, also mit 4.096 Token Kontext, als stärkstes flüssig laufendes Modell ausweist, und wo die Grenze liegt. Der M5 Pro ist mit 16 oder 20 Grafikkernen zu haben; für unsere Rechnung macht das keinen Unterschied, weil beide dieselbe Speicherbandbreite haben.

AusstattungnutzbarBandbreitestärkstes Modell, das flüssig läuftdie Grenze dieses Geräts
M6, 16 GB10,7 GB153 GB/sQwen3 14B, 11 bis 15 Token/sQwen3 14B läuft noch, Ministral 3 14B scheitert knapp am Speicher
M6, 24 GB16,0 GB170 GB/sQwen3 14B, 12 bis 16 Token/sgpt-oss 20B läuft noch, Mistral Small 3.2 24B nicht mehr, dafür fehlt 1 GB
M6, 32 GB21,3 GB170 GB/sQwen3 14B, 12 bis 16 Token/sQwen3 30B A3B 2507 läuft noch, Gemma 4 31B nicht mehr, dafür fehlen 0,5 GB
M5 Pro, 24 GB16,0 GB307 GB/sEuroLLM 22B, 13 bis 17 Token/sEuroLLM 22B läuft noch, Mistral Small 3.2 24B nicht mehr, dafür fehlt 1 GB
M5 Pro, 48 GB36,0 GB307 GB/sGemma 4 31B, 9,2 bis 13 Token/sLaguna XS 2.1 läuft noch, Llama 3.3 70B nicht mehr, dafür fehlen 9,5 GB
M5 Pro, 64 GB48,0 GB307 GB/sGemma 4 31B, 9,2 bis 13 Token/sLaguna XS 2.1 läuft noch, gpt-oss 120B nicht mehr, dafür fehlen 17 GB

Ein Token ist ungefähr ein Wortteil. Was die Tabelle je Stufe bedeutet:

16 GB reichen zum Ausprobieren. Qwen3 14B läuft, Ministral 3 14B mit seinen 10,8 GB scheitert knapp. Für Programmieren und Dokumente, die mehr Kontext brauchen, rutscht die Grenze auf Modelle mit 8 bis 12 Milliarden Parametern; die Geräteseite nennt Gemma 4 12B als stärkstes Modell, das dann noch flüssig läuft.

24 GB öffnen die Tür zu gpt-oss 20B. Das Modell braucht 12,8 GB und rechnet auf dem M6 mit rund 32 bis 47 Token je Sekunde, fast dreimal so schnell wie Qwen3 14B auf demselben Gerät. Der Grund ist die Bauart: gpt-oss besteht aus vielen Teilnetzen, sogenannten Experten, von denen je Textstück nur ein Teil rechnet; der Fachbegriff dafür lautet Mixture of Experts. Was das für den Speicher heißt, steht im Ratgeber gpt-oss.

32 GB tragen die 30B-Klasse, aber nicht jede. Qwen3 30B A3B 2507 passt mit 20,1 von 21,3 GB hinein und rechnet mit 30 bis 45 Token je Sekunde; Gemma 4 26B A4B mit 24 bis 36. Mistral Small 3.2 24B passt ebenfalls, ist aber ein dichtes Modell, bei dem für jedes Textstück das ganze Modell rechnet, und kommt auf dem M6 nur auf 7,6 bis 10 Token je Sekunde. Die Geräteseite stuft es deshalb als eingeschränkt ein. Gemma 4 31B passt nicht, dafür fehlen 0,5 GB. Für die 30B-Klasse ist die Frage also weniger, ob das Modell hineinpasst, sondern ob es dicht ist oder aus Experten besteht.

48 GB tragen dichte Modelle bis 31 Milliarden Parameter flüssig. Gemma 4 31B läuft auf dem M5 Pro mit 9,2 bis 13 Token je Sekunde, Laguna XS 2.1 mit 34 bis 50. Llama 3.3 70B braucht 45,5 GB und passt nicht in die 36 GB, die diese Ausstattung nutzbar hat.

64 GB sind die Stufe, auf der 70B-Modelle hineinpassen, aber nicht flüssig laufen. Llama 3.3 70B belegt 45,5 von 48,0 GB und rechnet nach unserer Rechnung mit 4,1 bis 5,6 Token je Sekunde; Apertus 70B 2509 liegt gleichauf. Die Geräteseite stuft beide als eingeschränkt ein. Wer ein 70B-Modell im Alltag nutzen will, ist beim Mac Studio besser aufgehoben, siehe unten. Für Modelle bis zur 30B-Klasse bringt der Schritt von 48 auf 64 GB vor allem Luft für einen längeren Kontext.

Was sich beim Mac mini (2024) mit M4 ändert

Die Speicherstufen sind dieselben: M4 mit 16, 24 oder 32 GB, M4 Pro mit 24, 48 oder 64 GB. Weil der nutzbare Speicher nur von der Speichergröße abhängt, stehen auf den Geräteseiten des Mac mini (2024) beim Ausprobieren dieselben Grenzsätze wie beim Mac mini (2026); bei 32.768 Token Kontext, also beim Auswerten von Dokumenten, weichen sie bei 24, 48 und 64 GB ab, weil ein Modell dort auf dem älteren Chip spürbar langsamer rechnet und die Geräteseite es dann als eingeschränkt einstuft. Was sich ändert, ist das Tempo, und der Unterschied ist kleiner, als der Generationssprung vermuten lässt: Qwen3 14B rechnet auf dem M4 mit 8,8 bis 12 Token je Sekunde, auf dem M6 mit 11 bis 15. Beim Programmieren mit 16.384 Token Kontext kommt Qwen3-Coder 30B A3B auf dem M4 Pro auf 37 bis 54 Token je Sekunde, auf dem M5 Pro auf 41 bis 60.

Der Grund steht in der Spalte Bandbreite: 120 GB/s beim M4 gegen 153 bis 170 beim M6, 273 GB/s beim M4 Pro gegen 307 beim M5 Pro. Wer einen Mac mini mit M4 hat, muss ihn für lokale KI nicht ersetzen; wer neu kauft, sollte das Geld eher in Speicher als in den neueren Chip stecken.

In unserer Rechnung hängt das Tempo an der Bandbreite, nicht an der Kernzahl

In unserer Rechnung entscheidet auf einem Mac der Speicher, ob ein Modell läuft, und die Speicherbandbreite, wie schnell. Das zeigt sich am selben Modell über die Baureihen hinweg: Gemma 4 31B rechnet auf dem Mac mini mit M5 Pro und 64 GB mit 9,2 bis 13 Token je Sekunde, auf dem Mac Studio mit M5 Max und derselben Speichergröße mit 15 bis 20. Der nutzbare Speicher ist in beiden Fällen 48,0 GB; die Bandbreite ist 307 gegen 614 GB/s.

Noch deutlicher wird es beim Programmieren mit Qwen3-Coder 30B A3B: Mac mini mit M5 Pro 41 bis 60 Token je Sekunde, Mac Studio mit M5 Max 69 bis 102, Mac Studio mit M5 Ultra 105 bis 154. Die Zahl der Grafikkerne innerhalb eines Chips ändert daran nichts, wie oben beim M5 Pro gezeigt.

Der Kontext: Was Ollama auf einem Mac von selbst einstellt

Die Tabellen oben gelten für 4.096 Token Kontext, die Werte zum Programmieren für 16.384. Je mehr Text das Modell gleichzeitig im Blick behalten soll, desto mehr Speicher braucht es zusätzlich, und an einer knappen Grenze kippt das: Qwen3 30B A3B 2507 läuft auf dem Mac mini mit 32 GB beim Ausprobieren noch, beim Programmieren mit 16.384 Token scheitert es knapp am Speicher. Llama 3.3 70B passt auf dem Mac mini mit 64 GB bei 4.096 Token hinein, bei 16.384 fehlen 1,5 GB.

Dazu kommt, dass Ollama den Kontext nicht auf jedem Mac gleich wählt. Unsere Geräteseiten nennen bei jedem Startbefehl, was das Programm auf diesem Gerät für dieses Modell von sich aus einstellt: auf dem Mac mini mit 16, 24 oder 32 GB sind das 4.096 Token, mit 48 GB 32.768 und mit 64 GB 262.144, sofern das Modell so viel Kontext zulässt. Ein großer Kontext hält von Anfang an Speicher frei, und ein Modell, das nach unserer Rechnung knapp passt, liegt dann womöglich zum Teil im langsameren Speicher. Die Startbefehle auf unseren Modellseiten setzen den Kontext deshalb nach dem Start mit /set parameter num_ctx auf den Wert unserer Rechnung; dauerhaft legen Sie ihn mit der Einstellung OLLAMA_CONTEXT_LENGTH fest. Ab welchem Speicher Ollama mehr Kontext wählt, nennt der Ratgeber Ornith 1.5.

Wann es der Mac Studio sein muss

Der Mac Studio unterscheidet sich vom Mac mini in zwei Dingen: Er geht beim Speicher weiter, bis 512 GB, und seine Chips haben eine höhere Bandbreite. Der zweite Punkt gilt schon für die kleinste Ausstattung.

Für 70B-Modelle im Alltag. Auf dem Mac Studio mit M5 Ultra und 96 GB läuft Llama 3.3 70B mit 9,0 bis 12 Token je Sekunde und Apertus 70B 2509 mit 8,9 bis 12; die Geräteseite stuft beide als flüssig ein. Das sind die Modelle, die auf dem Mac mini mit 64 GB zwar hineinpassen, aber unter 6 Token je Sekunde bleiben. Auf derselben Ausstattung läuft gpt-oss 120B mit 65,0 von 72,0 GB und 84 bis 123 Token je Sekunde; Qwen3.5 122B A10B passt nicht mehr, dafür fehlen 7 GB.

Für die Klasse um 120 Milliarden Parameter mit Reserve. Der Mac Studio mit M5 Max und 128 GB hat 96,0 GB nutzbar und trägt Qwen3.5 122B A10B; die Grenze liegt bei Laguna S 2.1, dafür fehlen 14,8 GB. Mit 256 GB, also 192,0 GB nutzbar, läuft Laguna S 2.1 noch; Ornith 1.5 397B passt mit 251,1 GB auch dort nicht hinein.

Für die größten offenen Modelle. Erst die Ausstattung mit 512 GB, also 384,0 GB nutzbar, trägt Modelle wie Ornith 1.5 397B mit 251,1 GB oder Intern-S2 397B mit 260,6 GB; GLM-5.3 mit 895,4 GB passt auch dort nicht. Die Tempowerte für diese Modelle tragen auf der Geräteseite ein Sternchen, weil unser Abgleich so weit nicht reicht. Und die Ausstattung selbst ist zum Stand dieses Textes angekündigt, nicht lieferbar:

„Mac Studio with 512GB of unified memory is coming in late October.“

Quelle: Apple Newsroom, The new Mac mini and Mac Studio are available today, gelesen am

Nicht für mehr Speicher in der kleinsten Stufe. Der Mac Studio mit M5 Max und 36 GB hat 24,0 GB nutzbar, weniger als ein Mac mini mit 48 GB. Er rechnet schneller, Gemma 4 31B mit 12 bis 17 Token je Sekunde statt 9,2 bis 13, trägt aber weniger Modelle: Die Grenze liegt bei Ornith 1.5 35B A3B, für Qwen3.6 35B A3B fehlen 0,4 GB. Wer zwischen beiden schwankt, entscheidet zwischen Speicher und Tempo, nicht zwischen klein und groß.

Der Mac mini als KI-Rechner für mehrere Personen

Ein Mac mini kann im Netz für andere Rechner antworten. Ollama hört ab Werk nur auf Anfragen vom selben Gerät; die Dokumentation beschreibt, wie sich das ändern lässt:

„Ollama binds 127.0.0.1 port 11434 by default. Change the bind address with the OLLAMA_HOST environment variable.“

Quelle: Ollama, FAQ, gelesen am

Zwei Dinge sind dabei zu bedenken. Ollama bearbeitet ab Werk eine Anfrage nach der anderen; dieselbe Dokumentation nennt die Einstellung dafür:

„OLLAMA_NUM_PARALLEL - The maximum number of parallel requests each model will process at the same time, default 1.“

Quelle: Ollama, FAQ, gelesen am

Wer den Wert erhöht, braucht laut derselben Stelle entsprechend mehr Speicher: Der Bedarf wächst mit der Zahl der parallelen Anfragen mal der Kontextlänge. Auf einem Mac mini, dessen Speicher ohnehin knapp bemessen ist, heißt das: Für ein Team, das gleichzeitig arbeitet, muss das Modell deutlich kleiner sein als das größte, das hineinpasst. Und wer den Rechner im Netz freigibt, gibt ihn allen frei, die das Netz erreichen; das gehört in dieselbe Überlegung wie die Wahl des Modells.

Mehrere Geräte zu einem Verbund zusammenzuschalten, damit ihr Speicher zusammenzählt, rechnet unser Katalog nur für wenige Geräte aus, keinen Mac mini darunter, und die Software dafür befindet sich nach Auskunft ihrer Entwickler im Versuchsstadium. Was dabei zu beachten ist, steht im Ratgeber Ornith 1.5 im Abschnitt über den Verbund.

Wer lokale KI für mehrere Personen im Unternehmen aufsetzt, hat neben dem Gerät Fragen zu klären, die keine Technikfragen sind:

Wann der Mac mini nicht die richtige Wahl ist

Wenn Sie den Speicher später erweitern wollen. Beim Mac wählen Sie ihn beim Kauf; bei einem Rechner mit Grafikkarte ist die Karte die Stellschraube, die sich austauschen lässt. Worauf es dabei ankommt, erklärt der Ratgeber Grafikkarte für KI.

Wenn Sie 70B-Modelle flüssig brauchen. Dafür reicht kein Mac mini; der Mac Studio mit M5 Ultra trägt sie ab 96 GB.

Wenn viele Menschen gleichzeitig zugreifen sollen. Für den Betrieb mit vielen Nutzern ist Serversoftware wie vLLM gebaut, die auf Linux-Servern mit passenden Grafikkarten läuft; was sie von Ollama unterscheidet, erklärt der Ratgeber Was ist Ollama.

Alle Ausstattungen des Mac mini und des Mac Studio mit den Modellen, die darauf laufen, finden Sie in unserem Katalog auf den Geräteseiten, mit aktuellen Angeboten der Händler, wo es welche gibt; wie Sie Chip und Speicher Ihres Geräts herausfinden, beschreibt die Anleitung Welches Gerät habe ich? Welche Modelle für Ihren Zweck gebaut sind, zeigen die Seiten je Einsatzzweck, etwa Lokale KI zum Programmieren.

Weitere Ratgeber