Auf dem M4 Mac Mini ist in Dev-Gruppen selten die lauteste Frage „Ollama oder MLX“, sondern ob 16GB wirklich reichen. Jemand installiert qwen2.5:14b, denkt „läuft, passt“, und ab der dritten Runde greift Swap — tok/s fallen von 11 auf 3. Jemand investiert in 24GB und sieht 7B bei ~50 tok/s — die falsche RAM-Stufe schmerzt mehr als das falsche Framework.
Macstripe Lab hat drei M4 Mac Mini (16GB / 24GB / 32GB) mit Ollama 0.6.2 und MLX gepaart gemessen: Speicher × Anwendungsfall × Framework-Entscheidungstabelle, Swap-Klippe und Sieben-Schritte-Checkliste. Preise und Apple-US-Listenpreise Stand 2026-07-21. Modell-Details: 7B vs. 14B Praxistest; Framework-Ebene: Ollama vs. MLX.
1. Zuerst die Kernaussage: Speicherstufe × Anwendungsfall × empfohlener Stack
| Unified Memory | Typischer Einsatz | Empfohlenes Modell | Runtime | Gemessene tok/s (Median) | Risiko |
|---|---|---|---|---|---|
| 16GB | Persönlicher Chat, leichte Skripte, lokaler Test | qwen2.5:7b / llama3.1:8b | Ollama | 7B ~29 · 8B ~28.8 | 14B swappt leicht; Chrome + IDE zusammen überfordert |
| 24GB | Claude Code Agent, dateiübergreifendes Coding | qwen2.5-coder:14b | Ollama | 14B ~15.1 · 7B ~51.1 | Sweet Spot; 14B-Decode langsamer als 7B — normal |
| 32GB | Großer ctx + Xcode auf derselben Maschine, leichter Team-Knoten | 14B + num_ctx 32K | Ollama serve | 14B ~16–18 | Teurer als 24GB; persönlicher ROI muss gerechnet werden |
| 48GB+ | Geteilte Inferenz, 32B-Exploration | qwen2.5:32b (Q4) | Ollama serve Cluster | 32B ~8–12 | Siehe M4 Pro Deployment-Leitfaden |
2. Drei Fallen: warum Speicher wichtiger ist als das Framework
Im Lab sehen wir immer wieder drei Muster: „dachte, ich habe richtig gewählt — Speicher reicht nicht“:
| Falle | Typisches Symptom | Gemessene Zahlen | Richtige Reaktion |
|---|---|---|---|
| Nur Leaderboard-tok/s | Im Netz „14B läuft 15 tok/s“; bei Ihnen nur 3 | 14B auf 16GB: 11.2 → 8.4 → 3.4 tok/s (Drei-Lauf-Abfall) | Swapins prüfen; Listen oft auf sauberem 24GB gemessen |
| Hintergrund-Apps ignorieren | „Ich laufe nur Ollama“, aber 30 Chrome-Tabs + Xcode-Index | 8B sauber 28.8 tok/s → mit Chrome 20.8 (aus Median ausgeschlossen) | Vor Benchmark Tabs schließen; 4–6GB für OS + IDE einplanen |
| Framework vs. Speicher verwechseln | MLX wechseln, um bei 14B „RAM zu sparen“ | Gleiches Modell Ollama vs. MLX Speicher-Delta <5% | Framework: wenige Prozent; Stufe: Größenordnung |
Ein Indie-Dev formulierte es treffend: „16GB, Claude Code + qwen2.5-coder:14b — erste zwei Runden OK, dritte Runde TTFT von 1,9s auf 5,8s.“ Das ist nicht „Modell wird dümmer“, sondern Unified Memory betritt die Swap-Zone. Theorie: Unified Memory und LLM-Inferenz.
3. Formfaktor: Grenzen von 16GB / 24GB / 32GB
Basis-M4 Mac Mini bietet drei Unified-Memory-Stufen; GPU 10 Kerne, Bandbreite ~ 120 GB/s. Die GB-Zahl hebt das L2-Bandbreiten-Limit nicht, entscheidet aber, ob Modell + KV + Vordergrund-Apps resident bleiben, ohne L3-Druck-Kollaps.
3.1 Speicher-Budget-Formel (Schätzung)
| Posten | 7B Q4 | 14B Q4 | Hinweis |
|---|---|---|---|
| Quantisierte Gewichte | ~4.5 GB | ~9 GB | Ollama-Default Q4_K_M |
| KV-Cache (num_ctx=2048) | ~0.5 GB | ~1 GB | Linear mit ctx |
| macOS + Vordergrund | 4–6 GB | 4–6 GB | Chrome/IDE je 1–3 GB |
| Ollama-Daemon | ~0.3 GB | ~0.3 GB | Resident HTTP-Dienst |
| Summe (grob) | ~10 GB | ~15 GB | 16GB + 14B fast ohne Reserve |
3.2 Drei Stufen: stabil / grenzwertig / vermeiden
| Speicher | 7B/8B | 14B | 32B | Anmerkung |
|---|---|---|---|---|
| 16GB | ✅ Stabil | ⚠️ Swap-anfällig | ❌ | Leichte Privatnutzung |
| 24GB | ✅ Sehr schnell | ✅ Sweet Spot | ⚠️ Knapp | Agent / Coding empfohlen |
| 32GB | ✅ | ✅ Großer ctx | ⚠️ Q4 testbar | CI + LLM auf einer Box |
Ist Ihr Haupt-Szenario „Claude Code + 14B auf diesem Mac“, ist 24GB der beste Preis-Leistungs-Upgrade-Punkt — nicht linear „+8GB = +8 tok/s“, sondern Swap verzögern, damit 14B aus der Kollapszone in die stabile Zone rückt. Vollständige Methodik: M4 lokale LLM Hub-Benchmarks.
4. Konfiguration: Ollama vs. MLX Speicher-Footprint (gemessen)
Viele nehmen an, MLX sei „nativer“ und spare RAM — Messungen sagen das Gegenteil. Gleiches Modell und Quantisierung: Gewichte und KV fast identisch; Unterschied liegt in der Runtime-Architektur, nicht in GB.
| Vergleich | Ollama | MLX | Gemessenes Delta |
|---|---|---|---|
| Modellgewichte (Llama 3.1 8B Q4) | ~4.9 GB | ~4.8 GB | Vernachlässigbar |
| Resident-Prozess | ~200–400 MB (Daemon) | On-Demand, kein Daemon | Ollama etwas höher |
| tok/s (16GB sauber 8B) | Median ~28.8 | ~28–32 | MLX 0–12 % schneller (offline) |
| tok/s (24GB sauber 8B) | Median ~51.2 | ~52–55 | Abstand schrumpft |
| Claude Code-Anbindung | ✅ Nativ :11434 | ❌ Eigenes HTTP nötig | Agenten → Ollama |
| Nach Swap-Trigger | 11.2 → 3.4 tok/s | Gleiche Stufe, gleicher Kollaps | RAM-Stufe entscheidet alles |
14B remote ohne Schreibtisch-Upgrade? Eine Woche auf einem Macstripe 24GB Cloud-Knoten testen, Agent-Workflow validieren, dann Kaufentscheidung.
5. Lab-Daten: tok/s, TTFT und Swap-Klippe
Testumgebung: Mac Mini M4 (Mac14,3), macOS 15.4.1, Ollama 0.6.2, Default Q4_K_M. Maschinen-IDs m4-16gb-lab-01, m4-24gb-lab-02. Zeitraum 2026-05-28 bis 2026-07-18.
5.1 16GB: 7B stabil vs. 14B Kollaps
| Modell | run 1 | run 2 | run 3 | Median | Swapins |
|---|---|---|---|---|---|
| qwen2.5:7b | 28.7 | 31.4 | 26.9 | 29.1 | 0 |
| qwen2.5:14b | 11.2 | 8.4 | 3.4 | — (Session abgebrochen) | 8421+ |
14B auf 16GB ist nicht „etwas langsamer“, sondern Drei-Phasen-Kollaps: run 1 OK → run 2 Swap beginnt → run 3 memorystatus: WARN → Runner OOM beendet.
5.2 24GB: 14B im Sweet Spot
| Modell | tok/s fünf Läufe | Median | TTFT | Swapins |
|---|---|---|---|---|
| qwen2.5:7b | 49.2 / 53.8 / 51.1 / 48.6 / 52.4 | 51.1 | ~2.0s | 0 |
| qwen2.5:14b | 14.2 / 16.8 / 15.1 / 17.3 / 14.9 | 15.1 | ~2.7s | 0 |
5.3 Raw-Log-Auszug
--- m4-16gb-lab-01 · qwen2.5:14b ---
run 1: tok/s=11.2 TTFT=2.71s
run 2: tok/s=8.4 Swapins: 1204
run 3: tok/s=3.4 memorystatus: WARN TTFT=5.81s
run 4: ERROR runner killed (oom?) Swapins: 8421
--- m4-24gb-lab-02 · qwen2.5:14b ---
tok/s: 14.2 16.8 15.1 17.3 14.9 median: 15.1
Vollständiges Log: resources/sample-benchmark-7b-14b-run.log; Repro-Skript: resources/benchmark-m4-mac-mini-ollama.sh.
6. Kanal: RAM-Upgrade kaufen vs. Cloud-Mac mieten
| Weg | Passend für | Vorteile | Nachteile |
|---|---|---|---|
| Kauf-Upgrade (16→24GB) | Lokaler Agent mehrmals pro Woche, lange Offline-Läufe | Einmalige Investition; Daten bleiben lokal | Apple-RAM-Upgrades teuer; an einen Schreibtisch gebunden |
| Cloud-Mac tag-/monatsweise | 14B testen, Peak-Jobs, Team-Knoten | In Minuten live; 24GB/48GB on demand | Netz nötig; Langzeit-ROI rechnen |
| Hybrid: 16GB lokal + 24GB Cloud | Alltag 7B lokal, schwere Tasks in der Cloud | Flexible Kosten; Peaks ohne Swap | Zwei Umgebungen pflegen |
Ein iOS- + AI-Stack-Dev nutzt Hybrid: 16GB lokal mit 7B für Completions, Claude-Code-Schwerlast per SSH auf Macstripe 24GB mit 14B — ~$103/Monat, planbarer als das Kaufzeit-RAM-Delta. Mietpreis-Vergleich: Gleicher Mac mini M4 — Mietpreise im Vergleich.
7. Upgrade-Preisdelta: was extra RAM kostet
| Upgrade-Pfad | Apple-Delta (ca., USD) | Cloud-Monatsdelta (ca.) | Wann es sich lohnt |
|---|---|---|---|
| 16GB → 24GB | +$200 (beim Kauf) | +~$30–50/Monat | 3+ Mal/Woche: 7B „editiert falsch“ |
| 24GB → 32GB | +$200 | Anbieterabhängig | Xcode CI + 14B auf einer Maschine |
| 16GB → 48GB (M4 Pro) | Neues Gerät | Macstripe 48GB-Knoten | Team-Share / 32B-Exploration |
ROI-Skizze: Wenn 7B-Qualität 2 Extra-Stunden pro Woche kostet (bei ~$50/h), sind das ~$400/Monat — bereits über dem typischen Apple-Delta 16→24GB. RAM-Stufe ist oft das günstigste wirksame Upgrade, mehr als Framework-Wechsel oder Prompt-Tuning.
8. Checkliste und sieben Schritte zum Rollout
Vor Bestellung oder Imaging Erwartungen abgleichen:
- ☐ Hauptnutzung Chat (7B reicht) oder Agent-Coding (eher 14B)
- ☐ Gleichzeitig 20+ Chrome-Tabs + IDE?
- ☐ Claude Code / Cursor mit lokalem Modell?
- ☐ Runtime: Ollama (Agent) oder MLX (nur Benchmark)
- ☐ Dauerhaft lokal oder Peak-Jobs in der Cloud
- ☐ Budget für 16GB / 24GB / 32GB — welche Stufe?
- ☐ Team-Sharing (→ 24GB+ oder Cloud-Knoten)
- ☐ Swap-Risiko akzeptieren (16GB + 14B = hohes Risiko)
Sieben Schritte (Ollama-Pfad)
- RAM-Stufe und Zielmodell festlegen (16GB→7B; 24GB→14B)
- Ollama installieren:
brew install ollamaoder offizielles pkg - Modell pullen:
ollama pull qwen2.5-coder:7b(16GB) oder:14b(24GB) - Metal prüfen:
ollama serve-Log zeigtggml_metal_init - Benchmark:
./resources/benchmark-m4-mac-mini-ollama.sh - Speicher beobachten:
vm_stat+ Aktivitätsanzeige Speicherdruck - Agent anbinden: Claude Code auf
http://127.0.0.1:11434
9. Zitierbare US-Startpreise (Stand 2026-07-21)
| Konfiguration | Apple US-Listenpreis (USD) | Education (ca.) | Macstripe Cloud monatlich (USD) |
|---|---|---|---|
| M4 Mac Mini 16GB / 256GB | $599 | ~$539 | ~$102.9 |
| M4 Mac Mini 24GB / 256GB | $799 | ~$719 | ~$130–150 (knotenabhängig) |
| M4 Mac Mini 32GB / 256GB | $999 | ~$899 | Angebot / individuell |
| M4 Pro 48GB (Inferenz-Knoten) | $1.399+ | Konfigurationsabhängig | Siehe Preispläne |
Apple-Preise aus öffentlichen US-Store-Angaben; Education erfordert Berechtigung; Cloud-Tarife laut Macstripe-Preisseite zum Bestellzeitpunkt.
10. Szenario-Auswahl: wer welche Stufe kaufen sollte
| Zielgruppe | Empfohlener RAM | Modell + Framework | Alternative |
|---|---|---|---|
| Studierende / Neugierige | 16GB | 7B + Ollama | Cloud tageweise für 14B |
| Indie-Dev + Agent | 24GB | 14B + Ollama | 16GB lokal + 24GB Cloud Hybrid |
| iOS-Dev + lokales LLM | 32GB | 14B + Xcode auf einer Box | CI und Inferenz auf zwei Maschinen |
| Kleines Team Inferenz-Knoten | 48GB | ollama serve Cluster | Macstripe 48GB-Knoten |
Unsicher, ob 24GB reicht? Eine Woche Cloud-Mac mieten und echten Agent-Workflow fahren — zuverlässiger als zehn Benchmark-Artikel. Macstripe SSH/VNC direkt, ~5 Minuten bis live, kein Langzeitvertrag — dann Kauf vs. Miete entscheiden.
FAQ
M4 Mac Mini für lokale LLMs: 16GB oder 24GB?
Alltag 7B/8B + leichte IDE: 16GB. Stabiles 14B, Claude Code Agent oder viele Browser-Tabs: 24GB. 14B auf 16GB gemessen: tok/s von 11,2 auf 3,4.
Was verbraucht mehr Speicher — Ollama oder MLX?
Gleiches Modell und Quantisierung: meist unter 5 % Unterschied. Engpass ist Unified-Memory-Stufe, nicht Framework-Name. Agenten → Ollama.
Lohnt sich 32GB gegenüber 24GB?
Persönlich 14B + Standard-ctx: 24GB reicht meist. 32GB für Xcode CI + LLM auf einer Maschine oder größeres num_ctx.
Woran erkenne ich Speichermangel?
Speicherdruck-Anzeige, vm_stat Swapins steigen, tok/s bricht ein. memorystatus WARN ist das Vor-Swap-Signal.
Kann ich eine Cloud-Mac für lokale LLMs mieten, ohne Hardware zu kaufen?
Ja. Macstripe 16GB/24GB/48GB dedizierte M4-Knoten — per SSH einloggen, Ollama installieren; gut zum Testen von 14B oder als Team-Inferenz-Knoten.
Fazit
Auf dem M4 Mac Mini ist die RAM-Stufe ein Veto: 16GB für 7B + Ollama zum privaten Testen; 24GB ist der 14B-Agent-Sweet-Spot; 32GB für CI + großen Kontext auf einer Maschine. Ollama vs. MLX Speicherlücke vernachlässigbar — Framework nach Szenario wählen (Agent → Ollama, Benchmarks → MLX).
14B noch auf 16GB erzwingen? 7B vs. 14B Praxistest zu Swap-Daten lesen, oder 24GB Cloud-Mac eine Woche testen, bevor Sie entscheiden.