Speichermodule im Detail — Unified-Memory-Konfiguration beim Betrieb von Ollama und MLX auf M4 Mac Mini

Auf dem M4 Mac Mini ist in Dev-Gruppen selten die lauteste Frage „Ollama oder MLX“, sondern ob 16GB wirklich reichen. Jemand installiert qwen2.5:14b, denkt „läuft, passt“, und ab der dritten Runde greift Swap — tok/s fallen von 11 auf 3. Jemand investiert in 24GB und sieht 7B bei ~50 tok/s — die falsche RAM-Stufe schmerzt mehr als das falsche Framework.

Macstripe Lab hat drei M4 Mac Mini (16GB / 24GB / 32GB) mit Ollama 0.6.2 und MLX gepaart gemessen: Speicher × Anwendungsfall × Framework-Entscheidungstabelle, Swap-Klippe und Sieben-Schritte-Checkliste. Preise und Apple-US-Listenpreise Stand 2026-07-21. Modell-Details: 7B vs. 14B Praxistest; Framework-Ebene: Ollama vs. MLX.

1. Zuerst die Kernaussage: Speicherstufe × Anwendungsfall × empfohlener Stack

Unified MemoryTypischer EinsatzEmpfohlenes ModellRuntimeGemessene tok/s (Median)Risiko
16GB Persönlicher Chat, leichte Skripte, lokaler Test qwen2.5:7b / llama3.1:8b Ollama 7B ~29 · 8B ~28.8 14B swappt leicht; Chrome + IDE zusammen überfordert
24GB Claude Code Agent, dateiübergreifendes Coding qwen2.5-coder:14b Ollama 14B ~15.1 · 7B ~51.1 Sweet Spot; 14B-Decode langsamer als 7B — normal
32GB Großer ctx + Xcode auf derselben Maschine, leichter Team-Knoten 14B + num_ctx 32K Ollama serve 14B ~16–18 Teurer als 24GB; persönlicher ROI muss gerechnet werden
48GB+ Geteilte Inferenz, 32B-Exploration qwen2.5:32b (Q4) Ollama serve Cluster 32B ~8–12 Siehe M4 Pro Deployment-Leitfaden
Kurzantwort: Erst RAM-Stufe, dann Modell, dann Ollama / MLX. Agent-Workflows → Ollama; MLX nur für Offline-Benchmarks und Modellvalidierung — nicht für den Alltags-Runtime-Pick. 14B nicht auf 16GB erzwingen; 24GB ist die stabile Untergrenze für 14B.

2. Drei Fallen: warum Speicher wichtiger ist als das Framework

Im Lab sehen wir immer wieder drei Muster: „dachte, ich habe richtig gewählt — Speicher reicht nicht“:

FalleTypisches SymptomGemessene ZahlenRichtige Reaktion
Nur Leaderboard-tok/s Im Netz „14B läuft 15 tok/s“; bei Ihnen nur 3 14B auf 16GB: 11.2 → 8.4 → 3.4 tok/s (Drei-Lauf-Abfall) Swapins prüfen; Listen oft auf sauberem 24GB gemessen
Hintergrund-Apps ignorieren „Ich laufe nur Ollama“, aber 30 Chrome-Tabs + Xcode-Index 8B sauber 28.8 tok/s → mit Chrome 20.8 (aus Median ausgeschlossen) Vor Benchmark Tabs schließen; 4–6GB für OS + IDE einplanen
Framework vs. Speicher verwechseln MLX wechseln, um bei 14B „RAM zu sparen“ Gleiches Modell Ollama vs. MLX Speicher-Delta <5% Framework: wenige Prozent; Stufe: Größenordnung

Ein Indie-Dev formulierte es treffend: „16GB, Claude Code + qwen2.5-coder:14b — erste zwei Runden OK, dritte Runde TTFT von 1,9s auf 5,8s.“ Das ist nicht „Modell wird dümmer“, sondern Unified Memory betritt die Swap-Zone. Theorie: Unified Memory und LLM-Inferenz.

3. Formfaktor: Grenzen von 16GB / 24GB / 32GB

Basis-M4 Mac Mini bietet drei Unified-Memory-Stufen; GPU 10 Kerne, Bandbreite ~ 120 GB/s. Die GB-Zahl hebt das L2-Bandbreiten-Limit nicht, entscheidet aber, ob Modell + KV + Vordergrund-Apps resident bleiben, ohne L3-Druck-Kollaps.

3.1 Speicher-Budget-Formel (Schätzung)

Posten7B Q414B Q4Hinweis
Quantisierte Gewichte~4.5 GB~9 GBOllama-Default Q4_K_M
KV-Cache (num_ctx=2048)~0.5 GB~1 GBLinear mit ctx
macOS + Vordergrund4–6 GB4–6 GBChrome/IDE je 1–3 GB
Ollama-Daemon~0.3 GB~0.3 GBResident HTTP-Dienst
Summe (grob)~10 GB~15 GB16GB + 14B fast ohne Reserve

3.2 Drei Stufen: stabil / grenzwertig / vermeiden

Speicher7B/8B14B32BAnmerkung
16GB✅ Stabil⚠️ Swap-anfälligLeichte Privatnutzung
24GB✅ Sehr schnell✅ Sweet Spot⚠️ KnappAgent / Coding empfohlen
32GB✅ Großer ctx⚠️ Q4 testbarCI + LLM auf einer Box

Ist Ihr Haupt-Szenario „Claude Code + 14B auf diesem Mac“, ist 24GB der beste Preis-Leistungs-Upgrade-Punkt — nicht linear „+8GB = +8 tok/s“, sondern Swap verzögern, damit 14B aus der Kollapszone in die stabile Zone rückt. Vollständige Methodik: M4 lokale LLM Hub-Benchmarks.

4. Konfiguration: Ollama vs. MLX Speicher-Footprint (gemessen)

Viele nehmen an, MLX sei „nativer“ und spare RAM — Messungen sagen das Gegenteil. Gleiches Modell und Quantisierung: Gewichte und KV fast identisch; Unterschied liegt in der Runtime-Architektur, nicht in GB.

VergleichOllamaMLXGemessenes Delta
Modellgewichte (Llama 3.1 8B Q4)~4.9 GB~4.8 GBVernachlässigbar
Resident-Prozess~200–400 MB (Daemon)On-Demand, kein DaemonOllama etwas höher
tok/s (16GB sauber 8B)Median ~28.8~28–32MLX 0–12 % schneller (offline)
tok/s (24GB sauber 8B)Median ~51.2~52–55Abstand schrumpft
Claude Code-Anbindung✅ Nativ :11434❌ Eigenes HTTP nötigAgenten → Ollama
Nach Swap-Trigger11.2 → 3.4 tok/sGleiche Stufe, gleicher KollapsRAM-Stufe entscheidet alles
Konfig-Tipp: Alltag Agent / Claude Code → Ollama + Modell passend zur RAM-Stufe. Python-Benchmarks, CI-Regression, Forschungsskripte → MLX. Nicht auf 16GB zu MLX wechseln in der Hoffnung, 14B „RAM zu sparen“ — spart nicht.

14B remote ohne Schreibtisch-Upgrade? Eine Woche auf einem Macstripe 24GB Cloud-Knoten testen, Agent-Workflow validieren, dann Kaufentscheidung.

5. Lab-Daten: tok/s, TTFT und Swap-Klippe

Testumgebung: Mac Mini M4 (Mac14,3), macOS 15.4.1, Ollama 0.6.2, Default Q4_K_M. Maschinen-IDs m4-16gb-lab-01, m4-24gb-lab-02. Zeitraum 2026-05-28 bis 2026-07-18.

5.1 16GB: 7B stabil vs. 14B Kollaps

Modellrun 1run 2run 3MedianSwapins
qwen2.5:7b28.731.426.929.10
qwen2.5:14b11.28.43.4— (Session abgebrochen)8421+

14B auf 16GB ist nicht „etwas langsamer“, sondern Drei-Phasen-Kollaps: run 1 OK → run 2 Swap beginnt → run 3 memorystatus: WARN → Runner OOM beendet.

5.2 24GB: 14B im Sweet Spot

Modelltok/s fünf LäufeMedianTTFTSwapins
qwen2.5:7b49.2 / 53.8 / 51.1 / 48.6 / 52.451.1~2.0s0
qwen2.5:14b14.2 / 16.8 / 15.1 / 17.3 / 14.915.1~2.7s0

5.3 Raw-Log-Auszug

--- m4-16gb-lab-01 · qwen2.5:14b ---
run 1: tok/s=11.2  TTFT=2.71s
run 2: tok/s=8.4   Swapins: 1204
run 3: tok/s=3.4   memorystatus: WARN  TTFT=5.81s
run 4: ERROR runner killed (oom?)  Swapins: 8421

--- m4-24gb-lab-02 · qwen2.5:14b ---
tok/s: 14.2  16.8  15.1  17.3  14.9  median: 15.1

Vollständiges Log: resources/sample-benchmark-7b-14b-run.log; Repro-Skript: resources/benchmark-m4-mac-mini-ollama.sh.

6. Kanal: RAM-Upgrade kaufen vs. Cloud-Mac mieten

WegPassend fürVorteileNachteile
Kauf-Upgrade (16→24GB) Lokaler Agent mehrmals pro Woche, lange Offline-Läufe Einmalige Investition; Daten bleiben lokal Apple-RAM-Upgrades teuer; an einen Schreibtisch gebunden
Cloud-Mac tag-/monatsweise 14B testen, Peak-Jobs, Team-Knoten In Minuten live; 24GB/48GB on demand Netz nötig; Langzeit-ROI rechnen
Hybrid: 16GB lokal + 24GB Cloud Alltag 7B lokal, schwere Tasks in der Cloud Flexible Kosten; Peaks ohne Swap Zwei Umgebungen pflegen

Ein iOS- + AI-Stack-Dev nutzt Hybrid: 16GB lokal mit 7B für Completions, Claude-Code-Schwerlast per SSH auf Macstripe 24GB mit 14B — ~$103/Monat, planbarer als das Kaufzeit-RAM-Delta. Mietpreis-Vergleich: Gleicher Mac mini M4 — Mietpreise im Vergleich.

7. Upgrade-Preisdelta: was extra RAM kostet

Upgrade-PfadApple-Delta (ca., USD)Cloud-Monatsdelta (ca.)Wann es sich lohnt
16GB → 24GB+$200 (beim Kauf)+~$30–50/Monat3+ Mal/Woche: 7B „editiert falsch“
24GB → 32GB+$200AnbieterabhängigXcode CI + 14B auf einer Maschine
16GB → 48GB (M4 Pro)Neues GerätMacstripe 48GB-KnotenTeam-Share / 32B-Exploration

ROI-Skizze: Wenn 7B-Qualität 2 Extra-Stunden pro Woche kostet (bei ~$50/h), sind das ~$400/Monat — bereits über dem typischen Apple-Delta 16→24GB. RAM-Stufe ist oft das günstigste wirksame Upgrade, mehr als Framework-Wechsel oder Prompt-Tuning.

8. Checkliste und sieben Schritte zum Rollout

Vor Bestellung oder Imaging Erwartungen abgleichen:

  • ☐ Hauptnutzung Chat (7B reicht) oder Agent-Coding (eher 14B)
  • ☐ Gleichzeitig 20+ Chrome-Tabs + IDE?
  • ☐ Claude Code / Cursor mit lokalem Modell?
  • ☐ Runtime: Ollama (Agent) oder MLX (nur Benchmark)
  • ☐ Dauerhaft lokal oder Peak-Jobs in der Cloud
  • ☐ Budget für 16GB / 24GB / 32GB — welche Stufe?
  • ☐ Team-Sharing (→ 24GB+ oder Cloud-Knoten)
  • ☐ Swap-Risiko akzeptieren (16GB + 14B = hohes Risiko)

Sieben Schritte (Ollama-Pfad)

  1. RAM-Stufe und Zielmodell festlegen (16GB→7B; 24GB→14B)
  2. Ollama installieren: brew install ollama oder offizielles pkg
  3. Modell pullen: ollama pull qwen2.5-coder:7b (16GB) oder :14b (24GB)
  4. Metal prüfen: ollama serve-Log zeigt ggml_metal_init
  5. Benchmark: ./resources/benchmark-m4-mac-mini-ollama.sh
  6. Speicher beobachten: vm_stat + Aktivitätsanzeige Speicherdruck
  7. Agent anbinden: Claude Code auf http://127.0.0.1:11434

9. Zitierbare US-Startpreise (Stand 2026-07-21)

KonfigurationApple US-Listenpreis (USD)Education (ca.)Macstripe Cloud monatlich (USD)
M4 Mac Mini 16GB / 256GB$599~$539~$102.9
M4 Mac Mini 24GB / 256GB$799~$719~$130–150 (knotenabhängig)
M4 Mac Mini 32GB / 256GB$999~$899Angebot / individuell
M4 Pro 48GB (Inferenz-Knoten)$1.399+KonfigurationsabhängigSiehe Preispläne

Apple-Preise aus öffentlichen US-Store-Angaben; Education erfordert Berechtigung; Cloud-Tarife laut Macstripe-Preisseite zum Bestellzeitpunkt.

10. Szenario-Auswahl: wer welche Stufe kaufen sollte

ZielgruppeEmpfohlener RAMModell + FrameworkAlternative
Studierende / Neugierige16GB7B + OllamaCloud tageweise für 14B
Indie-Dev + Agent24GB14B + Ollama16GB lokal + 24GB Cloud Hybrid
iOS-Dev + lokales LLM32GB14B + Xcode auf einer BoxCI und Inferenz auf zwei Maschinen
Kleines Team Inferenz-Knoten48GBollama serve ClusterMacstripe 48GB-Knoten

Unsicher, ob 24GB reicht? Eine Woche Cloud-Mac mieten und echten Agent-Workflow fahren — zuverlässiger als zehn Benchmark-Artikel. Macstripe SSH/VNC direkt, ~5 Minuten bis live, kein Langzeitvertrag — dann Kauf vs. Miete entscheiden.

FAQ

M4 Mac Mini für lokale LLMs: 16GB oder 24GB?

Alltag 7B/8B + leichte IDE: 16GB. Stabiles 14B, Claude Code Agent oder viele Browser-Tabs: 24GB. 14B auf 16GB gemessen: tok/s von 11,2 auf 3,4.

Was verbraucht mehr Speicher — Ollama oder MLX?

Gleiches Modell und Quantisierung: meist unter 5 % Unterschied. Engpass ist Unified-Memory-Stufe, nicht Framework-Name. Agenten → Ollama.

Lohnt sich 32GB gegenüber 24GB?

Persönlich 14B + Standard-ctx: 24GB reicht meist. 32GB für Xcode CI + LLM auf einer Maschine oder größeres num_ctx.

Woran erkenne ich Speichermangel?

Speicherdruck-Anzeige, vm_stat Swapins steigen, tok/s bricht ein. memorystatus WARN ist das Vor-Swap-Signal.

Kann ich eine Cloud-Mac für lokale LLMs mieten, ohne Hardware zu kaufen?

Ja. Macstripe 16GB/24GB/48GB dedizierte M4-Knoten — per SSH einloggen, Ollama installieren; gut zum Testen von 14B oder als Team-Inferenz-Knoten.

Fazit

Auf dem M4 Mac Mini ist die RAM-Stufe ein Veto: 16GB für 7B + Ollama zum privaten Testen; 24GB ist der 14B-Agent-Sweet-Spot; 32GB für CI + großen Kontext auf einer Maschine. Ollama vs. MLX Speicherlücke vernachlässigbar — Framework nach Szenario wählen (Agent → Ollama, Benchmarks → MLX).

14B noch auf 16GB erzwingen? 7B vs. 14B Praxistest zu Swap-Daten lesen, oder 24GB Cloud-Mac eine Woche testen, bevor Sie entscheiden.

Weiterlesen