Vous voulez faire tourner des LLM en local sans faire hurler le ventilateur de votre portable — un Mac serveur dédié est la solution la plus simple : une machine macOS toujours allumée gère l’inférence Ollama, votre portable Windows ne sert que de « télécommande ». Cet article vous donne une chronologie de 30 minutes à copier-coller pour que même un débutant obtienne ce soir son premier curl vers un modèle local.
Public visé : vous savez copier-coller des commandes terminal et avez des notions réseau. Pas besoin de Swift ni de posséder un Mac. Date de référence : 2026-07-27.
En bref : ce que vous devriez voir après 30 minutes
| Jalon | Terminé quand | Durée approx. |
|---|---|---|
| Mac accessible | ssh user@host réussit |
0–5 min |
| Environnement de base prêt | brew --version affiche une sortie |
5–12 min |
| Service d’inférence actif | ollama list montre un modèle téléchargé |
12–20 min |
| Outils IA connectés | curl vers l’API locale renvoie du JSON |
20–26 min |
| Validation OK | script de santé tout au vert | 26–30 min |
Deux chemins : acheter un Mac mini vs Mac cloud
| Dimension | Mac mini M4 en propre | Mac cloud (ex. Macstripe) |
|---|---|---|
| Étape 0 | Déballer, alimenter, configuration macOS | Commander dans la console → recevoir les identifiants SSH |
| Pour qui | Modèles 7×24 sur le long terme | Essai débutant, projet court, pas de Mac local |
| RAM conseillée | 24 Go minimum (serveur dev IA) | Forfait 24 Go |
| Faisable en 30 min ? | Oui (système préinstallé) | Plus facile (pas d’étape matérielle) |
Règle simple : pas sûr d’acheter → louez un Mac cloud une semaine. Utilisation >60 % et besoin sur six mois ou plus → évaluez l’achat. Comparaisons de config : benchmark mémoire M4.
Avant de commencer : ce qu’il vous faut
- ☐ Un ordinateur connecté (Windows / Linux / un autre Mac)
- ☐ Client SSH (OpenSSH inclus sous Windows 10+ ; terminal macOS/Linux)
- ☐ Réseau stable (premier pull ~4–5 Go ; filaire ou Wi‑Fi 5 GHz recommandé)
- ☐ Droits administrateur (installer Homebrew, modifier Réglages Système)
- Mac serveur dédié au développement IA
- Nœud macOS qui ne fait pas le travail bureautique quotidien et exécute Ollama, agents et CI léger. Séparé du portable principal pour éviter que le swap ralentisse toute la machine.
- Pas une tranche de VM
- Les LLM locaux sur Apple Silicon exigent Metal et mémoire unifiée complets. Choisissez un Mac physiquement dédié (propre ou cloud bare metal), pas un « bureau Mac cloud à vCPU partagés » déguisé en serveur.
Minutes 0–5 : obtenir un Mac accessible en SSH
Chemin A : Mac cloud (recommandé aux débutants)
- Dans la console Macstripe, choisir un nœud M4 24 Go dans une région proche.
- Après provisionnement, noter : IP, port SSH, nom d’utilisateur, mot de passe initial (ou clé).
- Tester depuis votre machine :
ssh -p 22 your_user@your_server_ip
# À la première connexion, taper yes pour faire confiance à l’empreinte
Chemin B : Mac mini en propre
- Terminer l’assistant de configuration macOS, créer un utilisateur local.
- Réglages Système → Général → Partage → Connexion à distance : activer.
- Sur le même LAN :
ssh your_user@mac-mini.local, ou redirection de port sur le routeur (production : Tailscale / WireGuard — hors scope ici).
AllowUsers.Minutes 5–12 : initialisation système et Homebrew
Après connexion, exécuter dans l’ordre (bloc entier copiable) :
# 1. Vérifier Apple Silicon et la mémoire
uname -m # doit afficher arm64
sysctl hw.memsize | awk '{print $2/1024/1024/1024 " GB"}'
# 2. Outils en ligne de commande Xcode (cliquer Installer, ~2–5 min)
xcode-select --install 2>/dev/null || true
# 3. Installer Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
echo 'eval "$(/opt/homebrew/bin/brew shellenv)"' >> ~/.zprofile
eval "$(/opt/homebrew/bin/brew shellenv)"
# 4. Outils de base
brew install git jq htop
Clavier : coller dans le Terminal macOS avec ⌘+V ; sur un terminal Windows distant, souvent Ctrl+Shift+V.
Si brew échoue sur les droits : utilisateur administrateur ? MDM d’entreprise qui bloque les sources ?
Minutes 12–20 : installer Ollama et le premier modèle
# Installer Ollama (script officiel)
curl -fsSL https://ollama.com/install.sh | sh
# Démarrage à la connexion (optionnel ; recommandé serveur)
brew services start ollama
# Tirer un modèle 7B orienté code (~4,5 Go ; 3–10 min selon le réseau)
ollama pull qwen2.5-coder:7b
# Test rapide
ollama run qwen2.5-coder:7b "Explique en une phrase ce qu'est un Mac serveur dédié"
| Modèle | RAM (approx.) | Usage |
|---|---|---|
qwen2.5-coder:7b |
5–6 Go | Complétion quotidienne, refactor d’un fichier |
deepseek-coder:6.7b |
5 Go | Modèle coder alternatif |
qwen2.5-coder:14b |
10–12 Go | Machines 24 Go+ uniquement — voir benchmark mémoire |
Pas besoin de tergiverser sur le framework : en débutant, Ollama par défaut. Détails : règles par défaut Ollama vs MLX.
Minutes 20–26 : brancher la chaîne outils IA
Trois branchements courants — un seul suffit pour cette section.
Option 1 : Cursor local + API Ollama distante
Sur votre portable, installez Cursor et pointez le point de terminaison compatible OpenAI vers le Mac serveur :
# Sur le Mac serveur : l’API répond ? (défaut 11434)
curl http://127.0.0.1:11434/api/tags
Pour un accès LAN temporaire (dev uniquement) :
# Exemple seulement : en prod, pare-feu / reverse proxy + TLS
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
brew services restart ollama
Depuis le navigateur du portable : http://IP_SERVEUR:11434 — réponse API ou 404 avec port ouvert.
Option 2 : Claude Code en SSH
# Sur le Mac serveur
npm install -g @anthropic-ai/claude-code # ou doc officielle
claude # connexion selon les invites ; modèles cloud possibles
Modèles locaux en complément : configurer Ollama en backend compatible OpenAI (même point de terminaison que l’option 1).
Option 3 : VS Code Remote-SSH
- Sur le portable : VS Code + extension Remote-SSH.
Cmd/Ctrl+Shift+P→ Remote-SSH: Connect to Host →your_user@your_server_ip.- Dans la fenêtre distante, extensions Python / langages ; le code s’exécute côté serveur.
Benchmarks des trois outils sur une même machine : benchmark programmation IA M4.
Minutes 26–30 : validation et contrôle de santé
Enregistrer ci-dessous dans ~/ai-mac-healthcheck.sh et chmod +x :
#!/bin/bash
set -e
echo "== AI Mac Server Health Check =="
echo -n "[1/5] Architecture: "; uname -m
echo -n "[2/5] Free memory (GB): "; vm_stat | awk '/Pages free/ {print $3*4096/1024/1024/1024}'
echo -n "[3/5] Ollama: "; command -v ollama && ollama --version
echo -n "[4/5] Models: "; ollama list | tail -n +2 | wc -l | xargs echo "count"
echo -n "[5/5] API probe: "
curl -sf http://127.0.0.1:11434/api/tags >/dev/null && echo "OK" || echo "FAIL"
echo "Done."
Critères de validation (déplier)
- Aucun
FAILsur les cinq contrôles - `ollama run` commence à répondre en moins de 10 secondes
- SSH stable depuis le portable pendant 10 minutes
- Espace disque libre > 30 Go (modèles et journaux croissent)
Pièges fréquents et correctifs rapides
| Symptôme | Cause probable | Action |
|---|---|---|
ollama très lent / timeout |
RAM insuffisante, swap | Modèle 7B ; fermer Chrome ; passer à 24 Go |
SSH Connection refused |
Connexion à distance désactivée / pare-feu | Partage et groupe de sécurité |
brew bloqué |
Connexion GitHub instable | Changer de région ou proxy |
| API inaccessible de l’extérieur | Écoute sur 127.0.0.1 seulement | OLLAMA_HOST + liste blanche pare-feu |
Premier pull interrompu |
Réseau instable | Relancer ollama pull — reprise supportée |
Ancienne idée : « un serveur dev IA doit être un serveur GPU ».
Sur Apple Silicon, mémoire unifiée + Metal font l’inférence locale ;louer aveuglément un cloud GPU Linuxcasse souvent l’écosystème Cursor / Xcode.
Conclusion : la suite
Après 30 minutes vous devriez avoir :
- Un nœud macOS accessible en SSH (Mac cloud ou Mac mini)
- Ollama actif + au moins un modèle coder
- Un chemin de dev IA depuis le portable (API Cursor / Claude Code / Remote-SSH — au choix)
Action J+1 : lancer une tâche agent sur un vrai dépôt, noter pic mémoire et tok/s. Si 16 Go swap en permanence, allez au benchmark configuration mémoire — ne forcez pas sur une machine trop lente.
Rappel de la chronologie
| Minutes | Tâche |
|---|---|
| 0–5 | Mac + connexion SSH |
| 5–12 | outils CLI + Homebrew |
| 12–20 | Ollama + qwen2.5-coder:7b |
| 20–26 | Cursor / Claude Code / VS Code |
| 26–30 | validation ai-mac-healthcheck.sh |
Pas encore de machine ? Passez d’abord le flux sur un Mac cloud, puis décidez d’un second Mac mini en salle — mieux que d’acheter et découvrir un manque de RAM.
Questions fréquemment posées
Débutant total—30 minutes suffisent ?
Oui pour la boucle minimale : login distant + inférence Ollama + un appel API. Prévoyez +15–30 min pour Xcode ou premier téléchargement de modèle. Cloud Mac souvent prêt en moins de 5 minutes.
Faut-il acheter un Mac mini ?
Non. L'essentiel : macOS stable, RAM suffisante, nœud SSH permanent. Louez un cloud Mac à la journée, validez le workflow, puis décidez.
16 Go de RAM suffisent ?
Pour modèle coder 7B + Agent léger oui ; pas Chrome à 50 onglets + Xcode + 14B. Serveur quotidien : 24 Go+ ; 14B permanent ou multi-utilisateur : 32 Go+.
Ollama ou MLX ?
Débutants : Ollama par défaut. MLX pour bench et fine-tuning—pas obligatoire pour ce premier guide serveur.
Coder depuis un PC Windows ?
Claude Code en SSH ; VNC ou VS Code Remote-SSH pour le GUI. Cursor en local, API Ollama vers le port 11434 du Mac.