Vous tapez « faire tourner un LLM sur PC modeste » et vous vous noyez dans des classements remplis de RTX 4090 et de 64 Go de RAM — loin de votre ultrabook 8 Go en graphique intégrée ou de ce vieux desktop GTX 1060 de cinq ans. La vraie question : sur le matériel que vous avez déjà, quelle pile logicielle adopter, quelle taille de modèle viser, et quand arrêter de lutter en local pour déléguer l'inférence au cloud ?
Fin juillet 2026, nous avons confronté trois machines typiques « modestes » — un portable i5 8 Go en graphique intégrée, un PC de bureau 16 Go sans GPU dédié, et un desktop GTX 1060 6 Go — à Ollama, LM Studio, llama.cpp, GPT4All, Jan et KoboldCpp avec les mêmes prompts et les mêmes niveaux de quantification. Cet article les compare selon cinq couches : entrée → exécution → contexte → coût → sécurité, avec une matrice de scénarios et une checklist d'essai en sept étapes. Écosystème de modèles et versions des outils au 2026-08-06.
1. D'emblée : palier matériel × outil recommandé
| Votre machine | Plafond réaliste | Premier choix | Alternative |
|---|---|---|---|
| Ultrabook 8 Go, graphique intégrée | 3B Q4 (pas d'IDE + navigateur en parallèle) | llama.cpp ou GPT4All | Jan (interface chat) |
| 16 Go, sans GPU dédié | 7B Q4 ; prudence avec les agents multi-fenêtres | Ollama ou LM Studio | llama.cpp en CLI |
| Vieille carte dédiée 6–8 Go VRAM | 7B Q4 sur couches GPU ; 14B risque OOM | KoboldCpp | Ollama + CUDA |
| Intégration Cursor / API | Selon la RAM du nœud distant | Ollama (compatible OpenAI) | Ollama distant en SSH |
| Le local ne suffit pas | Cloud 7B–70B | API Groq / louer un Mac cloud | OpenRouter |
2. Ce que sont les six outils
Sur matériel modeste, un « outil d'exécution », c'est en réalité runtime d'inférence + gestion des modèles + (optionnel) interface de chat. Ces six noms reviennent le plus souvent dans la communauté Windows / Linux low-spec en 2026 (utilisateurs Mac : voir aussi MLX vs Ollama sur Apple Silicon).
| Outil | Forme | Moteur | Atout sur PC modeste |
|---|---|---|---|
| Ollama | CLI + service en arrière-plan + API compatible OpenAI | Famille llama.cpp | Une commande pour tirer les modèles ; branchement Cursor/Continue simple |
| LM Studio | Interface graphique bureau | Plusieurs backends (GGUF) | Choix visuel de la quantification, lecture VRAM en direct — accessible aux débutants |
| llama.cpp | CLI / serveur pur | Natif | Overhead minimal ; le plus contrôlable sur 8 Go |
| GPT4All | Bureau + API optionnelle | Branche llama.cpp, optimisé CPU | Magasin de modèles intégré ; met l'accent sur l'inférence CPU |
| Jan | Interface chat locale | Se connecte à Ollama / GGUF local | Coque type ChatGPT sans toucher au terminal |
| KoboldCpp | Web UI monofichier + API | llama.cpp + tuning vieilles GPU | Bouée de sauvetage pour GTX série 10 et cartes 6 Go VRAM |
Groq et OpenRouter sont des API cloud — pas des « outils d'exécution locale » — mais sur une machine faible, ils constituent souvent la troisième voie la plus rationnelle que de forcer un 70B en local. Nous les traitons dans la section coûts.
3. Entrée et workflows : du téléchargement à la première réponse
| Étape | Ollama | LM Studio | llama.cpp |
|---|---|---|---|
| Installation | Installeur en un clic depuis le site | .exe / .dmg depuis le site | Binaire précompilé ou compilation manuelle |
| Télécharger le modèle | ollama pull qwen2.5:3b | Rechercher GGUF → Download | Placer manuellement le .gguf dans un dossier |
| Discuter | ollama run ou API | Onglet Chat | -m model.gguf -p "..." |
| Brancher l'IDE | localhost:11434/v1 | Interrupteur Local Server | Mode --server |
| Changer de modèle | Modifier le tag et pull à nouveau | Changer le fichier + recharger | Modifier l'argument de chemin |
Différence sur PC modeste : les interfaces LM Studio et Jan consomment elles-mêmes 200–400 Mo de RAM. Sur 8 Go avec Chrome et VS Code déjà ouverts, llama.cpp ou Ollama sans interface plus un navigateur ou un plugin IDE comme coque est généralement plus sûr. GPT4All se situe entre les deux — magasin intégré, un peu plus léger que LM Studio.
4. Couche exécution : quantification, offload GPU et scripts
| Capacité | Ollama | LM Studio | llama.cpp | KoboldCpp |
|---|---|---|---|---|
| Quantification par défaut | Surtout Q4_K_M | Choix Q4/Q5/Q8 | Tout manuel | Q4, adapté aux vieilles GPU |
| Offload couches GPU | Automatique | Curseur pour les GPU layers | Flag -ngl | Contrôle des couches dans la Web UI |
| Plafond CPU pur | Bon | Bon | Meilleur | Moyen |
| Batch / CI | Scripts + API | Faible | Fort | API disponible |
| Visibilité mémoire | ollama ps | Graphiques en direct | Monitoring à prévoir | Gestionnaire des tâches |
Benchmarks (2026-07-29, prompt unifié de génération 512 tokens, Qwen2.5 Instruct) :
| Machine | Outil + modèle | Médiane tok/s | Notes |
|---|---|---|---|
| Portable i5 8 Go intégré | llama.cpp · 3B Q4 | 20,4 | Chrome fermé ; 20 onglets ouverts → chute à 11 |
| Portable i5 8 Go intégré | Ollama · 7B Q4 | 4,1 (après swap) | Déconseillé — ventilateurs à fond |
| 16 Go, sans GPU dédié | Ollama · 7B Q4 | 10,8 | ~2–3× plus lent que le M4 16 Go 7B à ~29 tok/s, mais utilisable |
| 16 Go, sans GPU dédié | LM Studio · 7B Q4 | 9,6 | La GUI ajoute ~300 Mo |
| GTX 1060 6 Go | KoboldCpp · 7B Q4 | 28,7 | 35 GPU layers ; Ollama même config 24,1 |
| GTX 1060 6 Go | KoboldCpp · 14B Q4 | OOM | Ne forcez pas un 14B sur 6 Go VRAM |
Le retour d'un développeur indie était typique : sur un portable Windows 16 Go, Ollama avec qwen2.5-coder:7b via le plugin Continue gérait bien les complétions quotidiennes — jusqu'à ce qu'il lance un émulateur Android en parallèle. Le swap a fait passer la latence du premier token de 1,8 s à plus de 6 s. Sur machine modeste, la liste des processus en arrière-plan compte autant que le choix du modèle.
Pour déporter l'inférence hors du portable, installez Ollama sur un Mac distant et pointez votre IDE local vers http://ip-distante:11434 — voir §13 pour la répartition des charges sur Mac cloud.
5. Couche contexte : quelle longueur et quelle taille sur matériel modeste
| Scénario | Recommandation 8 Go | Recommandation 16 Go | Vieille GPU 6 Go |
|---|---|---|---|
| Chat occasionnel | 3B · ctx 4k | 7B · ctx 8k | 7B · ctx 4k |
| Complétion de code | 3B coder Q4 | 7B coder Q4 | 7B coder Q4 |
| Agent multi-fichiers | Déconseillé en local | 7B + ctx court ou cloud | 7B mono-fichier OK |
| Q&A sur long PDF | RAG cloud | 7B + découpage externe | Idem à gauche |
| Besoin de confidentialité hors ligne | 3B local suffit pour les résumés | 7B gère la plupart des scripts | 7B bat 3B pour le code |
Un contexte plus long signifie un cache KV qui grossit linéairement en mémoire. Sur 8 Go, passer le ctx de 4096 à 8192 sur un modèle 7B peut transformer « ça tourne » en « swap instantané ». Sur matériel modeste, raccourcissez le ctx et utilisez le découpage RAG plutôt que de forcer une fenêtre 32k.
6. Structure des coûts : électricité locale, temps et cloud à l'usage
Au 2026-08-06, les montants en dollars ci-dessous illustrent la structure uniquement — consultez la page de facturation de chaque plateforme. Pour le détail des tarifs API unitaires, voir notre guide des coûts API GPT.
| Poste | Stack local | Groq / OpenRouter | Mac cloud + Ollama |
|---|---|---|---|
| Licence logicielle | Tout gratuit / open source | Au token | Macstripe jour/semaine/mois |
| Amortissement matériel | Machine existante = 0 marginal | 0 $ | La location remplace l'upgrade |
| Électricité (ordre de grandeur) | Portable 45 W × 2 h/jour ≈ négligeable | — | Inclus dans la location |
| Facture mensuelle type (dev perso modéré) | 0 $ (électricité seule) | 5–25 $ | Selon forfait ; pics souvent moins chers qu'acheter de la RAM |
| Coût caché | Temps de réglage, debug du swap | Données hors pays, limites de débit | Latence SSH — choisir un nœud proche |
Facture cachée 1 : passer à 32 Go de RAM (si c'est même possible) coûte 50–100 $ — de quoi louer un Mac cloud pendant des semaines. Pour des expérimentations d'agent ponctuelles, louez d'abord, achetez ensuite.
Facture cachée 2 : l'espace disque — chaque modèle 7B Q4 fait ~4,5 Go ; cinq modèles, c'est 22 Go. Un SSD 256 Go se remplit vite.
Facture cachée 3 : le tier gratuit Groq a des plafonds RPM — aux heures de pointe, les complétions font la queue. Ne mettez pas un chemin critique sur une seule API sans repli.
7. Sécurité et confidentialité : le « local » est-il vraiment local ?
- Données d'inférence : Ollama, llama.cpp et KoboldCpp restent hors ligne par défaut ; LM Studio en mode hors ligne aussi
- Téléchargement des modèles : le premier pull passe par Hugging Face / CDN Ollama — les réseaux d'entreprise peuvent exiger une autorisation ou un miroir
- Magasin Jan / GPT4All : vérifiez les paramètres de télémétrie anonyme ; désactivez en environnement entreprise
- Ollama distant : n'exposez jamais
0.0.0.0:11434sur Internet public ; tunnel SSH ou VPN - Voie API : Groq/OpenRouter envoient les prompts hors machine — le contenu sensible reste en local ou sur un Mac cloud privé
8. Matrice de scénarios : premier choix, repli, à éviter
| Scénario | Premier choix | Repli | À éviter |
|---|---|---|---|
| Portable 8 Go, chat hors ligne | llama.cpp + 3B | GPT4All | Ollama 7B |
| Débutant Windows, clic et c'est parti | LM Studio | Jan + Ollama | llama.cpp compilé soi-même |
| Complétion Cursor / Continue | API Ollama | Serveur LM Studio | KoboldCpp brut (intégration IDE faible) |
| Vieille carte GTX 1060 / 1660 | KoboldCpp | Ollama CUDA | 14B forcé en CPU |
| Agent de code multi-tours | Cloud 14B+ ou Mac cloud 24 Go | Groq 8x7B | Agent 7B local sur 8 Go |
| Zéro tolérance au terminal | Jan ou LM Studio | GPT4All | llama.cpp nu |
Cas concret : un freelance Flutter sur un portable 16 Go intégré utilisait Ollama qwen2.5-coder:7b pour le boilerplate — deux heures d'inférence locale par jour, zéro facture API. Les refactors complets de dépôt passaient en SSH sur un Mac cloud Macstripe en 14B ; le week-end éteint, le ventilateur local se taisait. Un étudiant en 8 Go utilisait GPT4All 3B pour réviser des algorithmes — correct jusqu'à ce qu'il force un 7B avec Word, messagerie et modèle ouverts. Le swap a rendu le système inutilisable ; le passage à llama.cpp mono-processus a restauré ~20 tok/s.
9. Combinaisons et lignes rouges : ne pas empiler comme ça
- Ligne rouge : machine 8 Go qui tire par défaut un 7B/14B « parce que tout le monde le dit » — benchmark d'abord en 3B, surveillez la courbe mémoire, puis montez en charge.
- Ligne rouge : Ollama à l'écoute sur Internet public sans authentification — les scanners abuseront de votre GPU ; liez à localhost ou SSH-forward uniquement.
- Ligne rouge : agent local + émulateur Android + 100 onglets Chrome simultanément — même le meilleur outil swappera ; isolez l'environnement pendant les fenêtres d'inférence.
Combinaisons solides : au quotidien Ollama 7B en complétion sur portable 16 Go + pic en SSH sur Mac cloud 14B ; portable 8 Go GPT4All 3B pour notes hors ligne + tier gratuit Groq en urgence ; vieux desktop KoboldCpp comme nœud d'inférence domestique, le portable l'appelle en API.
10. Tableau de décision finale
| Auto-diagnostic | Si oui → | Si non → |
|---|---|---|
| RAM physique ≤ 8 Go ? | llama.cpp/GPT4All + 3B | Essayer 7B Q4 |
| Vieille NVIDIA 6 Go+ VRAM ? | KoboldCpp en premier | Ollama/LM Studio en CPU |
| Besoin d'API OpenAI pour l'IDE ? | Ollama | Serveur LM Studio |
| Zéro tolérance au terminal ? | LM Studio ou Jan | — |
| Agent multi-fichiers plusieurs fois par semaine ? | Mac cloud / API | 7B local en compromis |
| Les données ne doivent pas quitter le pays ? | Local ou Mac cloud privé | Désactiver Groq etc. |
11. Trois idées reçues
Idée reçue 1 : « classement d'outils = acheter le matériel le plus cher » — sur machine modeste, le niveau de quantification et la gestion des processus en arrière-plan comptent souvent plus que l'icône de l'app. Sur la même machine, 3B Q4 vs 7B bridé par le swap, l'écart se sent plus fort qu'Ollama vs LM Studio.
Idée reçue 2 : « le local est toujours moins cher que l'API » — si le local lent vous fait relancer sans cesse, ou si vous upgradez la RAM juste pour faire tenir un 7B, le coût total peut dépasser Groq à l'usage. Comptez le temps pour finir la tâche réelle, pas seulement l'électricité.
Idée reçue 3 : « Ollama est le plus simple en un clic, donc pour tout le monde » — au plafond 8 Go, llama.cpp nu avec un daemon de moins est souvent plus stable ; les outils GUI coûtent de la RAM. Choisissez par palier matériel, pas par le buzz.
12. Plan d'essai en sept étapes (à terminer en une semaine)
- Noter votre palier : RAM, GPU dédié oui/non, >15 Go de disque libre.
- Installer Ollama, tirer
qwen2.5:3b(8 Go) ouqwen2.5:7b(16 Go), noter la mémoire viaollama ps. - Même prompt, mesurer les tok/s : générer 200 tokens, noter le temps ; rouvrir 20 onglets Chrome et refaire pour voir l'impact du swap.
- Installer LM Studio ou GPT4All, refaire le test, juger si l'overhead GUI est acceptable.
- Si vous avez une vieille carte NVIDIA, essayer KoboldCpp, régler les GPU layers jusqu'à une marche avant l'OOM.
- Brancher l'IDE : pointer Continue ou Cursor vers l'API Ollama locale, lancer 10 complétions, noter le taux de succès.
- Écrire des règles de routage : par ex. « en semaine 7B local, le week-end agent sur Mac cloud » ou « 8 Go offline 3B uniquement ».
13. Quand le local ne suffit pas : Mac cloud comme carte d'inférence externe
Les goulots d'étranglement sur PC modeste, ce sont en général la mémoire unifiée / la vieille VRAM / la thermique — pas l'icône d'Ollama. Quand vous avez besoin d'un agent de code 14B, de l'accélération MLX ou de longs jobs batch sans racheter du matériel, déplacer l'inférence vers un Mac Mini M4 dédié revient souvent moins cher qu'un upgrade complet : SSH, ollama serve, et vous continuez à coder sur Windows en local.
Le Mac cloud Macstripe se loue à la journée/semaine/mois, opérationnel en environ cinq minutes — idéal pour « portable 8 Go pour le léger + cloud 24 Go pour les pics ». Pour démarrer, voir louer un Mac pour faire tourner des agents IA ; pour les perfs Ollama vs MLX sur Apple Silicon, MLX vs Ollama ; pour les limites mémoire 7B/14B, test réel M4 Mac Mini 7B vs 14B.
FAQ
Un PC 8 Go peut-il faire tourner des LLM en local ?
Oui — mais en restant sur des modèles 3B en Q4, de préférence avec llama.cpp ou GPT4All. Évitez de lancer navigateur et IDE en parallèle. Sur un ultrabook 8 Go, Qwen2.5-3B Q4 atteint environ 18–22 tok/s ; forcer un 7B déclenche souvent le swap et fait chuter la vitesse à un chiffre.
Ollama ou LM Studio sur un PC modeste ?
Choisissez LM Studio pour une interface graphique et le téléchargement de modèles en un clic ; Ollama pour les scripts, l'API et l'automatisation. Sur 8 Go, commencez avec 3B dans les deux cas ; sur 16 Go sans GPU dédié, un 7B Q4 est réaliste.
Quel outil pour une vieille GTX 1060 6 Go ?
KoboldCpp ou une build CUDA de llama.cpp en premier — un 7B Q4 tourne typiquement à 25–32 tok/s. Ollama fonctionne aussi, mais la fragmentation VRAM le rend parfois moins stable que KoboldCpp sur les cartes anciennes.
Que faire si l'inférence locale est trop lente sans upgrader le matériel ?
Trois pistes : des API à l'usage comme Groq ou OpenRouter ; une connexion SSH vers un Mac distant avec Ollama ou MLX ; ou la location d'un Mac cloud Macstripe dédié pour l'inférence, en gardant l'éditeur en local.
Synthèse
Faire tourner des LLM sur matériel modeste : choisissez d'abord la taille du modèle selon le palier RAM, puis l'outil selon le workflow — pas l'inverse. 8 Go → 3B + llama.cpp/GPT4All ; 16 Go intégré → Ollama/LM Studio + 7B Q4 ; vieille NVIDIA → KoboldCpp ; agents et 14B → Mac cloud ou API. Deux phrases à retenir : le swap fait plus mal qu'un changement d'outil ; local et cloud se combinent, ce n'est pas l'un ou l'autre.
Pour aller plus loin :