Poste de développement LLM local sur un portable modeste

Vous tapez « faire tourner un LLM sur PC modeste » et vous vous noyez dans des classements remplis de RTX 4090 et de 64 Go de RAM — loin de votre ultrabook 8 Go en graphique intégrée ou de ce vieux desktop GTX 1060 de cinq ans. La vraie question : sur le matériel que vous avez déjà, quelle pile logicielle adopter, quelle taille de modèle viser, et quand arrêter de lutter en local pour déléguer l'inférence au cloud ?

Fin juillet 2026, nous avons confronté trois machines typiques « modestes » — un portable i5 8 Go en graphique intégrée, un PC de bureau 16 Go sans GPU dédié, et un desktop GTX 1060 6 Go — à Ollama, LM Studio, llama.cpp, GPT4All, Jan et KoboldCpp avec les mêmes prompts et les mêmes niveaux de quantification. Cet article les compare selon cinq couches : entrée → exécution → contexte → coût → sécurité, avec une matrice de scénarios et une checklist d'essai en sept étapes. Écosystème de modèles et versions des outils au 2026-08-06.

Ce que livre cet article : le « classement » du titre désigne un parcours de décision trié par palier matériel — pas un palmarès hype. Réponse rapide : 8 Go → llama.cpp/GPT4All + 3B Q4 ; 16 Go intégré → Ollama/LM Studio + 7B Q4 ; vieille NVIDIA → KoboldCpp ; toujours bloqué → SSH vers un Mac cloud ou API à l'usage.

1. D'emblée : palier matériel × outil recommandé

Votre machinePlafond réalistePremier choixAlternative
Ultrabook 8 Go, graphique intégrée3B Q4 (pas d'IDE + navigateur en parallèle)llama.cpp ou GPT4AllJan (interface chat)
16 Go, sans GPU dédié7B Q4 ; prudence avec les agents multi-fenêtresOllama ou LM Studiollama.cpp en CLI
Vieille carte dédiée 6–8 Go VRAM7B Q4 sur couches GPU ; 14B risque OOMKoboldCppOllama + CUDA
Intégration Cursor / APISelon la RAM du nœud distantOllama (compatible OpenAI)Ollama distant en SSH
Le local ne suffit pasCloud 7B–70BAPI Groq / louer un Mac cloudOpenRouter

2. Ce que sont les six outils

Sur matériel modeste, un « outil d'exécution », c'est en réalité runtime d'inférence + gestion des modèles + (optionnel) interface de chat. Ces six noms reviennent le plus souvent dans la communauté Windows / Linux low-spec en 2026 (utilisateurs Mac : voir aussi MLX vs Ollama sur Apple Silicon).

OutilFormeMoteurAtout sur PC modeste
OllamaCLI + service en arrière-plan + API compatible OpenAIFamille llama.cppUne commande pour tirer les modèles ; branchement Cursor/Continue simple
LM StudioInterface graphique bureauPlusieurs backends (GGUF)Choix visuel de la quantification, lecture VRAM en direct — accessible aux débutants
llama.cppCLI / serveur purNatifOverhead minimal ; le plus contrôlable sur 8 Go
GPT4AllBureau + API optionnelleBranche llama.cpp, optimisé CPUMagasin de modèles intégré ; met l'accent sur l'inférence CPU
JanInterface chat localeSe connecte à Ollama / GGUF localCoque type ChatGPT sans toucher au terminal
KoboldCppWeb UI monofichier + APIllama.cpp + tuning vieilles GPUBouée de sauvetage pour GTX série 10 et cartes 6 Go VRAM

Groq et OpenRouter sont des API cloud — pas des « outils d'exécution locale » — mais sur une machine faible, ils constituent souvent la troisième voie la plus rationnelle que de forcer un 70B en local. Nous les traitons dans la section coûts.

3. Entrée et workflows : du téléchargement à la première réponse

ÉtapeOllamaLM Studiollama.cpp
InstallationInstalleur en un clic depuis le site.exe / .dmg depuis le siteBinaire précompilé ou compilation manuelle
Télécharger le modèleollama pull qwen2.5:3bRechercher GGUF → DownloadPlacer manuellement le .gguf dans un dossier
Discuterollama run ou APIOnglet Chat-m model.gguf -p "..."
Brancher l'IDElocalhost:11434/v1Interrupteur Local ServerMode --server
Changer de modèleModifier le tag et pull à nouveauChanger le fichier + rechargerModifier l'argument de chemin

Différence sur PC modeste : les interfaces LM Studio et Jan consomment elles-mêmes 200–400 Mo de RAM. Sur 8 Go avec Chrome et VS Code déjà ouverts, llama.cpp ou Ollama sans interface plus un navigateur ou un plugin IDE comme coque est généralement plus sûr. GPT4All se situe entre les deux — magasin intégré, un peu plus léger que LM Studio.

4. Couche exécution : quantification, offload GPU et scripts

CapacitéOllamaLM Studiollama.cppKoboldCpp
Quantification par défautSurtout Q4_K_MChoix Q4/Q5/Q8Tout manuelQ4, adapté aux vieilles GPU
Offload couches GPUAutomatiqueCurseur pour les GPU layersFlag -nglContrôle des couches dans la Web UI
Plafond CPU purBonBonMeilleurMoyen
Batch / CIScripts + APIFaibleFortAPI disponible
Visibilité mémoireollama psGraphiques en directMonitoring à prévoirGestionnaire des tâches

Benchmarks (2026-07-29, prompt unifié de génération 512 tokens, Qwen2.5 Instruct) :

MachineOutil + modèleMédiane tok/sNotes
Portable i5 8 Go intégréllama.cpp · 3B Q420,4Chrome fermé ; 20 onglets ouverts → chute à 11
Portable i5 8 Go intégréOllama · 7B Q44,1 (après swap)Déconseillé — ventilateurs à fond
16 Go, sans GPU dédiéOllama · 7B Q410,8~2–3× plus lent que le M4 16 Go 7B à ~29 tok/s, mais utilisable
16 Go, sans GPU dédiéLM Studio · 7B Q49,6La GUI ajoute ~300 Mo
GTX 1060 6 GoKoboldCpp · 7B Q428,735 GPU layers ; Ollama même config 24,1
GTX 1060 6 GoKoboldCpp · 14B Q4OOMNe forcez pas un 14B sur 6 Go VRAM

Le retour d'un développeur indie était typique : sur un portable Windows 16 Go, Ollama avec qwen2.5-coder:7b via le plugin Continue gérait bien les complétions quotidiennes — jusqu'à ce qu'il lance un émulateur Android en parallèle. Le swap a fait passer la latence du premier token de 1,8 s à plus de 6 s. Sur machine modeste, la liste des processus en arrière-plan compte autant que le choix du modèle.

Pour déporter l'inférence hors du portable, installez Ollama sur un Mac distant et pointez votre IDE local vers http://ip-distante:11434 — voir §13 pour la répartition des charges sur Mac cloud.

5. Couche contexte : quelle longueur et quelle taille sur matériel modeste

ScénarioRecommandation 8 GoRecommandation 16 GoVieille GPU 6 Go
Chat occasionnel3B · ctx 4k7B · ctx 8k7B · ctx 4k
Complétion de code3B coder Q47B coder Q47B coder Q4
Agent multi-fichiersDéconseillé en local7B + ctx court ou cloud7B mono-fichier OK
Q&A sur long PDFRAG cloud7B + découpage externeIdem à gauche
Besoin de confidentialité hors ligne3B local suffit pour les résumés7B gère la plupart des scripts7B bat 3B pour le code

Un contexte plus long signifie un cache KV qui grossit linéairement en mémoire. Sur 8 Go, passer le ctx de 4096 à 8192 sur un modèle 7B peut transformer « ça tourne » en « swap instantané ». Sur matériel modeste, raccourcissez le ctx et utilisez le découpage RAG plutôt que de forcer une fenêtre 32k.

6. Structure des coûts : électricité locale, temps et cloud à l'usage

Au 2026-08-06, les montants en dollars ci-dessous illustrent la structure uniquement — consultez la page de facturation de chaque plateforme. Pour le détail des tarifs API unitaires, voir notre guide des coûts API GPT.

PosteStack localGroq / OpenRouterMac cloud + Ollama
Licence logicielleTout gratuit / open sourceAu tokenMacstripe jour/semaine/mois
Amortissement matérielMachine existante = 0 marginal0 $La location remplace l'upgrade
Électricité (ordre de grandeur)Portable 45 W × 2 h/jour ≈ négligeableInclus dans la location
Facture mensuelle type (dev perso modéré)0 $ (électricité seule)5–25 $Selon forfait ; pics souvent moins chers qu'acheter de la RAM
Coût cachéTemps de réglage, debug du swapDonnées hors pays, limites de débitLatence SSH — choisir un nœud proche

Facture cachée 1 : passer à 32 Go de RAM (si c'est même possible) coûte 50–100 $ — de quoi louer un Mac cloud pendant des semaines. Pour des expérimentations d'agent ponctuelles, louez d'abord, achetez ensuite.
Facture cachée 2 : l'espace disque — chaque modèle 7B Q4 fait ~4,5 Go ; cinq modèles, c'est 22 Go. Un SSD 256 Go se remplit vite.
Facture cachée 3 : le tier gratuit Groq a des plafonds RPM — aux heures de pointe, les complétions font la queue. Ne mettez pas un chemin critique sur une seule API sans repli.

7. Sécurité et confidentialité : le « local » est-il vraiment local ?

  • Données d'inférence : Ollama, llama.cpp et KoboldCpp restent hors ligne par défaut ; LM Studio en mode hors ligne aussi
  • Téléchargement des modèles : le premier pull passe par Hugging Face / CDN Ollama — les réseaux d'entreprise peuvent exiger une autorisation ou un miroir
  • Magasin Jan / GPT4All : vérifiez les paramètres de télémétrie anonyme ; désactivez en environnement entreprise
  • Ollama distant : n'exposez jamais 0.0.0.0:11434 sur Internet public ; tunnel SSH ou VPN
  • Voie API : Groq/OpenRouter envoient les prompts hors machine — le contenu sensible reste en local ou sur un Mac cloud privé

8. Matrice de scénarios : premier choix, repli, à éviter

ScénarioPremier choixRepliÀ éviter
Portable 8 Go, chat hors lignellama.cpp + 3BGPT4AllOllama 7B
Débutant Windows, clic et c'est partiLM StudioJan + Ollamallama.cpp compilé soi-même
Complétion Cursor / ContinueAPI OllamaServeur LM StudioKoboldCpp brut (intégration IDE faible)
Vieille carte GTX 1060 / 1660KoboldCppOllama CUDA14B forcé en CPU
Agent de code multi-toursCloud 14B+ ou Mac cloud 24 GoGroq 8x7BAgent 7B local sur 8 Go
Zéro tolérance au terminalJan ou LM StudioGPT4Allllama.cpp nu

Cas concret : un freelance Flutter sur un portable 16 Go intégré utilisait Ollama qwen2.5-coder:7b pour le boilerplate — deux heures d'inférence locale par jour, zéro facture API. Les refactors complets de dépôt passaient en SSH sur un Mac cloud Macstripe en 14B ; le week-end éteint, le ventilateur local se taisait. Un étudiant en 8 Go utilisait GPT4All 3B pour réviser des algorithmes — correct jusqu'à ce qu'il force un 7B avec Word, messagerie et modèle ouverts. Le swap a rendu le système inutilisable ; le passage à llama.cpp mono-processus a restauré ~20 tok/s.

9. Combinaisons et lignes rouges : ne pas empiler comme ça

  1. Ligne rouge : machine 8 Go qui tire par défaut un 7B/14B « parce que tout le monde le dit » — benchmark d'abord en 3B, surveillez la courbe mémoire, puis montez en charge.
  2. Ligne rouge : Ollama à l'écoute sur Internet public sans authentification — les scanners abuseront de votre GPU ; liez à localhost ou SSH-forward uniquement.
  3. Ligne rouge : agent local + émulateur Android + 100 onglets Chrome simultanément — même le meilleur outil swappera ; isolez l'environnement pendant les fenêtres d'inférence.

Combinaisons solides : au quotidien Ollama 7B en complétion sur portable 16 Go + pic en SSH sur Mac cloud 14B ; portable 8 Go GPT4All 3B pour notes hors ligne + tier gratuit Groq en urgence ; vieux desktop KoboldCpp comme nœud d'inférence domestique, le portable l'appelle en API.

10. Tableau de décision finale

Auto-diagnosticSi oui →Si non →
RAM physique ≤ 8 Go ?llama.cpp/GPT4All + 3BEssayer 7B Q4
Vieille NVIDIA 6 Go+ VRAM ?KoboldCpp en premierOllama/LM Studio en CPU
Besoin d'API OpenAI pour l'IDE ?OllamaServeur LM Studio
Zéro tolérance au terminal ?LM Studio ou Jan
Agent multi-fichiers plusieurs fois par semaine ?Mac cloud / API7B local en compromis
Les données ne doivent pas quitter le pays ?Local ou Mac cloud privéDésactiver Groq etc.

11. Trois idées reçues

Idée reçue 1 : « classement d'outils = acheter le matériel le plus cher » — sur machine modeste, le niveau de quantification et la gestion des processus en arrière-plan comptent souvent plus que l'icône de l'app. Sur la même machine, 3B Q4 vs 7B bridé par le swap, l'écart se sent plus fort qu'Ollama vs LM Studio.

Idée reçue 2 : « le local est toujours moins cher que l'API » — si le local lent vous fait relancer sans cesse, ou si vous upgradez la RAM juste pour faire tenir un 7B, le coût total peut dépasser Groq à l'usage. Comptez le temps pour finir la tâche réelle, pas seulement l'électricité.

Idée reçue 3 : « Ollama est le plus simple en un clic, donc pour tout le monde » — au plafond 8 Go, llama.cpp nu avec un daemon de moins est souvent plus stable ; les outils GUI coûtent de la RAM. Choisissez par palier matériel, pas par le buzz.

12. Plan d'essai en sept étapes (à terminer en une semaine)

  1. Noter votre palier : RAM, GPU dédié oui/non, >15 Go de disque libre.
  2. Installer Ollama, tirer qwen2.5:3b (8 Go) ou qwen2.5:7b (16 Go), noter la mémoire via ollama ps.
  3. Même prompt, mesurer les tok/s : générer 200 tokens, noter le temps ; rouvrir 20 onglets Chrome et refaire pour voir l'impact du swap.
  4. Installer LM Studio ou GPT4All, refaire le test, juger si l'overhead GUI est acceptable.
  5. Si vous avez une vieille carte NVIDIA, essayer KoboldCpp, régler les GPU layers jusqu'à une marche avant l'OOM.
  6. Brancher l'IDE : pointer Continue ou Cursor vers l'API Ollama locale, lancer 10 complétions, noter le taux de succès.
  7. Écrire des règles de routage : par ex. « en semaine 7B local, le week-end agent sur Mac cloud » ou « 8 Go offline 3B uniquement ».

13. Quand le local ne suffit pas : Mac cloud comme carte d'inférence externe

Les goulots d'étranglement sur PC modeste, ce sont en général la mémoire unifiée / la vieille VRAM / la thermique — pas l'icône d'Ollama. Quand vous avez besoin d'un agent de code 14B, de l'accélération MLX ou de longs jobs batch sans racheter du matériel, déplacer l'inférence vers un Mac Mini M4 dédié revient souvent moins cher qu'un upgrade complet : SSH, ollama serve, et vous continuez à coder sur Windows en local.

Le Mac cloud Macstripe se loue à la journée/semaine/mois, opérationnel en environ cinq minutes — idéal pour « portable 8 Go pour le léger + cloud 24 Go pour les pics ». Pour démarrer, voir louer un Mac pour faire tourner des agents IA ; pour les perfs Ollama vs MLX sur Apple Silicon, MLX vs Ollama ; pour les limites mémoire 7B/14B, test réel M4 Mac Mini 7B vs 14B.

FAQ

Un PC 8 Go peut-il faire tourner des LLM en local ?

Oui — mais en restant sur des modèles 3B en Q4, de préférence avec llama.cpp ou GPT4All. Évitez de lancer navigateur et IDE en parallèle. Sur un ultrabook 8 Go, Qwen2.5-3B Q4 atteint environ 18–22 tok/s ; forcer un 7B déclenche souvent le swap et fait chuter la vitesse à un chiffre.

Ollama ou LM Studio sur un PC modeste ?

Choisissez LM Studio pour une interface graphique et le téléchargement de modèles en un clic ; Ollama pour les scripts, l'API et l'automatisation. Sur 8 Go, commencez avec 3B dans les deux cas ; sur 16 Go sans GPU dédié, un 7B Q4 est réaliste.

Quel outil pour une vieille GTX 1060 6 Go ?

KoboldCpp ou une build CUDA de llama.cpp en premier — un 7B Q4 tourne typiquement à 25–32 tok/s. Ollama fonctionne aussi, mais la fragmentation VRAM le rend parfois moins stable que KoboldCpp sur les cartes anciennes.

Que faire si l'inférence locale est trop lente sans upgrader le matériel ?

Trois pistes : des API à l'usage comme Groq ou OpenRouter ; une connexion SSH vers un Mac distant avec Ollama ou MLX ; ou la location d'un Mac cloud Macstripe dédié pour l'inférence, en gardant l'éditeur en local.

Synthèse

Faire tourner des LLM sur matériel modeste : choisissez d'abord la taille du modèle selon le palier RAM, puis l'outil selon le workflow — pas l'inverse. 8 Go → 3B + llama.cpp/GPT4All ; 16 Go intégré → Ollama/LM Studio + 7B Q4 ; vieille NVIDIA → KoboldCpp ; agents et 14B → Mac cloud ou API. Deux phrases à retenir : le swap fait plus mal qu'un changement d'outil ; local et cloud se combinent, ce n'est pas l'un ou l'autre.

Pour aller plus loin :