Faire tourner un LLM directement sur son ordinateur semblait réservé aux chercheurs il y a deux ans. En 2026, c'est accessible à tout développeur disposant d'une machine correcte. Ollama a démocratisé l'installation en quelques commandes. Mistral, LLaMA 3.2 et Phi-3 atteignent des niveaux de performance surprenants sur des configs grand public. Ce guide vous explique comment installer, choisir et exploiter ces modèles open source locaux — avec les prérequis matériels, les cas d'usage et les limites réelles.
Sommaire
- Pourquoi faire tourner un LLM en local en 2026
- Ollama : l'outil de référence pour déployer des LLM sur son ordinateur
- Mistral 7B vs LLaMA 3.2 vs Phi-3 : quel modèle choisir
- Prérequis matériels : GPU, RAM, stockage
- Installation étape par étape sur Windows, macOS et Linux
- Intégrer un LLM local à vos outils existants
- RAG avec un LLM local : guide pratique
- Performances comparées : local vs cloud
- Limites des LLM locaux
- Les 5 cas d'usage pro où le LLM local surpasse le SaaS
En janvier 2023, exécuter un LLM en local nécessitait plusieurs GPU professionnels pour 50 000 euros et une maîtrise de PyTorch. En juin 2026, une seule commande bash télécharge et lance Mistral 7B sur un MacBook Pro M3 ou un PC avec une RTX 3080. Cette démocratisation a une conséquence importante : des milliers d'entreprises commencent à explorer les LLM locaux pour des cas d'usage où la confidentialité des données prime sur la puissance brute. Ce guide couvre tout ce qu'il faut savoir pour franchir le pas.
Pourquoi faire tourner un LLM en local en 2026
La question se pose légitimement : ChatGPT, Claude et Gemini sont accessibles en quelques secondes, pourquoi s'embêter avec une installation locale ? Quatre raisons expliquent l'intérêt croissant des LLM locaux.
La confidentialité des données. Quand vous envoyez un prompt à l'API OpenAI ou Anthropic, vos données transitent par leurs serveurs et sont potentiellement utilisées pour améliorer leurs modèles (selon leurs conditions d'utilisation actuelles). Pour les données médicales, juridiques, financières ou les informations client, ce transfert pose des problèmes de conformité RGPD et NIS2. Un LLM local ne sort jamais de votre machine — vos données restent sous votre contrôle total.
Le coût à grande échelle. Un usage intensif de GPT-5 ou Claude 4 peut coûter plusieurs milliers d'euros par mois pour une équipe de 20 personnes. Un LLM local, une fois installé, coûte... l'électricité. Pour les tâches répétitives à volume élevé (synthèse de documents, classification, génération de rapports), le ROI d'un LLM local est souvent positif en moins de trois mois.
La latence et la disponibilité. Un LLM cloud dépend de la connexion internet et de la disponibilité du service distant. Un LLM local fonctionne hors ligne et répond en millisecondes une fois chargé en mémoire, sans passer par le réseau.
La personnalisation via fine-tuning. Vous pouvez adapter un modèle open source à votre domaine métier, votre terminologie ou vos cas d'usage spécifiques — ce que les modèles cloud ne permettent pas (ou de façon très limitée et très coûteuse). Pour une vue complète de comment ces LLM locaux s'articulent avec les solutions de cybersécurité des PME, notre guide sur la conformité NIS2 pour les PME souligne l'importance de contrôler les flux de données.
Ollama : l'outil de référence pour déployer des LLM sur son ordinateur
Ollama (ollama.com) est devenu en 2024-2026 le standard de facto pour l'installation de LLM en local. Son succès repose sur une philosophie simple : installer un LLM doit être aussi simple qu'installer une application.
Ollama fonctionne comme un daemon en arrière-plan qui expose une API REST sur localhost:11434. Cette API est volontairement compatible avec l'API OpenAI — ce qui signifie que tous les outils et bibliothèques conçus pour OpenAI fonctionnent nativement avec Ollama en changeant simplement l'URL de base.
La bibliothèque Ollama propose plus de 200 modèles précompilés, dont les versions quantisées optimisées pour les machines grand public. La quantisation (compression des poids de 16 bits à 4 ou 8 bits) permet de faire tenir des modèles larges en mémoire au prix d'une légère perte de qualité — souvent imperceptible sur les tâches courantes.
Les avantages d'Ollama : installation en une commande, gestion automatique des modèles (téléchargement, mise à jour, suppression), support GPU multi-plateforme (CUDA, ROCm, Metal), API compatible OpenAI, interface web Open WebUI disponible.
Ses limites : moins de flexibilité que llama.cpp en configuration avancée, communauté plus récente que LM Studio, pas adapté à l'hébergement multi-utilisateurs en production sans configuration supplémentaire.
Mistral 7B vs LLaMA 3.2 vs Phi-3 : quel modèle open source choisir
Le choix du modèle dépend avant tout de votre cas d'usage et de votre matériel. Voici les trois familles de modèles les plus utilisées en 2026 :
Mistral 7B / Mistral Nemo (12B) — licence Apache 2.0
Mistral 7B reste en 2026 le meilleur rapport qualité/performance pour les machines à GPU limité. Développé par Mistral AI (Paris), il excelle sur le français et les langues européennes — un avantage non négligeable pour les entreprises françaises. Mistral Nemo 12B offre une qualité nettement supérieure pour ceux qui disposent d'un GPU 12 Go ou plus. Recommandé pour : génération de texte en français, synthèse de documents, tâches de bureau polyvalentes.
LLaMA 3.2 (1B, 3B, 8B, 11B, 70B) — licence Meta Llama 3
La famille LLaMA 3.2 de Meta couvre un spectre très large de tailles. Les versions 8B sont parmi les meilleures pour les machines grand public. LLaMA 3.2 11B est la première à intégrer nativement le traitement d'images (vision multimodale). LLaMA 3.1 70B reste la référence open source pour les tâches de raisonnement complexe, mais nécessite du matériel conséquent. Recommandé pour : code, raisonnement logique, cas d'usage en anglais principalement.
Phi-3 / Phi-3.5 (3.8B, 7B) — licence MIT
La série Phi de Microsoft est remarquable pour sa taille. Phi-3.5 Mini (3.8B) atteint des performances comparables à des modèles 7B sur les benchmarks de raisonnement et de code, tout en consommant deux fois moins de mémoire. Idéal pour les machines modestes ou les déploiements edge. Recommandé pour : machines sans GPU ou GPU limité, applications nécessitant une faible latence.
Prérequis matériels : GPU, RAM, stockage
Les prérequis matériels déterminent ce que vous pouvez faire tourner. Voici les configurations réalistes en 2026 :
Configuration minimale (sans GPU) : CPU moderne 8 cœurs, 32 Go RAM, 50 Go de stockage SSD. Vous pouvez faire tourner Mistral 7B ou Phi-3 Mini sur CPU, mais la vitesse de génération sera de 3 à 8 tokens par seconde — fonctionnel mais lent pour un usage interactif.
Configuration intermédiaire (GPU 8 Go VRAM) : NVIDIA RTX 3070/4060 Ti, 16 Go RAM, 100 Go SSD. Cette configuration fait tourner tous les modèles 7-8B confortablement (30-60 tokens/seconde) et les modèles 13B quantisés avec plus de lenteur.
Configuration avancée (GPU 12-16 Go VRAM) : NVIDIA RTX 3080/4070/4080, 32 Go RAM, 200 Go SSD. Vous pouvez faire tourner les modèles 13B sans quantisation, et les modèles 30-34B quantisés. La génération atteint 50-80 tokens/seconde sur les modèles 7B.
Configuration professionnelle (GPU 24+ Go VRAM) : NVIDIA RTX 3090/4090, RTX 4500/6000 Ada, 64 Go RAM. Les modèles 70B quantisés deviennent accessibles, et la plupart des cas d'usage production sont couverts.
Sur Mac avec puce Apple Silicon (M2/M3/M4) : la mémoire unifiée est partagée entre CPU et GPU, ce qui est un avantage majeur. Un Mac M3 Pro avec 36 Go de mémoire peut faire tourner des modèles 30B quantisés très confortablement. Sur les prérequis matériels et la mise en place de systèmes Linux pour optimiser vos déploiements, le guide maintenance et optimisation informatique pour professionnels couvre les configurations pratiques.

Installation étape par étape sur Windows, macOS et Linux
macOS :
Télécharger l'installateur depuis ollama.com ou via Homebrew :
brew install ollama
ollama serve # démarrer le daemon
ollama pull mistral # télécharger Mistral 7B (~4.1 Go)
ollama run mistral # lancer une session interactiveLinux :
curl -fsSL https://ollama.com/install.sh | sh
ollama pull mistral
ollama run mistralWindows :
Télécharger l'exécutable depuis ollama.com (installateur .exe). Ollama s'installe comme un service Windows et démarre automatiquement avec le système. Le support GPU CUDA est inclus si vous avez une NVIDIA avec les derniers drivers installés.
Vérification de l'installation :
# Lister les modèles installés
ollama list
# Appel API depuis le terminal
curl http://localhost:11434/api/generate \
-d '{"model": "mistral", "prompt": "Bonjour, présente-toi en une phrase."}'
# Afficher les infos du modèle
ollama show mistralIntégrer un LLM local à vos outils existants
Open WebUI — interface chat type ChatGPT en local :
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:mainOpen WebUI se connecte automatiquement à Ollama sur localhost. Vous obtenez une interface graphique complète avec historique des conversations, gestion des modèles et support multi-utilisateurs.
Continue (plugin VS Code et JetBrains) :
Continue est un plugin d'IA pour IDEs qui s'intègre à Ollama. Il permet d'avoir une IA de complétion de code et un assistant conversationnel directement dans votre éditeur, tournant entièrement en local. Dans les settings de Continue, configurer :
{
"models": [{
"title": "Mistral local",
"provider": "ollama",
"model": "mistral"
}]
}LangChain et LlamaIndex (Python) :
Les deux frameworks majeurs d'orchestration LLM supportent nativement Ollama via leur intégration "Ollama" :
from langchain_ollama import OllamaLLM
llm = OllamaLLM(model="mistral")
response = llm.invoke("Résume ce document en 5 points clés : ...")
print(response)RAG (Retrieval-Augmented Generation) avec un LLM local : guide pratique
Le RAG est la technique qui permet à votre LLM local de répondre à des questions sur vos documents internes sans les envoyer sur le cloud. Voici l'architecture de base :
1. Indexation : vos documents (PDF, Word, textes) sont découpés en chunks (morceaux de 500 à 1000 tokens), convertis en vecteurs numériques (embeddings) et stockés dans une base de données vectorielle comme Chroma, Qdrant ou Milvus.
2. Requête : quand l'utilisateur pose une question, elle est aussi convertie en vecteur et comparée aux vecteurs des documents pour trouver les passages les plus pertinents (recherche sémantique).
3. Génération : les passages trouvés sont injectés dans le prompt du LLM avec la question de l'utilisateur. Le LLM génère une réponse basée sur ces extraits pertinents — sans avoir à "mémoriser" tous vos documents.
Exemple minimaliste avec LangChain + Ollama + Chroma :
from langchain_ollama import OllamaEmbeddings, OllamaLLM
from langchain_chroma import Chroma
from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain_community.document_loaders import PyPDFLoader
# Charger et indexer un PDF
loader = PyPDFLoader("rapport_annuel.pdf")
docs = loader.load()
splitter = RecursiveCharacterTextSplitter(chunk_size=500)
chunks = splitter.split_documents(docs)
# Créer la base vectorielle locale
embeddings = OllamaEmbeddings(model="mistral")
db = Chroma.from_documents(chunks, embeddings)
# Requête RAG
question = "Quel est le chiffre d'affaires de 2025 ?"
relevant = db.similarity_search(question, k=3)
context = "\n".join([d.page_content for d in relevant])
llm = OllamaLLM(model="mistral")
answer = llm.invoke(f"Contexte : {context}\n\nQuestion : {question}")
print(answer)
Performances comparées : local vs cloud (latence, coût, confidentialité)
Comparer un LLM local à un modèle cloud nécessite de distinguer trois dimensions :
Qualité de génération : Les grands modèles cloud (GPT-5, Claude 4, Gemini 2.5 Pro) restent supérieurs aux modèles locaux 7-13B sur les tâches complexes. L'écart se réduit pour les tâches courantes (synthèse, Q/R sur documents, génération de contenu standard). Sur le code Python ou JavaScript basique à intermédiaire, Mistral 7B Instruct ou LLaMA 3.2 8B s'en sortent très bien.
Latence : Un LLM local sur GPU performant répond en 0.5 à 2 secondes pour le premier token (time-to-first-token), contre 0.3 à 3 secondes pour les API cloud selon la charge. La vitesse de génération est comparable sur les modèles 7B avec un bon GPU. L'avantage local se manifeste surtout dans les usages hors ligne et les intégrations à faible latence.
Coût : Pour un usage de 10 requêtes par heure sur 8 heures de travail, 5 jours par semaine, le coût mensuel sur GPT-5 peut atteindre 100 à 500 euros selon la longueur des prompts. Un LLM local coûte l'électricité supplémentaire de votre GPU : 5 à 20 euros par mois. L'amortissement du GPU (500 à 2000 euros) est rentabilisé en 3 à 18 mois selon l'intensité d'utilisation.
Limites des LLM locaux et quand préférer un modèle cloud
La franchise s'impose : les LLM locaux ne remplacent pas tous les cas d'usage des modèles cloud en 2026.
Quand le LLM local montre ses limites : raisonnement multi-étapes très complexe (résolution de problèmes mathématiques avancés, débogage de code complexe avec dépendances multiples), créativité et originalité sur des sujets très variés, compréhension de fenêtres de contexte très larges (les modèles cloud acceptent 200K à 1M tokens, les modèles locaux 7B sont limités à 8K-32K selon la version), multilinguisme sur des langues rares.
Quand le LLM local s'impose : données personnelles, médicales ou financières soumises au RGPD, informations propriétaires ou confidentielles, usage hors ligne ou en zone à connectivité limitée, volumes de requêtes très élevés, intégration dans des applications embarquées. Pour les startups qui construisent des produits IA sur mesure avec ces contraintes, notre comparatif des assistants IA pour développeurs couvre aussi les outils qui intègrent des LLM locaux.
Les 5 cas d'usage professionnels où un LLM local surpasse les solutions SaaS
1. Analyse et synthèse de documents confidentiels
Contrats, rapports financiers, dossiers RH, données clients : ces documents ne peuvent pas être envoyés sur des serveurs tiers. Un LLM local avec RAG permet de les analyser en toute sécurité.
2. Assistant de code en entreprise sur codebase propriétaire
Votre code source est confidentiel. Un LLM local intégré à votre IDE (via Continue ou CodeGPT) peut analyser votre codebase, répondre à des questions sur l'architecture et suggérer des refactorisations sans que votre code propriétaire ne sorte de vos serveurs.
3. Chatbot de support interne sur documentation privée
Base de connaissances RH, manuel opérateur, guide des processus internes : un RAG local transforme votre documentation en un assistant interactif accessible à tous vos employés, sans abonnement SaaS et sans partage de données.
4. Génération de rapports à haute cadence
Pour les équipes qui génèrent des dizaines de rapports similaires par jour (rapports d'audit, comptes-rendus de réunion, synthèses de veille), un LLM local élimine les coûts d'API et les délais de réseau.
5. Traitement de données sensibles en secteur réglementé
Santé, finance, droit, éducation : les réglementations imposent de garder les données sur des serveurs sous contrôle. Un LLM local est souvent la seule option légale pour ces secteurs. Pour comprendre les implications de la directive NIS2 sur le choix de vos outils IA, notre interview avec Sarah Maubert, RSSI freelance PME, donne le cadre réglementaire pratique. Et pour aller plus loin sur l'architecture d'un prompt engineering efficace avec ces modèles locaux, notre guide prompt engineering 2026 couvre aussi les spécificités des modèles open source.
En 2026, le LLM local n'est plus une curiosité de laboratoire mais un outil de production sérieux pour les organisations qui prennent la confidentialité de leurs données au sérieux. La barrière d'entrée n'a jamais été aussi basse, la qualité n'a jamais été aussi haute — et les raisons de garder ses données à soi n'ont jamais été aussi nombreuses.
