IA locale sur PC : le guide pour se passer du cloud
Chaque mois, un nouvel abonnement IA débarque dans ta liste de prélèvements. ChatGPT Plus, Claude Pro, Gemini Advanced : à 20 ou 25 euros pièce, la facture grimpe vite si tu jongles entre plusieurs assistants pour comparer les réponses ou éviter d'être bloqué en cas de panne côté fournisseur.
Il y a aussi la question de ce que tu envoies dans ces outils. Un brouillon de contrat, un extrait de code propriétaire, une conversation un peu personnelle : tout part sur des serveurs que tu ne contrôles pas, avec des conditions d'utilisation qu'on lit rarement en entier.
Bonne nouvelle : en 2026, faire tourner une intelligence artificielle correcte directement sur son PC ou son Mac n'a plus rien d'exotique. Les modèles open weight ont fait un bond, et le matériel grand public suit. Reste à savoir si ça vaut vraiment le coup de s'y mettre, et à quel prix en confort.
Pourquoi faire tourner une IA chez soi
L'argument numéro un, c'est la confidentialité : rien ne quitte ta machine, ce qui compte pour du contenu sensible ou du code sous NDA. Le deuxième, plus terre à terre, c'est le budget : une fois le modèle téléchargé, l'usage est illimité et gratuit, sans quota de requêtes ni palier tarifaire. Le troisième, c'est l'indépendance : ça continue de fonctionner en train, en avion, ou le jour où le service cloud est en panne.
La contrepartie, on la voit tout de suite : tu perds l'accès aux modèles les plus puissants du marché, ceux qui tournent sur des fermes de GPU que ton salon n'égalera jamais. L'IA locale, c'est un compromis, pas un remplacement pur et simple.
Ce qu'il te faut côté matériel
La contrainte principale n'est pas le processeur mais la mémoire, et plus précisément la VRAM si tu as une carte graphique dédiée, ou la RAM unifiée sur un Mac Apple Silicon. Plus un modèle a de paramètres, plus il a besoin de mémoire pour charger ses poids et répondre à une vitesse tolérable.
| Taille du modèle | Mémoire nécessaire | Usage réaliste |
|---|---|---|
| 7-8 milliards de paramètres | 8 Go de VRAM ou RAM unifiée | Chat courant, résumés, rédaction simple |
| 12-14 milliards | 16 Go | Raisonnement plus fin, code basique, multimodal |
| 20-30 milliards | 24 Go et plus | Code avancé, contextes longs, agents |
| 70 milliards et plus | 48 Go et plus (ou déchargement lent sur disque) | Qualité proche des modèles cloud, mais lent sans GPU pro |
Un Mac avec 16 Go de mémoire unifiée ou un PC équipé d'une carte graphique avec 8 Go de VRAM suffit déjà pour un usage quotidien correct. Sans GPU dédié, ça reste possible en s'appuyant sur le processeur et la RAM, mais attends-toi à des réponses nettement plus lentes.
Les outils pour démarrer
Étape 1 : installer un moteur d'inférence. Ollama est le choix le plus simple pour débuter : une ligne de commande à copier-coller et le modèle tourne. LM Studio propose la même chose avec une interface graphique, plus confortable pour un premier essai.
Étape 2 : télécharger un modèle adapté à ta machine. Les deux outils affichent la taille de chaque modèle avant téléchargement, ce qui évite de saturer le disque avec un fichier de 40 Go inutilisable sur ta configuration.
Étape 3 : brancher une interface de chat. Ollama et LM Studio proposent une fenêtre de discussion basique intégrée, mais des interfaces comme Open WebUI permettent d'obtenir quelque chose de plus proche de ChatGPT, avec historique des conversations et gestion de plusieurs modèles en parallèle.
Étape 4 : tester avant de désinstaller tes abonnements. Compare les réponses sur tes usages réels, pas sur des questions génériques. C'est souvent là que se joue la décision de garder ou non un abonnement cloud en complément.
Quel modèle choisir
Gemma 4, chez Google, sous licence Apache 2.0 : la version 12 milliards de paramètres gère texte, image et audio, et tient sur 16 Go de mémoire (8 Go en version compressée). Un bon point d'entrée polyvalent.
gpt-oss, chez OpenAI : les déclinaisons 20B et 120B, elles aussi en licence ouverte, offrent un raisonnement solide pour qui a la mémoire nécessaire pour la version 120B.
Qwen 2.5 Coder, chez Alibaba : une référence pour l'aide au code en local, avec un bon compromis taille/qualité sur la version 14B.
Nemotron 3.5 Lightning, chez NVIDIA, sorti en août : un modèle à mélange d'experts de 30 milliards de paramètres pensé pour des agents qui tournent en continu, avec une génération de texte nettement plus rapide que la moyenne des modèles ouverts comparables.
Cloud ou local : le vrai comparatif
| Critère | IA cloud (ChatGPT, Claude, Gemini) | IA locale |
|---|---|---|
| Confidentialité | Données envoyées à un tiers | Rien ne sort de la machine |
| Coût | Abonnement mensuel récurrent | Gratuit après le matériel |
| Qualité des réponses | Meilleure, surtout sur les tâches complexes | Correcte à bonne, variable selon le modèle |
| Disponibilité hors ligne | Impossible | Totale |
| Simplicité de mise en route | Immédiate | Installation et réglages nécessaires |
Les pièges qu'on ne vous dit pas
Un modèle local, même récent, reste en général en retrait par rapport aux meilleurs modèles cloud sur les tâches qui demandent du raisonnement complexe ou des connaissances très pointues. Ne t'attends pas à retrouver exactement le niveau de GPT-5 ou de Claude sur un modèle de 8 milliards de paramètres.
Il y a aussi la question de la chaleur et du bruit : faire tourner un modèle en continu sollicite le GPU comme un jeu vidéo exigeant, ce qui se traduit par des ventilateurs qui montent en régime et une facture d'électricité qui suit. Sur laptop, ça se paie aussi en autonomie de batterie.
Enfin, contrairement à un service cloud mis à jour en continu, un modèle local ne s'améliore pas tout seul. C'est à toi de suivre les nouvelles versions et de les retélécharger, ce qui demande un minimum de veille si tu veux rester sur du matériel à jour.
Le verdict
L'IA locale n'est pas encore prête à remplacer entièrement un abonnement cloud pour qui a besoin du meilleur niveau de réponse possible. En revanche, pour du chat quotidien, de la rédaction, ou du code sur des tâches courantes, ça tient largement la route et ça élimine à la fois le coût récurrent et le risque de voir ses données partir ailleurs. Le combo le plus réaliste reste sans doute hybride : un modèle local pour l'usage courant et confidentiel, un abonnement cloud gardé en réserve pour les tâches qui demandent vraiment plus de puissance.
Et toi, tu es passé à l'IA locale ou tu restes fidèle à ton abonnement cloud ? Dis-moi en commentaire quel modèle tourne chez toi.