IA locale sur PC : le guide pour se passer du cloud

IA locale sur PC : le guide pour se passer du cloud
Photo by Igor Omilaev on Unsplash

Chaque mois, un nouvel abonnement IA débarque dans ta liste de prélèvements. ChatGPT Plus, Claude Pro, Gemini Advanced : à 20 ou 25 euros pièce, la facture grimpe vite si tu jongles entre plusieurs assistants pour comparer les réponses ou éviter d'être bloqué en cas de panne côté fournisseur.

Il y a aussi la question de ce que tu envoies dans ces outils. Un brouillon de contrat, un extrait de code propriétaire, une conversation un peu personnelle : tout part sur des serveurs que tu ne contrôles pas, avec des conditions d'utilisation qu'on lit rarement en entier.

Bonne nouvelle : en 2026, faire tourner une intelligence artificielle correcte directement sur son PC ou son Mac n'a plus rien d'exotique. Les modèles open weight ont fait un bond, et le matériel grand public suit. Reste à savoir si ça vaut vraiment le coup de s'y mettre, et à quel prix en confort.

Pourquoi faire tourner une IA chez soi

L'argument numéro un, c'est la confidentialité : rien ne quitte ta machine, ce qui compte pour du contenu sensible ou du code sous NDA. Le deuxième, plus terre à terre, c'est le budget : une fois le modèle téléchargé, l'usage est illimité et gratuit, sans quota de requêtes ni palier tarifaire. Le troisième, c'est l'indépendance : ça continue de fonctionner en train, en avion, ou le jour où le service cloud est en panne.

La contrepartie, on la voit tout de suite : tu perds l'accès aux modèles les plus puissants du marché, ceux qui tournent sur des fermes de GPU que ton salon n'égalera jamais. L'IA locale, c'est un compromis, pas un remplacement pur et simple.

Ce qu'il te faut côté matériel

La contrainte principale n'est pas le processeur mais la mémoire, et plus précisément la VRAM si tu as une carte graphique dédiée, ou la RAM unifiée sur un Mac Apple Silicon. Plus un modèle a de paramètres, plus il a besoin de mémoire pour charger ses poids et répondre à une vitesse tolérable.

Taille du modèleMémoire nécessaireUsage réaliste
7-8 milliards de paramètres8 Go de VRAM ou RAM unifiéeChat courant, résumés, rédaction simple
12-14 milliards16 GoRaisonnement plus fin, code basique, multimodal
20-30 milliards24 Go et plusCode avancé, contextes longs, agents
70 milliards et plus48 Go et plus (ou déchargement lent sur disque)Qualité proche des modèles cloud, mais lent sans GPU pro

Un Mac avec 16 Go de mémoire unifiée ou un PC équipé d'une carte graphique avec 8 Go de VRAM suffit déjà pour un usage quotidien correct. Sans GPU dédié, ça reste possible en s'appuyant sur le processeur et la RAM, mais attends-toi à des réponses nettement plus lentes.

Les outils pour démarrer

Étape 1 : installer un moteur d'inférence. Ollama est le choix le plus simple pour débuter : une ligne de commande à copier-coller et le modèle tourne. LM Studio propose la même chose avec une interface graphique, plus confortable pour un premier essai.

Étape 2 : télécharger un modèle adapté à ta machine. Les deux outils affichent la taille de chaque modèle avant téléchargement, ce qui évite de saturer le disque avec un fichier de 40 Go inutilisable sur ta configuration.

Étape 3 : brancher une interface de chat. Ollama et LM Studio proposent une fenêtre de discussion basique intégrée, mais des interfaces comme Open WebUI permettent d'obtenir quelque chose de plus proche de ChatGPT, avec historique des conversations et gestion de plusieurs modèles en parallèle.

Étape 4 : tester avant de désinstaller tes abonnements. Compare les réponses sur tes usages réels, pas sur des questions génériques. C'est souvent là que se joue la décision de garder ou non un abonnement cloud en complément.

Quel modèle choisir

Gemma 4, chez Google, sous licence Apache 2.0 : la version 12 milliards de paramètres gère texte, image et audio, et tient sur 16 Go de mémoire (8 Go en version compressée). Un bon point d'entrée polyvalent.

gpt-oss, chez OpenAI : les déclinaisons 20B et 120B, elles aussi en licence ouverte, offrent un raisonnement solide pour qui a la mémoire nécessaire pour la version 120B.

Qwen 2.5 Coder, chez Alibaba : une référence pour l'aide au code en local, avec un bon compromis taille/qualité sur la version 14B.

Nemotron 3.5 Lightning, chez NVIDIA, sorti en août : un modèle à mélange d'experts de 30 milliards de paramètres pensé pour des agents qui tournent en continu, avec une génération de texte nettement plus rapide que la moyenne des modèles ouverts comparables.

Cloud ou local : le vrai comparatif

CritèreIA cloud (ChatGPT, Claude, Gemini)IA locale
ConfidentialitéDonnées envoyées à un tiersRien ne sort de la machine
CoûtAbonnement mensuel récurrentGratuit après le matériel
Qualité des réponsesMeilleure, surtout sur les tâches complexesCorrecte à bonne, variable selon le modèle
Disponibilité hors ligneImpossibleTotale
Simplicité de mise en routeImmédiateInstallation et réglages nécessaires

Les pièges qu'on ne vous dit pas

Un modèle local, même récent, reste en général en retrait par rapport aux meilleurs modèles cloud sur les tâches qui demandent du raisonnement complexe ou des connaissances très pointues. Ne t'attends pas à retrouver exactement le niveau de GPT-5 ou de Claude sur un modèle de 8 milliards de paramètres.

Il y a aussi la question de la chaleur et du bruit : faire tourner un modèle en continu sollicite le GPU comme un jeu vidéo exigeant, ce qui se traduit par des ventilateurs qui montent en régime et une facture d'électricité qui suit. Sur laptop, ça se paie aussi en autonomie de batterie.

Enfin, contrairement à un service cloud mis à jour en continu, un modèle local ne s'améliore pas tout seul. C'est à toi de suivre les nouvelles versions et de les retélécharger, ce qui demande un minimum de veille si tu veux rester sur du matériel à jour.

Le verdict

L'IA locale n'est pas encore prête à remplacer entièrement un abonnement cloud pour qui a besoin du meilleur niveau de réponse possible. En revanche, pour du chat quotidien, de la rédaction, ou du code sur des tâches courantes, ça tient largement la route et ça élimine à la fois le coût récurrent et le risque de voir ses données partir ailleurs. Le combo le plus réaliste reste sans doute hybride : un modèle local pour l'usage courant et confidentiel, un abonnement cloud gardé en réserve pour les tâches qui demandent vraiment plus de puissance.

Et toi, tu es passé à l'IA locale ou tu restes fidèle à ton abonnement cloud ? Dis-moi en commentaire quel modèle tourne chez toi.