What each model needs to run locallyCe qu'il faut pour faire tourner chaque modèle en local
These are the memory figures behind the checker above, at Q4 quantization (the compressed format almost everyone runs locally). "Needs about" is total machine memory: the model itself, its working space, and roughly 3 GB left for the operating system. That means unified memory on an Apple Silicon Mac, or RAM plus graphics memory on a PC. Voici les chiffres de mémoire utilisés par l'outil ci-dessus, en quantization Q4 (le format compressé que presque tout le monde utilise en local). « Nécessite environ » correspond à la mémoire totale de la machine : le modèle, son espace de travail, et environ 3 Go laissés au système. Soit la mémoire unifiée sur un Mac Apple Silicon, ou la RAM plus la mémoire graphique sur un PC.
| ModelModèle | Needs aboutNécessite environ | Comfortable onÀ l'aise sur |
|---|
Estimates for planning, not benchmarks. Context length also eats memory: long documents and long sessions are the real local constraint, more than raw model size. Estimations pour planifier, pas des benchmarks. La longueur de contexte consomme aussi de la mémoire : les documents et sessions longs sont la vraie contrainte en local, plus que la taille brute du modèle.
How to run AI locally, step by stepComment faire tourner une IA en local, étape par étape
The order matters. Most people do it backwards, hunting for the perfect model before they can run anything at all. L'ordre compte. La plupart des gens s'y prennent à l'envers, en cherchant le modèle parfait avant même de pouvoir en faire tourner un.
1. Install the runtime first, not the model1. Installez d'abord le moteur, pas le modèle
Install the software that runs models before you choose one. LM Studio is a desktop app with a built-in model browser, and is the right call if you are not technical. Ollama is command line, for developers. Either way you will have something running in 10 to 20 minutes. Installez le logiciel qui fait tourner les modèles avant d'en choisir un. LM Studio est une application de bureau avec un catalogue intégré, le bon choix si vous n'êtes pas technique. Ollama passe par la ligne de commande, pour les développeurs. Dans les deux cas, vous aurez quelque chose qui tourne en 10 à 20 minutes.
2. Match the model to the machine2. Accordez le modèle à la machine
Model size is measured in billions of parameters (B). Bigger is smarter but needs more memory. 16 GB is the realistic daily-driver floor for a genuinely useful model; 24 to 32 GB opens up the mixture-of-experts models that are the current sweet spot. That is exactly what the checker at the top of this page works out for you. La taille d'un modèle se mesure en milliards de paramètres (B). Plus gros veut dire plus malin, mais demande plus de mémoire. 16 Go est le plancher réaliste pour un modèle vraiment utile au quotidien ; 24 à 32 Go ouvrent la porte aux modèles « mixture-of-experts », le meilleur compromis actuel. C'est exactement ce que calcule l'outil en haut de cette page.
3. Understand why MoE models changed the maths3. Comprenez pourquoi les modèles MoE ont changé le calcul
Models like gpt-oss-20b and Qwen3-30B-A3B only fire a small slice of themselves for each word. They take the memory of their full size but run at the speed of a 3B model. That is why the sweet spot moved from "14B dense on 16 GB" to "20 to 30B MoE on 24 to 32 GB": same speed, noticeably smarter. Des modèles comme gpt-oss-20b et Qwen3-30B-A3B n'activent qu'une petite partie d'eux-mêmes à chaque mot. Ils occupent la mémoire de leur taille complète mais tournent à la vitesse d'un modèle 3B. C'est pourquoi le meilleur compromis est passé de « 14B dense sur 16 Go » à « 20 à 30B MoE sur 24 à 32 Go » : même vitesse, nettement plus malin.
4. Use a quantized version4. Prenez une version quantisée
Quantization shrinks a model so it runs on weaker hardware with minimal quality loss. Look for Q4 or Q5 versions: Q4 roughly halves the memory needed, and is what makes a 14B model fit comfortably in 16 GB. Think of the raw model as an uncompressed photo and the quantized one as a high-quality JPEG. La quantization compresse un modèle pour qu'il tourne sur du matériel plus modeste avec une perte de qualité minime. Cherchez les versions Q4 ou Q5 : Q4 divise à peu près par deux la mémoire nécessaire, et c'est ce qui permet à un modèle 14B de tenir confortablement dans 16 Go. Voyez le modèle brut comme une photo non compressée, et la version quantisée comme un JPEG de bonne qualité.
5. Then point an agent at it5. Puis branchez-y un agent
Chatting with a local model is useful. The real unlock is pointing an agent at it so it can do multi-step work on its own. That is where a local setup stops being a privacy exercise and starts giving hours back. See how that work actually flows. Discuter avec un modèle local, c'est utile. Le vrai déclic, c'est d'y brancher un agent pour qu'il mène un travail en plusieurs étapes tout seul. C'est là qu'une installation locale cesse d'être un exercice de confidentialité et commence à vous rendre des heures. Voir comment le travail se déroule vraiment.
Common questionsQuestions fréquentes
Can I run an AI model on my own computer?Puis-je faire tourner une IA sur mon propre ordinateur ?
Almost certainly yes. A machine with 8 GB of memory runs small models comfortably, and 16 GB is the realistic floor for a genuinely useful daily driver. What changes with more memory is which size of model you can load, not whether local AI works at all. Presque certainement oui. Une machine avec 8 Go de mémoire fait tourner confortablement de petits modèles, et 16 Go est le plancher réaliste pour un modèle vraiment utile au quotidien. Ce qui change avec plus de mémoire, c'est la taille de modèle que vous pouvez charger, pas le fait que l'IA locale fonctionne ou non.
How much RAM do I need to run an LLM locally?De combien de RAM ai-je besoin pour faire tourner un LLM en local ?
Counting the model, its working space and the operating system, plan for roughly 7 GB of total machine memory for a 4B model, 14 GB for a 14B model, 26 GB for a 32B model and 55 GB for a 70B model, all at Q4 quantization. So 16 GB comfortably runs a 14B model, and 24 to 32 GB opens up the 20B to 30B mixture-of-experts models that are the current sweet spot. En comptant le modèle, son espace de travail et le système, prévoyez environ 7 Go de mémoire totale pour un modèle 4B, 14 Go pour un 14B, 26 Go pour un 32B et 55 Go pour un 70B, le tout en quantization Q4. Donc 16 Go font tourner confortablement un modèle 14B, et 24 à 32 Go ouvrent la porte aux modèles mixture-of-experts de 20 à 30B, le meilleur compromis actuel.
Can I run Llama 3.3 70B locally?Puis-je faire tourner Llama 3.3 70B en local ?
Only on a large machine. At Q4 the model itself is about 43 GB, and you need roughly 55 GB of total machine memory once working space and the operating system are counted. In practice that means a 64 GB or larger Mac, or a multi-GPU box. On a 16 GB laptop, a 14B model or a 20B MoE model gives you far better speed for the same task. Seulement sur une grosse machine. En Q4, le modèle lui-même pèse environ 43 Go, et il faut compter à peu près 55 Go de mémoire totale une fois l'espace de travail et le système inclus. En pratique : un Mac de 64 Go ou plus, ou une machine multi-GPU. Sur un portable de 16 Go, un modèle 14B ou un MoE 20B vous donnera bien plus de vitesse pour la même tâche.
Is running AI locally actually private?L'IA en local est-elle vraiment privée ?
Yes, when it is set up correctly. A local model runs entirely on your own hardware, so no prompt, document or transcript is sent to a provider. The caveat is configuration: some tools phone home for telemetry or model updates by default, which is why the setup is worth verifying rather than assuming. Oui, à condition que ce soit bien configuré. Un modèle local tourne entièrement sur votre matériel : aucun prompt, document ou transcription n'est envoyé à un fournisseur. La nuance est dans la configuration : certains outils remontent des données de télémétrie ou vont chercher des mises à jour par défaut. C'est pour cela qu'il vaut mieux vérifier l'installation que la supposer bonne.
Does a local model replace ChatGPT or Claude?Un modèle local remplace-t-il ChatGPT ou Claude ?
For about 80% of everyday work, yes: drafting, summarizing, questions over your own files, transcription, classification, extraction, coding help. Keep a frontier model for the genuinely hard 20%, and route nothing confidential to it. Not sure where any of this fits in your business? Start with where to begin with AI. Pour environ 80 % du travail quotidien, oui : rédiger, résumer, poser des questions sur vos propres fichiers, transcrire, classer, extraire, aider à coder. Gardez un modèle de pointe pour les 20 % vraiment difficiles, et ne lui envoyez rien de confidentiel. Vous ne savez pas où tout cela se place dans votre entreprise ? Commencez par par où commencer avec l'IA.