Ollama : faire tourner un LLM en local sans API payante (guide 2026)
Ma facture d’API IA grimpait mois après mois, portée par des tâches que je trouvais presque honteuses : résumer des articles de veille, classer des centaines de mots-clés, pré-trier des notes brutes. Payer du premium pour cela revenait à louer une Ferrari pour aller chercher le pain.
Ollama règle ce problème précis : un LLM local gratuit, installé en cinq minutes, qui tourne sur une machine ordinaire et absorbe les tâches de volume. Voici le matériel dont tu as vraiment besoin, l’installation pas à pas, mes cas d’usage quotidiens et les limites franches de l’exercice.
✨ Résumé Essentiel
- Ollama installe et fait tourner des modèles open source en local, sans abonnement ni envoi de données vers un cloud.
- Un ordinateur doté de 8 Go de RAM suffit pour les modèles compacts ; un GPU de 8 Go de VRAM rend l’usage interactif fluide.
- L’installation tient en une commande sur Linux et macOS, en un installateur graphique sur Windows.
- Les bons cas d’usage : résumé, classification, données sensibles, traités en batch via l’API locale.
- La rédaction créative pointue reste le territoire des grands modèles cloud : mieux vaut assumer la complémentarité.
Après plusieurs semaines d’usage mixte, ma règle est simple : le volume et le confidentiel en local, la plume et le raisonnement complexe en cloud. Ma ligne de dépense API a baissé, ma productivité n’a pas bougé. Voilà le vrai verdict de cet Ollama tuto.

Le matériel qu’il faut vraiment (et celui qu’on te vend pour rien)
Les vidéos marketing promettent des LLM locaux sur un nano-ordinateur à 50 euros. Techniquement vrai, pratiquement pénible. Voici la grille réaliste que j’utilise quand je conseille les entrepreneurs que j’accompagne :
| Configuration | Ce que ça donne en vrai | Modèles conseillés |
|---|---|---|
| 8 Go de RAM, pas de GPU | Ça tourne, lentement. Correct pour du batch nocturne | Modèles 3B type llama3.2:3b |
| 16 Go de RAM | Zone de confort pour un usage quotidien | Modèles 7B-8B quantisés type llama3.1:8b, mistral |
| GPU 8 Go de VRAM, ou Mac Apple Silicon 16 Go | Réponses rapides, conversation agréable | Modèles 8B, voire 13B compressés |
| GPU 24 Go de VRAM et plus | Territoire des modèles costauds en local | Modèles 30B et plus |
Trois repères pour t’y retrouver dans ce vocabulaire. Le chiffre suivi de B indique les milliards de paramètres, donc grossièrement la capacité du modèle. Les modèles proposés par Ollama sont quantifiés, autrement dit compressés pour tenir dans la mémoire de ta machine. Et un modèle 8B quantifié occupe environ 5 Go sur le disque : prévois de l’espace de stockage et autant de RAM libre pendant l’exécution.
Mon poste de croisière : un portable de 16 Go de RAM sans GPU dédié. Les réponses arrivent au rythme d’une lecture rapide, largement suffisant pour du traitement par lots lancé avant le déjeuner. Pour de la conversation interactive longue, je bascule sur mes abonnements cloud, sans état d’âme.
Ollama installation : pas à pas sur les trois systèmes
Rendez-vous sur ollama.com, section Download, puis suis le chemin de ta plateforme.
Sur Linux, une seule ligne suffit :
« `bash
curl -fsSL https://ollama.com/install.sh | sh
« `
Sur macOS avec Homebrew :
« `bash
brew install ollama
« `
Sur Windows, télécharge l’installateur graphique depuis le site officiel et double-clique. C’est tout.
Vérifie ensuite que tout respire correctement :
« `bash
ollama –version
« `
Puis télécharge et lance ton premier modèle :
« `bash
ollama pull llama3.2:3b
ollama run llama3.2:3b
« `
La première commande télécharge le modèle, quelques minutes selon ta connexion. La seconde ouvre une session de chat directement dans le terminal : tape ta question, discute, puis quitte proprement avec `/bye`. Deux commandes pratiques pour garder une vue d’ensemble :
« `bash
ollama list
ollama ps
« `
Note pratique issue de mon ollama installation sur trois machines différentes : l’application tourne en arrière-plan après installation sur macOS et Windows, et le service démarre automatiquement sur Linux. Si tu préfères une interface graphique, des applications tierces comme Open WebUI se branchent sur Ollama, mais le terminal reste le chemin le plus direct pour débuter.
Trois cas d’usage solopreneur qui rentabilisent la bête
Cas numéro 1 : le résumé de veille. Je collecte chaque semaine des articles et des newsletters dans un dossier dédié. Un petit script Python envoie chaque texte à l’API locale d’Ollama et rend trois puces factuelles par article. Je lis quarante sources résumées pendant mon café du matin, sans dépenser un centime d’API.
L’API locale parle HTTP, donc n’importe quel langage de script s’y connecte :
« `bash
curl http://localhost:11434/api/generate -d ‘{
« model »: « llama3.2:3b »,
« prompt »: « Résume ce texte en 3 points factuels : [ton texte ici] »,
« stream »: false
}’
« `
Cas numéro 2 : la classification en masse. Taguer 500 lignes de requêtes SEO par intention, informationnelle, commerciale ou transactionnelle, voilà la corvée parfaite pour un modèle 3B. Le résultat alimente ensuite mon tableur de clustering. Pour la méthode de scripting complète, j’ai détaillé mes micro-automatisations Python dans un article dédié.
Cas numéro 3 : les données sensibles. Notes personnelles, chiffres d’affaires, brouillons stratégiques : tout ce que je refuse d’envoyer chez un hébergeur tiers passe par mon modèle IA local. Rien ne quitte la machine, et la connexion internet n’est même plus nécessaire une fois les modèles téléchargés.
Un bonus qui découle des précédents : brancher Ollama sur un outil d’automatisation visuelle comme n8n ouvre la porte à des workflows hybrides, moitié local, moitié cloud. J’y consacre un guide n8n pensé pour les solopreneurs si tu veux voir l’enchaînement complet.

Limites : là où le cloud garde l’avantage
Limite numéro 1 : la plume. Un modèle 8B local rédige un résumé correct et un post LinkedIn moyen. Pour un article de fond en français impeccable, les grands modèles hébergés dans le cloud conservent une avance nette. Je fais donc toute la rédaction finale côté cloud, et le pré-traitement en local.
Limite numéro 2 : la vitesse brute. Sans GPU, un gros modèle de 30B et plus devient pénible en conversation interactive. Le traitement par lots nocturne reste parfaitement viable, l’échange en temps réel non.
Limite numéro 3 : les connaissances figées. Un modèle IA local ne connaît rien après sa date d’entraînement et ne navigue pas sur le web tout seul. Il résume et transforme ce que tu lui fournis, il ne va pas chercher l’information manquante à ta place.
Limite numéro 4 : la fenêtre de contexte. Beaucoup de modèles locaux acceptent des contextes plus courts que les API haut de gamme. Les documents de plusieurs centaines de pages restent plus simples à digérer côté services cloud.
Aucune de ces limites n’est rédhibitoire si tu places l’outil au bon étage de la maison. Ollama est l’ouvrier de volume, pas la star de la rédaction. Un llm local gratuit excelle là où les API coûtent cher pour pas grand-chose.
Le mot de la fin
Un LLM local gratuit ne remplace pas ton abonnement cloud, il absorbe ce qui mérite de rester à la maison : le volume répétitif et le confidentiel. Installe Ollama ce soir, télécharge un modèle 3B, fais-lui résumer trois articles de veille. Si le rythme te convient, tu viens de rogner une ligne de frais fixes sans perdre en capacité.
Mes autres expérimentations terrain, matériels testés et scripts complets, sont réunies dans la rubrique Labo.
FAQ : questions fréquentes sur Ollama
Ollama est-il vraiment gratuit ?
Oui. Ollama est un logiciel open source et les modèles qu’il télécharge sont publiés sous licences ouvertes. Tu ne paies que l’électricité consommée par ta propre machine.
Quelle différence entre un modèle 3B et un modèle 70B ?
Le chiffre exprime les milliards de paramètres du modèle. Plus il est élevé, plus le modèle est capable, mais plus il exige de RAM ou de VRAM et plus il répond lentement. Pour du résumé et de la classification, un modèle de 3B à 8B suffit largement.
Peut-on utiliser Ollama sans connexion internet ?
Oui, une fois les modèles téléchargés. C’est l’un de ses atouts majeurs : tes données restent sur la machine et l’outil fonctionne entièrement hors ligne, pratique en déplacement ou sur une connexion instable.
Ollama remplace-t-il ChatGPT ou Claude ?
Non, et ce n’est pas son rôle. Il excelle sur les tâches de volume et de confidentialité, pas sur la rédaction créative de haut niveau ni sur le raisonnement très complexe. Les deux approches se complètent plutôt qu’elles ne s’opposent.
Quel modèle choisir pour débuter ?
Commence par un modèle compact polyvalent comme llama3.2:3b. Si ta machine dispose de marges, monte sur un modèle 8B tel que llama3.1:8b ou mistral pour un meilleur niveau de langue française.




Laisser un commentaire