Generative AI

Comment exécuter des LLMs en local avec Ollama (guide 2026)

La réponse rapide (juillet 2026) : Ollama (version actuelle v0.32.5, 27 juillet 2026) est un outil gratuit et open-source qui télécharge et exécute des modèles de langage open-weight sur votre propre matériel, en une seule commande. Installez-le via curl -fsSL https://ollama.com/install.sh | sh sous Mac ou Linux, ou irm https://ollama.com/install.ps1 | iex sous Windows, puis tapez ollama run llama3.2 pour commencer à converser en quelques secondes. Les modèles s'exécutent entièrement sur votre machine et n'en sortent jamais. L'outil lui-même est gratuit ; un plan Pro optionnel (20 $/mois) permet de router les requêtes vers du matériel en datacenter pour les modèles qui dépassent la RAM ou la VRAM disponible en local.

Dernière vérification : 29 juillet 2026, d'après la documentation officielle et les pages de tarification.

Written by Alexis

Ce qu'est réellement Ollama

Ollama encapsule des modèles open-weight dans un serveur d'inférence local, avec une interface CLI claire et une API REST compatible OpenAI à l'adresse http://localhost:11434. Installez-le une seule fois, téléchargez un modèle, et vous disposez immédiatement d'une interface de chat dans votre terminal ou d'un endpoint API utilisable par n'importe quelle bibliothèque.

L'outil gère automatiquement la sélection du format de quantification, l'allocation des couches GPU et le cache de contexte. Les fichiers de modèles proviennent d'ollama.com/library et sont stockés localement après le premier téléchargement. Lors des exécutions suivantes, le modèle se charge depuis le disque en VRAM (ou en RAM en l'absence de GPU) en quelques secondes.

Ollama est gratuit et open-source. Le tier Pro à 20 $/mois est strictement dédié au déchargement cloud ; il ne bloque aucune fonctionnalité locale.

Installer Ollama

macOS et Linux :

curl -fsSL https://ollama.com/install.sh | sh

Sous Linux, le script installe également un service systemd qui lance le serveur Ollama en arrière-plan au démarrage.

Windows (PowerShell) :

irm https://ollama.com/install.ps1 | iex

Un installateur direct est également disponible sur ollama.com.

Docker :

docker run -d -p 11434:11434 ollama/ollama

Vérifiez l'installation :

ollama --version

Prérequis GPU vérifiés par Ollama au démarrage :

  • NVIDIA : capacité de calcul 5.0 ou supérieure, pilote 550 ou plus récent (pilote 570 requis pour les cartes avec capacité de calcul 5.0-6.2 plus anciennes)
  • AMD : ROCm v7 sous Linux ; la prise en charge Windows couvre certains modèles de la série 7000 et les modèles PRO
  • Apple Silicon : API Metal, détectée automatiquement
  • Vulkan : couche d'accélération de secours pour les GPU Intel et certains GPU AMD sous Windows et Linux

En l'absence de GPU compatible, ou si le modèle ne tient pas en VRAM, Ollama bascule automatiquement sur le CPU. Le résultat est correct dans les deux cas ; l'inférence CPU est significativement plus lente.

Lancer votre premier modèle

ollama run llama3.2

Cette commande télécharge le tag par défaut 3B (2.0 GB) s'il n'est pas déjà présent, puis ouvre un chat interactif. Tapez /bye pour quitter.

Lancer un tag de taille spécifique :

ollama run llama3.2:1b # 1.3 GB, fast on limited hardware
ollama run gemma3:4b # 3.3 GB, multimodal
ollama run deepseek-r1:7b # 4.7 GB, reasoning model

Passer un prompt ponctuel sans ouvrir la session interactive :

ollama run llama3.2 "Explain the CAP theorem in two sentences"

Soumettre une image à un modèle multimodal :

ollama run gemma3:4b "Describe this chart. /path/to/chart.png"

Commandes CLI à utiliser au quotidien :

ollama list # models downloaded locally
ollama ps # models currently loaded in memory
ollama pull qwen3:8b # download without opening a chat session
ollama rm qwen3:8b # delete a model from disk
ollama stop gemma3 # unload a model from memory
ollama show llama3.2 # print parameters, template, and license

Choisir le bon modèle selon votre matériel

Ollama utilise la quantification Q4 par défaut, ce qui réduit la taille des fichiers par rapport au FP16. La taille du fichier quantifié est un indicateur fiable de la RAM ou VRAM libre nécessaire.

Modèle Tag Taille fichier RAM/VRAM requise Points forts
gemma3 gemma3:270m 292 MB 1 GB+ Edge / Raspberry Pi / appareils contraints
llama3.2 llama3.2:1b 1.3 GB 4 GB+ Agents légers, inférence rapide sur appareil
llama3.2 llama3.2:3b 2.0 GB 4 GB+ Chat généraliste sur laptops avec 8 GB RAM
qwen3 qwen3:4b 2.5 GB 6 GB+ Texte multilingue, fenêtre de contexte 256K
gemma3 gemma3:4b 3.3 GB 6 GB+ Texte et images sur laptops grand public
mistral mistral:7b 4.4 GB 8 GB+ Suivi d'instructions, appels de fonctions
deepseek-r1 deepseek-r1:7b 4.7 GB 8 GB+ Chaînes de raisonnement, maths, logique
llama3.1 llama3.1:8b 4.9 GB 8 GB+ Utilisation d'outils, contexte 128K, capacités générales solides
gemma3 gemma3:12b 8.1 GB 12 GB+ Raisonnement multimodal, un seul GPU milieu de gamme
qwen3 qwen3:14b 9.3 GB 12 GB+ Codage et raisonnement sur cartes 16 GB
llama3.1 llama3.1:70b 43 GB 48 GB+ Raisonnement de niveau production, configs multi-GPU

Quand un modèle tient entièrement en VRAM, vous bénéficiez du débit GPU maximal. Quand il ne tient que partiellement, Ollama décharge automatiquement les couches restantes en RAM ; le débit baisse proportionnellement au nombre de couches traitées par le CPU. Pour les modèles qui ne tiennent pas en local quelle que soit la quantification, Ollama Cloud peut router les requêtes vers du matériel en datacenter.

Utiliser l'API REST locale

Ollama s'exécute sur http://localhost:11434 et accepte le même format de requête que l'API OpenAI : tout client qui supporte une URL de base personnalisée fonctionne sans modification de code.

Générer une complétion :

curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "What is a transformer model?",
"stream": false
}'

Chat avec historique de messages :

curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [
{"role": "user", "content": "Explain attention mechanisms"}
],
"stream": false
}'

Générer des embeddings (utilisez un modèle dédié à l'embedding pour de meilleurs résultats) :

curl http://localhost:11434/api/embed -d '{
"model": "nomic-embed-text",
"input": "The quick brown fox"
}'

Vérifier les modèles chargés :

curl http://localhost:11434/api/ps

Définissez "stream": true (valeur par défaut) pour recevoir la sortie token par token en JSON délimité par des sauts de ligne. Définissez "stream": false pour attendre la réponse complète, ce qui simplifie les scripts.

Personnaliser les modèles avec un Modelfile

Un Modelfile intègre un prompt système, une longueur de contexte et des paramètres d'échantillonnage dans un modèle local nommé. Créez-le une fois, puis ollama run mon-modele et la configuration est déjà en place.

Créez un fichier nommé Modelfile :

FROM llama3.2
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """
You are a concise technical assistant. Answer in plain text only.
Show your reasoning step by step before giving the final answer.
"""

Construisez et lancez :

ollama create my-assistant -f Modelfile
ollama run my-assistant

Les paramètres qui influencent le plus la qualité des sorties :

  • temperature (défaut 0.8) : des valeurs basses donnent une sortie plus déterministe ; augmentez-la pour les tâches créatives
  • num_ctx (défaut 2048) : fenêtre de contexte en tokens ; augmentez-la pour coller de longs documents, au prix d'une consommation VRAM accrue
  • top_p (défaut 0.9) : contrôle la diversité des sorties en complément de la température
  • repeat_penalty (défaut 1.1) : réduit les répétitions en boucle dans les longues sorties

Vous pouvez aussi construire depuis un fichier GGUF local : FROM ./my-model.gguf. C'est la voie à suivre si vous avez téléchargé un modèle directement depuis Hugging Face.

Intégrer avec Python ou JavaScript

Les deux bibliothèques officielles encapsulent l'API REST avec des fonctions typées. Elles nécessitent qu'Ollama soit en cours d'exécution en local (ou pointé vers un hôte distant).

Python (Python 3.8 ou supérieur requis) :

pip install ollama

from ollama import chat

response = chat(
model='llama3.2',
messages=[{'role': 'user', 'content': 'Summarize the halting problem'}]
)
print(response.message.content)

Streaming :

stream = chat(
model='llama3.2',
messages=[{'role': 'user', 'content': 'Write a regex that matches ISO dates'}],
stream=True,
)
for chunk in stream:
print(chunk['message']['content'], end='', flush=True)

JavaScript / TypeScript :

npm i ollama

import ollama from 'ollama'

const response = await ollama.chat({
model: 'llama3.2',
messages: [{ role: 'user', content: 'What is a closure?' }],
})
console.log(response.message.content)

Pointer l'une ou l'autre bibliothèque vers un hôte différent :

from ollama import Client
client = Client(host='http://192.168.1.10:11434')

const ollama = new Ollama({ host: 'http://192.168.1.10:11434' })

Les deux bibliothèques exposent la surface complète de l'API : chat, generate, embed, pull, rm, list, ps, create, copy, push.

FAQ

Ollama peut-il fonctionner sans connexion internet après l'installation ?
Oui. Une fois un modèle téléchargé sur le disque, le serveur d'inférence tourne entièrement hors ligne. Le processus ollama serve ne communique pas avec des serveurs externes. Seuls ollama pull et ollama push requièrent une connexion réseau.

Comment lancer Ollama en service en arrière-plan sous Linux ?
Le script d'installation configure automatiquement un service systemd. Vérifiez son état avec systemctl status ollama et activez le démarrage automatique avec sudo systemctl enable --now ollama. En cas d'installation manuelle, le fichier d'unité de service n'est pas créé ; vous devrez démarrer ollama serve vous-même.

Puis-je utiliser Ollama avec LangChain, LlamaIndex ou d'autres frameworks IA ?
Oui. Définissez l'URL de base dans votre framework sur http://localhost:11434/v1 et utilisez n'importe quel nom de modèle téléchargé. La plupart des frameworks qui supportent les endpoints compatibles OpenAI ne nécessitent aucune autre modification de code.

Que se passe-t-il si un modèle est trop volumineux pour mon GPU ?
Ollama divise le modèle automatiquement : les couches qui tiennent en VRAM s'exécutent sur le GPU, le reste sur le CPU. Le débit de génération baisse proportionnellement au nombre de couches déportées sur CPU. La solution pratique est d'utiliser un tag de taille inférieure ou une variante QAT (quantization-aware-trained) du modèle, que proposent certains modèles comme gemma3.

Comment voir ce qui est actuellement en mémoire et le libérer ?
ollama ps liste les modèles chargés, leur empreinte mémoire et le temps depuis lequel ils sont résidents. Les modèles se déchargent automatiquement après 5 minutes d'inactivité par défaut. Pour forcer un déchargement immédiat, utilisez ollama stop <model>.

Si ce guide vous a fait gagner quelques heures, recevez AI Weekly gratuitement, 3 numéros par semaine, lu par 40,000+ praticiens.