Aller au contenu
Neaptidestudio
blog

Une IA locale pour programmer : démarrer avec Ollama

Neaptide · 20 septembre 2026 · 8 min de lecture

Lancez un modèle local avec Ollama : installation, API HTTP, exercice Python vérifiable et diagnostic de lenteur.

Dans cet article
Ordinateur local, bloc de modèle compact et fiche de code.

Pour essayer un modèle local, choisissez un petit extrait de code : expliquer une fonction, proposer des tests ou repérer une erreur. Pour ce premier essai, une procédure reproductible et une réponse vérifiable comptent davantage que la taille du modèle.

Ollama exécute les modèles et fournit une interface pour les interroger. Ce guide utilise la version locale de Qwen2.5-Coder 1.5B comme exemple pédagogique de petite taille. Il ne s'agit ni d'un classement des meilleurs modèles actuels ni d'une garantie de qualité sur de grands projets. Fiche du modèle.

Installation et première réponse

Suivez les instructions officielles adaptées à votre système, puis démarrez l'application ou le service. Dans un terminal :

ollama --version
ollama run qwen2.5-coder:1.5b

Le premier lancement télécharge le modèle : une connexion Internet et de l'espace disque sont nécessaires. Une fois l'invite interactive affichée, posez une courte question sur du code. Pour quitter, saisissez `/bye`.

Ne mesurez pas la rapidité sur la seule première réponse : le chargement du modèle et la génération sont deux étapes distinctes. Commencez par obtenir une réponse reproductible à une demande simple.

Un exercice au résultat vérifiable

Demandez une fonction avec des exigences précises :

Écris une fonction Python unique_names(names). Elle reçoit une liste de chaînes, retire les espaces aux extrémités, puis élimine les chaînes vides et les doublons sans tenir compte de la casse. Conserve l'ordre des premières occurrences et leur écriture après suppression des espaces. Fournis le code et trois tests. N'ajoute aucune dépendance.

Fixez les résultats attendus avant d'évaluer la réponse :

assert unique_names([" Anna ", "anna", "", "BOB"]) == ["Anna", "BOB"]
assert unique_names([]) == []
assert unique_names([" A ", "a", "B", "b"]) == ["A", "B"]

Ce sont des critères définis pour l'exercice, pas les résultats d'un essai du modèle. Lisez le code proposé avant de lancer les vérifications dans un environnement de test. Si la fonction modifie l'ordre ou la casse de la première occurrence, signalez précisément l'écart et demandez une correction.

Cet exercice montre si le modèle respecte ces consignes. Il ne prouve pas qu'il sait modifier seul un grand dépôt.

Interroger le modèle depuis un programme

Ollama fournit une API HTTP locale. Sous macOS, Linux ou WSL :

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5-coder:1.5b",
  "prompt": "Explain the difference between a Python list and a tuple.",
  "stream": false
}'

Le paramètre `stream: false` demande une réponse complète plutôt qu'un flux de fragments. Les champs sont décrits dans la documentation de generate. Cette requête vérifie l'accès à l'API ; elle ne raccorde pas automatiquement le modèle à toutes les fonctions de l'éditeur.

Pour intégrer un éditeur, vérifiez d'abord que l'extension choisie accepte Ollama ou un endpoint local compatible. Renseignez ensuite l'adresse du serveur et le nom exact du modèle installé. La prise en charge du chat n'implique pas celle de tous les outils d'un agent de développement.

Que signifie « local » ?

Ollama indique ne pas recevoir vos prompts et réponses lorsqu'un modèle s'exécute localement. Les modèles cloud suivent un autre circuit. L'éditeur, les extensions et les outils externes peuvent aussi contacter leurs propres services : examinez donc toute la chaîne. FAQ Ollama.

Un mode local-only permet de désactiver les fonctions cloud d'Ollama. Toutefois, ne qualifiez pas votre environnement d'entièrement hors ligne avant d'avoir vérifié les téléchargements de dépendances, les requêtes des extensions et le comportement des outils. Faites le premier essai sur du code pédagogique.

Si les réponses sont trop lentes

Exécutez `ollama ps` pour voir les modèles chargés et la répartition entre CPU et GPU. Cela aide à identifier la limitation. Vérifier où s'exécute le modèle.

Modifiez un seul paramètre à la fois : modèle plus petit, entrée plus courte ou contexte configuré plus réduit. Fermez les applications gourmandes et répétez la même tâche. Ne réglez pas systématiquement le contexte au maximum : les poids ne sont pas seuls à occuper la mémoire.

Consignez le modèle et son tag, le matériel, le contexte, le prompt, la durée et les résultats des tests. Une réponse rapide ne suffit pas à choisir une configuration si le code n'est pas vérifié.

faq

L'essentiel en bref

Un petit modèle local peut-il remplacer un agent cloud ?

Évaluez séparément vos besoins : explication de code, correction d'une fonction, modification de plusieurs fichiers. Une réussite dans un scénario ne se généralise pas automatiquement.

Faut-il acheter une carte graphique tout de suite ?

Commencez avec votre ordinateur et un petit modèle. Consultez le guide RAM, VRAM et contexte (/fr/blog/local-llm-ram-vram-context), puis fondez tout achat sur une limite mesurée dans votre tâche.

Comment choisir le modèle suivant ?

Comparez plusieurs candidats sur les mêmes demandes et les mêmes tests définis à l'avance. Notez la rapidité, mais aussi les corrections manuelles nécessaires pour obtenir un résultat acceptable.