Локальная нейросеть для программирования: первый запуск через Ollama
Neaptide · 20 сентября 2026 г. · 8 мин чтения
Первый запуск локальной модели для кода через Ollama: установка, HTTP API, проверяемая задача и диагностика скорости.
В этой статье

Локальную модель удобно попробовать на небольшом фрагменте кода: объяснить функцию, предложить тесты или найти ошибку. Для первого опыта важнее воспроизводимый запуск и понятная проверка, чем самая большая модель в каталоге.
Ollama запускает модели и предоставляет интерфейс для обращения к ним. В этом руководстве используется локальный вариант Qwen2.5-Coder 1.5B как небольшой учебный пример. Это не рекомендация лучшей модели на сегодняшний день и не обещание качества на больших проектах. Карточка модели.
Установка и первый ответ
Установите Ollama по официальной инструкции для своей системы и запустите приложение или службу. В терминале проверьте:
ollama --version
ollama run qwen2.5-coder:1.5bПервый запуск загружает модель, поэтому нужен интернет и место на диске. После появления интерактивного ввода задайте короткий вопрос по коду. Для выхода из сессии используйте `/bye`.
Не оценивайте скорость по одному первому ответу: загрузка модели и генерация — разные этапы. Сначала добейтесь повторяемого ответа на небольшой запрос.
Учебная задача с проверяемым результатом
Попросите модель написать функцию со строгими условиями:
Напиши функцию Python unique_names(names). Она принимает список строк, удаляет пробелы по краям, исключает пустые строки и повторы без учёта регистра. Порядок первых вхождений и их написание после удаления пробелов сохрани. Верни код и три теста. Не добавляй зависимости.Заранее зафиксируйте ожидаемые результаты, например:
assert unique_names([" Anna ", "anna", "", "BOB"]) == ["Anna", "BOB"]
assert unique_names([]) == []
assert unique_names([" A ", "a", "B", "b"]) == ["A", "B"]Это авторские критерии задачи, а не результат измерения модели. Сначала прочитайте предложенный код, затем выполните проверки в тестовом окружении. Если функция меняет порядок или регистр первой строки, укажите конкретное расхождение и запросите исправление.
Такой небольшой опыт показывает, умеет ли модель следовать вашим условиям. Он не доказывает способность самостоятельно изменять большой репозиторий.
Как обратиться к модели из программы
Ollama предоставляет локальный HTTP API. Для macOS, Linux или WSL пример запроса выглядит так:
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5-coder:1.5b",
"prompt": "Explain the difference between a Python list and a tuple.",
"stream": false
}'Здесь `stream: false` запрашивает единый ответ вместо потока частей. Описание полей находится в документации generate. Запрос показывает доступность API; он не подключает модель ко всем функциям редактора автоматически.
Для интеграции с редактором сначала проверьте, поддерживает ли выбранное расширение Ollama или совместимый локальный endpoint. Затем укажите адрес сервера и точное имя установленной модели. Возможность отвечать в чате не означает поддержку всех инструментов агентной разработки.
Что значит «работает локально»
Для локально выполняемой модели Ollama сообщает, что не получает ваши промпты и ответы. У облачных моделей другой путь обработки. Кроме того, редактор, плагины и внешние инструменты могут обращаться к своим сервисам. Поэтому проверяйте всю связку. FAQ Ollama.
Для сценария без облачных функций в Ollama предусмотрен режим local-only. Но не называйте рабочий процесс полностью офлайн, пока не проверили загрузку зависимостей, обращения расширений и поведение инструментов. Первую пробу проводите на учебном коде.
Если ответ слишком медленный
Выполните `ollama ps`: команда показывает загруженные модели и распределение выполнения между CPU и GPU. Это помогает понять, где искать ограничение. Диагностика размещения модели.
Затем меняйте по одному условию: уменьшите модель, сократите входной текст или снизьте заданный контекст. Закройте другие тяжёлые приложения и повторите ту же задачу. Не увеличивайте контекст автоматически до максимума: память нужна не только весам модели.
Для журналирования достаточно записывать модель и тег, оборудование, контекст, запрос, время и результат тестов. Показатель «быстро ответила» без проверки кода мало помогает выбирать рабочую конфигурацию.