IA local para programar: primeros pasos con Ollama
Neaptide · 20 de septiembre de 2026 · 8 min de lectura
Ejecuta un modelo local con Ollama: instalación, API HTTP, ejercicio Python comprobable y diagnóstico de lentitud.
En este artículo

Para probar un modelo local, empieza por un fragmento de código: explicar una función, proponer pruebas o detectar un error. En este primer ensayo importan más una configuración reproducible y un resultado comprobable que el tamaño del modelo.
Ollama ejecuta modelos y ofrece una interfaz para consultarlos. Esta guía utiliza la variante local de Qwen2.5-Coder 1.5B como ejemplo didáctico pequeño. No pretende recomendar el mejor modelo actual ni garantizar buenos resultados en proyectos grandes. Ficha del modelo.
Instalación y primera respuesta
Sigue las instrucciones oficiales para tu sistema e inicia la aplicación o el servicio. En la terminal:
ollama --version
ollama run qwen2.5-coder:1.5bLa primera ejecución descarga el modelo, por lo que necesitas conexión a Internet y espacio en disco. Cuando aparezca la entrada interactiva, plantea una pregunta breve sobre código. Escribe `/bye` para salir.
No juzgues la velocidad por la primera respuesta: cargar el modelo y generar texto son fases distintas. Primero consigue una respuesta reproducible con una petición sencilla.
Un ejercicio con resultados comprobables
Pide una función con requisitos explícitos:
Escribe una función Python unique_names(names). Recibe una lista de cadenas, elimina los espacios de los extremos, las cadenas vacías y los duplicados sin distinguir mayúsculas de minúsculas. Conserva el orden de las primeras apariciones y su escritura tras quitar los espacios. Devuelve el código y tres pruebas. No añadas dependencias.Define de antemano los resultados esperados:
assert unique_names([" Anna ", "anna", "", "BOB"]) == ["Anna", "BOB"]
assert unique_names([]) == []
assert unique_names([" A ", "a", "B", "b"]) == ["A", "B"]Estos son criterios del ejercicio, no resultados medidos del modelo. Lee el código propuesto antes de ejecutar las comprobaciones en un entorno de pruebas. Si cambia el orden o las mayúsculas de la primera aparición, señala la discrepancia concreta y solicita una corrección.
Este pequeño ensayo permite comprobar si el modelo sigue esas instrucciones. No demuestra que pueda modificar un repositorio grande por su cuenta.
Consultar el modelo desde un programa
Ollama ofrece una API HTTP local. En macOS, Linux o WSL, puedes enviar:
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5-coder:1.5b",
"prompt": "Explain the difference between a Python list and a tuple.",
"stream": false
}'Aquí, `stream: false` solicita una respuesta completa en lugar de una secuencia de fragmentos. Los campos se explican en la documentación de generate. La petición comprueba el acceso a la API; no conecta automáticamente el modelo con todas las funciones del editor.
Para integrarlo en un editor, comprueba primero que la extensión elegida admite Ollama o un endpoint local compatible. Indica después la dirección del servidor y el nombre exacto del modelo instalado. Disponer de chat no implica admitir todas las herramientas de un agente de desarrollo.
Qué significa «local»
Ollama afirma que no recibe tus prompts ni respuestas cuando el modelo se ejecuta localmente. Los modelos en la nube siguen otro recorrido. El editor, las extensiones y las herramientas externas también pueden contactar con sus propios servicios: revisa el conjunto. Preguntas frecuentes de Ollama.
Ollama dispone de un modo local-only para trabajar sin sus funciones en la nube. Aun así, no describas el proceso como completamente desconectado hasta comprobar las descargas de dependencias, las solicitudes de las extensiones y el comportamiento de las herramientas. Usa código de ejemplo en la primera prueba.
Si las respuestas son demasiado lentas
Ejecuta `ollama ps`: muestra los modelos cargados y el reparto de ejecución entre CPU y GPU. Esto ayuda a localizar la limitación. Comprobar dónde se ejecuta el modelo.
Cambia una sola condición cada vez: un modelo más pequeño, menos texto de entrada o un contexto configurado menor. Cierra otras aplicaciones exigentes y repite la misma tarea. No aumentes siempre el contexto al máximo: la memoria también se utiliza para otros elementos además de los pesos.
Registra el modelo y su etiqueta, el equipo, el contexto, la petición, el tiempo y las pruebas. «Respondió rápido» sirve de poco para elegir una configuración sin comprobar el código.