Saltar al contenido
Neaptideestudio
blog

IA local para programar: primeros pasos con Ollama

Neaptide · 20 de septiembre de 2026 · 8 min de lectura

Ejecuta un modelo local con Ollama: instalación, API HTTP, ejercicio Python comprobable y diagnóstico de lentitud.

En este artículo
Ordenador local junto a un bloque de modelo y una ficha de código.

Para probar un modelo local, empieza por un fragmento de código: explicar una función, proponer pruebas o detectar un error. En este primer ensayo importan más una configuración reproducible y un resultado comprobable que el tamaño del modelo.

Ollama ejecuta modelos y ofrece una interfaz para consultarlos. Esta guía utiliza la variante local de Qwen2.5-Coder 1.5B como ejemplo didáctico pequeño. No pretende recomendar el mejor modelo actual ni garantizar buenos resultados en proyectos grandes. Ficha del modelo.

Instalación y primera respuesta

Sigue las instrucciones oficiales para tu sistema e inicia la aplicación o el servicio. En la terminal:

ollama --version
ollama run qwen2.5-coder:1.5b

La primera ejecución descarga el modelo, por lo que necesitas conexión a Internet y espacio en disco. Cuando aparezca la entrada interactiva, plantea una pregunta breve sobre código. Escribe `/bye` para salir.

No juzgues la velocidad por la primera respuesta: cargar el modelo y generar texto son fases distintas. Primero consigue una respuesta reproducible con una petición sencilla.

Un ejercicio con resultados comprobables

Pide una función con requisitos explícitos:

Escribe una función Python unique_names(names). Recibe una lista de cadenas, elimina los espacios de los extremos, las cadenas vacías y los duplicados sin distinguir mayúsculas de minúsculas. Conserva el orden de las primeras apariciones y su escritura tras quitar los espacios. Devuelve el código y tres pruebas. No añadas dependencias.

Define de antemano los resultados esperados:

assert unique_names([" Anna ", "anna", "", "BOB"]) == ["Anna", "BOB"]
assert unique_names([]) == []
assert unique_names([" A ", "a", "B", "b"]) == ["A", "B"]

Estos son criterios del ejercicio, no resultados medidos del modelo. Lee el código propuesto antes de ejecutar las comprobaciones en un entorno de pruebas. Si cambia el orden o las mayúsculas de la primera aparición, señala la discrepancia concreta y solicita una corrección.

Este pequeño ensayo permite comprobar si el modelo sigue esas instrucciones. No demuestra que pueda modificar un repositorio grande por su cuenta.

Consultar el modelo desde un programa

Ollama ofrece una API HTTP local. En macOS, Linux o WSL, puedes enviar:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5-coder:1.5b",
  "prompt": "Explain the difference between a Python list and a tuple.",
  "stream": false
}'

Aquí, `stream: false` solicita una respuesta completa en lugar de una secuencia de fragmentos. Los campos se explican en la documentación de generate. La petición comprueba el acceso a la API; no conecta automáticamente el modelo con todas las funciones del editor.

Para integrarlo en un editor, comprueba primero que la extensión elegida admite Ollama o un endpoint local compatible. Indica después la dirección del servidor y el nombre exacto del modelo instalado. Disponer de chat no implica admitir todas las herramientas de un agente de desarrollo.

Qué significa «local»

Ollama afirma que no recibe tus prompts ni respuestas cuando el modelo se ejecuta localmente. Los modelos en la nube siguen otro recorrido. El editor, las extensiones y las herramientas externas también pueden contactar con sus propios servicios: revisa el conjunto. Preguntas frecuentes de Ollama.

Ollama dispone de un modo local-only para trabajar sin sus funciones en la nube. Aun así, no describas el proceso como completamente desconectado hasta comprobar las descargas de dependencias, las solicitudes de las extensiones y el comportamiento de las herramientas. Usa código de ejemplo en la primera prueba.

Si las respuestas son demasiado lentas

Ejecuta `ollama ps`: muestra los modelos cargados y el reparto de ejecución entre CPU y GPU. Esto ayuda a localizar la limitación. Comprobar dónde se ejecuta el modelo.

Cambia una sola condición cada vez: un modelo más pequeño, menos texto de entrada o un contexto configurado menor. Cierra otras aplicaciones exigentes y repite la misma tarea. No aumentes siempre el contexto al máximo: la memoria también se utiliza para otros elementos además de los pesos.

Registra el modelo y su etiqueta, el equipo, el contexto, la petición, el tiempo y las pruebas. «Respondió rápido» sirve de poco para elegir una configuración sin comprobar el código.

faq

Lo esencial en breve

¿Un modelo local pequeño puede sustituir a un agente en la nube?

Evalúa por separado las tareas que necesitas: explicar código, corregir una función y modificar varios archivos. Acertar en un escenario no garantiza acertar en los demás.

¿Tengo que comprar una GPU inmediatamente?

Empieza con tu ordenador y un modelo pequeño. Consulta la guía de RAM, VRAM y contexto (/es/blog/local-llm-ram-vram-context) para estimar memoria y basa cualquier compra en una limitación medida de tu tarea real.

¿Cómo elijo el siguiente modelo?

Compara candidatos adecuados con las mismas peticiones y pruebas definidas previamente. Registra la velocidad y las correcciones manuales necesarias para alcanzar un resultado aceptable.