IA local o en la nube: qué elegir para trabajar
Neaptide · 28 de septiembre de 2026 · 12 min de lectura
Compara IA local y en la nube: privacidad, calidad, velocidad y costes. Dos esquemas, un cálculo transparente y una plantilla para probar tus tareas.
En este artículo

La IA local atrae con una promesa sencilla: los documentos se quedan en tu ordenador, el modelo funciona sin Internet y cada consulta no genera una factura. Pero ejecutar un modelo gratis no garantiza que su resultado salga barato. Si dedicas mucho tiempo a corregir respuestas, el ahorro en la suscripción puede desaparecer en unos días de trabajo.
Respuesta breve: un modelo de lenguaje local es útil cuando necesitas procesar en tu propio dispositivo o trabajar sin conexión, siempre que su calidad sea suficiente para la tarea. Elige un servicio en la nube cuando su modelo y sus herramientas produzcan un mejor resultado de trabajo y sus condiciones de tratamiento de datos sean aceptables. Combinar ambos tiene sentido si has definido qué materiales pueden salir de tu infraestructura y en qué etapa.
Aquí comparamos asistentes para texto, documentos y código. La generación de vídeo, el procesamiento de audio y otros usos requieren pruebas distintas. El artículo se basa en documentación de los productos, revisada el 27 de septiembre de 2026. No hemos realizado una prueba comparativa propia de los modelos; el ejemplo numérico es un cálculo transparente con datos hipotéticos.
Qué significa que la IA sea local
En este artículo, IA local es un modelo cuyos cálculos se ejecutan en tu ordenador o en un servidor que administras. IA en la nube es un modelo que un proveedor externo ejecuta para ti. La ventana de la aplicación puede ser idéntica en ambos casos.
Un portátil con un modelo y un servidor en tu oficina son configuraciones diferentes. El primero puede funcionar sin conexión después de prepararlo. El segundo necesita acceso por red, pero puede compartirse con el equipo. Alquilar un servidor e instalar un modelo por tu cuenta es otro caso: controlas el software, pero la infraestructura física pertenece al proveedor. La palabra «local» no describe por sí sola todos estos límites.
LM Studio ilustra bien la diferencia. Su documentación indica que el chat con un modelo descargado y el procesamiento de documentos pueden funcionar sin conexión. Sin embargo, los modelos en la nube y la búsqueda web de esa misma aplicación de escritorio envían consultas fuera del dispositivo. Comprueba el modo elegido y todo el proceso.

Comparación según ocho criterios prácticos
En esta tabla, la opción local es un modelo en tu ordenador. Un servidor compartido por el equipo añade acceso por red, administración de usuarios y gestión de la carga conjunta.
| Criterio | Modelo local | Servicio en la nube |
|---|---|---|
| Datos | Puede procesar sin enviarlos a proveedores externos si todas las etapas permanecen en el dispositivo | El proveedor procesa la consulta; la conservación, el entrenamiento y el acceso dependen del producto y sus condiciones |
| Calidad | Limitada por el modelo y la configuración disponibles; hay que probarla con tus tareas | Puedes elegir modelos que no caben en tu ordenador; su calidad también debe comprobarse |
| Uso sin conexión | Posible tras descargar los componentes necesarios; las herramientas de red son un caso aparte | El procesamiento remoto requiere acceso al servicio |
| Velocidad | Depende del equipo, el modelo, la longitud de la entrada y otras tareas del ordenador | Depende del modelo, la red, la cola y los límites del servicio |
| Costes | Equipo, energía, configuración, mantenimiento y revisión de respuestas | Suscripción o pago por uso, integración, administración y revisión de respuestas |
| Mantenimiento | Tú eliges y actualizas modelos, aplicación y entorno | El proveedor mantiene la infraestructura del modelo; el proceso y los accesos siguen siendo tu responsabilidad |
| Aumento de la demanda | Más usuarios comparten recursos limitados; crecer puede exigir otro equipo | La ampliación depende de cuotas, planes y capacidad disponible del proveedor |
| Versiones | Puedes conservar archivos concretos del modelo y su entorno | El proveedor determina qué versiones están disponibles y durante cuánto tiempo |
La tabla sirve para definir tus requisitos. No demuestra que una opción sea más rápida, barata o precisa con tus documentos.
Cuándo resulta útil la IA local
El procesamiento puede quedarse en tu infraestructura
Si las normas del equipo impiden enviar materiales de trabajo a un servicio externo, el procesamiento local permite realizar una tarea sin esa transferencia. Por ejemplo, preparar un borrador de resumen de notas internas o clasificar solicitudes. Tanto el modelo como los componentes que leen los archivos originales deben ejecutarse localmente.
Ese control exige trabajo: restringir el acceso al ordenador y las carpetas, comprobar las copias de seguridad y actualizar el software. Tener un modelo en el disco no protege un documento frente a otro usuario, software malicioso o una sincronización mal configurada.
Puedes trabajar sin Internet
Durante un viaje o con una conexión inestable, un asistente local puede seguir editando texto y respondiendo sobre los materiales disponibles. Hay que descargar antes el modelo, los componentes de ejecución y los documentos. La búsqueda web, una base de conocimiento remota y otras dependencias de red no estarán disponibles sin conexión. La documentación de LM Studio explica esta separación entre funciones locales y descarga de componentes.
Puedes conservar una configuración probada
Para una operación repetitiva, puede ser útil fijar un modelo, sus ajustes y la aplicación. Procesar fichas similares de forma habitual puede importar más que acceder al modelo más reciente cada semana. Pero conservar los archivos no garantiza una respuesta idéntica en cada ejecución: hay que comprobar el comportamiento junto con los ajustes de generación y el entorno.
Los modelos en la nube también pueden tener versiones, aunque el proveedor decide cuánto tiempo siguen disponibles. Ollama, por ejemplo, avisa de la retirada de determinados modelos en la nube y aclara que no afecta a los modelos locales ya descargados.
Las limitaciones de ejecutar un modelo localmente
La primera es la calidad en una tarea concreta. Un modelo que cabe cómodamente en un portátil puede tener dificultades con código complejo, documentos largos o instrucciones ambiguas. Es una hipótesis que comprobar, no un motivo para descartar todos los modelos pequeños. Una tarea bien delimitada puede exigir menos capacidades que una conversación abierta.
La segunda es la memoria y la carga de trabajo. El tamaño del archivo del modelo no equivale a toda la memoria que necesita al funcionar. El procesamiento del contexto, los datos de trabajo y los demás programas también ocupan espacio. En los modelos de lenguaje, uno de esos consumos es la caché KV; sus necesidades dependen de la arquitectura y la estrategia de almacenamiento. Documentación de Hugging Face sobre la caché. Nuestra guía de RAM, VRAM y contexto incluye explicaciones y cálculos detallados.
De ahí una regla de compra: la etiqueta AI PC y una cifra de TOPS no sustituyen una prueba del modelo en la aplicación que vas a usar. La documentación de AMD describe, por ejemplo, distintas formas de ejecutar modelos en CPU, GPU y NPU con componentes de software diferentes. Que exista una NPU no significa que cualquier aplicación vaya a utilizarla automáticamente.
La tercera limitación es tu tiempo. Ni siquiera una aplicación cómoda elimina la selección del modelo, la revisión de su licencia, las actualizaciones o la resolución de fallos. En un experimento personal, eso puede ser parte del atractivo. En un proceso de equipo, alguien debe responsabilizarse. Si no hay nadie, conviene recalcular el ahorro previsto.
Qué aporta la nube y dónde están sus límites
Un servicio en la nube permite empezar sin comprar hardware para el modelo. Da acceso a modelos y herramientas que no puedes o no quieres mantener. Su utilidad depende de la tarea: poder subir un archivo o invocar una herramienta no demuestra que el resultado sea correcto.
La contrapartida es depender del acceso al servicio, sus límites y sus cambios. Una suscripción no implica necesariamente un uso ilimitado. Una API exige controlar el gasto. Si cambia el modelo o desaparece una versión necesaria, tendrás que volver a validar el proceso.
Para unas pocas tareas variadas, la nube suele ser un punto de partida cómodo: puedes comprobar su utilidad antes de invertir en equipo. Es una secuencia práctica, no una afirmación de que siempre sea más barata. Con una carga constante y hardware adecuado ya disponible, el cálculo puede cambiar.
Privacidad: cuatro preguntas distintas
Decir que «la IA en la nube se entrena con todo lo que subes» es demasiado general. Anthropic afirma, por ejemplo, que no utiliza por defecto las entradas y salidas de sus productos comerciales, incluidos Claude for Work y la API, para entrenar modelos. El envío de comentarios o un consentimiento específico pueden cambiar esas condiciones. Los productos de consumo tienen otras reglas.
Excluir los datos del entrenamiento no dice por sí solo cuánto tiempo se conservan. Para decidir dónde procesarlos, plantea cuatro preguntas:
- ¿Quién procesa los datos? ¿Solo tu máquina, tu servidor o un proveedor externo y sus subcontratistas?
- ¿Qué se guarda y durante cuánto tiempo? Los archivos originales, el historial, los registros de consultas y las copias de seguridad son objetos distintos.
- ¿Puede usarse el material para entrenar? Revisa las reglas de tu producto, plan y configuración de comentarios.
- ¿Qué servicios adicionales reciben el contenido? La búsqueda web, el reconocimiento de documentos escaneados, las herramientas externas y la sincronización pueden tener condiciones propias.
Incluso con un mismo proveedor, la conservación puede variar entre la API, los archivos subidos y la interfaz de chat. Los acuerdos sin conservación también pueden cubrir solo determinadas funciones y condiciones.
En un proceso local, una comprobación sencilla consiste en abrir un documento, hacer una pregunta y obtener una respuesta con la red desactivada. Eso demuestra que el escenario probado funciona sin conexión. No demuestra que no se envíen datos cuando vuelva la conectividad. Ollama permite desactivar sus funciones en la nube con OLLAMA_NO_CLOUD=1 y un reinicio de la aplicación, pero ese ajuste no controla los demás programas del ordenador.
Cuánto cuesta un resultado que puedes utilizar
Compara el mismo volumen de trabajo e incluye el tiempo humano. Una fórmula mensual básica es: parte de la inversión inicial + uso del servicio + energía adicional + mantenimiento + revisión y corrección de respuestas. Puedes excluir los gastos iguales para ambas opciones si lo indicas expresamente.
Consideremos un escenario hipotético: una persona, 200 tareas al mes, su tiempo valorado en 20 € por hora y un horizonte de 36 meses. No son precios de productos ni mediciones. La energía y las horas son supuestos del ejemplo; sustitúyelos por tus datos antes de decidir.
| Partida | Opción local, al mes | Opción en la nube, al mes |
|---|---|---|
| Hardware adicional | 900 € ÷ 36 = 25 € | 0 €: se usa el ordenador existente |
| Configuración inicial | 6 h × 20 € ÷ 36 ≈ 3,33 € | 1 h × 20 € ÷ 36 ≈ 0,56 € |
| Energía adicional | 30 kWh × 0,30 € = 9 € | 0 € en este escenario: no se cuenta un incremento separado |
| Servicio o licencia | 0 € según el supuesto | 40 € por todo el volumen mensual según el supuesto |
| Mantenimiento y administración | 1,5 h × 20 € = 30 € | 0,5 h × 20 € = 10 € |
| Antes de revisar las respuestas | 67,33 € | 50,56 € |
Este cálculo supone que no hay integraciones de pago adicionales, equipos de respaldo ni otros gastos. Añádelos si tu proceso los necesita. No vuelvas a contar un ordenador ya comprado como una compra nueva, pero sí las ampliaciones y los recursos adicionales necesarios para el modelo. Aquí no se considera el valor residual del equipo.
Veamos la sensibilidad del resultado: un minuto adicional de correcciones en cada una de las 200 tareas cuesta 66,67 € al mes, a 20 € por hora. Supera la diferencia entre las dos opciones de la tabla. No suponemos que un modelo local o en la nube vaya a necesitar necesariamente ese minuto. El ejemplo muestra por qué la calidad puede importar más que el precio de acceso.
Una métrica final útil es el coste por resultado aceptado: todos los gastos del volumen comparado, incluidos intentos fallidos y correcciones, divididos entre los resultados que superan tus comprobaciones. Si no hay ninguno aceptado, la métrica no está definida: el proceso todavía no cumple su función.
Cómo probar ambas opciones antes de comprar equipo
Para un primer piloto puedes elegir 12 tareas representativas: cuatro de extracción de hechos, cuatro de redacción o edición y cuatro de razonamiento o código. Es un punto de partida cómodo, no un estándar validado estadísticamente. Ajusta las proporciones a tu trabajo y utiliza solo materiales que ambas opciones tengan permitido procesar.
No incluyas únicamente preguntas fáciles. Añade un documento contradictorio, una pregunta cuya respuesta no aparezca en las fuentes y una tarea donde sea fácil pasar por alto un error. Si el modelo extrae un plazo de entrega, anota antes el plazo correcto y su fuente. Si edita un correo, enumera los hechos que debe preservar. Para código, prepara una comprobación del comportamiento esperado.
- Registra las condiciones. Nombre y versión del modelo, configuración local y cuantización, aplicación, contexto disponible, herramientas y modo. Para la nube: plan o API, modo elegido y fecha.
- Aporta las mismas fuentes. Si comparas modelos, iguala el acceso a búsqueda y herramientas. Si comparas procesos completos, conserva las diferencias útiles y descríbelas claramente.
- Mide la espera. Distingue la primera consulta, cuando el modelo aún no está cargado, de las siguientes. Repite el escenario varias veces; una ejecución rápida dice poco sobre una jornada de trabajo.
- Aplica criterios definidos de antemano. Registra errores críticos, aceptación o rechazo y minutos de corrección. Un formato atractivo no debe ocultar un dato incorrecto.
- Calcula los costes y prueba una situación exigente. Por ejemplo, un documento largo con tus aplicaciones habituales abiertas o un servidor compartido por varios usuarios. Prueba por separado el uso sin conexión si lo necesitas.
Los tokens por segundo sirven para el diagnóstico técnico, pero no miden el tiempo hasta obtener un resultado útil. La API de Ollama informa, por ejemplo, de duraciones separadas para cargar el modelo, procesar la entrada y generar la salida. La revisión humana y el tiempo total de la tarea deben medirse aparte.
Nuestra plantilla de comparación entre IA local y en la nube incluye condiciones del piloto, una ficha de tarea y un registro de resultados. Está vacía: no contiene puntuaciones inventadas de modelos. Para tu primera instalación local, consulta la guía de Ollama.
Cuándo conviene combinar IA local y en la nube
Un proceso mixto resulta útil cuando cada etapa tiene requisitos distintos de datos y calidad. Por ejemplo, un informe interno se procesa localmente. Después, una persona prepara un resumen autorizado para el procesamiento externo y el modelo en la nube ayuda a redactar un texto público. El resultado final se comprueba frente a los hechos originales.
La dificultad está en el contenido del resumen intermedio. Eliminar nombres no basta si quedan cifras confidenciales, condiciones comerciales u otra información sensible. Transfiere únicamente el material cuyo procesamiento externo esté realmente permitido. Si no es posible, la tarea se queda dentro de la infraestructura autorizada o la realiza una persona.

Combinar ambos enfoques tiene costes propios: dos conjuntos de herramientas, traspasos entre ellos y revisión de materiales intermedios. Si una sola opción ya resuelve bien la tarea, no hace falta añadir otra solo por la arquitectura.
Por dónde empezar
Empieza con un modelo local si trabajar sin conexión o procesar dentro de tu infraestructura es obligatorio. Prueba primero la tarea con el equipo disponible. Si la calidad no basta, decide si conviene cambiar el modelo, el proceso o el hardware: una restricción de datos no convierte una respuesta deficiente en útil.
Empieza con un servicio en la nube si el procesamiento externo es admisible, las tareas son variadas y quieres comprobar pronto la utilidad de la herramienta. Compara el resultado con tu método actual y fija un límite de gasto claro.
Combina ambas opciones cuando tengas una frontera concreta: qué originales se quedan dentro, qué puede enviarse y quién revisa el paso entre etapas. La compra de un «ordenador para IA» tiene sentido después de esa decisión, cuando ya conoces el modelo, la carga y los requisitos del resultado.