En enero de 2026, OpenAI tuvo una caída de servidores de 4 horas. Durante ese tiempo, miles de equipos que dependían de la API para sus flujos de trabajo se quedaron sin su herramienta principal. Los que tenían Ollama corriendo en local siguieron trabajando sin interrupciones.
Eso resume mejor que cualquier argumento técnico por qué la IA local ha dejado de ser una curiosidad para convertirse en una decisión estratégica en 2026. No se trata solo de privacidad ni de ahorro en APIs — se trata de independencia operativa. Tu agente funciona cuando tú lo necesitas, no cuando los servidores de un tercero están disponibles.
Esta guía te explica cómo construir tu propio servidor de IA local con Ollama desde cero: qué hardware necesitas según tu presupuesto, cómo instalarlo en menos de 5 minutos, qué modelos funcionan mejor en cada configuración, y cuándo tiene más sentido delegar en un VPS gestionado en lugar de gestionar el hardware tú mismo.
0€
Coste de Ollama (software)
300€
Hardware mínimo con 32GB
~3€
Electricidad/mes servidor 24/7
Qué es Ollama y por qué todo el mundo habla de él en 2026
Ollama es una herramienta de línea de comandos gratuita y de código abierto que convierte la instalación y ejecución de modelos de lenguaje en algo tan simple como instalar una aplicación. Antes de Ollama, correr un modelo local requería gestionar entornos de Python, dependencias de CUDA, cuantizaciones manuales y configuración de APIs. Ahora son tres comandos:
# Instalar Ollama (macOS y Linux)
curl -fsSL https://ollama.ai/install.sh | sh
# Descargar y arrancar un modelo
ollama run deepseek-r1:8b
# Desde ese momento responde en localhost:11434
La API que expone Ollama es compatible con el formato de OpenAI, lo que significa que cualquier aplicación configurada para usar ChatGPT puede apuntar a tu modelo local simplemente cambiando la URL base. Eso incluye OpenClaw, Open WebUI, Cursor, Continue.dev y cualquier herramienta que use la API de OpenAI.
Por qué la IA local tiene sentido económico en 2026
La cuenta que la comunidad de r/LocalLLaMA lleva haciendo desde principios de 2026 es esta: por el precio de dos años de suscripción a ChatGPT Plus (480€), tienes un mini PC capaz de correr modelos de 7-13B parámetros de forma ilimitada y completamente privada. Sin límites de tokens. Sin datos que salen de tu red. Sin dependencia de servidores externos.
Para uso moderado, la amortización es de 18-24 meses. Para uso intensivo (equipos, agentes autónomos, volúmenes altos), puede ser de 6-12 meses.
Requisitos de hardware: lo que realmente importa
Antes de elegir hardware, hay un único concepto que determina todo lo demás: el ancho de banda de memoria. No la CPU. No los TOPS del NPU. No el número de núcleos. El factor que decide la velocidad de generación de tokens es cuántos GB/s puede mover el sistema entre la RAM y los procesadores.
Importante sobre los TOPS del NPU: Los fabricantes venden los mini PC con claims de «86 TOPS de IA» o «512 TOPS». En mayo de 2026, ni Ollama ni llama.cpp usan el NPU para inferencia de LLMs. Los TOPS son irrelevantes para Ollama. Lo que importa es la GPU integrada (Radeon 780M mínimo recomendable en AMD) y la cantidad y velocidad de la RAM.
| RAM total |
RAM disponible para modelo |
Modelos que caben |
Velocidad orientativa |
| 16GB | ~10-11GB | 7-8B parámetros | 18-35 tok/s |
| 32GB ✅ | ~26-28GB | 13-14B parámetros | 15-25 tok/s |
| 48-64GB | ~42-58GB | 30-34B parámetros | 10-20 tok/s |
| 96-128GB | ~90-122GB | 70B parámetros (Q4) | 5-10 tok/s |
SO-DIMM vs LPDDR5X soldada — el error más caro: Algunos mini PC tienen la RAM soldada a la placa (LPDDR5X). No se puede ampliar. Si compras uno con 16GB soldados y luego quieres 32GB, tienes que comprar otro equipo. Verifica siempre si el modelo usa SO-DIMM (intercambiable) o LPDDR5X (fija) antes de comprar. El Beelink SER8 y el GMKtec K8 Plus usan SO-DIMM. El Beelink SER9 y algunos GMKtec tienen memoria soldada.
¿Ya sabes cuánta RAM necesitas y quieres ver qué hardware concreto comprar? Hemos analizado todos los equipos — Raspberry Pi, mini PC AMD, Mac mini M4 y NAS — en nuestra
guía completa de infraestructura de IA local 2026 →
Los dos caminos: Mac mini Apple Silicon vs Mini PC AMD
En 2026, el mercado de hardware para Ollama se ha polarizado en dos categorías con filosofías distintas.
Mac mini Apple Silicon
Filosofía: Eficiencia máxima. CPU y GPU comparten el mismo pool de RAM (memoria unificada), eliminando el cuello de botella de VRAM. Sin ventilador audible. Consume 20-40W bajo carga.
Mejor para: Servidor 24/7 silencioso, usuarios de ecosistema Apple, casos donde el consumo eléctrico importa.
Contra: RAM no expandible (soldada y elegida al comprar), precio por GB de RAM más alto.
Mini PC AMD Ryzen
Filosofía: Máxima RAM por euro. La Radeon 780M de los Ryzen 8000 permite offloading GPU en Ollama. SO-DIMM expandible en los mejores modelos.
Mejor para: Presupuesto ajustado, necesidad de RAM ampliable, Windows/Linux preferido.
Contra: Mayor consumo (15-65W), ruido audible bajo carga, rendimiento por vatio inferior.
Instalar Ollama: en 5 minutos con cualquier hardware
macOS (Mac mini M4)
# Instalar con Homebrew (recomendado)
brew install ollama
# O descargar desde ollama.ai
curl -fsSL https://ollama.ai/install.sh | sh
# Arrancar el servidor
ollama serve
# En otra terminal: descargar y usar un modelo
ollama pull qwen3:8b
ollama run qwen3:8b
Linux / Ubuntu (Mini PC AMD)
# Instalar Ollama
curl -fsSL https://ollama.ai/install.sh | sh
# Verificar que detecta la GPU AMD (Radeon 780M)
ollama run llama3.2:8b --verbose
# Busca en el output: "gpu_layers" mayor que 0
# Arrancar como servicio del sistema
sudo systemctl enable ollama
sudo systemctl start ollama
Modelos recomendados para empezar en 2026
# Para 16GB RAM — rápido y capaz en tareas generales
ollama pull qwen3:8b
# Para 32GB RAM — el mejor equilibrio calidad/velocidad en 2026
ollama pull deepseek-r1:14b
# Para 48-64GB RAM — calidad cercana a GPT-4o en tareas de código
ollama pull qwen3-coder:32b
# Para uso con OpenClaw (necesita 64K contexto y tool calling)
ollama pull glm4-flash:9b # 16GB — el más ligero compatible
ollama pull devstral:24b # 32GB+ — el mejor para OpenClaw
Añadir interfaz visual: Open WebUI en 2 minutos
Ollama solo tiene interfaz de terminal. Si quieres una interfaz tipo ChatGPT accesible desde cualquier dispositivo de tu red, Open WebUI es la solución estándar de la comunidad.
# Instalar y arrancar Open WebUI con Docker
docker run -d \
--name open-webui \
-p 3000:8080 \
-v open-webui:/app/backend/data \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
--restart always \
ghcr.io/open-webui/open-webui:main
# Acceder desde el navegador: http://localhost:3000
# O desde tu móvil: http://IP-DE-TU-SERVIDOR:3000
Conectar OpenClaw a tu servidor Ollama local
OpenClaw puede usar tu servidor Ollama local como proveedor de IA en lugar de las APIs de pago de Anthropic u OpenAI. La configuración es una sola línea en el archivo .env:
# En ~/.openclaw/.env
LLM_PROVIDER=ollama
OLLAMA_BASE_URL=http://localhost:11434
OLLAMA_MODEL=devstral:24b # Cambia por el modelo que tengas
Aviso importante sobre APIs de cloud con OpenClaw: Desde principios de 2026, Anthropic (Claude) y Google (Gemini) prohíben usar sus APIs con OpenClaw según sus términos de servicio. Los usuarios que lo han intentado reportan bloqueos de clave API. La vía recomendada es usar modelos locales vía Ollama o las APIs de OpenAI/DeepSeek, que tienen políticas más permisivas.
Cuándo el servidor local NO es la respuesta correcta
Un servidor de IA local tiene un problema estructural para ciertos casos de uso: si el equipo se apaga, se corta la luz o necesita reiniciarse, el agente se detiene. Si tu caso de uso requiere que el agente esté disponible 24/7 para responder clientes por WhatsApp o Telegram sin que dependas de que una máquina esté encendida en tu oficina o casa, el hardware local no es la solución correcta.
✅ Usa hardware local si:
- Tienes datos sensibles que no pueden salir de tu red
- El uso de APIs te cuesta más de 30-40€/mes
- Quieres experimentar con múltiples modelos
- Eres desarrollador que itera rápido con modelos
- La disponibilidad 24/7 no es crítica
✅ Usa VPS OpenClaw si:
- Necesitas el agente disponible 24/7 sin gestionar hardware
- Atiendes clientes por WhatsApp/Telegram en producción
- No quieres preocuparte por actualizaciones o reinicios
- Prefieres coste fijo predecible: 5,49€/mes todo incluido(contratándolo 24 meses).
La combinación más eficiente en 2026 es: hardware local para desarrollo y experimentación, VPS gestionado para el agente en producción. No tienes que elegir uno u otro.
Preguntas frecuentes sobre servidores de IA local con Ollama
1. ¿Qué es Ollama y para qué sirve?
Ollama es una herramienta gratuita que permite descargar y ejecutar modelos de lenguaje directamente en tu hardware, sin enviar datos a ningún servidor externo. Con un solo comando puedes tener corriendo Llama 4, DeepSeek R1, Qwen 3 o Mistral en tu Mac, PC o mini PC. Expone una API local compatible con OpenAI, conectándose con cualquier aplicación que use ChatGPT.
2. ¿Cuánto cuesta montar un servidor de IA local con Ollama?
El software (Ollama) es gratuito. El hardware va desde ~300€ (mini PC con 32GB para modelos de 7B) hasta ~2.000€ (Mac mini M4 Pro 48GB para modelos de 30B). La electricidad es de 3-10€ al mes para un mini PC o Mac mini corriendo 24/7 en España.
3. ¿Qué modelos de IA puedo correr con Ollama en local?
Ollama soporta más de 100 modelos. Los más usados en 2026: Llama 4, DeepSeek R1 y V3, Qwen 3, Mistral, Phi-4, Gemma 3 y GLM-4.7-Flash. El modelo que puedes correr depende de tu RAM: 16GB para modelos de 7-8B, 32GB para 13-14B, 48-64GB para 32-34B.
Etiquetas: servidor ia local, ollama 2026, montar servidor ia local, ollama hardware, ia local sin nube, ollama guia, ollama mac mini, ollama mini pc, ollama openclaw