// IA LOCAL
IA local en casa: qué equipo mueve de verdad un LLM
IA local frente a la nube: cuotas, censura, coste y privacidad. Y qué equipo mueve de verdad un LLM: manda el ancho de banda de memoria, no la CPU.
- #ia-local
- #llm
- #ollama
- #hardware
- #privacidad

Me pasó un domingo por la tarde. Estaba pidiéndole a un chatbot de la nube que me reescribiera un script y, a la cuarta iteración, me saltó el cartelito: has alcanzado tu límite, vuelve dentro de tres horas. Un script mío, en un problema mío, y resulta que el ritmo lo marcaba el contador de otro. Esa misma semana otro modelo se negó a explicarme cómo funcionaba una técnica de escaneo de red de lo más normal “por seguridad”. Ahí decidí bajarme la IA a casa, al mismo laboratorio donde ya corre todo lo demás.
Y la sorpresa fue doble: primero, que un modelo abierto en local hoy da para muchísimo más de lo que pensaba. Y segundo, que casi todo lo que se lee sobre “qué equipo necesitas” está mal enfocado. Voy a contarte las dos cosas, con la parte de hardware sin optimismo de folleto.
[aff]Hay enlaces de afiliado más abajo: si compras algo desde ellos me llevo una pequeña comisión y a ti no te cuesta ni un céntimo más. En calidad de Afiliado de Amazon, obtengo ingresos por las compras adscritas que cumplen los requisitos aplicables.
Por qué querrías la IA en tu propia máquina
No es postureo de homelab. Son cuatro razones concretas, y las he vivido las cuatro.
Las cuotas. En la nube pagas por token o por mes, y en cualquiera de los dos casos hay un techo. Cuando le coges el gusto a usar un modelo para todo —resumir, programar, ordenar notas— ese techo llega antes de lo que crees. En local no hay contador: el único límite es cuánto aguanta tu máquina despierta, y la electricidad de un mini PC es ridícula.
La censura y los filtros. Los modelos de la nube vienen con una capa de “esto no te lo cuento” que muchas veces se pasa de frenada. Para trabajo técnico legítimo —seguridad, ingeniería inversa, temas médicos o legales— es un incordio real. Un modelo abierto en tu equipo responde a lo que le preguntas sin llamar a un comité.
El coste a la larga. Una suscripción son cientos de euros al año, para siempre. Un equipo capaz de mover IA local es un pago único que además te sirve para el resto del laboratorio. Si le vas a dar uso, los números terminan cuadrando.
La privacidad, que para mí es la gorda. Todo lo que escribes en un chat de la nube viaja a un servidor ajeno y, según la letra pequeña, puede acabar entrenando al siguiente modelo. Tus correos, tu código, tus ideas a medio cocer. En local no sale ni una frase de tu red. Es la misma razón por la que monto mis servicios en casa en vez de alquilarlos: si el dato es mío, se queda conmigo.
¿Están los modelos abiertos a la altura?
Esta es la pregunta honesta, y la respuesta honesta es “para lo tuyo, casi seguro que sí”.
Los modelos abiertos de la última hornada —Llama 3.3, Qwen, DeepSeek, Gemma, la familia gpt-oss— han cerrado buena parte de la distancia con los de pago para el trabajo del día a día. Redactar, resumir un texto largo, traducir, programar, ordenar ideas, responder sobre documentos tuyos: en todo eso un buen modelo de 14B a 70B cumple de sobra, y encima lo hace sin enviar nada fuera.
Donde la nube todavía saca ventaja es en el filo: razonamiento muy complejo, matemáticas duras, cadenas de pasos largas donde un modelo enorme aún se equivoca menos. Si tu trabajo vive ahí, ten los dos y tira del de la nube para esos casos. Pero para el 90% de lo que la gente le pide de verdad a una IA, un modelo local bien elegido no te va a dejar tirado. He trasteado unos cuantos de estos abiertos en equipos de gama alta y la sensación es esa: ya no es un juguete, es una herramienta.
Lo que no te voy a hacer es enseñarte una gráfica de MMLU con números que cambian cada mes y que la mitad de las webs se inventan. La comparación que sí importa para decidir hardware no es la de calidad, es la de velocidad. Y ahí viene lo interesante.
La verdad incómoda: manda el ancho de banda de memoria
Aquí es donde casi todos los artículos meten la pata. Te hablan de núcleos, de teraflops, de la NPU con sus “45 TOPS”. Y para generar texto, casi nada de eso es el cuello de botella.
Un modelo genera el texto palabra a palabra, y para cada una tiene que leer todos sus pesos de la memoria. Un modelo de 70B cuantizado a 4 bits ocupa unos 40 GB. Así que la velocidad a la que escupe palabras depende, en primera aproximación, de una división: ancho de banda de memoria dividido entre el tamaño del modelo. No de la potencia bruta de la CPU.
Esto lo cambia todo. Un mini PC con un Ryzen potente y DDR5 en doble canal se queda en unos 90 GB/s. Suena bien hasta que divides: un 70B a 90 GB/s da un techo teórico de unos dos tokens por segundo. Se lee a trompicones, desesperante. Ese mismo modelo en una máquina de memoria unificada de gran ancho de banda —el tipo de memoria que llevan los Apple Silicon o el Ryzen AI Max— vuela relativamente porque mueve 256 GB/s o más.

Por eso una máquina “normal”, por muchos núcleos que tenga, topa antes en la práctica de lo que su ficha promete. Y por eso las cajas que de verdad mueven modelos grandes son las de memoria unificada, no las de la CPU más cara. Ten esta idea en la cabeza y no te venderán humo.
Instalarlo es más fácil de lo que crees
La parte técnica da menos miedo del que parece. La vía más cómoda hoy es Ollama: un programa que se encarga de descargar el modelo, cuantizarlo, detectar tu gráfica y darte un chat en la terminal y una API local, todo en uno.

En un Linux, esto es literalmente todo:
# 1. Instalar Ollama (deja un servicio corriendo en segundo plano)
curl -fsSL https://ollama.com/install.sh | sh
# 2. Bajar un modelo (viene ya cuantizado en Q4, listo para tu RAM)
ollama pull llama3.3
# 3. Hablar con él
ollama run llama3.3
A partir de ahí tienes una API en localhost:11434 con la que puedes conectar tu editor, un script o una interfaz web tipo Open WebUI si quieres algo más de salón. ollama list te enseña lo que tienes descargado. Ni cuenta, ni cuota, ni una sola frase saliendo de tu red.
Qué modelo mueve de verdad cada equipo
Con la regla del ancho de banda en la mano, ya se puede clasificar el hardware sin autoengaños. Esto es lo que aguanta cada gama de verdad, en cuantización Q4, que es el equilibrio habitual entre tamaño y calidad:

Traducido a decisiones:
- Un Intel N100 o N150 (memoria de un solo canal) se queda en un asistente ligero de 1-3B: resúmenes, respuestas cortas, clasificar texto. Un 7-8B arranca, pero va tan lento que se te quitan las ganas. Como primer contacto para ver si esto te sirve, cumple; como máquina de IA, no es lo suyo.
- Un Ryzen (o Intel) con DDR5 dual-channel sí te da un asistente local honesto de 8B a 14B. Suficiente para redactar, resumir y programar cosas normales, y además te vale de todoterreno para el resto del homelab. Es, probablemente, donde deberías empezar en serio.
- De 32B para arriba en un mini PC corriente, olvídate. El modelo puede caber en la RAM, pero el ancho de banda lo deja a paso de tortuga. Cabe no es lo mismo que se usa.
- Para 70B a ritmo de lectura hace falta memoria unificada de gran ancho de banda. Ahí es donde la IA local grande deja de ser un experimento.
Puedes filtrar los equipos justo por esto en el comparador de mini PC —tiene una columna de IA local con el tamaño que cada uno mueve con soltura y el porqué—, ver de un vistazo cuál elegir para IA local y la gama completa en la comparativa a fondo.
Los equipos que recomiendo
Ordenados por lo que quieres hacer, no por precio a secas.
Para empezar y quitarte el gusanillo

Beelink SER8 — Ryzen 7 8845HS
Virtualización con varias máquinas a la vez, transcodifica de sobra y hasta echa una partida. 8 núcleos Zen 4 y hasta 64 GB de RAM ampliables.
- +8 núcleos / 16 hilos Zen 4, Radeon 780M
- +Dos ranuras NVMe, hasta 64 GB de RAM
- +Refrigeración contenida para lo que rinde
- -Su precio se ha ido por encima de los 800 €: hay minis con la misma CPU más baratos
- -Consume más en idle que un N100
Un Ryzen 7 con DDR5 mueve un 8B fluido y un 14B con algo de paciencia, y además te vale de todoterreno para el resto del homelab: Docker, Plex, alguna máquina virtual. Es el punto dulce si quieres probar IA local sin comprar una máquina solo para eso. No esperes 70B, pero para el asistente del día a día cumple.
La puerta asequible a la memoria unificada

Apple Mac Mini M4 — 16 GB, memoria unificada
La forma más barata de tocar memoria unificada para IA local. Con 16 GB mueve modelos de 8B a 14B con soltura y en silencio; el ecosistema de IA en macOS está muy pulido. No es un equipo de 70B, pero para empezar bien y consumir poco es difícil de batir.
- +Memoria unificada (~120 GB/s): más ancho de banda que un mini PC x86 corriente
- +Silencioso de verdad y consumo mínimo en idle
- +macOS con ecosistema de IA local muy accesible
- -16 GB de base: techo en 8-14B; para 32B/70B toca un M4 Pro con más RAM (otro precio)
- -La RAM no se amplía: la eliges al comprar y ahí se queda
El Mac Mini M4 es, para su precio, la forma más barata de tocar memoria unificada. Con 16 GB te mueve modelos de 8B a 14B con soltura y en silencio absoluto, y si subes de configuración sube el techo. No es la bestia de 70B, pero macOS y su ecosistema de IA local están muy pulidos y el consumo es de risa. Si ya vives en Apple, es la opción obvia, aunque conviene saber dónde se atraganta antes de dejarlo fijo de servidor: Docker y los servicios de siempre tienen sus matices en macOS, y lo desmenuzo en la review del Mac Mini M4 como servidor casero. Si en cambio quieres el techo de 70B en x86, mira el duelo GMKtec EVO-X2 vs Mac Mini M4.
IA local de verdad: 70B en casa

GMKtec EVO-X2 — Ryzen AI Max+ 395, hasta 128 GB
La caja pensada para correr modelos grandes en local: APU Ryzen AI Max+ 395 con memoria unificada LPDDR5X a ~256 GB/s. Es donde un 70B cuantizado deja de ser una promesa y responde a ritmo de lectura.
- +Memoria unificada LPDDR5X-8000 (~256 GB/s): 32B de sobra y 70B Q4 usable
- +16 núcleos Zen 5 y Radeon 8060S: también virtualiza y juega fuerte
- +Hasta 128 GB para cargar el modelo entero sin salir a disco
- -Precio y consumo de otra liga; no es un mini de 24/7 barato
- -Para solo multimedia y contenedores es tirar dinero: su gracia es la IA
Aquí es donde la cosa se pone seria. El GMKtec EVO-X2 lleva el Ryzen AI Max+ 395 con memoria unificada LPDDR5X a unos 256 GB/s y hasta 128 GB. Eso es justo lo que pide un 70B cuantizado para responder a ritmo de lectura en vez de a trompicones. Para solo Plex y cuatro contenedores es tirar el dinero; si tu objetivo es servir modelos grandes en casa, es la caja.
Si quieres jugar en la liga de las estaciones de trabajo

ASUS Ascent GX10 — NVIDIA GB10, 128 GB
El superchip GB10 Grace Blackwell del NVIDIA DGX Spark, en una caja que sí se compra suelta. 128 GB unificados a 273 GB/s y el stack CUDA de NVIDIA: para prototipar y servir modelos que a un mini PC normal ni le caben.
- +128 GB unificados a 273 GB/s: 70B va fino y hasta 200B en FP4 le entra
- +Superchip NVIDIA GB10 con CUDA y NVIDIA DGX OS de serie
- +Interconexión ConnectX (QSFP) para enlazar dos equipos y mover modelos aún mayores; 10GbE de LAN aparte
- -Precio de estación de trabajo (~4.000 €): nicho puro
- -ARM y DGX OS: no es el servidor de contenedores de siempre
El ASUS Ascent GX10 monta el superchip NVIDIA GB10 —el mismo del DGX Spark—, con 128 GB unificados a 273 GB/s y el stack CUDA de NVIDIA de serie. Un 70B va fino y hasta modelos mayores en FP4 le entran. Es nicho puro y cuesta lo que cuesta una estación de trabajo, pero si prototipas o sirves modelos que a un mini PC ni le caben, es de lo poco de esta clase que se compra suelto.
Preguntas que me hacen siempre
// preguntas frecuentes
Preguntas frecuentes
¿Necesito una gráfica dedicada cara para correr IA en local?
¿Qué es la cuantización y el 'Q4' que sale por todas partes?
¿Cuánta RAM necesito para cada tamaño de modelo?
¿Los modelos abiertos son de verdad gratis y privados?
¿Vale mi mini PC de homelab que ya tengo?
Qué haría yo
Si nunca has tocado esto, no compres nada todavía. Coge el mini PC que ya tengas, instala Ollama, baja un modelo de 8B y úsalo una semana de verdad. Vas a descubrir dos cosas: que para un montón de tareas te sobra, y dónde exactamente se te queda corto. Esa frontera, y no una gráfica de benchmarks, es la que te dice qué comprar.
Si al cabo de esa semana quieres subir de liga y meter un 70B en casa, entonces sí: la respuesta es memoria unificada de gran ancho de banda, un EVO-X2 o, si vives en Apple y te llega, un Mac de gama alta. Lo que no haría es gastarme un dineral en la CPU con más núcleos pensando que eso mueve la IA. No es así. Manda la memoria, y ahora ya lo sabes tú también.
Actualización 6 jul 2026: instalación probada con Ollama en Linux. Las cifras de tokens por segundo del artículo son techos teóricos por ancho de banda de memoria, no medidas de un equipo concreto; los tamaños de modelo en Q4 son los de referencia habituales.