IAsin humo
Software28 de julio de 20266 minutos 26 segundos de lectura

Qué IA puedes ejecutar en tu propio ordenador

Los titulares dicen “IA gratis en tu ordenador” y casi nadie explica la parte que lo decide todo: cuánta memoria hace falta. La cuenta es de una línea y sirve para cualquier modelo, hoy y dentro de dos años.

Por DidadoY

Qué IA puedes ejecutar en tu propio ordenador
/ En esta noticia

Cada vez que un laboratorio libera un modelo "abierto y gratis", ocurre lo mismo: mucha gente entiende que se lo puede bajar y ponerlo a funcionar en su portátil, lo intenta, y descubre que no. O que sí, pero escupiendo una palabra cada tres segundos.

El problema es que casi nadie explica la parte aburrida, que es justo la que decide todo. Y es una cuenta de una sola línea.

La única regla que importa

Un modelo de lenguaje tiene que caber entero en memoria para funcionar rápido. Y lo que ocupa depende de dos cosas: cuántos parámetros tiene y con cuánta precisión se guarda cada uno.

En la práctica, la mayoría de la gente usa modelos cuantizados: versiones comprimidas donde cada parámetro se guarda con menos bits para que ocupen menos. El estándar de facto es la cuantización de 4 bits, que reduce el tamaño a algo más de medio gigabyte por cada mil millones de parámetros, con una pérdida de calidad que casi nadie nota.

La cuenta rápida, entonces:

PrecisiónEspacio por cada 1.000 millones de parámetros
16 bits (original)~2 GB
8 bits~1 GB
4 bits (lo habitual)~0,6 GB

Con eso ya puedes estimar cualquier modelo del mundo. Uno de 8.000 millones de parámetros en 4 bits ocupa unos 5 GB. Uno de 70.000 millones, unos 40 GB. Uno de 700.000 millones, unos 400 GB.

Y hay que sumar un margen: el contexto —lo que el modelo tiene "en la cabeza" mientras trabaja— también consume memoria, y crece con la longitud de la conversación. Como regla, deja libre entre 1 y 3 GB por encima del tamaño del archivo.

Qué mueve tu equipo, en concreto

Lo que manda es la memoria de la tarjeta gráfica (VRAM), no la RAM del sistema. Si el modelo no cabe en la VRAM, parte se procesa en el procesador principal y la velocidad se desploma: pasas de decenas de palabras por segundo a esperar.

Tu equipoLo que mueve con solturaPara qué sirve
Portátil sin gráfica dedicadaModelos de 1.000 a 4.000 millonesResumir, reformular, pruebas
Gráfica de 8 GBHasta ~8.000 millonesRedactar, traducir, preguntas generales
Gráfica de 12-16 GBHasta ~14.000 millonesTrabajo real, código sencillo
Gráfica de 24 GBHasta ~32.000 millonesCódigo, análisis de documentos largos
Mac con 32-64 GB unificadosHasta ~70.000 millones (lento pero usable)Casi todo, sin prisa
Dos gráficas de 24 GB~70.000 millones con fluidezUso profesional

Los Mac con chip propio merecen un párrafo aparte porque son el caso raro: su memoria es unificada, la comparten procesador y gráfica, así que un Mac de 64 GB puede cargar modelos que exigirían tres tarjetas gráficas de escritorio. No van tan rápido como una gráfica dedicada equivalente, pero cargan cosas que en un PC normal no entran.

Lo que no vas a poder ejecutar

Aquí está la línea que conviene tener clara antes de descargar 200 GB para nada.

Los modelos de frontera que se publican con pesos abiertos —los de cientos de miles de millones de parámetros, o los billonarios— no caben en ningún ordenador doméstico. Ni en el mejor Mac, ni en un PC con dos tarjetas de las caras. Hacen falta varias GPU profesionales de las que cuestan decenas de miles de euros por unidad.

Hay un matiz técnico que despista mucho: muchos de esos modelos gigantes son de mezcla de expertos, y solo activan una fracción de sus parámetros por cada palabra que generan. Eso los hace más baratos de servir, sí, pero tienes que cargarlos enteros de todas formas. Un modelo que activa 100.000 millones de parámetros de 2 billones sigue necesitando el espacio de los 2 billones.

Así que cuando leas que un modelo "se puede descargar y ejecutar en tu propia infraestructura", traduce: en la infraestructura de una empresa. Que es una noticia excelente por otros motivos —privacidad, precios, independencia—, pero no significa que lo tengas en casa.

Cómo se hace, en cinco minutos

No hace falta saber programar. Dos programas cubren el 95 % de los casos:

LM Studio es la opción para empezar. Se instala como cualquier aplicación, tiene un buscador de modelos integrado que te avisa de si tu equipo puede con cada uno, y una interfaz de chat parecida a la de ChatGPT. Está en Windows, Mac y Linux.

Ollama es la opción para quien no le tenga miedo a la terminal. Un comando descarga el modelo y otro lo arranca. Su ventaja real es que expone una API local, así que puedes conectarle otras herramientas —editores de código, aplicaciones propias— como si fuera un servicio de pago.

Consejo práctico para la primera vez: empieza por un modelo pequeño, de 3.000 o 4.000 millones de parámetros. Si va fluido, sube al siguiente escalón. Es más rápido probar de abajo arriba que descargar 40 GB para descubrir que tu equipo no puede.

Cómo elegir modelo sin perderte

Los nombres cambian cada pocos meses, así que memorizar cuál es el mejor hoy no sirve de nada. Los criterios sí duran:

  • Mira el tamaño en gigabytes antes que el nombre. Es el único dato que determina si funcionará.
  • Busca la etiqueta instruct o chat. Los modelos "base" no están entrenados para responder a instrucciones y parecen roto cuando no lo están.
  • Elige la cuantización de 4 bits (aparece como Q4 o similar) salvo que te sobre memoria.
  • Comprueba la licencia si es para trabajar. "Pesos abiertos" no siempre significa uso comercial libre; varios modelos populares tienen condiciones para empresas por encima de cierto tamaño.
  • Prueba en tu caso, no en los rankings. Un modelo pequeño bien elegido puede ganarle a uno grande en tu tarea concreta, y al revés.

Para qué merece la pena de verdad

Seamos honestos con lo que se gana y lo que se pierde. Un modelo que corre en tu equipo casi nunca va a igualar al mejor servicio de pago en capacidad pura. Si lo que buscas es la respuesta más lista posible, pagar una suscripción sale mejor.

Ejecutarlo en casa gana en otras tres cosas, y no son menores. Tus datos no salen de tu equipo, lo que para documentos confidenciales, historiales médicos o código de una empresa cambia por completo la ecuación. Funciona sin internet. Y no tiene contador: puedes lanzarle diez mil peticiones sin que nadie te cobre por token, algo que para procesar volumen de forma automatizada marca la diferencia.

Ahí está el uso sensato para la mayoría: modelo local para lo repetitivo, lo masivo y lo sensible; servicio de pago para lo difícil.

La lectura sin humo

"IA gratis en tu ordenador" es cierto y engañoso a la vez. Cierto porque hay modelos libres, gratuitos y muy capaces que se instalan en diez minutos. Engañoso porque los que salen en los titulares no son esos.

Si tienes un equipo normal, puedes tener funcionando esta tarde una IA que redacta, resume, traduce y responde razonablemente bien, sin pagar nada y sin que un solo dato salga de tu casa. Eso hace tres años era ciencia ficción.

Lo que no vas a tener es el modelo de la portada. Y quien te diga lo contrario, o no ha mirado cuánta memoria hace falta, o prefiere no contarlo.

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Seguir leyendo