Ejecutar LLMs locales con Ollama Desktop: guía completa

  • Comparativa detallada entre las herramientas líderes para ejecutar modelos de lenguaje en local como Ollama, LM Studio y Jan.
  • Análisis de los requisitos de hardware necesarios, destacando la importancia de la VRAM y el uso de cuantización para optimizar el rendimiento.
  • Guía de configuración técnica y despliegue de modelos abiertos para garantizar la privacidad total de los datos.

LLMs locales con Ollama Desktop

Hace apenas un tiempo, montar un modelo de lenguaje en el ordenador de casa era algo reservado para gente con presupuestos astronómicos o investigadores con acceso a granjas de GPUs. Hoy la cosa ha cambiado radicalmente y, con un portátil que no sea prehistórico o una estación de trabajo decente, cualquiera puede hacer correr modelos como Llama, Mistral o Gemma de forma totalmente offline, evitando que la información vuele hacia servidores externos.

La gran ventaja de este enfoque es que recuperamos la soberanía sobre nuestros datos. Mientras que las APIs de la nube son rápidas, ejecutar la IA en local nos permite manejar informes médicos o código propietario sin miedo a que acaben en el entrenamiento de un modelo ajeno, además de eliminar las facturas mensuales por consumo de tokens que pueden volverse locas en proyectos grandes.

Ollama: La navaja suiza para desarrolladores

Ollama se ha ganado el corazón de la comunidad porque trata a los LLMs casi como si fueran contenedores de Docker. Su filosofía es no dar vueltas: instalas, haces un pull del modelo y ya tienes una API compatible con OpenAI corriendo en tu puerto 11434. Es la opción ideal si buscas automatización y quieres integrar la IA en tus propios scripts de Python sin complicaciones.

Para ponerlo en marcha en Windows, basta con ejecutar el instalador .exe, mientras que en Linux se hace con una línea de comando mediante curl. Un detalle vital es la gestión de la variable de entorno OLLAMA_MODELS; si no quieres llenar tu disco principal, puedes decirle a Ollama que guarde los modelos en un disco duro externo o una partición con más espacio.

Usa la inteligencia artificial de ChatGPT nativa en Windows
Artículo relacionado:
Usa la inteligencia artificial de ChatGPT nativa en Windows

Comandos esenciales y flujo de trabajo

La interacción se hace principalmente vía terminal. El comando ollama run es el más usado, ya que descarga el modelo si no existe y abre el chat al instante. Si quieres ver qué tienes instalado, usas ollama list, y para limpiar espacio, ollama rm. Una joya oculta son los Modelfiles, que permiten crear versiones personalizadas de un modelo definiendo el system prompt y otros parámetros para estandarizar el comportamiento de la IA.

Alternativas visuales: LM Studio y Jan

Ollama Desktop

No todo el mundo quiere pelearse con la consola de comandos. Para quienes prefieren una interfaz gráfica pulida, LM Studio es la opción ganadora. Permite explorar modelos directamente desde Hugging Face y ajustar la temperatura o la longitud del contexto mediante deslizadores visuales, lo que facilita enormemente el prototipado rápido.

Por otro lado, tenemos a Jan, que apuesta fuerte por ser 100% open-source y auditable. Es la herramienta perfecta para entornos donde la privacidad es un requisito no negociable y se necesita un cliente que no tenga componentes propietarios. Jan destaca por su motor de inferencia Nitro y su capacidad para integrarse con hardware específico de Intel o AMD.

El hardware: El verdadero cuello de botella

Para que la IA no vaya a paso de tortuga, hay que entender que la VRAM de la GPU es la reina absoluta. Si el modelo cabe entero en la memoria de la tarjeta gráfica, la velocidad de respuesta es instantánea. Si el sistema tiene que hacer offload a la memoria RAM convencional, el rendimiento cae drásticamente, aunque en los chips de Apple Silicon esto se mitiga gracias a la memoria unificada.

  • 8GB de RAM: Suficiente para modelos pequeños de 1B a 3B parámetros.
  • 16GB de RAM: El punto de partida para mover modelos de 7B u 8B con fluidez.
  • 32GB o más: Necesario para aventurarse con modelos de 30B o los mastodontes de 70B.

Otro concepto clave es la cuantización. Básicamente, consiste en reducir la precisión de los pesos del modelo (por ejemplo, de 16 bits a 4 bits) para que ocupen menos espacio. Las versiones Q4_K_M suelen ser el equilibrio perfecto, ya que reducen el tamaño del archivo sin que la IA empiece a decir incoherencias o pierda demasiada capacidad de razonamiento.

Soluciones de grado profesional y producción

Cuando pasamos de un experimento personal a un entorno de empresa, herramientas como vLLM entran en juego. Utiliza una técnica llamada PagedAttention que optimiza la memoria y permite manejar cientos de peticiones simultáneas, algo que Ollama no hace de forma nativa para tráfico masivo. Es la opción estándar para quienes despliegan en clústeres de Kubernetes.

Para quienes buscan versatilidad multimodal, LocalAI es la alternativa más completa, ya que no solo genera texto, sino que puede manejar imágenes y audio, funcionando como un reemplazo integral de la infraestructura de OpenAI. Recientemente, han aparecido soluciones como Lemonade, optimizadas específicamente para las NPU de los procesadores AMD Ryzen AI, logrando una eficiencia energética muy superior.

Comparativa de uso rápido

Si eres un principiante total, ve a por LM Studio. Si eres programador y quieres montar un agente, Ollama es tu mejor amigo. Para despliegues masivos en servidor, vLLM es la elección lógica. Y si necesitas algo para el móvil o extremadamente privado, Sanctum o Jan son los caminos a seguir.

Cómo será la integración de ChatGPT con el BBVA
Artículo relacionado:
OpenAI lanza ChatGPT Gov para optimizar procesos gubernamentales en EE. UU.

Montar tu propia infraestructura de inteligencia artificial local permite experimentar con modelos de vanguardia como DeepSeek-R1 o Llama 3.3 sin depender de una conexión a internet o de las políticas de precios de las grandes tecnológicas. Combinando el hardware adecuado con la herramienta de inferencia que mejor se adapte a tu perfil, es posible convertir cualquier ordenador moderno en un centro de procesamiento de lenguaje natural potente, privado y completamente gratuito. Comparte la información y otros usuarios conocerán la herramienta.


Add as preferred source