¿Qué Es Ollama? Guía Completa para Ejecutar Modelos de IA en Local
9 August 2026 · Actualizado 9 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
¿Qué Es Ollama? Guía Completa para Ejecutar Modelos de IA en Local
Descubre qué es Ollama, cómo funciona y cómo ejecutar modelos de IA en local. Aprende a instalar Ollama, elegir modelos, utilizar su API y CLI y crear flujos de trabajo de IA privados sin depender de la nube.

¿Qué es Ollama? La guía completa para ejecutar modelos de IA en local
Ollama es una herramienta gratuita y de código abierto que te permite descargar y ejecutar grandes modelos de lenguaje como Llama 3, Mistral y Gemma directamente en tu propio ordenador, con un servidor API local que funciona en http://localhost:11434. Existe porque no todo el mundo quiere enviar sus prompts a un proveedor en la nube o pagar tarifas por token. Eso sí, el rendimiento en local depende totalmente de tu hardware, así que un modelo de vanguardia en la nube seguirá superándolo en tareas de razonamiento exigentes.
Esta guía explica qué es Ollama, cómo funciona, cómo instalarlo, qué modelos elegir y dónde encaja, además de la forma más inteligente de pagar suscripciones de IA como Claude, ChatGPT y Gemini sin perder dinero en comisiones de cambio de divisa.
¿Pagas cada mes por ChatGPT, Claude o Gemini? Bleap no cobra comisiones de cambio de divisa en tus suscripciones en USD y te da un 20% de cashback plano en Claude, ChatGPT y Gemini, con una Mastercard autocustodiada y sin suscripción propia. (El 20% de cashback aplica solo a Claude, ChatGPT y Gemini.) Consigue la tarjeta Bleap →
1. ¿Qué es Ollama?
Ollama es un ejecutor de modelos de lenguaje grandes gratuito y de código abierto, creado para hacer que los modelos de IA locales sean accesibles en hardware de consumo corriente. Se encarga de las partes más engorrosas de ejecutar un LLM por ti: descargar los pesos del modelo, gestionar el almacenamiento, detectar tu GPU y ofrecer una interfaz sencilla para chatear con el modelo.
Se lanzó en 2023 y rápidamente se convirtió en una de las herramientas de LLM de código abierto más populares para quienes quieren tener la IA a su manera. La propuesta de valor principal es sencilla: descargar, gestionar y chatear con LLMs completamente desde tu propio equipo, sin necesidad de clave API, sin suscripción y sin que ningún dato salga de tu dispositivo.
¿A quién va dirigido? A desarrolladores independientes, equipos pequeños, investigadores y usuarios que priorizan la privacidad y quieren tener control total sobre dónde van sus prompts y cuánto gastan.
2. Cómo funciona Ollama
A grandes rasgos, Ollama funciona como un servidor local en tu equipo. Carga los pesos del modelo en memoria y expone una API REST en localhost, con la que pueden comunicarse tanto la línea de comandos como cualquier aplicación conectada.
Los modelos vienen en un formato cuantizado basado en GGUF y se descargan desde la biblioteca de modelos de Ollama con un solo comando. Una vez descargado un modelo, todo el ciclo de inferencia ocurre en tu dispositivo: introduces tu prompt, el modelo lo procesa localmente y te devuelve la respuesta, sin ningún viaje de ida y vuelta a la nube.
La cuantización es el truco clave. Al comprimir los pesos del modelo a formatos numéricos más pequeños, la cuantización permite que los modelos de lenguaje de gran tamaño funcionen en GPU de consumo estándar, e incluso en equipos que solo tienen CPU, sin necesidad de un centro de datos.
Componentes principales de la arquitectura
- Servidor API local: escucha por defecto en http://localhost:11434, de modo que cualquier herramienta puede conectarse a él.
- Capa de almacenamiento de modelos: los modelos se guardan en caché en disco tras la primera descarga, así que no hace falta volver a descargarlos.
- Abstracción del hardware: detección automática de tu GPU (NVIDIA CUDA, Apple Metal o AMD ROCm), con opción de recurrir a la CPU cuando no hay GPU disponible.
3. Características principales de Ollama
- Biblioteca de modelos de Ollama: una colección curada y lista para descargar de los LLM de código abierto más populares, que se puede explorar por nombre, tamaño y etiqueta.
- Compatibilidad multiplataforma: instaladores nativos para macOS, Linux y Windows.
- API compatible con OpenAI: un endpoint de sustitución directa que facilita migrar código existente desde APIs en la nube sin complicaciones.
- Personalización mediante Modelfile: define prompts de sistema, parámetros y modelos base usando una configuración sencilla similar a un Dockerfile.
- Ejecución simultánea de modelos: permite ejecutar varios modelos a la vez (a partir de la v0.5), útil para configuraciones multiagente.
- CLI ligera: una interfaz de línea de comandos intuitiva para descargar, ejecutar y gestionar modelos.
4. Ollama frente a IA en la nube (ChatGPT, Claude y otras)
Factor | Ollama (local) | ChatGPT / Claude (nube) |
|---|---|---|
Privacidad | Control total de tus datos | Los datos se procesan en servidores del proveedor |
Coste | Gratis una vez tienes el hardware | Suscripción o pago por token |
Latencia | Depende de tu GPU local | Baja, centros de datos optimizados |
Conexión a internet | Solo para descargar el modelo | Siempre necesaria |
Elección de modelo | Biblioteca de código abierto | Limitado al proveedor |
Esfuerzo de configuración | Moderado | Ninguno |
En cuanto a privacidad, Ollama mantiene todo en tu equipo, mientras que las herramientas en la nube procesan tus prompts en la infraestructura del proveedor. En cuanto a coste, Ollama es gratis una vez tienes el hardware, mientras que los servicios en la nube cobran de forma mensual o por solicitud. La nube gana en latencia y configuración, ya que los centros de datos optimizados responden rápido y no requieren ninguna instalación por tu parte. Ollama gana en elección de modelo, ofreciéndote una biblioteca abierta en lugar de un único modelo cerrado a un proveedor.
La conclusión: Ollama gana en privacidad y coste para IA local, mientras que la nube gana en rendimiento puro y comodidad de configuración inmediata. No es un sustituto para todos los casos de uso, pero sí un complemento sólido para escenarios sensibles a la privacidad o sin conexión.
¿Sigues pagando el precio completo de tu plan de IA en la nube cada mes? Con Bleap pagas Claude, ChatGPT y Gemini en USD al cambio real, así que 0% de comisiones por cambio de divisa, más un 20% de cashback fijo en esas tres suscripciones. Consigue la tarjeta Bleap →
5. Requisitos del sistema e instalación
Requisitos del sistema para Ollama
- macOS: 13 Ventura o posterior; se recomienda Apple Silicon (M1/M2/M3), aunque también es compatible con Intel.
- Windows: Windows 10/11 (64 bits); una GPU NVIDIA con CUDA 11.3+ o una GPU AMD con ROCm es opcional, pero recomendable.
- Linux: Ubuntu 20.04 o superior, o equivalente, con el mismo soporte de GPU que en Windows.
- RAM: mínimo 8 GB para modelos de 7B, 16 GB recomendados, y 32 GB o más para modelos de 13B en adelante.
- Espacio en disco: los modelos van desde unos 2 GB (versión cuantizada de 3B) hasta 40 GB o más (70B), así que reserva espacio en consecuencia.
- Solo CPU: es compatible, pero mucho más lento, y se recomienda reservarlo para modelos pequeños (de 1B a 3B).
Guía de instalación de Ollama (paso a paso)
- macOS / Windows: descarga el instalador desde ollama.com, ejecútalo y Ollama se iniciará como un servicio en segundo plano.
- Linux: ejecuta el script oficial de instalación en una sola línea: curl -fsSL https://ollama.com/install.sh | sh.
- Verifica la instalación: abre una terminal y escribe ollama --version.
- Descarga tu primer modelo: ejecuta ollama pull llama3 para descargar Llama 3 de Meta.
- Empieza a chatear: ejecuta ollama run llama3 y escribe tu primer prompt.
6. Biblioteca de modelos de Ollama: cómo elegir el modelo adecuado
Cada modelo está a un solo ollama pull de distancia. Entre las opciones generales más populares están Llama 3, Mistral, Gemma 2, Phi-3 y Qwen 2.5. Para tareas más especializadas, existen modelos de programación como CodeLlama y DeepSeek-Coder, modelos de visión y multimodales como LLaVA y Moondream, y modelos de embeddings como Nomic-Embed-Text para pipelines de RAG.
Una regla rápida para calcular el tamaño: el número de parámetros del modelo multiplicado por unos 0,6 GB te da la VRAM mínima que necesitarás. Los niveles de cuantización (Q4, Q5, Q8) te permiten sacrificar precisión a cambio de un menor uso de recursos, siendo Q4 el más ligero y Q8 el más fiel a los pesos originales.
Para explorar todo el catálogo, visita ollama.com/library, donde se listan todos los modelos disponibles con sus etiquetas y variantes de tamaño.
7. Comandos esenciales de la CLI de Ollama
La CLI de Ollama simplifica la gestión de modelos con un puñado de comandos intuitivos.
Comando | Qué hace |
|---|---|
ollama pull <modelo> | Descarga un modelo de la biblioteca |
ollama run <modelo> | Inicia una sesión de chat interactiva |
ollama list | Muestra todos los modelos instalados localmente |
ollama rm <modelo> | Elimina un modelo del disco |
ollama show <modelo> | Muestra los metadatos y parámetros del modelo |
ollama serve | Inicia manualmente el servidor de la API de Ollama |
ollama create | Crea un modelo personalizado a partir de un Modelfile |
También puedes enviar la entrada directamente a un modelo mediante una tubería: echo "Explain REST APIs" | ollama run mistral. Y para ver estadísticas de rendimiento, como la velocidad de tokens, añade el flag: ollama run <modelo> --verbose.
8. Integraciones populares y ecosistema
Integración de LangChain con Ollama
Ollama cuenta con soporte nativo en LangChain a través del paquete langchain-ollama, que permite crear cadenas, agentes y pipelines de RAG con LLM locales sin ninguna dependencia de la nube. Una importación típica sería from langchain_ollama import OllamaLLM.
API de Python de Ollama
La librería de Python ollama (pip install ollama) refleja la API REST y es ideal para scripting y automatización. Una llamada básica sería: import ollama; response = ollama.chat(model='llama3', messages=[...]).
Otras integraciones destacadas
- LlamaIndex: indexación y recuperación de documentos con embeddings locales.
- Open WebUI: una interfaz de chat basada en navegador, similar a ChatGPT, que se conecta a tu servidor local de Ollama.
- Continue (plugin de VS Code / JetBrains): un asistente de programación con IA impulsado por un modelo local de Ollama.
- AnythingLLM: un espacio de trabajo de RAG sin código que usa Ollama como backend de inferencia.
9. Privacidad y seguridad de datos con Ollama
La garantía de privacidad principal es sencilla: toda la inferencia se ejecuta en el propio dispositivo, así que tus prompts y respuestas nunca salen de tu máquina local. No hay telemetría, no necesitas ninguna cuenta y no dependes de ningún proveedor.
Esto hace que Ollama sea una gran opción para material sensible como historiales médicos, documentos legales, código fuente propietario y datos confidenciales de empresa. También ayuda a los equipos a cumplir con el RGPD, la HIPAA y las políticas internas de gobernanza de datos. Merece la pena recordar que, incluso los modelos de pesos abiertos a los que se accede mediante una API en la nube, siguen exponiendo tus datos a ese proveedor, mientras que la privacidad de la IA local elimina ese riesgo por completo.
10. Casos de uso reales y aplicaciones
- Asistente de programación con IA: ejecuta CodeLlama o DeepSeek-Coder localmente dentro de VS Code mediante el plugin Continue.
- Pipelines de RAG: combina Ollama con una base de datos vectorial como Chroma o Qdrant para consultas privadas sobre documentos.
- Asistente de IA sin conexión: usa Ollama en un portátil mientras viajas, en entornos aislados de la red, o donde la conectividad no sea fiable.
- Agentes de IA locales: crea agentes autónomos de tareas con LangChain o AutoGen usando un modelo local como base.
- Educación y experimentación: un entorno seguro para probar prompts, estudiar el comportamiento de los modelos y aprender el funcionamiento de los LLM sin sorpresas en la factura.
11. Limitaciones de Ollama
- Límite del hardware: el rendimiento está limitado por la VRAM de tu GPU local, y los modelos muy grandes (70B en adelante) requieren GPUs de gama alta para consumidor o estaciones de trabajo.
- Sin interfaz integrada: Ollama en sí mismo solo funciona por CLI y API, así que necesitas una herramienta aparte como Open WebUI para tener una interfaz de chat.
- Diferencia de calidad entre modelos: incluso los mejores LLM de código abierto pueden quedarse por detrás de modelos punteros como GPT-4o y Claude 3.5 Sonnet en razonamiento complejo.
- Tamaño de descarga inicial: los modelos son archivos grandes (de 2 a 40 GB), lo que hace que empezar sea lento con conexiones limitadas.
- El soporte para Windows todavía está madurando: algunas funciones específicas van por detrás de las implementaciones de macOS y Linux.
¿Ejecutas modelos locales para ahorrar dinero, pero sigues pagando precio completo por la IA en la nube? Bleap te da un 0% de comisión por cambio de divisa en suscripciones en USD y un cashback plano del 20% en Claude, ChatGPT y Gemini, sin ninguna suscripción mensual propia. Consigue la tarjeta Bleap →
Preguntas frecuentes (FAQ)
¿Es gratis usar Ollama?
Sí. Ollama es totalmente de código abierto (licencia MIT) y no tiene ningún coste de uso. Lo único que pagas es el hardware en el que lo ejecutes.
¿Cómo se compara Ollama con ChatGPT?
Ollama ejecuta modelos de código abierto en local, con total privacidad de tus datos. ChatGPT ofrece un modelo puntero más potente, pero procesa tus datos en los servidores de OpenAI y cobra por token o mediante suscripción.
¿Cuáles son los requisitos mínimos para ejecutar Ollama?
Un sistema operativo moderno de 64 bits (macOS 13+, Windows 10/11 o Ubuntu 20.04+), al menos 8 GB de RAM y unos 5 GB de espacio libre en disco para un modelo pequeño. Una GPU dedicada acelera notablemente el rendimiento.
¿Puedo usar Ollama sin conexión a internet?
Una vez descargado el modelo inicial, Ollama funciona completamente sin conexión, convirtiéndose en un auténtico asistente de IA offline.
¿Cómo integro Ollama con Python o LangChain?
Instala el paquete de Python ollama (pip install ollama) para hacer llamadas directas a la API, o usa langchain-ollama para incorporar Ollama en las cadenas y agentes de LangChain como un LLM local listo para usar.
¿Qué modelos de Ollama son mejores para tareas de programación?
CodeLlama, DeepSeek-Coder-V2 y Qwen2.5-Coder son las opciones más populares para asistencia de programación en local con Ollama.
Conclusión
Ollama es un ejecutor de grandes modelos de lenguaje gratuito y de código abierto que hace que la inferencia de IA privada sea accesible en cualquier equipo del día a día. Es flexible, privado y cuenta con un ecosistema de integraciones que crece rápidamente, y resulta ideal para desarrolladores y usuarios preocupados por la privacidad que puedan asumir ciertas limitaciones de rendimiento frente a los modelos punteros en la nube. Instálalo, descarga un modelo y prueba hoy mismo tu primera conversación en local. Y uses las herramientas de IA que uses, paga con cabeza: con Bleap te ahorras las comisiones de cambio de divisa en las suscripciones en USD, y en Claude, ChatGPT y Gemini consigues un 20% de cashback en cada renovación.
Una forma más inteligente de gastar, enviar, ganar y operar

- Artificial Inteligence








