¿Qué Es Ollama? Guía Completa para Ejecutar Modelos de IA Localmente
9 August 2026 · Actualizado 9 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
¿Qué Es Ollama? Guía Completa para Ejecutar Modelos de IA Localmente
Descubre qué es Ollama, cómo funciona y cómo ejecutar modelos de IA localmente. Aprende a instalar Ollama, elegir modelos, usar su API y CLI y crear flujos de trabajo de IA privados sin depender de la nube.

¿Qué es Ollama? La guía completa para correr modelos de IA de forma local
Ollama es una herramienta gratuita y de código abierto que te permite descargar y correr modelos de lenguaje grandes como Llama 3, Mistral y Gemma directamente en tu propia computadora, con un servidor API local corriendo en http://localhost:11434. Existe porque no todo mundo quiere mandar sus prompts a un proveedor en la nube o pagar tarifas por token. Eso sí, el rendimiento local depende totalmente de tu hardware, así que un modelo de nube de punta seguirá superándolo en tareas de razonamiento pesado.
Esta guía te explica qué es Ollama, cómo funciona, cómo instalarlo, qué modelos elegir y en qué casos conviene usarlo, además de la forma más inteligente de pagar tus suscripciones de IA como Claude, ChatGPT y Gemini sin perder dinero en comisiones cambiarias.
¿Pagas ChatGPT, Claude o Gemini cada mes? Bleap cobra 0% de comisión cambiaria en tus suscripciones en USD y te da un cashback fijo del 20% en Claude, ChatGPT y Gemini, con una Mastercard autocustodiada y sin ninguna suscripción propia. (El cashback del 20% aplica solo para Claude, ChatGPT y Gemini.) Consigue la tarjeta Bleap →
1. ¿Qué es Ollama?
Ollama es un ejecutor de modelos de lenguaje grande gratuito y de código abierto, creado para hacer que los modelos de IA locales sean accesibles en hardware de consumo común. Se encarga de las partes complicadas de correr un LLM por ti: descargar los pesos del modelo, administrar el almacenamiento, detectar tu GPU y ofrecer una interfaz sencilla para chatear con el modelo.
Se lanzó en 2023 y rápidamente se convirtió en una de las herramientas de LLM de código abierto más populares para quienes quieren tener IA bajo sus propios términos. La propuesta de valor es muy simple: descargar, administrar y chatear con LLMs completamente en tu propia máquina, sin necesidad de una API key, sin suscripción y sin que tus datos salgan de tu dispositivo.
¿Para quién es? Para desarrolladores independientes, equipos pequeños, investigadores y usuarios que priorizan la privacidad y quieren tener control total sobre a dónde van sus prompts y cuánto gastan.
2. Cómo funciona Ollama
A grandes rasgos, Ollama corre como un servidor local en tu máquina. Carga los pesos del modelo en memoria y expone una API REST en localhost, con la que se pueden comunicar tanto la línea de comandos como cualquier app conectada.
Los modelos vienen en un formato cuantizado basado en GGUF y se descargan desde la biblioteca de modelos de Ollama con un solo comando. Una vez descargado el modelo, todo el ciclo de inferencia ocurre en tu dispositivo: tu prompt entra, el modelo lo procesa localmente y la respuesta regresa, sin ningún viaje de ida y vuelta a la nube.
La cuantización es el truco clave. Al comprimir los pesos del modelo a formatos numéricos más pequeños, la cuantización permite que los modelos de lenguaje grandes corran en GPUs de consumo estándar, e incluso en máquinas que solo tienen CPU, sin necesitar un centro de datos.
Componentes principales de la arquitectura
- Servidor API local: escucha en http://localhost:11434 por defecto, así que cualquier herramienta puede conectarse a él.
- Capa de almacenamiento de modelos: los modelos se guardan en caché en disco después de la primera descarga, así que no hay que descargarlos otra vez.
- Abstracción de hardware: detección automática de tu GPU (NVIDIA CUDA, Apple Metal o AMD ROCm), con respaldo en CPU cuando no hay GPU disponible.
3. Características principales de Ollama
- Biblioteca de modelos de Ollama: una colección curada y lista para descargar de los LLM open-source más populares, que puedes explorar por nombre, tamaño y etiqueta.
- Soporte multiplataforma: instaladores nativos para macOS, Linux y Windows.
- API compatible con OpenAI: un endpoint que puedes usar como reemplazo directo, lo que hace que migrar tu código existente desde APIs en la nube sea muy sencillo.
- Personalización con Modelfile: define prompts de sistema, parámetros y modelos base usando una configuración simple, similar a un Dockerfile.
- Servicio simultáneo de modelos: corre varios modelos al mismo tiempo (a partir de la v0.5), muy útil para configuraciones multiagente.
- CLI ligera: una interfaz de línea de comandos intuitiva para descargar, ejecutar y administrar modelos.
4. Ollama vs. IA en la nube (ChatGPT, Claude y otras)
Factor | Ollama (Local) | ChatGPT / Claude (Nube) |
|---|---|---|
Privacidad | Control total de tus datos | Datos procesados en servidores del proveedor |
Costo | Gratis después del hardware | Suscripción o pago por token |
Latencia | Depende de tu GPU local | Baja, centros de datos optimizados |
Internet necesario | Solo para descargar el modelo | Siempre |
Elección de modelo | Biblioteca de código abierto | Limitado al proveedor |
Esfuerzo de configuración | Moderado | Ninguno |
En cuanto a privacidad, Ollama mantiene todo en tu máquina, mientras que las herramientas en la nube procesan tus prompts en la infraestructura del proveedor. En costo, Ollama es gratis una vez que ya tienes el hardware, mientras que los servicios en la nube cobran mensualmente o por solicitud. La nube gana en latencia y configuración, ya que los centros de datos optimizados responden rápido y no requieren instalación de tu parte. Ollama gana en elección de modelo, dándote una biblioteca abierta en lugar de un solo modelo amarrado a un proveedor.
La conclusión: Ollama gana en privacidad y costo cuando se trata de IA local, mientras que la nube gana en rendimiento puro y comodidad de cero configuración. No es un reemplazo para todos los casos de uso, pero sí un gran complemento para escenarios sensibles a la privacidad o sin conexión.
¿Sigues pagando el precio completo de tu plan de IA en la nube cada mes? Con Bleap pagas Claude, ChatGPT y Gemini en USD al tipo de cambio real, o sea 0% en comisiones cambiarias, más un cashback plano del 20% en esas tres suscripciones. Consigue la tarjeta Bleap →
5. Requisitos del sistema e instalación
Requisitos del sistema para Ollama
- macOS: 13 Ventura o posterior; se recomienda Apple Silicon (M1/M2/M3), aunque también es compatible con Intel.
- Windows: Windows 10/11 (64 bits); una GPU NVIDIA con CUDA 11.3+ o una GPU AMD con ROCm es opcional, pero recomendable.
- Linux: Ubuntu 20.04 o superior (o equivalente), con el mismo soporte de GPU que en Windows.
- RAM: mínimo 8 GB para modelos de 7B, se recomiendan 16 GB, y 32 GB o más para modelos de 13B en adelante.
- Espacio en disco: los modelos van desde aproximadamente 2 GB (versión cuantizada de 3B) hasta 40 GB o más (70B), así que calcula el espacio según lo que necesites.
- Solo CPU: es compatible, pero mucho más lento, así que conviene reservarlo para modelos pequeños (de 1B a 3B).
Guía de instalación de Ollama (paso a paso)
- macOS / Windows: descarga el instalador desde ollama.com, ejecútalo y Ollama se iniciará como un servicio en segundo plano.
- Linux: ejecuta el script oficial de instalación en una línea: curl -fsSL https://ollama.com/install.sh | sh.
- Verifica la instalación: abre una terminal y escribe ollama --version.
- Descarga tu primer modelo: ejecuta ollama pull llama3 para descargar el Llama 3 de Meta.
- Comienza a chatear: ejecuta ollama run llama3 y escribe tu primer mensaje.
6. Biblioteca de modelos de Ollama: cómo elegir el modelo correcto
Cada modelo está a un solo ollama pull de distancia. Entre las opciones generales más populares están Llama 3, Mistral, Gemma 2, Phi-3 y Qwen 2.5. Para trabajos más específicos, hay modelos de programación como CodeLlama y DeepSeek-Coder, modelos de visión y multimodales como LLaVA y Moondream, y modelos de embeddings como Nomic-Embed-Text para pipelines de RAG.
Una regla práctica para calcular el tamaño: la cantidad de parámetros del modelo multiplicada por aproximadamente 0.6 GB te da la VRAM mínima que vas a necesitar. Los niveles de cuantización (Q4, Q5, Q8) te permiten sacrificar precisión a cambio de usar menos recursos, siendo Q4 el más ligero y Q8 el más fiel a los pesos originales.
Para ver todo el catálogo, visita ollama.com/library, donde se listan todos los modelos disponibles con sus etiquetas y variantes de tamaño.
7. Comandos esenciales de la CLI de Ollama
La CLI de Ollama hace que administrar modelos sea muy sencillo, con un puñado de comandos bastante intuitivos.
Comando | Qué hace |
|---|---|
ollama pull <model> | Descarga un modelo de la biblioteca |
ollama run <model> | Inicia una sesión de chat interactiva |
ollama list | Muestra todos los modelos instalados localmente |
ollama rm <model> | Elimina un modelo del disco |
ollama show <model> | Muestra los metadatos y parámetros del modelo |
ollama serve | Inicia manualmente el servidor de la API de Ollama |
ollama create | Crea un modelo personalizado a partir de un Modelfile |
También puedes redirigir la entrada directamente a un modelo: echo "Explain REST APIs" | ollama run mistral. Y si quieres ver estadísticas de rendimiento como la velocidad de tokens, agrega la bandera: ollama run <model> --verbose.
8. Integraciones populares y ecosistema
Integración de LangChain con Ollama
Ollama tiene soporte nativo en LangChain a través del paquete langchain-ollama, que permite crear cadenas de LLM locales, agentes y pipelines de RAG sin depender de la nube. Una importación típica se ve así: from langchain_ollama import OllamaLLM.
API de Ollama para Python
La librería de Python ollama (pip install ollama) refleja la API REST y es ideal para scripts y automatización. Una llamada básica se ve así: import ollama; response = ollama.chat(model='llama3', messages=[...]).
Otras integraciones destacadas
- LlamaIndex: indexación y recuperación de documentos con embeddings locales.
- Open WebUI: una interfaz de chat basada en navegador, similar a ChatGPT, que se conecta a tu servidor local de Ollama.
- Continue (plugin para VS Code / JetBrains): un asistente de programación con IA impulsado por un modelo local de Ollama.
- AnythingLLM: un espacio de trabajo de RAG sin código que usa Ollama como backend de inferencia.
9. Privacidad y seguridad de datos con Ollama
La garantía de privacidad principal es simple: toda la inferencia ocurre en tu propio equipo, así que tus prompts y respuestas nunca salen de la máquina local. No hay telemetría, no se requiere cuenta y no hay dependencia de ningún proveedor.
Esto hace de Ollama una opción excelente para manejar información sensible, como notas médicas, documentos legales, código fuente propietario y datos empresariales confidenciales. También ayuda a los equipos a cumplir con el GDPR, HIPAA y las políticas internas de gobernanza de datos. Vale la pena recordar que incluso los modelos de pesos abiertos a los que se accede mediante una API en la nube exponen tus datos a ese proveedor, mientras que la privacidad de la IA local elimina ese riesgo por completo.
10. Casos de uso y aplicaciones en el mundo real
- Asistente de programación con IA: corre CodeLlama o DeepSeek-Coder localmente dentro de VS Code usando el plugin Continue.
- Pipelines de RAG: combina Ollama con una base de datos vectorial como Chroma o Qdrant para hacer preguntas y respuestas sobre documentos privados.
- Asistente de IA sin conexión: usa Ollama en tu laptop mientras viajas, en entornos sin acceso a internet, o donde la conectividad no sea confiable.
- Agentes de IA locales: crea agentes autónomos de tareas con LangChain o AutoGen usando un modelo local como base.
- Educación y experimentación: un sandbox seguro para probar prompts, estudiar el comportamiento de los modelos y aprender cómo funcionan los LLM sin sorpresas en tu cuenta.
11. Limitaciones de Ollama
- Límite de hardware: el rendimiento depende de la VRAM de tu GPU local, y los modelos muy grandes (70B en adelante) requieren GPUs de gama alta para consumidores o estaciones de trabajo.
- Sin interfaz integrada: Ollama en sí solo funciona por CLI y API, así que necesitas una herramienta aparte como Open WebUI para tener una interfaz de chat.
- Brecha en la calidad del modelo: incluso los mejores LLM de código abierto pueden quedarse atrás de modelos de punta como GPT-4o y Claude 3.5 Sonnet en razonamiento complejo.
- Tamaño de descarga inicial: los modelos son archivos grandes (de 2 a 40 GB), lo que hace que empezar sea lento si tienes una conexión limitada.
- Soporte para Windows todavía en desarrollo: algunas funciones específicas van un paso atrás comparadas con las implementaciones de macOS y Linux.
¿Corres modelos locales para ahorrar dinero, pero sigues pagando precio completo por la IA en la nube? Bleap te da 0% de comisión por tipo de cambio en suscripciones en USD y un cashback plano del 20% en Claude, ChatGPT y Gemini, sin necesidad de pagar una suscripción mensual propia. Consigue la tarjeta Bleap →
Preguntas Frecuentes (FAQ)
¿Ollama es gratis?
Sí. Ollama es completamente de código abierto (licencia MIT) y no tiene ningún costo de uso. Lo único que pagas es el hardware donde lo ejecutas.
¿Cómo se compara Ollama con ChatGPT?
Ollama ejecuta modelos de código abierto de manera local, con privacidad total de tus datos. ChatGPT ofrece un modelo de punta más potente, pero procesa tu información en los servidores de OpenAI y cobra por token o mediante suscripción.
¿Cuáles son los requisitos mínimos para correr Ollama?
Un sistema operativo moderno de 64 bits (macOS 13+, Windows 10/11 o Ubuntu 20.04+), al menos 8 GB de RAM y unos 5 GB de espacio libre en disco para un modelo pequeño. Contar con una GPU dedicada acelera bastante el rendimiento.
¿Puedo usar Ollama sin conexión a internet?
Después de descargar el modelo inicial, Ollama funciona completamente sin conexión, lo que lo convierte en un verdadero asistente de IA offline.
¿Cómo integro Ollama con Python o LangChain?
Instala el paquete de Python ollama (pip install ollama) para hacer llamadas directas a la API, o usa langchain-ollama para conectar Ollama a las cadenas y agentes de LangChain como un LLM local listo para usar.
¿Qué modelos de Ollama son mejores para tareas de programación?
CodeLlama, DeepSeek-Coder-V2 y Qwen2.5-Coder son las opciones más populares para asistencia de programación local con Ollama.
Conclusión
Ollama es un ejecutor de modelos de lenguaje grande gratuito y de código abierto que hace posible la inferencia de IA privada en hardware común. Es flexible, privado y cuenta con el respaldo de un ecosistema de integraciones que crece rápido, por lo que es ideal para desarrolladores y usuarios que valoran la privacidad y están dispuestos a aceptar ciertas limitaciones de rendimiento frente a los modelos de punta en la nube. Instálalo, descarga un modelo y arranca hoy mismo tu primera conversación local. Y sin importar qué herramientas de IA uses, paga de forma inteligente: con Bleap te olvidas de las comisiones por tipo de cambio en tus suscripciones en USD, y en Claude, ChatGPT y Gemini obtienes 20% de cashback en cada renovación.
Una forma más inteligente de gastar, enviar, ganar y operar

- Artificial Inteligence








