Los Mejores Modelos de IA Open Source para Programación, Agentes y Razonamiento (2026)
28 July 2026 · Actualizado 28 July 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
Los Mejores Modelos de IA Open Source para Programación, Agentes y Razonamiento (2026)
Descubre los mejores modelos de IA open source y open weight de 2026. Compara DeepSeek, Qwen3, Kimi K2, Gemma, Mistral, GLM y MiniMax para programación, agentes y despliegue local.

1. El estado de la IA de código abierto en 2026: acortando distancias
La distancia entre los modelos de peso abierto y los sistemas cerrados de vanguardia se ha reducido drásticamente desde 2023. Lo que hace dos años era un experimento interesante, hoy es una realidad en producción. Hace un año, la opinión generalizada era que un trabajo serio de programación con agentes significaba usar Claude o GPT y aceptar la factura de la API, mientras que las opciones de código abierto se veían como experimentos curiosos y no como alternativas para producción; en 2026 esa ecuación ha cambiado, y los modelos de peso abierto ya se están desplegando dentro de pipelines de ingeniería reales, en empresas reales.
Tres fuerzas impulsaron este cambio. La primera, la eficiencia de parámetros: las arquitecturas Mixture-of-Experts (MoE) permiten que los modelos manejen un número enorme de parámetros totales activando solo una fracción de ellos en cada paso. La mayoría de los modelos punteros usan ya MoE, activando una fracción de sus parámetros totales por token, y Kimi K2 tiene 1 billón de parámetros en total pero solo activa 32.000 millones por paso de inferencia, mientras que DeepSeek utiliza 37.000 millones de sus 671.000 millones. Esa proporción es precisamente lo que hace que la calidad de primer nivel resulte asequible para alojarla uno mismo. La segunda, los avances en razonamiento, impulsados por los modos de "pensamiento" activables y el aprendizaje por refuerzo en tareas verificables. La tercera, la madurez multimodal, con el manejo de visión y contexto largo ya como estándar y no como un añadido de última hora.
En cuanto al debate entre IA de código abierto y propietaria, la paridad ha llegado de verdad para programación, razonamiento, resumen de textos y flujos de trabajo estructurados. Los mejores modelos de peso abierto ahora son muy competitivos en programación, razonamiento, resumen y flujos de trabajo estructurados, aunque los modelos cerrados todavía pueden llevar ventaja en algunas experiencias creativas, de seguridad y de asistente pulido.
Las empresas están apostando por los pesos abiertos para controlar costes, proteger la privacidad de los datos y tener libertad para hacer ajustes personalizados (fine-tuning). Este ecosistema está impulsado por un amplio grupo de laboratorios: Meta, Mistral, Google DeepMind, Alibaba, DeepSeek, Zhipu AI, Moonshot AI y MiniMax lanzan versiones de pesos abiertos muy competitivas, a menudo con solo semanas de diferencia entre unas y otras.
Código abierto vs. pesos abiertos vs. propietario: diferencias clave
Estos términos se suelen usar de forma imprecisa, pero la diferencia es importante a efectos de cumplimiento normativo. "Código abierto" normalmente implica que los pesos, el código, los datos de entrenamiento y la licencia están todos disponibles; "pesos abiertos" significa que los pesos del modelo están disponibles, pero puede que el proceso completo de entrenamiento o el conjunto de datos no lo estén. De hecho, la mayoría de los "LLM de código abierto" más populares son en realidad modelos de pesos abiertos.
- Código abierto real (compatible con OSI): Pesos completos junto con licencias permisivas como Apache 2.0 o MIT. Se permite el uso comercial, la modificación y la redistribución con restricciones mínimas.
- Pesos abiertos: Los pesos se pueden descargar y alojar de forma autónoma, pero los datos de entrenamiento o el código no se publican, y la licencia puede incluir condiciones de uso adicionales.
- Propietario: Acceso cerrado, únicamente mediante API. Sin pesos disponibles ni posibilidad de autoalojamiento.
Esta distinción condiciona el licenciamiento de los modelos de IA, la aprobación de cumplimiento normativo y la viabilidad comercial. Una referencia rápida:
Tipo de licencia | Uso comercial | Modificar | Redistribuir | Ejemplo |
|---|---|---|---|---|
Apache 2.0 / MIT | Sí | Sí | Sí | Qwen3, DeepSeek |
Pesos abiertos personalizados | Condicional | Sí | Condicional | Kimi K2, Llama 4 |
Pesos abiertos restrictivos | Condicional | Sí | Restringido | Gemma 3 |
Propietario | Solo condiciones de API | No | No | GPT-4o, Claude |
¿Estás probando APIs alojadas de estos modelos mientras tu equipo ya paga por Claude y ChatGPT? Bleap no cobra comisiones de cambio de divisa en suscripciones en USD y te devuelve un 20% fijo en las renovaciones de Claude, ChatGPT y Gemini, así que las herramientas que estás evaluando te salen más baratas cada mes. (El cashback solo aplica a esas tres.) Consigue la tarjeta Bleap →
2. Cómo hemos evaluado y clasificado estos modelos
Las clasificaciones solo son útiles si la metodología es transparente, así que aquí explicamos exactamente cómo evaluamos cada modelo. Trianguamos datos de varios benchmarks en lugar de fiarnos de una sola tabla de clasificación, porque la contaminación de datos y el sobreajuste a las pruebas más populares son riesgos reales.
Benchmarks utilizados:
- Razonamiento: MATH-500, GPQA Diamond, ARC-Challenge
- Programación: HumanEval+, SWE-bench Verified
- Conocimiento: MMLU-Pro, BIG-Bench Hard
- Multimodal: MMMU, DocVQA (cuando aplica)
- Uso de herramientas / agentes: BFCL (Berkeley Function Calling Leaderboard), AgentBench
Otros factores considerados (más allá de los benchmarks):
- Condiciones de licencia y viabilidad comercial
- Comunidad activa y frecuencia de actualizaciones
- Flexibilidad de despliegue (inferencia local, API alojada, BYOK)
- Tamaño de la ventana de contexto y usabilidad en el mundo real
Una advertencia sobre la fiabilidad de los benchmarks. Las puntuaciones son solo una foto fija en el tiempo, y las tablas de clasificación públicas se actualizan periódicamente para combatir la contaminación de datos. LiveBench renovó su conjunto de preguntas en junio de 2026 como parte de su rotación mensual habitual para evitar la contaminación, así que las puntuaciones absolutas aparecen más bajas en general, y lo realmente significativo es la comparación dentro de una misma instantánea, no las cifras en bruto de un año a otro. Por eso damos más peso a las evaluaciones independientes y resistentes a la contaminación que a las cifras reportadas por los propios fabricantes, y por eso varios benchmarks de esta guía deben interpretarse como orientativos y no como valores absolutos. Cuando una cifra procede del propio creador del modelo, lo indicamos claramente.
3. Los mejores modelos de IA de código abierto y open-weight en 2026
Lee esta sección como niveles de capacidad, no como una clasificación estricta del 1 al 8. Cada modelo se presenta con lo que es, sus rasgos más destacados, sus mejores resultados en benchmarks, sus concesiones reales y el caso de uso al que mejor se adapta. El "mejor" modelo aquí es, sinceramente, el que encaja con tu licencia, tu hardware y tu flujo de trabajo.
3.1 DeepSeek R2 / DeepSeek V3
Qué es: el modelo generalista open-weight insignia de DeepSeek, construido sobre una gran arquitectura Mixture-of-Experts que mantiene bajos los parámetros activos en relación con el tamaño total.
Características destacadas: un razonamiento casi de vanguardia con una fracción del coste de inferencia habitual, una capacidad excepcional en programación y matemáticas, y un sólido soporte multilingüe. Su diseño de atención dispersa (sparse-attention) está pensado para mantener la coherencia en secuencias largas sin disparar el consumo de memoria.
Puntos destacados en benchmarks: la última generación de DeepSeek es uno de los mejores generalistas con licencia permisiva, con una puntuación aproximada del 70% en SWE-bench Verified, un gran número total de parámetros, un contexto de 128K y una licencia MIT estándar.
Ventajas: razonamiento de primer nivel, una licencia inusualmente permisiva para un modelo de este calibre, y un desarrollo activo. DeepSeek es una gran opción con licencia MIT para equipos que necesitan una licencia comercial clara.
Desventajas: el elevado número de parámetros exige un hardware considerable para un autoalojamiento completo, y algunas auditorías de terceros han planteado ciertas dudas sobre su alineamiento que conviene revisar antes de desplegarlo de cara al público.
Ideal para: empresas que necesitan un modelo de razonamiento autoalojado y robusto, y copilotos de programación donde el coste de inferencia por token importa a gran escala.
Licencia: MIT (uso comercial permisivo).
3.2 Qwen3 (Alibaba Cloud)
Qué es: la serie de pesos abiertos de Alibaba, que abarca desde modelos densos pequeños hasta el buque insignia MoE. Qwen3-235B-A22B es el modelo estrella, con una arquitectura Mixture-of-Experts de 235B de parámetros totales y 22B activados, y destaca por permitir alternar entre un modo de razonamiento para tareas complejas y un modo sin razonamiento para diálogos más ágiles.
Características destacadas: el cambio entre modo de razonamiento y modo directo, un rendimiento multilingüe puntero y una gran capacidad para tareas agénticas y uso de herramientas. Qwen3-235B-A22B logra un Elo de 2056 en CodeForces, el más alto entre los modelos de pesos abiertos y por encima de Gemini 2.5 Pro en programación competitiva.
Aspectos destacados de los benchmarks: en una comparativa directa DeepSeek vs Qwen3, Qwen3 se impone en evaluaciones de codificación estructurada y llamadas a funciones. Los benchmarks lo sitúan codo con codo con Gemini 2.5 Pro, con 95,6 en ArenaHard y 77,1 en LiveBench, además de alcanzar 74,8 en LiveCodeBench v6. La variante Qwen3-Coder va todavía más lejos: Qwen3-Coder-480B-A35B es la mejor opción en general para programación, con un 69,6 % en SWE-bench Verified, lo más avanzado entre los modelos abiertos sin escalado en tiempo de inferencia, gracias a un diseño MoE con un contexto de 256K ampliable a 1M y licencia Apache 2.0.
Ventajas: tamaños flexibles para cualquier presupuesto de hardware, un seguimiento de instrucciones excelente y, sobre todo, una licencia Apache 2.0 que permite usarlo en aplicaciones comerciales sin quebraderos de cabeza legales.
Inconvenientes: las variantes MoE más grandes requieren infraestructura de nivel empresarial, y el modo de razonamiento añade una latencia que hay que tener en cuenta.
Ideal para: aplicaciones multilingües, flujos de trabajo agénticos y desarrolladores que buscan una única familia de modelos capaz de escalar desde un portátil hasta un servidor.
Licencia: Apache 2.0 (la mayoría de variantes).
3.3 Kimi K2 (Moonshot AI)
Qué es: el modelo de vanguardia de pesos abiertos de Moonshot AI, construido sobre un MoE de un billón de parámetros. Kimi K2 es el mejor programador agéntico en modo multi-intento, con un 65,8% en SWE-bench Verified en un solo intento y un 71,6% con varios intentos, con 1T de parámetros totales y 32B activos, una ventana de contexto de 128K y una licencia MIT modificada.
Características destacadas: una ventana de contexto amplia, puntuaciones sobresalientes en tareas agénticas y uso de herramientas, y una gran capacidad de ingeniería de software dentro de entornos de agentes (agent harnesses). K2 se apoya en una sólida trayectoria como modelo de contexto largo, con un rendimiento notable en tareas de edición multiarchivo y un seguimiento de instrucciones sólido cuando opera dentro de un entorno de agente.
Ventajas: compite de verdad con los modelos propietarios de vanguardia en tareas agénticas, y ofrece una ventana de contexto amplia para trabajos de largo alcance.
Desventajas: las herramientas de despliegue todavía están madurando en comparación con familias más antiguas, y la licencia incluye una condición que conviene leer bien. Kimi se publica bajo una licencia MIT modificada cuya única modificación es que, para uso comercial con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares en ingresos mensuales, hay que mostrar de forma visible el nombre del modelo en la interfaz del producto.
Ideal para: pipelines de IA agéntica, agentes de programación autónomos y análisis de documentos extensos.
Licencia: MIT modificada (revisa la cláusula de atribución antes de desplegar a gran escala).
3.4 Gemma 3 (Google DeepMind)
Qué es: la familia ligera de pesos abiertos de Google (aproximadamente entre 1B y 27B parámetros), diseñada para despliegue local y en dispositivos edge.
Características destacadas: un ajuste centrado en la eficiencia, variantes multimodales potentes y un kit de herramientas de IA responsable incluido. Es una de las opciones más prácticas cuando se dispone de hardware limitado. Si necesitas un despliegue local, la familia Gemma es un excelente punto de partida.
Datos destacados de los benchmarks: En relación con su tamaño, Gemma 3 27B se defiende bien en MMLU-Pro y ARC-Challenge, y sus variantes multimodales rinden bien en MMMU. Es competitivo dentro de su categoría de parámetros, no frente a los gigantes MoE de más de 200B.
Ventajas: Funciona en hardware de consumo, incluidas variantes pequeñas que caben en muy poca VRAM, con un ajuste de seguridad sólido y una integración limpia con el ecosistema de Google.
Desventajas: Los modelos Gemma más pequeños se quedan por detrás de rivales de pesos abiertos más grandes en razonamiento complejo, y la licencia no es OSI-open. Los términos de Gemma incluyen restricciones de distribución importantes que debes aceptar.
Ideal para: Despliegue en el edge, apps que priorizan la privacidad en el dispositivo y desarrolladores con hardware limitado.
Licencia: Términos de Uso de Gemma (uso comercial permitido con condiciones; no aprobada por la OSI).
Veredicto de la review de Gemma 3: Lo mejor en su clase para entornos con recursos limitados, siempre que aceptes los términos de la licencia.
3.5 Modelos Mistral (Mistral AI)
Qué es: La familia de Mistral AI, que abarca Mistral 7B, los modelos Mixtral MoE, Mistral Large y Mistral Nemo.
Características destacadas: Mistral fue pionero en técnicas de eficiencia como la atención de ventana deslizante (sliding-window attention), mantiene un fuerte posicionamiento en privacidad de datos europea, y publica sus modelos principales bajo licencia Apache 2.0. Para despliegues locales con hardware limitado, sus modelos más pequeños siguen siendo de las opciones más prácticas. Los modelos pequeños de Mistral están entre las opciones más prácticas para despliegues locales con recursos de hardware limitados.
Datos destacados de los benchmarks: Un buen rendimiento en programación y seguimiento de instrucciones, con un desempeño especialmente sólido en idiomas europeos, un área en la que a menudo supera a rivales más grandes.
Ventajas: Una licencia Apache 2.0 genuinamente abierta en los modelos principales, un excelente soporte de la comunidad y una amplia compatibilidad con herramientas de despliegue como Ollama, vLLM y llama.cpp.
Desventajas: Los modelos más grandes de Mistral no son totalmente abiertos, y Mistral Large solo está disponible mediante API.
Ideal para: Empresas europeas preocupadas por el RGPD, entusiastas de los LLM autoalojados y cualquiera que necesite un cumplimiento limpio con la licencia Apache 2.0.
Licencia: Apache 2.0 (Mistral 7B, Mixtral); propietaria para Mistral Large.
3.6 GLM-4 / GLM Z1 (Zhipu AI)
Qué es: La serie ChatGLM de Zhipu AI, entre los modelos bilingües (chino-inglés) de peso abierto más capaces, con una variante dedicada al razonamiento.
Características destacadas: Un uso sólido de herramientas y generación de código, y cada vez más una opción de codificación creíble para el mercado occidental. GLM se posiciona como la mejor alternativa a Claude Sonnet, con el proveedor reportando paridad con Claude Sonnet 4 en varias clasificaciones de codificación, un total de 357B parámetros, 200K de contexto y una licencia MIT.
Puntos destacados de los benchmarks: Lo mejor de su categoría en evaluaciones en chino como C-Eval y CMMLU, además de un buen desempeño en tareas de codificación y agénticas. Entre los modelos autoalojables, GLM lidera un grupo muy ajustado junto a MiniMax, DeepSeek, Kimi y otros, y en un benchmark agéntico del mundo real obtiene una puntuación prácticamente igual a la de un modelo propietario de primer nivel.
Ventajas: Excelente rendimiento bilingüe, pesos abiertos bajo una licencia permisiva y una comunidad de investigación activa.
Desventajas: Históricamente menos representado en las herramientas occidentales, y la documentación en inglés puede quedar por detrás de los recursos en chino.
Ideal para: Herramientas empresariales en chino y bilingües, y despliegues en el mercado asiático.
Licencia: MIT / Apache 2.0 (la mayoría de las variantes).
3.7 MiniMax-Text-01
Qué es: el modelo de MiniMax construido sobre una arquitectura híbrida de atención más atención lineal, optimizado para contextos extremadamente largos.
Características destacadas: una ventana de contexto que llega a 1M, un coste de escalado casi lineal y un rendimiento sólido en resumen y recuperación de información. Se sitúa en el competitivo grupo de modelos autoalojables junto a DeepSeek y Kimi en codificación agéntica.
Lo mejor en benchmarks: destaca en evaluaciones de contexto largo como SCROLLS y LongBench, donde su arquitectura está diseñada específicamente para mantener la coherencia en textos extensos.
Ventajas: una longitud de contexto inigualable entre los modelos de peso abierto y eficiencia de costes para documentos muy largos.
Desventajas: los benchmarks de razonamiento general quedan por detrás de la gama alta, y la comunidad es más pequeña. La licencia permite el uso comercial, pero incluye restricciones que conviene leer con atención.
Ideal para: pipelines legales, de investigación y de RAG empresarial que requieran contextos muy largos.
Licencia: licencia abierta de MiniMax (uso comercial permitido; conviene leer las restricciones de uso).
3.8 Meta Llama 4 (Mención honorífica)
Las variantes Scout y Maverick de Llama 4 aportaron capacidad multimodal y contexto largo a la línea de peso abierto de Meta. Se trata de una mención honorífica en lugar de una de las mejores opciones porque Llama utiliza la licencia comunitaria de Meta en lugar de una licencia OSI estándar, lo que sigue restringiendo ciertos usos comerciales a gran escala. Donde Llama 4 brilla es en su inigualable ecosistema de ajuste fino (fine-tuning), sus amplias herramientas comunitarias y su madura compatibilidad multimodal. Si necesitas un contexto largo, Llama 4 Scout es una opción sólida para probar. Es la elección natural para los desarrolladores que quieren construir sobre la biblioteca más completa de ajustes finos comunitarios disponible.
4. Benchmarks de modelos de IA 2026: tabla comparativa cara a cara
Ninguna clasificación por sí sola cuenta toda la historia. Usa esta tabla como punto de partida y luego valídala con tus propias tareas. Las puntuaciones con estrellas indican la posición relativa dentro de este grupo, no puntuaciones absolutas.
Modelo | Razonamiento (MATH-500) | Programación (HumanEval+) | Conocimiento (MMLU-Pro) | Agéntico (BFCL) | Ventana de contexto | Licencia |
|---|---|---|---|---|---|---|
DeepSeek R2 / V3 | ★★★★★ | ★★★★★ | ★★★★☆ | ★★★★☆ | 128K | MIT |
Qwen3-235B | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 128K | Apache 2.0 |
Kimi K2 | ★★★★☆ | ★★★★★ | ★★★★☆ | ★★★★★ | 128K | MIT Modificada |
Gemma 3 27B | ★★★☆☆ | ★★★☆☆ | ★★★★☆ | ★★★☆☆ | 128K | Gemma ToU |
Mistral 7B | ★★★☆☆ | ★★★★☆ | ★★★☆☆ | ★★★☆☆ | 32K | Apache 2.0 |
GLM Z1 / GLM-4.6 | ★★★★☆ | ★★★★☆ | ★★★★☆ | ★★★★☆ | 200K | MIT |
MiniMax-Text-01 | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | 1M | Abierta personalizada |
Advertencia: los benchmarks son fotografías puntuales. El rendimiento en el mundo real varía según la tarea, el prompt y el ajuste fino, y una ventana de contexto grande solo es útil si el modelo se mantiene coherente a lo largo del texto. El tamaño de la ventana de contexto importa, pero solo si el modelo mantiene la coherencia con textos largos; una ventana de 256K no sirve de nada si el modelo empieza a alucinar a partir de 100K.
Sobre la contaminación de datos: Trata las cifras que reportan los proveedores como orientativas hasta que evaluaciones independientes las confirmen, y compara siempre dentro de un mismo snapshot del benchmark, nunca entre distintos momentos temporales. Para clasificaciones en vivo y mantenidas de forma independiente, consulta el Open LLM Leaderboard de Hugging Face, LMSYS Chatbot Arena y LiveCodeBench.
5. Modelos de IA agéntica y rendimiento específico en programación
¿Qué hace que un modelo sea bueno para tareas agénticas?
La capacidad agéntica implica razonamiento en varios pasos, un uso fiable de herramientas, llamadas a funciones y la finalización autónoma de tareas sin que un humano tenga que corregir cada paso. Los rasgos que separan a los buenos agentes de los que dan quebraderos de cabeza son una salida estructurada fiable (JSON limpio), pocas alucinaciones en los argumentos de las herramientas y coherencia en contextos largos, de modo que el modelo no pierda el hilo a mitad de la tarea. Los principales modelos que se ponen a prueba para IA agéntica se evalúan en contexto largo, llamadas a funciones, salida estructurada, fiabilidad en el uso de herramientas y buen rendimiento en programación. Los benchmarks que corresponden a esto son BFCL, AgentBench, SWE-bench Verified y Tau-Bench.
Los mejores modelos de IA para programar en 2026
En ingeniería de software, tres familias lideran el terreno de los modelos de peso abierto: DeepSeek, Qwen3 y Kimi K2. El mejor modelo de código abierto para programar es Qwen3-Coder-480B, con un 69,6% en SWE-bench Verified bajo licencia Apache 2.0, mientras que DeepSeek roza el 70% bajo licencia MIT, MiniMax obtiene un 69,4% y Kimi K2 llega al 71,6% en modo agéntico con múltiples intentos.
Lo que debes buscar depende de tu flujo de trabajo. Para el autocompletado en línea, lo que más importa es la latencia y contar con un modelo más pequeño. Para la programación con agentes completos, al estilo Devin, necesitas una comprensión del contexto a nivel de repositorio, generación de pruebas y capacidad para recuperarse de pasos fallidos. DeepSeek, Kimi K2, Qwen3, GLM y unos cuantos más han reducido la distancia con los modelos de vanguardia de código cerrado en los aspectos que realmente importan: la finalización de tareas en varios pasos, la precisión en las llamadas a herramientas y la capacidad de recuperación ante fallos.
Los mejores modelos para flujos de trabajo agénticos
[CTA BANNER]
Qwen3 y Kimi K2 son los modelos agénticos más destacados, con GLM y DeepSeek pisándoles los talones. Todos se integran sin problemas con los frameworks agénticos más populares, como LangChain, LlamaIndex, AutoGen y CrewAI. A la hora de comparar la fiabilidad en el uso de herramientas (tool-calling), da prioridad a los modelos con puntuaciones altas en BFCL y una salida estructurada coherente, ya que un modelo que invoca herramientas con argumentos mal formados romperá tu pipeline mucho antes que otro que razone algo peor. En la práctica, prueba dos candidatos dentro de tu propio entorno de agentes antes de decidirte: el comportamiento en ese entorno suele importar más que la posición en el ranking de benchmarks.
6. Opciones de despliegue: inferencia local, APIs alojadas y BYOK
Ejecutar modelos en local (LLMs autoalojados)
Alojar tú mismo el modelo te da control sobre la privacidad y los costes, pero los requisitos de hardware crecen rápidamente con el tamaño del modelo.
- Modelos de 7B: Una sola GPU de consumo (8-16 GB de VRAM) o un Apple Silicon los ejecuta sin problemas.
- Modelos densos de 70B: Necesitarás varias GPU o una configuración de CPU con mucha RAM (64GB o más).
- Modelos MoE de 100B+: Un servidor con varias GPU o una instancia en la nube son opciones realistas, aunque la dispersión (sparsity) del MoE ayuda. Qwen3-30B-A3B es la opción MoE más práctica para quienes quieren una calidad superior a la del nivel 8B, ya que necesita unos 20 GB de VRAM para cargar todos los pesos de los expertos, pero funciona a una velocidad más cercana a la de un modelo de 3B gracias a la activación dispersa.
Entre las herramientas para inferencia local están Ollama, LM Studio, llama.cpp, vLLM y Hugging Face Transformers. La cuantización permite sacrificar algo de calidad a cambio de un consumo de memoria mucho menor: GGUF (Q4, Q8), GPTQ y AWQ reducen el tamaño del modelo, siendo Q4 el punto óptimo habitual para hardware de consumo.
Guía rápida según el nivel de hardware: en un portátil o estación de trabajo, empieza con una variante pequeña de Qwen3 o Gemma 3; en la gama más básica, Qwen3.6-35B-A3B es el único modelo que realmente puedes ejecutar en un portátil. Con una sola GPU de alta VRAM, los modelos MoE de tamaño medio se vuelven viables, y para un nodo de servidor completo se abren las puertas a los modelos insignia MoE de 200B o más.
APIs alojadas y despliegue en la nube
Si prefieres no gestionar GPUs, los modelos de peso abierto se ofrecen a través de proveedores como Together AI, Fireworks AI, Groq, Replicate y AWS Bedrock. La contrapartida es comodidad frente a control de datos: obtienes escalabilidad instantánea y ninguna carga de infraestructura, pero tus prompts salen de tu entorno. Utiliza una API alojada cuando necesites avanzar rápido, gestionar tráfico irregular o comparar modelos antes de invertir en hardware. Elige el autoalojamiento completo cuando la residencia de datos, la privacidad o la economía de costes a largo plazo sean prioritarias. Ten en cuenta que los precios de las API alojadas casi siempre se cotizan y facturan en dólares, algo relevante si pagas desde una cuenta en euros.
BYOK (usa tu propia clave) y enfoques híbridos
BYOK te permite conectar tu propia clave de proveedor a una herramienta o gateway en lugar de pagar una tarifa por puesto con recargo. En el contexto de los modelos de peso abierto, esto suele significar dirigir varios modelos a través de un único gateway. Los despliegues híbridos son cada vez más habituales: ejecutar un modelo pequeño en local para datos sensibles y recurrir a una API en la nube para cargas de trabajo pesadas o con picos. Al calcular costes, compara el coste total de propiedad del autoalojamiento (amortización del hardware, consumo eléctrico, tiempo de operación) con el precio de las API según tu volumen real de consultas; el punto de equilibrio suele ser más alto de lo que los equipos esperan, así que las cargas de trabajo pesadas y constantes favorecen el autoalojamiento, mientras que las ligeras o variables favorecen las APIs.
7. Licencias de modelos de IA: lo que necesitas saber antes de desplegarlos
Las licencias son el factor más pasado por alto en el despliegue de LLM, y el que más probabilidades tiene de hacer descarrilar un lanzamiento durante la revisión legal. Un modelo líder en benchmarks no sirve de nada si su licencia prohíbe tu caso de uso. La licencia determina qué puedes lanzar.
Nivel 1, Realmente abiertas (compatibles con OSI): Apache 2.0 y MIT. Apache 2.0 y MIT imponen restricciones mínimas, mientras que las licencias MIT modificadas añaden condiciones de uso que merece la pena leer antes de construir un producto. Qwen3, DeepSeek, GLM y los modelos principales de Mistral entran en esta categoría, permitiendo uso comercial completo, modificación y redistribución.
Nivel 2, Pesos abiertos, licencia personalizada: Meta Llama 4, Kimi K2 y MiniMax. Los pesos están disponibles libremente, pero la licencia restringe usos concretos. La condición de Kimi es el requisito de atribución a umbrales muy altos de usuarios o ingresos mencionado antes; Llama utiliza la licencia comunitaria de Meta con sus propios límites de escala.
Nivel 3, Pesos abiertos, restrictivas: Gemma 3, bajo las Condiciones de Uso de Gemma de Google. El uso está permitido pero con restricciones importantes, y no está aprobada por OSI.
Nivel 4, Propietarias, solo API: Mistral Large, Claude y GPT-4o. Sin pesos, sin autoalojamiento, licencia regida enteramente por los términos de la API del proveedor.
Lista de comprobación práctica antes de producción:
- ¿Puedo usar esto comercialmente en mi categoría específica de producto?
- ¿Puedo hacer fine-tuning y redistribuir el modelo resultante?
- ¿Hay límites de número de usuarios o de ingresos que activen obligaciones adicionales?
- ¿Hay requisitos de atribución o de mención del nombre en la interfaz?
- ¿La licencia restringe el uso para productos de la competencia?
Comprueba siempre la ficha exacta del modelo antes de desplegarlo, porque las licencias cambian entre versiones y un modelo base permisivo puede tener un fine-tune con licencia restrictiva.
8. Cómo elegir el modelo de IA de código abierto adecuado para tu caso de uso
Ningún modelo gana en todas las categorías. La adecuación al caso de uso importa más que la posición en un ranking de benchmarks, y los equipos más inteligentes eligen primero por sus restricciones. No elijas un LLM de código abierto solo por su posición en el ranking; elígelo por adecuación, porque el mejor modelo de código abierto en 2026 no es un único modelo, es el que se ajusta a tu licencia, tu hardware, tu presupuesto y tu flujo de trabajo.
Guía rápida de selección de modelos
Caso de uso | Primera opción | Alternativa | Motivo clave |
|---|---|---|---|
Mejor en general (hardware potente) | Qwen3-235B | DeepSeek V3 | Mayor amplitud de benchmarks, además de licencia Apache 2.0 |
Mejor para programación | Qwen3-Coder-480B | Kimi K2 | Resultado puntero en SWE-bench, licencia limpia |
Mejor para tareas agénticas (multi-intento) | Kimi K2 | Qwen3-235B | Líder en SWE-bench multi-intento |
Mejor generalista con licencia permisiva | DeepSeek V3 | GLM-4.6 | ~70% en SWE-bench bajo licencia MIT |
Mejor para uso local / portátil | Gemma 3 | Mistral 7B | Funciona en hardware de consumo |
Mejor bilingüe (chino-inglés) | GLM Z1 | Qwen3 | Rendimiento líder en chino |
Mejor contexto largo | MiniMax-Text-01 | DeepSeek V3 | Ventana de contexto de 1M |
Mejor ecosistema de fine-tuning | Llama 4 | Mistral | Herramientas comunitarias más completas |
Un marco de decisión sencillo
Trabaja estas cuatro preguntas en orden. Primero, la licencia: si necesitas derechos comerciales sin restricciones, empieza por modelos Apache 2.0 o MIT (Qwen3, DeepSeek, GLM, Mistral) y solo plantéate un modelo de Nivel 2 o 3 si la diferencia de capacidad es decisiva. Segundo, el hardware: ajusta el modelo a lo que realmente puedas ejecutar; un portátil apunta a una variante pequeña de Gemma 3 o Qwen3, mientras que un servidor abre la puerta a los modelos insignia. Tercero, el flujo de trabajo: la programación y los pipelines agénticos se benefician de Qwen3, Kimi K2 y DeepSeek, mientras que el RAG con documentos largos apunta a MiniMax. Cuarto, el presupuesto: ten en cuenta los costes de API en dólares si usas inferencia alojada, ya que las comisiones por transacción en el extranjero inflan silenciosamente cada factura mensual.
Ese último punto es donde tu forma de pagar importa tanto como la elección del modelo. Si tu equipo usa APIs alojadas y paga mensualmente por asistentes de IA, una tarjeta que añade un 2-3% en cada cargo en USD se come los ahorros que tanto te costó conseguir. Pagar en USD al tipo de cambio real con un 0% de comisiones de cambio de divisa mantiene tu presupuesto de infraestructura bajo control, y en concreto en Claude, ChatGPT y Gemini, el cashback plano del 20% de Bleap convierte un coste recurrente en un reembolso parcial.
¿Usas modelos abiertos en local pero sigues pagando cada mes por Claude, ChatGPT y Gemini? Bleap te da 0% de comisiones de cambio en suscripciones en USD y un cashback plano del 20% en esos tres asistentes, con una tarjeta Mastercard autocustodiada y sin cuota de suscripción propia. Consigue la tarjeta Bleap →
Preguntas frecuentes
¿Cuál es el mejor modelo de IA de código abierto en 2026?
No hay un único ganador. Para la mayoría de desarrolladores, Qwen3-235B-A22B es la opción más completa gracias a su licencia Apache 2.0 y su amplio rendimiento en benchmarks. En cuanto a programación específicamente, Qwen3-Coder-480B lidera con un 69,6% en SWE-bench Verified, DeepSeek alcanza alrededor del 70% bajo licencia MIT, y Kimi K2 llega al 71,6% en modo agéntico con múltiples intentos. La elección correcta depende de tu licencia, tu hardware y tu flujo de trabajo.
¿Cuál es la diferencia entre código abierto y pesos abiertos?
Código abierto («open source») normalmente significa que los pesos, el código, los datos de entrenamiento y la licencia están todos disponibles, mientras que pesos abiertos («open weight») significa que solo están disponibles los pesos del modelo, y el proceso de entrenamiento o el conjunto de datos pueden no estarlo. La mayoría de los populares «LLM de código abierto» son en realidad modelos de pesos abiertos.
DeepSeek vs Qwen3: ¿cuál debería elegir?
Ambos son excelentes. Elige DeepSeek si buscas un modelo generalista con licencia MIT permisiva y un razonamiento sólido con una buena relación coste-rendimiento. Elige Qwen3 si quieres la gama más amplia de tamaños de modelo, un modo de razonamiento activable, un soporte multilingüe líder en su categoría y licencia Apache 2.0 en la mayoría de sus variantes. Para programación pura, la variante Qwen3-Coder tiene actualmente una ligera ventaja.
¿Qué modelo de código abierto es mejor para programar?
Qwen3-Coder, DeepSeek y Kimi K2 lideran el terreno. Elige según la licencia y tu flujo de trabajo: Qwen3-Coder para tener derechos limpios bajo Apache 2.0, DeepSeek para un generalista permisivo con licencia MIT, y Kimi K2 cuando necesites el mejor rendimiento en programación agéntica con múltiples intentos.
¿Puedo ejecutar estos modelos en mi propio hardware?
Sí, dentro de ciertos límites. Un modelo de 7B se ejecuta en una sola GPU de consumo o en un Apple Silicon, y modelos MoE eficientes como Qwen3-30B-A3B funcionan en una estación de trabajo con unos 20 GB de VRAM. Los modelos insignia de más de 200B necesitan servidores con varias GPU o instancias en la nube. La cuantización (GGUF Q4/Q8, GPTQ, AWQ) reduce aún más los requisitos.
¿Debo preocuparme por la licencia antes de desplegar el modelo?
Sin duda. Los modelos con licencia Apache 2.0 y MIT (Qwen3, DeepSeek, GLM, Mistral) son los más seguros para uso comercial. Las licencias personalizadas como la de Kimi incluyen ciertas condiciones, por ejemplo un requisito de atribución a partir de umbrales muy altos de usuarios o ingresos, y los términos de Gemma son aún más restrictivos. Lee siempre la ficha exacta del modelo antes de ponerlo en producción.
¿Cuál es la forma más inteligente de pagar suscripciones de IA y APIs alojadas?
La mayoría de las herramientas de IA y los servicios de inferencia alojados se facturan en USD, y una tarjeta normal añade una comisión del 2-3% por transacción en el extranjero en cada cargo. Pagar en USD al tipo de cambio real con 0% de comisiones de cambio elimina ese coste, y en Claude, ChatGPT y Gemini, Bleap te da un cashback plano del 20% en cada renovación.
Conclusión
La IA de peso abierto en 2026 ya no es el compromiso de bajo presupuesto. La brecha con los modelos frontera propietarios se ha cerrado en programación, razonamiento y trabajo agéntico, y el factor decisivo ahora es la adecuación, no el ranking en bruto. Qwen3-235B lidera en amplitud y licencias, DeepSeek y Kimi K2 impulsan el rendimiento en programación y tareas agénticas, Gemma 3 y Mistral dominan el nivel local y de edge, GLM brilla en bilingüismo, y MiniMax se lleva el contexto largo. Elige el modelo según tu licencia, tu hardware y tu flujo de trabajo, y valídalo con tus propias tareas antes de comprometerte.
Sea cual sea el modelo que despliegues o al que te suscribas, paga de forma inteligente. Con Bleap te ahorras las comisiones de cambio de divisa en las suscripciones en USD y en las facturas de APIs alojadas, y en Claude, ChatGPT y Gemini ganas un cashback plano del 20% en cada renovación, todo con una Mastercard autocustodiada sin cuota mensual propia. El dinero que ahorras al elegir el modelo correcto rinde aún más cuando tu método de pago deja de filtrar un 2-3% en cada cargo.
Construye con modelos abiertos. Paga los cerrados sin el impuesto del cambio de divisa. Bleap: 0% de comisiones de cambio en suscripciones en USD, un cashback plano del 20% en Claude, ChatGPT y Gemini, y hasta un 20% de cashback en gastos del día a día. Sin cuota mensual, autocustodiada por diseño. Consigue la tarjeta Bleap →
Una forma más inteligente de gastar, enviar, ganar y operar

- Artificial Inteligence








