Blogs

OpenAI baja un 80% los precios de su API: ¿qué cambia en 2026?

18 August 2026  ·  Actualizado 18 August 2026

Gabriel Caetano

Gabriel Caetano

ARTIFICIAL INTELIGENCE

OpenAI baja un 80% los precios de su API: ¿qué cambia en 2026?

OpenAI ha reducido un 80% el precio de la API de GPT-5.6 Luna y un 20% el de Terra. Descubre los nuevos precios de 2026, qué modelos ofrecen más valor, cómo queda frente a sus rivales y cómo reducir aún más tu factura de IA.

openai-api-price-cuts

OpenAI Baja el Precio un 80%: La Guía Completa 2026 de las API de IA Más Baratas

OpenAI bajó el precio un 80% de GPT-5.6 Luna el 30 de julio de 2026, pasando de 1$/6$ a 0,20$ por millón de tokens de entrada y 1,20$ por millón de tokens de salida. La compañía redujo el precio de Terra un 20%, hasta 2$ por millón de tokens de entrada y 12$ por millón de tokens de salida, y recortó el coste de Luna un 80%, hasta 20 céntimos por millón de tokens de entrada y 1,20$ por millón de tokens de salida. Eso sí, ese 80% tan destacado se aplica a un nivel concreto, no a toda la gama, así que tu ahorro real dependerá de qué modelo uses realmente.

Si construyes con OpenAI, pagas por sus servicios o ajustas tu presupuesto alrededor de esta compañía, este es uno de los cambios de precios más relevantes del año. A continuación tienes el análisis completo: qué modelos se han abaratado, por qué ha pasado, cómo se compara ahora OpenAI con Google, Anthropic y el terreno del código abierto, y cómo sacarle hasta el último centavo a tu factura de la API. Y como las suscripciones de IA todavía se cobran mensualmente en dólares, también repasaremos esa forma silenciosa en que la mayoría pierde dinero en cada renovación, y cómo evitarlo.

Esta guía está pensada para desarrolladores individuales, startups que vigilan cada gasto y empresas con cargas de trabajo en producción. Las cifras importan, así que las hemos verificado con la información más reciente de 2026 a lo largo de todo el texto.

¿Pagas cada mes por ChatGPT, Claude o Gemini? Bleap no cobra comisiones de cambio de divisa en tus suscripciones en USD y te da un 20% de cashback fijo en las renovaciones de Claude, ChatGPT y Gemini, con una Mastercard autocustodiada y sin ninguna suscripción propia. (El 20% de cashback aplica solo a Claude, ChatGPT y Gemini.) Consigue la tarjeta Bleap →

1. ¿Qué ha pasado exactamente? Los recortes de precios de OpenAI en 2026, explicados

El anuncio oficial, el calendario y los modelos afectados

El eje central de la historia es un movimiento único y muy agresivo. OpenAI recortó el precio de su modelo GPT-5.6 Luna en un 80% el 30 de julio de 2026, solo tres semanas después del lanzamiento público completo de la familia GPT-5.6. Terra también bajó un 20%, mientras que el nivel más avanzado, Sol, se quedó sin cambios.

Lo que más ha llamado la atención en el sector es precisamente el momento elegido. OpenAI anunció que rebajaba el precio de dos de sus modelos de inteligencia artificial más recientes, GPT-5.6 Terra y GPT-5.6 Luna, apenas tres semanas después de su lanzamiento público. Normalmente, las empresas no vuelven a fijar precios de un producto tan rápido a menos que el mercado las haya obligado a hacerlo. La familia GPT-5.6 se lanzó el 9 de julio con Sol como modelo de referencia, Terra como opción de gama media y Luna como alternativa más económica, y tres semanas es muy poco tiempo para revisar esos precios. Esto sugiere que los precios iniciales no encajaban donde OpenAI esperaba frente a las alternativas que los clientes estaban evaluando.

OpenAI planteó el cambio como una cuestión de eficiencia y no de apuro. "Nuestra estrategia sigue centrada en avanzar tanto en capacidad como en eficiencia, de modo que cada generación de inteligencia pueda hacer más trabajo a un coste menor", explicó OpenAI en un comunicado. Estos cambios se aplican a los precios de la API que pagan los desarrolladores por token. Los planes de consumo de ChatGPT son un producto distinto con su propia tarifa mensual.

Las nuevas cifras de precios: un desglose completo del coste por token

Aquí es exactamente donde se sitúa esa reducción del 80%, y así se compara con el resto de la gama. Todas las cifras son por millón de tokens en el nivel estándar, en USD, que es como se cotizan los precios de tokens a nivel global.

Modelo

Entrada anterior

Salida anterior

Entrada nueva

Salida nueva

Reducción

GPT-5.6 Luna

$1,00

$6,00

$0,20

$1,20

80%

GPT-5.6 Terra

$2,50

$15,00

$2,00

$12,00

20%

GPT-5.6 Sol

$5,00

$30,00

$5,00

$30,00

0%

GPT-5

N/D

N/D

$1,25

$10,00

N/D

GPT-4.1

N/D

N/D

$2,00

$8,00

N/D

GPT-4.1 Mini

N/D

N/D

$0,40

$1,60

N/D

GPT-4.1 Nano

N/D

N/D

$0,10

$0,40

N/D

GPT-4o (legacy)

N/D

N/D

$2,50

$10,00

N/D

GPT-4o mini

N/D

N/D

$0,15

$0,60

N/D

o3 (razonamiento)

N/D

N/D

$2,00

$8,00

N/D

o4-mini (razonamiento)

N/D

N/D

$1,10

$4,40

N/D

Las cifras clave detrás del recorte están claras. Luna ahora cuesta $0,20 por millón de tokens de entrada y $1,20 por millón de tokens de salida, frente a los $1 y $6 anteriores, y las tarifas de Terra bajaron a $2 por millón de tokens de entrada y $12 por millón de tokens de salida, desde los $2,50 y $15 previos.

Siempre importan dos precios, no uno solo. Los tokens de entrada son lo que envías al modelo: tu prompt, las instrucciones del sistema, documentos e historial de conversación. Los tokens de salida son lo que el modelo genera como respuesta. En la mayoría de los modelos, el coste de salida es varias veces superior al de entrada, por lo que un modelo verboso y hablador puede acabar costando más que uno conciso, incluso con la misma tarifa de partida.

Merece la pena conocer el panorama general. GPT-4o cuesta 2,50 $ por millón de tokens de entrada y 10 $ por millón de salida en 2026, mientras que GPT-4o mini se sitúa en 0,15 $/0,60 $ y el modelo de razonamiento o3 ronda los 2 $/8 $ tras los últimos recortes de precio. Los precios se mantienen en 2 $/1M de entrada y 8 $/1M de salida para GPT-4.1, 0,40 $/1,60 $ para GPT-4.1 Mini, 0,10 $/0,40 $ para GPT-4.1 Nano, y GPT-5 se sitúa en 1,25 $/10 $.

Aclaración: ¿qué es un token? Un token es un fragmento de texto, de unos 4 caracteres o aproximadamente tres cuartas partes de una palabra en inglés. La frase que estás leyendo tiene unos 15 tokens. Los precios se expresan por millón de tokens porque las cargas de trabajo reales alcanzan cifras de miles de millones. Como referencia aproximada, 1 millón de tokens equivale a unas 750.000 palabras, o unas diez novelas completas.

Qué cambios de precio llegaron al 80% y cuáles no

El matiz importante: no todos los modelos bajaron un 80%, y de hecho la mayoría no bajó nada en esta ronda. La cifra del 80% corresponde específicamente a Luna, el nivel más barato y rápido. Luna pasó de 1 $/6 $ a 0,20 $/1,20 $ por millón de tokens de entrada/salida, una reducción del 80% tanto en el precio de entrada como en el de salida, lo que convierte a Luna en uno de los modelos capaces más baratos disponibles entre los proveedores de primer nivel.

Terra tuvo un recorte más modesto pero significativo del 20%, y Sol, el modelo insignia, mantuvo su precio sin cambios. OpenAI redujo el coste de su modelo GPT-5.6 Luna en un 80% y rebajó el precio de su modelo Terra en un 20%, pero no realizó ningún cambio en el precio de Sol, su modelo más avanzado.

Entonces, ¿cuánto se ahorra un usuario normal en la práctica? Depende totalmente de dónde se concentre tu consumo. Si ejecutas tareas sencillas de alto volumen en Luna, tu factura acaba de bajar en torno a un 80%. Si tu carga de trabajo depende de Sol para razonamiento de última generación, no ahorras nada directamente, aunque suele ser buena idea trasladar las tareas que lo permitan a los niveles ahora más baratos. Este cambio funciona gracias a la mejora progresiva de capacidades. Según OpenAI, las mejoras de GPT-5.6 permiten que Luna y Terra asuman cargas de trabajo que antes requerían un modelo premium, lo que significa que los clientes pueden completar muchas tareas de IA con sistemas más económicos sin que la capacidad se resienta de forma notable.

2. ¿Por qué OpenAI ha recortado los precios de forma tan drástica?

Mejoras en la eficiencia del hardware: la historia de la computación

La parte más llamativa de este recorte de precios es cómo lo ha financiado OpenAI. La empresa asegura que su propio modelo se encargó de la ingeniería. Dentro de un proceso liderado por personas, Sol reescribió y optimizó de forma autónoma los kernels de GPU en producción y realizó cientos de experimentos para mejorar la generación de tokens; el trabajo con los kernels redujo el coste total de servir el modelo en aproximadamente un 20%, y los experimentos aumentaron la eficiencia de generación de tokens en más de un 15%.

El planteamiento público de OpenAI es que la eficiencia de la gama alta subvenciona los niveles más baratos. La narrativa interna de la empresa, compartida públicamente, es que la pila de inferencia optimizada de Sol es lo que financia los recortes de Luna y Terra: una mejor eficiencia en la parte alta de la gama genera margen para competir con más agresividad en los niveles donde realmente está el volumen. El principio general aquí es sencillo. A medida que la inferencia se vuelve más eficiente por consulta, el coste marginal de servir cada token cae, y a la escala de OpenAI, incluso una mejora del 20% en el coste de servicio se traduce en un ahorro absoluto enorme que se puede trasladar al cliente.

La empresa también presenta esto como el inicio de un patrón que se repetirá, y no como un hecho puntual. OpenAI lo plantea como un bucle que se retroalimenta: a medida que sus modelos mejoren en el trabajo autónomo, las futuras rondas de ahorro de costes podrían llegar más rápido.

Intensa presión competitiva por parte de los rivales

La eficiencia es la razón oficial, pero la competencia es la presión que hay detrás. Las dos semanas previas al movimiento de OpenAI estuvieron muy cargadas. Anthropic lanzó Claude Opus 5 el 24 de julio a 5$/25$ por millón de tokens de entrada/salida, ofreciendo un rendimiento cercano al de Fable 5 por, más o menos, el mismo coste que su predecesor, y Google lanzó Gemini 3.6 Flash a 1,50$/7,50$ por millón de tokens con una mejora de eficiencia del 17% ese mismo mes.

La presión no viene solo de los laboratorios estadounidenses de siempre. Los modelos chinos de bajo coste se han hecho con una cuota de mercado real. Una investigación de CNBC publicada el 7 de julio de 2026 reveló que los modelos chinos han capturado el 46% del uso de tokens empresarial en EE. UU. en OpenRouter, llegando en ocasiones a superar a los modelos de origen estadounidense, y DeepSeek V4 Pro, por ejemplo, tiene un precio de 0,435 $/0,87 $ por millón de tokens, beneficiándose de un descuento promocional permanente del 75%.

En conjunto, la presión competitiva llega desde todos los frentes: rivales de gama alta que igualan las capacidades a menor coste, modelos de gama media que compiten a base de precio, y modelos abiertos o con descuento que están redefiniendo lo que significa "barato". Estos cambios refuerzan la posición de OpenAI frente a rivales como Anthropic, cuyos modelos Claude siguen siendo muy utilizados pero tienen costes de uso más altos, mientras que los competidores chinos de código abierto, entre ellos Z.ai, han subido aún más la apuesta al ofrecer sistemas de IA capaces a precios sustancialmente más bajos.

Los objetivos estratégicos de OpenAI, la cuota de mercado y el alcance de su ecosistema

Bajar los precios en los niveles donde más se usa la IA responde a una lógica de conquista de terreno. Unos modelos de entrada y de gama media más baratos atraen a más desarrolladores, que crean más productos, que atraen a más usuarios, que generan más uso. OpenAI ha revisado a fondo los precios de su catálogo de IA, rebajando de forma significativa el coste de sus modelos de entrada y de gama media a medida que se intensifica la competencia en el mercado de la IA generativa y las empresas exigen opciones más asequibles.

La escala que OpenAI está defendiendo es enorme, y este movimiento de precios llegó acompañado de un hito. OpenAI reveló que sus modelos ya superan los mil millones de usuarios activos y los dos millones de empresas, un anuncio que llegó justo después de las rebajas de precio en dos modelos de su familia GPT-5.6.

La sensibilidad al coste es ahora un factor decisivo para los compradores, no una idea de última hora. La empresa se enfrenta a la presión de atender a una clientela cada vez más pendiente de los costes, en la que las empresas han mostrado menos disposición a implantar modelos caros sin tener una idea clara del retorno de su inversión. Los días del uso ilimitado de la IA sin reparar en gastos están llegando a su fin. OpenAI dio el pistoletazo de salida al boom de la IA con el lanzamiento de ChatGPT en 2022, lo que llevó a las empresas a lanzarse a implantar esta tecnología, y así nació la era del llamado "tokenmaxxing", en la que los empleadores animaban a sus trabajadores a usar la IA todo lo posible sin preocuparse por el coste.

El papel de las arquitecturas de modelos más nuevas y eficientes

Detrás de todo esto hay un avance constante hacia diseños de modelos más eficientes. Las nuevas generaciones hacen más con cada unidad de cómputo, y los niveles "mini" y "nano" están diseñados específicamente para asumir la mayor parte del trabajo diario a una fracción del coste de los modelos insignia. Por eso un modelo de la clase Luna puede ahora encargarse de tareas que antes exigían un modelo premium.

La tendencia de fondo lleva más de un año en marcha. Los precios de los modelos punteros no han dejado de desplomarse desde principios de 2025, impulsados por una combinación de mejoras en la eficiencia de la inferencia, avances en los modelos de peso abierto y movimientos competitivos deliberados. Las cifras son reales y no dejan de ser preocupantes: incluso a esta escala, los líderes del sector están gastando a manos llenas. La empresa opera con pérdidas mientras sigue invirtiendo en el desarrollo de modelos e infraestructura, con unos ingresos de 13.070 millones de dólares en 2025 frente a unas pérdidas netas de 38.500 millones de dólares. Precios más bajos sumados a un gasto elevado significan que la narrativa de la eficiencia no es un simple gancho de marketing. Es la única forma de que las cuentas cuadren.

3. Guía modelo por modelo: ¿qué modelo de OpenAI deberías usar en 2026?

Ahora la gama es amplia. Así es como puedes pensar en cada categoría, cuánto cuesta y a quién le conviene.

GPT-5.6 Luna, el nuevo campeón de la relación calidad-precio

Luna es el modelo que acaba de convertirse en noticia. El precio de entrada de GPT-5.6 Luna cayó un 80%, hasta 0,20 $ por millón de tokens desde 1 $, mientras que el precio de salida bajó a 1,20 $ desde 6 $.

Con 0,20 $/1,20 $, Luna está diseñado para escalar. Es la opción adecuada para cargas de trabajo de alto volumen, estructuradas y sensibles a la latencia: clasificación, etiquetado, enrutamiento, análisis de sentimiento, chat en tiempo real y generación sencilla. La gran mejora de esta ronda es que Luna ahora puede encargarse de tareas que antes exigían un modelo más caro, así que muchos equipos pueden consolidar su uso en él. Si haces millones de llamadas al mes con tareas repetitivas, Luna es tu punto de partida por defecto.

GPT-5.6 Terra, el nivel intermedio equilibrado

Terra se sitúa en el punto medio de relación calidad-precio, con 2 $/12 $ tras su recorte del 20%. Es el caballo de batalla razonable para tareas demasiado complejas para Luna pero que no justifican el precio del modelo insignia: atención al cliente con contexto real, análisis de documentos, generación de contenido y cargas de trabajo generales de asistente. Para la mayoría de flujos de producción, Terra es el nivel al que solo deberías subir cuando la calidad de salida de Luna se quede corta.

GPT-5.6 Sol, el buque insignia

Sol es la cúspide de la familia y ha mantenido su precio en 5 $/30 $. También ha ganado una opción de velocidad. OpenAI anunció un nuevo modo Fast para Sol en la API, que sustituye a la anterior oferta de Procesamiento Prioritario, y el modo Fast ofrece hasta 2,5 veces la velocidad del procesamiento estándar. Reserva Sol para problemas realmente difíciles, donde la mejora en precisión o capacidad sea medible y merezca la pena pagar el extra.

GPT-4.1 y GPT-4o, las opciones veteranas

Muchos sistemas de producción siguen funcionando con la generación de GPT-4, que sigue siendo una opción muy rentable para trabajos con contexto largo. GPT-4.1 se lanzó como el reemplazo recomendado por OpenAI para GPT-4o: es más barato ($2/$8 frente a $2,50/$10), tiene una ventana de contexto de 1 millón de tokens frente a 128K, y obtiene mejores resultados en los benchmarks de seguimiento de instrucciones y programación. En el extremo más económico, GPT-4.1 Nano es uno de los modelos capaces más baratos que existen. Con $0,10 por millón de tokens de entrada, GPT-4.1 Nano es una de las opciones más económicas disponibles con un rendimiento sólido. Los usuarios que ya utilizaban GPT-4o mantienen, por lo general, sus condiciones anteriores: GPT-4o conserva para ellos la tarifa heredada de $2,50/1M tokens de entrada y $10/1M tokens de salida.

GPT-4o mini sigue siendo el caballo de batalla para tareas de alto volumen. Con $0,15 por millón de tokens de entrada y $0,60 por millón de tokens de salida, GPT-4o mini es unas 17 veces más barato que GPT-4o en cuanto a entrada, y es el motor de la mayoría de las cargas de trabajo de clasificación, extracción y enrutamiento a gran escala. Para hacernos una idea práctica: un millón de llamadas cortas de clasificación de unos 500 tokens cada una cuesta menos de $80 con GPT-4o mini.

o3 y o4-mini, los modelos de razonamiento

Los modelos de razonamiento son harina de otro costal, y su precio esconde una trampa. Los modelos de la serie o de OpenAI (o4-mini, o3, o3-pro) están diseñados para tareas que requieren razonamiento en varios pasos, como matemáticas, depuración de código complejo y análisis científico. o4-mini, con $1,10/$4,40 por millón de tokens, ofrece la mejor relación calidad-precio para cargas de razonamiento con presupuesto ajustado. Eso sí, estos modelos también facturan los tokens de razonamiento interno a la tarifa de salida, por lo que el coste real puede llegar a ser de 3 a 10 veces el precio base, dependiendo de la complejidad de la tarea.

Esa distinción es esencial entender antes de calcular tu presupuesto. Una sola respuesta de o3 puede consumir entre 5.000 y 20.000 tokens internos de razonamiento que pagas a la tarifa de salida, así que una tarea que cuesta 0,01 $ en GPT-4o puede llegar a costar 0,15 $ o más en o3, a pesar de unos precios de partida similares. La regla práctica: para la mayoría de las cargas de trabajo en producción, o4-mini ofrece la mejor relación calidad-precio dentro de la categoría de razonamiento, así que reserva o3 y o3-pro para tareas donde las evaluaciones muestren una mejora de precisión medible.

Tabla comparativa rápida: los modelos de OpenAI de un vistazo

Modelo

Entrada $/1M

Salida $/1M

Contexto

Mejor para

Velocidad

GPT-5.6 Luna

0,20 $

1,20 $

400K

Tareas sencillas y de alto volumen

La más rápida

GPT-5.6 Terra

2,00 $

12,00 $

1M

Trabajo de producción equilibrado

Rápida

GPT-5.6 Sol

5,00 $

30,00 $

1M

Razonamiento de vanguardia

Opción de modo rápido

GPT-4.1

2,00 $

8,00 $

1M

Contexto largo, programación

Rápida

GPT-4.1 Nano

0,10 $

0,40 $

1M

La opción capaz más barata

La más rápida

GPT-4o mini

0,15 $

0,60 $

128K

Clasificación, enrutamiento

Rápida

o4-mini

1,10 $

4,40 $

Amplio

Razonamiento económico

Moderada

o3

2,00 $

8,00 $

Amplio

Razonamiento de alta precisión

Más lenta

La opción más rentable para la mayoría de los equipos: empezar con Luna o GPT-4.1 Nano para volumen, pasar a Terra cuando la calidad lo exija, y usar o4-mini para razonamiento antes de recurrir a o3.

Cómo elegir el modelo adecuado: un marco de decisión

Mantenlo simple con una ruta de decisión corta:

  • ¿La tarea es sencilla y de alto volumen? Usa Luna, GPT-4.1 Nano o GPT-4o mini.
  • ¿Necesita razonamiento genuino o cálculos matemáticos? Usa primero o4-mini, y o3 solo si las evaluaciones demuestran una mejora real.
  • ¿Es trabajo de producción equilibrado con contexto real? Usa Terra o GPT-4.1.
  • ¿Es un problema realmente complejo, de vanguardia? Usa Sol.
  • ¿La velocidad en tiempo real es crítica? Usa Luna o GPT-4o mini.

La regla de oro para controlar costes: empieza con lo económico y sube de nivel solo cuando la calidad no sea suficiente. La mayoría de los equipos sobredimensionan el modelo por defecto, pagando precios de gama alta por tareas que un modelo mini resuelve perfectamente.

4. Impacto real: ¿cuánto se puede ahorrar de verdad?

Los porcentajes son abstractos. Esto es lo que suponen los recortes en facturas reales. Los precios que aparecen a continuación usan las tarifas vigentes de 2026.

Caso de uso de desarrollador: crear un chatbot

Imagina un desarrollador autónomo que gestiona un chatbot de atención al cliente que procesa 5 millones de tokens al mes, repartidos aproximadamente en 3M de entrada y 2M de salida.

Con la tarifa antigua de Luna ($1/$6), eso sale a unos $3 de entrada más $12 de salida, unos $15 al mes, o $180 al año solo en el modelo. Con la nueva tarifa de Luna ($0,20/$1,20), sale a unos $0,60 de entrada más $2,40 de salida, unos $3 al mes, o $36 al año. Eso es un recorte del 80% en el coste base del modelo del bot. Los 144 € ahorrados al año son el tipo de dinero que financia un mejor sistema de registro (logging) o un mes de hosting.

Caso de uso de startup: producto SaaS con IA

Piensa en una startup SaaS que ofrece una función de resumen de documentos para 500 clientes empresariales, consumiendo unos 200 millones de tokens de entrada y 40 millones de tokens de salida al mes con un modelo de gama media.

Mover esa carga de trabajo de un nivel de $2,50/$15 a Terra a $2/$12 cambia el coste mensual de unos 500 € de entrada y 600 € de salida a unos 400 € de entrada y 480 € de salida, un ahorro de unos 220 € al mes, o 2.640 € al año. Con precios más bajos, funciones nativas de IA que antes tenían margen negativo se vuelven viables, y productos que solo funcionaban en mercados adinerados empiezan a tener sentido en otros más sensibles al precio. Ese es el efecto silencioso y acumulativo de una guerra de precios: categorías enteras de productos cruzan la línea hacia la rentabilidad.

Caso de uso empresarial: herramientas internas de IA a gran escala

Pensemos en una empresa de 1.000 personas que usa la API para búsqueda interna de conocimiento, redacción de correos y automatización de RR. HH., consumiendo unos 2.000 millones de tokens de entrada y 400 millones de tokens de salida al mes, la mayoría de uso rutinario.

Enrutar la mayor parte de ese tráfico hacia Luna a 0,20 $/1,20 $ en lugar de un modelo de gama media a 2 $/12 $ marca la diferencia entre unos 4.800 € al mes y unos 880 € al mes. En un año son decenas de miles de euros, y si lo desglosamos por empleado, el coste de las herramientas de IA internas se queda en una cifra de un solo dígito en euros por persona al mes. Lo que realmente importa aquí no es la rebaja de precio por sí sola, sino combinarla con un enrutamiento disciplinado.

Caso de uso individual y autónomos: usuarios intensivos de la API

Un desarrollador o creador de contenido autónomo que use la API directamente podría gastar entre 80 € y 150 € al mes. Tras las rebajas, y con algo de disciplina en el enrutamiento, ese mismo resultado puede bajar a entre 30 € y 60 €. El modo batch, la caché y los prompts más cortos (todo esto se explica en la Sección 6) lo reducen todavía más.

Hay otra palanca que queda fuera de la API por completo. Si además pagas suscripciones a ChatGPT, Claude o Gemini en dólares, una tarjeta normal suele añadir sin que te des cuenta una comisión por operación en divisa extranjera de entre el 2% y el 3% en cada renovación. Si pagas esas suscripciones con una tarjeta Bleap, pagas en dólares al tipo de cambio real con un 0% de comisión de cambio, además de un 20% de cashback fijo en las renovaciones de Claude, ChatGPT y Gemini. Con un gasto mensual de 40 € en suscripciones de IA, solo ese cashback ya supone unos 96 € al año, sin contar la comisión de cambio que dejas de pagar.

¿Has recortado tu factura de la API pero sigues perdiendo dinero en las renovaciones de suscripciones? Bleap te da un 0% de comisión de cambio en suscripciones de IA en dólares y un 20% de cashback fijo en Claude, ChatGPT y Gemini, sin ninguna suscripción mensual propia. (El cashback solo se aplica a esas tres herramientas.) Consigue la tarjeta Bleap →

5. OpenAI frente a la competencia: ¿es OpenAI realmente la opción más barata ahora?

El recorte del 80% hizo que OpenAI fuera mucho más competitivo, pero "el más barato" depende en gran medida del nivel del que hablemos.

OpenAI frente a Google Gemini: precio y rendimiento

Google juega fuerte en todos los niveles y tiene una ventaja estructural. Los precios de la API de Gemini van desde 0,10 $/0,40 $ por millón de tokens de entrada/salida en Gemini 2.5 Flash-Lite, hasta 0,30 $/2,50 $ en Gemini 3.5 Flash-Lite y 1,50 $/7,50 $ en Gemini 3.6 Flash, llegando a 2 $/12 $ en Gemini 3.1 Pro, siendo la tarifa estándar más baja actualmente la de Gemini 2.5 Flash-Lite, con 0,10 $/0,40 $.

Hay un detalle a tener en cuenta a la hora de calcular el presupuesto en los niveles Pro. En estos modelos, cuando un solo prompt supera los 200.000 tokens de contexto, la tarifa de entrada prácticamente se duplica y la de salida sube en consecuencia: en Gemini 3.1 Pro, la entrada pasa de 2,00 $ a 4,00 $ por millón, y la salida de 12,00 $ a 18,00 $. La verdadera ventaja de Gemini está en la longitud del contexto. La línea Gemini de Google tiene algo que los demás no terminan de igualar: una ventana de contexto de 1 millón de tokens en todos sus modelos, incluso en el más económico. Donde OpenAI gana es en la profundidad de su ecosistema, la madurez de sus herramientas y la confianza de marca entre más de mil millones de usuarios. Gemini, por su parte, suele ganar en precio bruto cuando se trata de trabajar con documentos largos.

OpenAI frente a Anthropic Claude: la alternativa premium

Claude sigue siendo el favorito de las empresas por la calidad de su escritura, su fiabilidad en contextos largos y su alineación en cuestiones de seguridad, y este verano lanzó modelos nuevos. Anthropic presentó Claude Opus 5 el 24 de julio a 5 $/25 $ por millón de tokens de entrada/salida, ofreciendo un rendimiento cercano al de Fable 5 por prácticamente el mismo coste que su predecesor. En el nivel medio, el panorama es más sensible al factor tiempo. Claude Sonnet 5, de Anthropic, tiene una tarifa de lanzamiento de 2,00 $ de entrada y 10,00 $ de salida por millón de tokens, precios que se mantendrán hasta el 31 de agosto de 2026, fecha a partir de la cual está previsto que suban a 3,00 $ y 15,00 $.

Esa ventana inicial es clave para tu comparativa. Durante ese periodo, Sonnet 5 y Terra de OpenAI compiten prácticamente a la par, pero después la diferencia podría ampliarse a favor de OpenAI en cuanto a precio. Claude suele costar más en su nivel más avanzado, y para muchos equipos la calidad de redacción y razonamiento justifica ese sobrecoste en cargas de trabajo concretas.

OpenAI frente al código abierto: la amenaza del nivel "gratuito"

Los modelos de pesos abiertos y con grandes descuentos marcan el suelo de precios de todo el mercado. DeepSeek V4 Pro, por ejemplo, tiene un precio de 0,435 $/0,87 $ por millón de tokens, gracias a un descuento promocional permanente del 75%. Y no se trata solo de ruido mediático: tienen tracción real. Los modelos chinos han captado el 46% del uso de tokens empresarial en EE. UU. en OpenRouter, llegando en ciertos momentos a superar a los modelos de origen estadounidense.

Pero "gratis" casi nunca es realmente gratis. Alojar un modelo open-source por tu cuenta implica pagar por GPUs, mantenimiento, disponibilidad, seguridad y el tiempo de ingeniería necesario para mantenerlo todo funcionando. El código abierto realmente gana en volúmenes muy altos, tareas sencillas o cuando hay restricciones estrictas de privacidad de datos. La API de OpenAI gana en velocidad de salida al mercado, fiabilidad, soporte y cero sobrecarga de DevOps. El coste oculto de un modelo "gratuito" es el equipo que necesitas para mantenerlo en marcha.

Tabla comparativa de precios competitivos

Proveedor

Modelo

Entrada $/1M

Salida $/1M

Contexto

Punto fuerte destacado

OpenAI

GPT-5.6 Luna

0,20 $

1,20 $

400K

El modelo de primer nivel más barato para alto volumen

OpenAI

GPT-5.6 Terra

2,00 $

12,00 $

1M

Caballo de batalla equilibrado para producción

OpenAI

GPT-4.1 Nano

0,10 $

0,40 $

1M

El modelo capaz más barato de OpenAI

Google

Gemini 3.1 Pro

2,00 $

12,00 $

1M

Contexto de 1M, razonamiento potente

Google

Gemini 3.6 Flash

1,50 $

7,50 $

1M

Término medio en relación precio-rendimiento

Google

Gemini 2.5 Flash-Lite

0,10 $

0,40 $

1M

La tarifa estándar más baja

Anthropic

Claude Opus 5

5,00 $

25,00 $

1M

Razonamiento y escritura premium

Anthropic

Claude Sonnet 5

2,00 $*

10,00 $*

1M

Gama media, precio de lanzamiento

DeepSeek

V4 Pro

0,435 $

0,87 $

Amplio

Precios con descuento agresivo

Mistral

Large 3

Variable

Variable

256K

Opción europea

*Precio introductorio de Claude Sonnet 5; el precio introductorio de Anthropic para Claude Sonnet 5 vuelve a la tarifa estándar de 3,00 $/1M de entrada y 15,00 $/1M de salida el 1 de septiembre de 2026. Ten en cuenta también que Mistral tiene un contexto máximo de 256K en Large 3 y Small 4, sin opción de 1M.

El veredicto: dónde se sitúa OpenAI en 2026

Tras los recortes, OpenAI es muy competitivo, aunque no siempre es la opción más barata. Gemini le gana en contexto largo y en las gamas más económicas, DeepSeek le gana en precio puro, y Claude cobra un extra por su calidad. La verdadera ventaja de OpenAI está en el conjunto: la confianza de marca entre mil millones de usuarios y dos millones de empresas, herramientas maduras, ajuste fino (fine-tuning), fiabilidad y soporte empresarial. La estrategia más práctica para la mayoría de los equipos es usar OpenAI como opción por defecto y, después, derivar cargas de trabajo concretas a alternativas cuando la relación precio-rendimiento las favorezca claramente.

6. Cómo maximizar tus ahorros en los costes de la API de OpenAI

La reducción del 80% es todo un regalo, pero los mayores ahorros siguen dependiendo de cómo uses la API. Las cuatro palancas contrastadas juntas hacen la mayor parte del trabajo. Las cuatro más importantes son el prompt caching (hasta un 90% de descuento en tokens de entrada repetidos), la Batch API (50% de descuento para tareas no urgentes), dirigir las tareas sencillas a un modelo mini en lugar de a un modelo completo, y recortar los prompts de sistema. Combinadas, estas medidas suelen reducir la factura de una API en producción entre un 50% y un 70% sin que la calidad del resultado se vea afectada.

Elige el modelo adecuado para cada tarea

Esta es, con diferencia, la palanca con mayor impacto. Dirigir las tareas sencillas a Luna o a un nivel mini en lugar de a un modelo insignia ahorra aproximadamente un 80% en esas llamadas. Crea un pequeño enrutador que clasifique las solicitudes entrantes y envíe cada una al modelo más económico capaz de gestionarla: clasificación y extracción a Luna o GPT-4o mini, generación general a Terra o GPT-4.1, y razonamiento genuino únicamente a o4-mini o o3. La mayoría de los equipos que auditan su tráfico descubren que gran parte de él nunca necesitó realmente un modelo premium.

Utiliza la compresión de prompts y la optimización de tokens

La compresión de prompts consiste en eliminar instrucciones redundantes, contexto repetido y relleno innecesario de tus prompts. Los prompts de sistema demasiado largos y el contexto duplicado se facturan en cada llamada, así que recortarlos genera un ahorro que se multiplica rápidamente a lo largo de millones de solicitudes. Existen herramientas y librerías para automatizar este proceso, y los ahorros habituales rondan entre el 20% y el 40%. Una revisión manual rápida, eliminando instrucciones repetidas y ajustando los ejemplos, a menudo ya permite recuperar una cantidad sorprendente por sí sola.

Aprovecha los precios del caché de entrada

Si tus llamadas comparten un prefijo estable, un prompt de sistema fijo, una base de conocimiento o un bloque de instrucciones largo, el prompt caching aplica descuentos considerables a esos tokens de entrada repetidos. Activa el prompt caching estructurando los prompts con el contenido estable al principio, y consigue hasta un 90% de descuento en los tokens de entrada repetidos. Es el truco con más impacto para pipelines de RAG y chatbots con prompts de sistema estáticos. Coloca todo lo constante al principio del prompt y la entrada variable del usuario al final, y la parte fija se procesará a una fracción del precio.

Usa la Batch API para cargas de trabajo que no sean en tiempo real

Todo lo que no necesite una respuesta instantánea debería pasar por la Batch API. Usa la Batch API para cargas de trabajo que no sean en tiempo real y consigue un 50% de descuento en todo. El procesamiento masivo de documentos, el enriquecimiento nocturno de datos, la generación de contenido a gran escala y el análisis offline son casos perfectos para esto. La contrapartida es la latencia, ya que los trabajos por lotes pueden tardar horas en devolver resultados, pero para tareas programadas eso no supone ningún problema, y el descuento del 50% está garantizado.

Monitoriza y audita tu consumo de tokens

No puedes reducir lo que no puedes ver. Usa el panel de uso de OpenAI junto con una herramienta de observabilidad de terceros para hacer seguimiento del gasto por función y por modelo. Establece límites de uso estrictos y alertas para evitar sustos en la factura, y detecta los culpables habituales: solicitudes duplicadas, ventanas de contexto descontroladas, reintentos que se acumulan y respuestas que nadie llega a leer. Un solo bucle mal configurado puede duplicar la factura sin que te des cuenta, así que las alertas son un seguro barato.

Paga de forma más inteligente por las suscripciones que rodean tu stack de API

Hay una palanca de ahorro que queda completamente fuera de tu código. La mayoría de los equipos combinan el uso de la API con suscripciones de consumo de pago: ChatGPT Plus o Pro para el equipo, más las licencias de Claude y Gemini, todo facturado mensualmente en dólares. Una tarjeta estándar añade una comisión por transacción en el extranjero de entre el 2% y el 3% a cada una de esas renovaciones, lo cual es dinero tirado a la basura.

Paga esas suscripciones con una tarjeta Bleap y pagarás en USD al cambio real, es decir, con un 0% de comisión por cambio de divisa, además de ganar un 20% de cashback fijo en las renovaciones de Claude, ChatGPT y Gemini. Es una Mastercard autocustodiada que puedes usar en cualquier sitio donde se acepte Mastercard, sin ninguna suscripción mensual propia. Para un equipo pequeño que gasta 200 € al mes en estas tres herramientas, ese 20% de cashback supone unos 480 € al año, sin contar el ahorro en comisiones de cambio de divisa. Ten en cuenta que el 20% de cashback se aplica específicamente a Claude, ChatGPT y Gemini. Para otras herramientas de IA facturadas en USD, la ventaja es el 0% de comisión por cambio de divisa.

Fine-tuning vs. ingeniería de prompts, ¿qué ahorra más?

A veces, la jugada más barata a largo plazo es hacer fine-tuning de un modelo más pequeño en lugar de saturar uno grande con prompts elaborados de few-shot en cada llamada. El fine-tuning tiene un coste inicial, pero si te permite sustituir un modelo insignia por una versión mini a gran escala, el ahorro continuo en inferencia puede amortizarlo rápidamente. El punto de equilibrio depende del volumen. Como referencia general, el fine-tuning suele tener sentido cuando manejas un volumen de tokens mensual alto y constante en una tarea repetitiva, en la que la ingeniería de prompts por sí sola te obliga a pagar precios de modelo insignia por un trabajo que un modelo mini ajustado podría hacer igual.

7. Qué significan estos recortes de precio para la industria de la IA: implicaciones más amplias

La IA se está convirtiendo en infraestructura, igual que antes le pasó a la computación en la nube

Existe un paralelismo histórico muy claro. En la década de 2010, AWS bajó los precios de EC2 y S3 decenas de veces a medida que la escala reducía los costes marginales, y la computación en la nube pasó de ser un servicio premium a convertirse en un producto básico. La inferencia de IA está siguiendo la misma trayectoria. El recorte del 80% en Luna, financiado gracias a mejoras de eficiencia, es un ejemplo de manual del efecto volante: más escala, más eficiencia, precios más bajos, más uso.

Lo razonable es esperar que los precios de las API punteras sigan bajando de forma notable año tras año hasta bien entrada la segunda mitad de esta década, porque las mismas fuerzas que provocaron este recorte siguen acelerándose. El artículo técnico de OpenAI presenta el trabajo de autooptimización como el inicio de un bucle de retroalimentación y no como un ejercicio puntual: sus ingenieros escriben que, a medida que los modelos mejoran y pueden trabajar de forma más autónoma, la capacidad de la propia empresa para acelerar las mejoras de eficiencia también se acelera, generando una dinámica compuesta. Para las startups nativas de IA, esto se traduce en menores barreras de entrada y una iteración más rápida cada año.

Democratización de la IA: ¿quién sale más beneficiado?

Los grandes ganadores son aquellos para quienes el precio era el obstáculo. Los desarrolladores independientes y las startups autofinanciadas ya pueden ejecutar funciones de IA en producción que antes tenían márgenes negativos. Los equipos en mercados emergentes y sensibles al precio, donde los presupuestos dejaban la IA puntera fuera de alcance, ahora pueden construir sobre los mismos modelos que cualquier otro. Y las empresas ya consolidadas pueden extender la IA a tareas internas de menor valor que nunca justificaban pagar precios premium. Cuando el nivel más económico y competente cuesta 0,20 $ por millón de tokens de entrada, el "es demasiado caro para probarlo" deja de ser una excusa para no construir.

La otra cara de la moneda es la presión sobre los márgenes en todo el sector. Este movimiento podría acelerar la adopción de modelos y el uso de la nube, pero también plantea dudas sobre si las mejoras de eficiencia pueden compensar los menores ingresos por token. Aun así, para los usuarios la dirección es claramente positiva: más capacidad, a precios más bajos y con mayor disponibilidad.

¿Aprovechas una IA más barata pero sigues pagando el precio completo en tus suscripciones? Bleap te ofrece 0% de comisiones cambiarias en la facturación de IA en USD y un 20% de cashback fijo en las renovaciones de Claude, ChatGPT y Gemini, con una Mastercard autocustodiada y sin suscripción propia. Consigue la tarjeta Bleap →

Conclusión: la IA más barata ya está aquí, así que págala con inteligencia

El titular es simple y real: OpenAI bajó el precio un 80% en GPT-5.6 Luna el 30 de julio de 2026, gracias a mejoras de eficiencia y empujado por la guerra de precios de IA más feroz hasta la fecha. Pero los matices importan igual. Ese 80% corresponde a un solo nivel, la mayor parte de tu ahorro viene del enrutamiento inteligente de modelos, el uso de caché y el procesamiento por lotes, y OpenAI ahora es muy competitivo sin ser siempre el más barato.

Para cualquiera que esté construyendo con IA en 2026, la estrategia está clara. Empieza con el modelo más barato que cumpla tus necesidades, enruta con criterio, usa caché de forma agresiva, agrupa todo lo que puedas en lotes y auditá sin descanso. Si haces esto, puedes reducir una factura de producción entre un 50% y un 70% además del recorte anunciado.

Después, cierra la última brecha. Las suscripciones de IA que envuelven tu stack de API, ChatGPT, Claude y Gemini, se facturan mensualmente en USD, y una tarjeta normal se lleva entre un 2% y un 3% en cada renovación. Págalas con Bleap en su lugar: 0% de comisiones cambiarias en la facturación en USD, un 20% de cashback fijo en esas tres herramientas, y una Mastercard autocustodiada sin suscripción mensual propia. Modelos más baratos más pagos más inteligentes: así es como conviertes la guerra de precios de 2026 en un beneficio real para tu bolsillo.

Preguntas frecuentes

¿De verdad OpenAI ha bajado los precios un 80%?

Sí, pero solo en un modelo concreto. OpenAI anunció una reducción del 20% en el precio de Terra y del 80% en el de Luna. Esa cifra del 80% se aplica a GPT-5.6 Luna, su nivel más barato y rápido, que pasó de 1$/6$ a 0,20$/1,20$ por millón de tokens de entrada/salida. El nivel insignia, Sol, no sufrió cambios.

¿Cuándo se produjo la bajada de precios de OpenAI?

El recorte se anunció el 30 de julio de 2026. OpenAI bajó el precio de su modelo GPT-5.6 Luna un 80% ese día, apenas tres semanas después del lanzamiento público completo de la familia GPT-5.6.

¿Cuál es el modelo más barato de OpenAI en 2026?

Dentro de la gama actual, GPT-5.6 Luna (0,20$/1,20$) y GPT-4.1 Nano (0,10$/0,40$) son las opciones más económicas con buenas prestaciones. GPT-4.1 Nano, con 0,10$ por millón de tokens de entrada, es uno de los modelos capaces más baratos que existen en el mercado. Cuál te conviene depende de tus necesidades de contexto y del tipo de tarea.

¿Por qué OpenAI ha recortado precios de forma tan agresiva?

El motivo oficial es la eficiencia, y el motivo de fondo es la competencia. OpenAI atribuyó las rebajas a las mejoras de eficiencia logradas durante el desarrollo interno de GPT-5.6, incluido el papel del propio modelo en la optimización del software de producción y en la mejora de la decodificación especulativa. Al mismo tiempo, rivales como Anthropic y Google lanzaron modelos competitivos semanas antes, y los modelos chinos de bajo coste se han hecho con una parte importante del mercado empresarial.

¿Es OpenAI ahora más barato que Google Gemini o Anthropic Claude?

Depende del nivel. Gemini suele ser más barato en contexto largo y en sus tarifas de entrada, con precios desde alrededor de 0,10$/0,40$ en su nivel más económico. Claude, por su parte, suele tener un precio superior, con Opus 5 a 5$/25$. El Luna de OpenAI, a 0,20$/1,20$, resulta muy competitivo para trabajos de gran volumen, pero ningún proveedor es el más barato en todas las categorías.

¿Cuánto puedo ahorrar realmente en mi factura de la API de OpenAI?

Más allá del recorte de precio destacado, la optimización disciplinada es la que hace el trabajo pesado. Combinados, el prompt caching, la Batch API, el enrutamiento de modelos y la reducción de los prompts del sistema suelen recortar entre un 50% y un 70% la factura de una API en producción sin afectar a la calidad de los resultados. La palanca individual más potente es dirigir las tareas sencillas a un nivel más barato.

¿Qué son los "tokens de razonamiento" y por qué cuestan más?

Los modelos de razonamiento generan un razonamiento interno oculto que se paga a las tarifas de salida. Estos modelos facturan los tokens de razonamiento interno a precio de tokens de salida, por lo que el coste real puede llegar a ser de 3 a 10 veces el precio base según la complejidad de la tarea. Por eso una respuesta de o3 puede acabar costando mucho más de lo que sugiere su precio anunciado, y por eso o4-mini suele ser la opción de razonamiento con mejor relación calidad-precio.

¿Cómo ayuda Bleap a reducir los costes de la IA?

Bleap no vende modelos de IA. Es una empresa fintech de tarjetas que cambia la forma en que pagas tus suscripciones de IA. Los planes de IA se facturan mensualmente en USD, y la mayoría de las tarjetas añaden una comisión de cambio de divisa del 2% al 3% en cada renovación. Con Bleap pagas en USD al tipo de cambio real, sin comisiones de cambio, y recibes un cashback plano del 20% en las renovaciones de Claude, ChatGPT y Gemini. Es una Mastercard autocustodiada, sin suscripción mensual propia. El cashback del 20% se aplica solo a esas tres herramientas; para el resto de herramientas de IA facturadas en USD, la ventaja es la ausencia total de comisión de cambio.

¿Seguirán bajando los precios de la IA en 2026 y después?

La tendencia apunta claramente en esa dirección. Los precios de los modelos punteros llevan cayendo en todo el sector desde principios de 2025, impulsados por una combinación de mejoras en la eficiencia de inferencia, avances en los modelos de peso abierto y movimientos competitivos deliberados. Con estas ganancias de eficiencia acumulándose y una competencia cada vez más intensa, se esperan más recortes en todo el sector.

Una forma más inteligente de gastar, enviar, ganar y operar

Imagen de la sección Puntos Clave
  • Artificial Inteligence

Artículos relacionados