jueves, 30 de julio de 2026 · Edición #173
miuranews

El briefing diario de inteligencia artificial en español

Modelos

El precio de entrada engaña: el índice Miuranews del coste real de las APIs de IA

Entre la API de IA más cara y la más barata hay 193 veces de diferencia. Y el precio de entrada, el que todo el mundo cita, ordena mal el ranking en 6 de 14 casos.

Gonzalo
Gonzalo· Fundador
· 6 min de lectura
Precios de Modelos

Las claves

  • El índice Miuranews sitúa el coste real entre 0,154 € y 29,66 € por unidad de trabajo: una diferencia de 193 veces dentro del mismo mercado.
  • La salida representa entre el 40% (DeepSeek-V4) y el 73,5% (Gemini 3.5 Flash-Lite) del coste total. Ordenar por precio de entrada cambia 6 de las 14 posiciones del ranking.
  • Grok 4.5, Gemini 3.6 Flash y Mistral Medium 3.5 cuestan exactamente lo mismo —2,64 €— pese a tener precios de lista distintos.

Si estás decidiendo qué modelo de IA meter en producción y comparas por el precio de entrada, estás mirando el número que menos importa. En una carga de trabajo realista, el coste de salida se lleva entre el 40% y el 73,5% de la factura según el modelo, y eso reordena el ranking por completo: seis de los catorce modelos que hemos analizado cambian de posición cuando se compara por coste real en lugar de por precio de entrada.

Para poder comparar hemos construido un índice: el coste en euros de procesar una unidad de trabajo estándar, definida como 750.000 tokens de entrada más 250.000 de salida. Es una proporción 3:1 que se aproxima a lo que consume un asistente conversacional o un flujo con contexto amplio y respuestas cortas. Los precios de lista son públicos y verificables; la unidad de trabajo, la ponderación y la conversión a euros son cálculo nuestro.

El resultado es un abanico brutal. Procesar esa unidad cuesta 0,154 € con el modelo más barato del mercado y 29,66 € con el más caro: 193 veces más. No estamos comparando un modelo de juguete con uno serio, sino dos productos que compiten por el mismo tipo de tarea. Ese rango es la primera señal de que este mercado todavía no tiene un precio de referencia.

La salida es donde está la factura

El dato más útil del índice no es el ranking, sino la proporción entre lo que cobra cada proveedor por leer y por escribir. Varía muchísimo. Hay modelos donde la salida cuesta el doble que la entrada y otros donde cuesta más de ocho veces más.

Esa ratio decide quién gana. El caso más claro es un modelo que cobra 2 dólares por millón de tokens de entrada frente a otro que cobra 1,50: parece un 33% más caro. Pero el primero solo cobra tres veces más por la salida y el segundo cinco veces más, así que ambos acaban costando exactamente lo mismo, 2,64 € por unidad de trabajo. Y un tercero, con precios de lista idénticos al segundo, aterriza en la misma cifra. Tres modelos de tres proveedores distintos, empatados al céntimo, y ninguna comparativa por precio de entrada lo habría detectado.

El movimiento contrario también existe. Un modelo ligero que aparece segundo por precio de entrada cae al cuarto puesto en coste real, porque su salida cuesta 8,3 veces su entrada: la ratio más desequilibrada de toda la tabla. Si tu caso de uso genera respuestas largas —resúmenes, redacción, generación de código—, ese modelo es bastante peor negocio de lo que aparenta.

El caché ahorra menos de lo que promete

Casi todos los proveedores han incorporado precios de caché: si repites el mismo prefijo de contexto, esos tokens se cobran con un descuento que en algunos casos llega al 90%. El titular suena espectacular. El efecto real, mucho menos.

Hemos calculado un segundo escenario en el que el 75% de los tokens de entrada llegan cacheados, que es una tasa de acierto optimista pero alcanzable en un asistente con instrucciones fijas y documentos repetidos. El ahorro sobre el coste total se queda entre el 17,9% y el 31,9% en los modelos de los grandes proveedores. Solo en los modelos chinos, cuyo precio de caché es casi simbólico, el ahorro llega al 44%.

La explicación es aritmética: el descuento del 90% se aplica sobre la entrada, y la entrada es la parte pequeña de la factura. Descontar el 90% del 40% del coste da un 36% de ahorro máximo teórico, y solo si absolutamente todo entra por caché. El caché es una optimización sensata, no un cambio de categoría de precio.

Dos avisos importantes aquí. El primero: dos de los modelos de la tabla no publican precio de caché, así que aparecen como no disponible y su coste con caché no es comparable. El segundo: algunos proveedores cobran también por escribir en la caché, un sobrecoste que nuestro cálculo no incluye porque en un uso sostenido se amortiza, pero que penaliza a quien haga peticiones esporádicas.

Las letras pequeñas que multiplican la factura

Tres advertencias que el precio de portada no cuenta.

El contexto largo es un multiplicador silencioso. Al menos dos de los modelos analizados aplican una tarifa distinta cuando la petición supera un umbral de tamaño, y en un caso esa tarifa se aplica a todos los tokens de la petición, no solo a los que exceden el límite. Un modelo que cuesta 2,64 € en contexto corto pasa a 5,27 € en contexto largo. Otro salta de 3,95 € a 6,59 €. Si tu aplicación mete documentos grandes, el precio que has presupuestado no es el que vas a pagar.

El procesamiento por lotes es la palanca de ahorro más grande y la menos comentada. Tres de los grandes proveedores aplican un 50% de descuento sobre todas las tarifas si aceptas que la respuesta llegue de forma diferida. Es la mitad de la factura a cambio de latencia, y para tareas de fondo —clasificación, enriquecimiento de datos, generación en bloque— no hay razón para no usarlo.

Y los precios se mueven. Uno de los modelos de la tabla tiene ya anunciada una subida a partir del 1 de septiembre de 2026 que elevará su coste real un 50%, de 3,52 € a 5,27 €. Cualquier cálculo de costes a doce meses hecho sobre las tarifas de hoy tiene una fecha de caducidad conocida.

El "pero" del índice

Este índice mide precio, no valor. Un modelo 193 veces más barato no es 193 veces peor, pero tampoco es equivalente: no hemos cruzado estos datos con ningún benchmark de calidad, y hacerlo requiere decisiones metodológicas discutibles que merecen una pieza aparte. Tampoco medimos velocidad, límites de peticiones, disponibilidad regional ni condiciones de tratamiento de datos, que en Europa pesan tanto como el precio.

Hay además un detalle que nos chirría y que preferimos señalar antes que esconder: los precios de caché de los dos modelos chinos guardan proporciones muy distintas entre sí respecto a su precio de entrada —50 veces menos en uno, 120 veces menos en otro— sin que la documentación explique el motivo. Los hemos usado tal cual figuran, pero es el dato de toda la tabla del que menos nos fiamos.

Metodología

Hemos recogido los precios oficiales de entrada, caché y salida de las páginas de tarifas de OpenAI, Anthropic, Google, xAI, Mistral y DeepSeek el 30 de julio de 2026, tomando siempre la tarifa estándar y, cuando existen tramos por tamaño de contexto, la de contexto corto. Sobre esos precios calculamos el coste de una unidad de trabajo definida por nosotros: 750.000 tokens de entrada más 250.000 de salida, una proporción 3:1 que aproxima un uso conversacional con contexto amplio. La conversión a euros usa el tipo de cambio de referencia del Banco Central Europeo del 29 de julio de 2026, 1 euro igual a 1,1380 dólares. El escenario con caché asume que el 75% de los tokens de entrada son aciertos de caché y no contabiliza los costes de escritura en caché, lo que lo hace ligeramente optimista. Los precios de lista son dato de fuente; la unidad de trabajo, la ponderación, la tasa de acierto de caché y todos los importes en euros son cálculo propio de Miuranews.

Índice Miuranews de coste real de las APIs de IA. Coste de 1 unidad de trabajo = 750.000 tokens de entrada + 250.000 de salida. Tarifas estándar y contexto corto a 30-07-2026. Conversión a euros al tipo BCE de 29-07-2026 (1 € = 1,1380 $).
# Proveedor Modelo DATO DE FUENTE — precio de lista ($/M tokens) CÁLCULO PROPIO DE MIURANEWS
Entrada Caché Salida IMC (€/unidad) IMC con caché 75% (€) Peso de la salida
1DeepSeekDeepSeek-V4-Flash0,1400,00280,280,1540,08640,0 %
2DeepSeekDeepSeek-V4-Pro0,4350,00360,870,4780,26540,0 %
3MistralMistral Large 30,50n/d1,500,659n/d50,0 %
4GoogleGemini 3.5 Flash-Lite0,300,032,500,7470,61373,5 %
5OpenAIGPT-5.6 Luna0,500,053,000,9890,76666,7 %
6AnthropicClaude Haiku 4.51,000,105,001,7571,31362,5 %
7xAIGrok 4.5 (ctx. corto)2,000,306,002,6361,79650,0 %
8GoogleGemini 3.6 Flash1,500,157,502,6361,96962,5 %
9MistralMistral Medium 3.51,50n/d7,502,636n/d62,5 %
10AnthropicClaude Sonnet 5 (hasta 31-08-2026)2,000,2010,003,5152,62562,5 %
11GoogleGemini 3.1 Pro (≤200k)2,000,2012,003,9543,06566,7 %
12OpenAIGPT-5.6 Sol2,500,2515,004,9433,83166,7 %
13AnthropicClaude Opus 55,000,5025,008,7876,56362,5 %
14OpenAIGPT-5.5 Pro15,00n/d90,0029,657n/d66,7 %

IMC = Índice Miuranews de Coste: euros por unidad de trabajo (750.000 tokens de entrada + 250.000 de salida). IMC con caché asume que el 75% de los tokens de entrada son aciertos de caché y no incluye costes de escritura en caché. Peso de la salida = porcentaje del IMC atribuible a los tokens de salida. Las tres columnas de la derecha son cálculo propio de Miuranews; las tres de precios son dato de fuente. «n/d»: el proveedor no publica precio de caché para ese modelo. Grok 4.5 y Gemini 3.1 Pro tienen tarifas superiores para contexto largo no reflejadas aquí. Claude Sonnet 5 sube a 3/15 $ el 1 de septiembre de 2026 (IMC 5,27 €).

Fuentes

Enlaces a las fuentes originales en las que se apoya esta noticia. Contrasta cada dato en su origen.

EtiquetasOpenAIAnthropicGoogle DeepMindDeepSeek

Preguntas frecuentes

¿Por qué comparáis con 750.000 tokens de entrada y 250.000 de salida en lugar de mitad y mitad?
Porque una proporción 3:1 se acerca más a un uso real. En un asistente conversacional o en un sistema con recuperación de documentos, el modelo lee mucho contexto —instrucciones, historial, fragmentos recuperados— y escribe respuestas comparativamente cortas. Una ponderación 50/50 exageraría el peso de la salida y penalizaría de más a los modelos con tarifa de escritura alta. Si tu caso genera respuestas largas, como redacción o generación de código, el coste real será mayor que el del índice y las diferencias entre modelos se ampliarán todavía más.
¿Significa esto que el modelo más barato es el que debo elegir?
No. El índice mide precio, no calidad, velocidad, límites de peticiones ni condiciones de tratamiento de datos, que en Europa suelen ser determinantes. Un modelo 193 veces más barato no es 193 veces peor, pero tampoco es intercambiable. La utilidad del índice es otra: saber cuánto estás pagando de más por la opción que elijas, para poder decidir si esa diferencia se justifica con la calidad que obtienes en tu caso concreto.
Si el caché descuenta hasta un 90%, ¿por qué el ahorro real es solo del 20% o el 30%?
Porque el descuento se aplica únicamente a los tokens de entrada, y la entrada representa entre el 27% y el 60% del coste total según el modelo. Aunque el 100% de la entrada llegara cacheada con un 90% de descuento, el ahorro máximo sobre la factura rondaría el 36% en el mejor de los casos. Además, algunos proveedores cobran por escribir en la caché, un sobrecoste que este cálculo no incluye y que reduce aún más el ahorro en usos poco repetitivos.
Gonzalo

GonzaloFundador

Madrileño enganchado a la tecnología desde pequeño. Trabajo en finanzas pero la inteligencia artificial es lo que me quita el sueño. Creé Miuranews para seguirla de cerca y contarla en español sin hype.

Todos sus artículos →

◈ Asistente Miuranews

Pregunta sobre este artículo

Respuestas basadas en esta pieza y en el archivo de Miuranews. Sin inventar: si no está cubierto, te lo dice.

Prueba una

Experimento en beta · No sustituye a la lectura del artículo