El precio de la inteligencia se desploma: qué casos de uso salen ahora a cuenta
Hay una conversación sobre IA que casi nadie tiene en las PYMEs y es la única que decide si un proyecto sigue vivo a los seis meses: cuánto cuesta operarlo cada mes. La buena noticia es que ese número lleva medio año cayendo en picado, y julio ha traído el recorte más claro hasta ahora. Vamos a hacer las cuentas de verdad.
Lo que cambió en julio
El 24 de julio Anthropic lanzó Claude Opus 5. El dato que importa no es el nombre ni la puntuación en los benchmarks, sino la etiqueta de precio: 5 dólares por millón de tokens de entrada y 25 por millón de salida. Exactamente la mitad de lo que cuesta Claude Fable 5, el modelo más capaz del catálogo, que está en 10 y 50.
En paralelo, Google movió ficha con Gemini 3.6 Flash orientado explícitamente a abaratar el coste por token de los agentes, que es donde el gasto se dispara porque un agente encadena muchas llamadas para una sola tarea.
Y hay una fecha que conviene apuntar: el precio de introducción de Claude Sonnet 5, que está en 2 y 10 dólares por millón, termina el 31 de agosto de 2026. A partir del 1 de septiembre pasa a 3 y 15. Si tienes volumen y estabas pensando en migrar, el calendario importa.
Las tres palancas que casi nadie usa
El precio de lista es solo el punto de partida. Hay tres mecanismos que reducen la factura de forma sustancial y que en la mayoría de implantaciones que revisamos no están activados.
1. Cacheo de prompts: hasta un 90 por ciento menos
Si tus peticiones comparten una parte fija (las instrucciones del sistema, un catálogo de productos, un manual interno), esa parte se puede cachear. La lectura desde caché cuesta aproximadamente una décima parte del precio normal de entrada. La contrapartida es que escribir en caché cuesta un 25 por ciento más de lo normal, así que el punto de equilibrio está en dos peticiones: a partir de la segunda que reutiliza el mismo prefijo, ya estás ahorrando.
El detalle que rompe el cacheo en la práctica: basta con meter la fecha y hora actual, un identificador de sesión o un dato variable al principio de las instrucciones para invalidarlo todo. Lo estable va primero, lo que cambia va al final.
2. Procesamiento por lotes: 50 por ciento menos
Si el trabajo no necesita respuesta inmediata (clasificar el correo de la noche, resumir los tickets del día, enriquecer una base de datos), la API de lotes lo hace al 50 por ciento del precio. La mayoría de tareas completa en menos de una hora. Aplicado a Opus 5, eso deja la entrada en 2,50 y la salida en 12,50 por millón.
3. Escalonar el modelo según la tarea
El error más caro y más común es usar el modelo más potente para todo. Clasificar un correo entrante como factura, consulta o spam no necesita el mismo motor que redactar una propuesta comercial. Reservar el modelo grande para lo que de verdad lo pide, y usar uno menor para el trabajo rutinario, suele recortar la factura más que cualquier negociación de tarifas.
Las cuentas de un caso real
Imagina la clasificación y respuesta inicial de 2.000 correos al mes. Cada uno consume del orden de 1.500 tokens de entrada (instrucciones más el correo) y 300 de salida.
- Sin optimizar, con el modelo más capaz: son 3 millones de tokens de entrada y 0,6 de salida. A 10 y 50 dólares, unos 60 dólares al mes.
- Con Opus 5 a mitad de precio: baja a unos 30 dólares.
- Añadiendo cacheo de las instrucciones y lotes nocturnos: se queda en el entorno de 8 a 10 dólares al mes.
El mismo caso de uso, sin tocar una línea de la lógica de negocio, pasa de 60 a menos de 10. Esa diferencia es la que convierte un piloto que no salía a cuenta en un proceso que se queda.
Qué revisar en tu empresa
La conclusión práctica no es cambiar de proveedor corriendo. Es sentarse media hora con los casos de uso que descartaste hace seis meses por caros y volver a hacer los números con los precios de hoy. En nuestra experiencia, entre un tercio y la mitad de esos descartes cambian de signo.
Y para lo que ya tienes en producción: comprueba si estás cacheando, si hay trabajo que podría ir por lotes, y si estás usando un modelo caro para tareas que no lo necesitan.
Conclusión
El coste de operar IA ha dejado de ser la barrera que era. Lo que sigue siendo barrera es no medirlo: sin un coste por operación calculado, no hay forma de saber si un caso de uso escala o si te va a explotar la factura al triplicar el volumen. Empieza por ahí.
Fuentes citadas: tarifas oficiales de Anthropic para Claude Opus 5, Claude Sonnet 5 y Claude Fable 5 (agosto 2026); documentacion oficial sobre cacheo de prompts y API de lotes; cobertura de prensa sobre el lanzamiento de Gemini 3.6 Flash (4-ago-2026).
Sigue leyendo
¿Cuánto te cuesta realmente cada automatización?
30 minutos para calcular el coste por operación de tus casos de uso y ver cuáles cambian de viabilidad con los precios actuales.
Agendar Auditoría Gratuita