Cómo hacer tu stack de IA portable sin reescribir tu lógica de negocio

La suspensión de Claude Fable 5 sigue activa cuando escribimos estas líneas (a 22 de junio son ya 10 días sin acceso, según el statement oficial de Anthropic). Es el momento perfecto para hacer algo que probablemente habías postergado: construir una arquitectura multi-proveedor que sobreviva a cualquier caída. Esta es la guía práctica con los patrones que ya usamos con nuestros clientes.

El problema real no es la caída, es la dependencia

La mayoría de empresas que usan IA en producción lo hacen contra una sola API. Esto es legítimo cuando el proveedor es estable y los modelos son intercambiables. Pero deja de serlo cuando:

  • El proveedor cae por mantenimiento o por una incidencia global (ha pasado con OpenAI, Anthropic y Google en los últimos 12 meses).
  • El proveedor sube precios de forma agresiva (caso clásico: GPT-4 Turbo a GPT-4o).
  • El gobierno de un país suspende el acceso a un modelo (lo que vimos hace 10 días con Fable 5).
  • El proveedor descontinúa un modelo y no avisa con tiempo razonable.

La portabilidad no es paranoia. Es ingeniería básica de cualquier sistema crítico. La buena noticia es que, en IA, es más fácil de implementar que en otros stacks.

El patrón: gateway multi-proveedor

La arquitectura más usada en producción es la de un gateway que abstrae las llamadas a uno o varios proveedores LLM. Tu aplicación habla con el gateway, y el gateway decide qué proveedor usar para cada llamada.

Hay tres implementaciones maduras en 2026:

  • LiteLLM (open source, Python): el más usado en PYMEs. 100+ proveedores soportados, drop-in replacement para OpenAI API, enrutamiento por modelo, retry automático, fallbacks.
  • OpenRouter (SaaS): si prefieres no operar infraestructura. Modelo de "un punto de entrada para todos los modelos" con pricing unificado. Útil para experimentación rápida.
  • Tu propia implementación (~200 líneas): si necesitas control total o tienes requisitos de compliance. Una clase que envuelve cada llamada con retry y fallback a proveedores secundarios.
"Si tu código dice literalmente `from openai import OpenAI`, tienes una dependencia dura. Si dice `from gateway import ChatCompletion`, tienes una opción." — patrón de diseño recomendado por nuestros clientes enterprise.

Cuándo usar un tercer proveedor open-weight

Para casos donde la latencia crítica o el coste manda, añadimos una tercera línea de defensa: un modelo open-weight autoalojado o vía Mistral. Esto cubre escenarios donde ambos proveedores principales caen o el coste se dispara.

  • Mistral (europeo, GDPR-friendly) — la opción por defecto para PYMEs europeas. Modelos como Codestral 25.08 son excelentes para casos de código y razonamiento.
  • Qwen (Alibaba) — competitivo en benchmarks, especialmente en chino y multilingual.
  • Llama 4 o su sucesor Muse Spark (Meta) — si prefieres un modelo con gran comunidad open-weight.

Plan de acción para las próximas 2 semanas

Si tienes automatizaciones críticas en producción hoy, este es el orden de operaciones que recomendamos:

  • Semana 1: Inventario. Lista todas las llamadas a APIs LLM en tu código. Identifica cuáles son críticas y cuáles son experimentales.
  • Semana 1: Elige y despliega un gateway (LiteLLM es el más práctico para empezar).
  • Semana 2: Migra las llamadas críticas al gateway. Mantén compatibilidad con tu API actual durante la transición.
  • Semana 2: Configura un segundo proveedor activo (ej. Anthropic si usabas GPT, o viceversa) y prueba el failover.
  • Trimestre siguiente: Evalúa un tercer proveedor open-weight para casos no sensibles.

Conclusión

La suspensión de Fable 5 fue el aviso. Multi-proveedor es la nueva baseline de cualquier sistema que dependa de LLMs frontier. No es un coste evitable: es el seguro mínimo. Si quieres que montemos el gateway para tu caso concreto, agenda 30 minutos con nosotros y vemos qué proveedor encaja con tu stack.


Fuentes citadas: documentación oficial de LiteLLM, OpenRouter, Mistral. Patrones basados en arquitecturas desplegadas por SoulThinker en clientes enterprise.

Sigue leyendo

Pasa a la acción

¿Tu stack es portable hoy?

30 minutos para auditar tus dependencias de IA y diseñar un plan realista de portabilidad para tu caso.

Agendar Auditoría Gratuita
WhatsApp