Cloudflare AI Gateway: cómo almacenar en caché, limitar peticiones y controlar los costes de las llamadas a APIs de LLM (Guía 2026)

Si tu SaaS lanzó una función de LLM este año, tu factura de OpenAI o Anthropic es ahora una partida por la que pregunta el departamento financiero, y varía con un uso que no controlas del todo. El primer impulso es construir internamente un proxy de caché y un tope de gasto. Antes de dedicar un sprint a ello, Cloudflare AI Gateway te ofrece casi todo eso cambiando una sola línea de la URL base de tu API.

Cloudflare AI Gateway es un proxy que se sitúa entre tu aplicación y proveedores de LLM como OpenAI, Anthropic y Google. Enrutas las llamadas al modelo a través de él para obtener caché, limitación de peticiones, reintentos, límites de gasto y registro por petición, sin cambiar el SDK de tu proveedor. Las funciones básicas son gratuitas y añaden, como mucho, decenas de milisegundos de latencia.

Esta guía cubre qué hace, cómo la caché y los límites de peticiones recortan el coste real, cómo configurarlo, cómo se compara con construir tu propio proxy o usar herramientas como LiteLLM y Helicone, y cuándo no es la opción adecuada.

¿Qué es Cloudflare AI Gateway?

Cloudflare AI Gateway es un proxy de peticiones gestionado para el tráfico de modelos de IA. En lugar de que tu aplicación llame directamente a api.openai.com o api.anthropic.com, llama a un endpoint de gateway en el edge de Cloudflare, que reenvía la petición al proveedor y devuelve la respuesta. Como cada llamada pasa por un único punto, obtienes un punto de control que antes no tenías.

Ese punto de control hace cinco cosas que merece la pena tener en cuenta:

  • Caché, para que las peticiones idénticas o similares se sirvan sin volver a llamar al proveedor.
  • Limitación de peticiones, para que un bucle descontrolado o un cliente abusivo no pueda acumular miles de llamadas.
  • Reintentos y mecanismos de respaldo, para que un tiempo de espera agotado del proveedor no se manifieste como una función que falla.
  • Límites de gasto y de peticiones, para que el gateway deje de servir en cuanto supere un umbral que tú definas.
  • Registro y analíticas, para que puedas ver el coste, la latencia y el recuento de tokens por petición en lugar de leer una factura mensual.

Es compatible con los principales proveedores, incluidos OpenAI, Anthropic, Google AI Studio, Groq y Mistral, además del propio Workers AI de Cloudflare. No necesitas alojar tu aplicación en Cloudflare para usarlo. El gateway es agnóstico respecto al proveedor y funciona con un backend estándar en cualquier lugar.

¿Cómo reduce la caché tu factura de LLM?

La caché es donde la mayoría de los equipos encuentran el ahorro más rápido, porque un acierto de caché cuesta cero tokens del proveedor y devuelve la respuesta en decenas de milisegundos en lugar del uno a varios segundos que tarda una llamada al modelo. El gateway almacena una respuesta indexada según la petición y, cuando llega de nuevo la misma petición, reproduce la respuesta guardada.

Cuánto ahorras depende por completo de lo repetitivo que sea tu tráfico. Un asistente de soporte que responde las mismas preguntas sobre el producto, un endpoint de clasificación que puntúa entradas similares o una función de “resume este documento” ejecutada sobre los mismos documentos verán tasas de repetición altas. En cargas de trabajo como estas, entre el 20 y el 40 por ciento de las peticiones suelen ser casi duplicadas, y la caché elimina de golpe esa parte de la factura.

Sé honesto con el caso contrario. Si cada prompt arrastra un contexto largo y específico del usuario, como un chat que incluye todo el historial de la conversación, las tasas de acierto de caché son bajas y la caché de coincidencia exacta apenas ayuda. Cloudflare también ofrece una caché basada en similitud, que empareja peticiones parecidas pero no idénticas. Eso eleva las tasas de acierto en consultas parafraseadas, pero puede devolver una respuesta que era correcta para una pregunta ligeramente distinta, así que prueba la exactitud con tráfico real antes de activarla para respuestas de cara al usuario.

Gráfico que compara el tráfico de LLM de alta y baja repetición y cómo responde cada uno a la caché

¿Cómo protegen tu presupuesto la limitación de peticiones y los topes de gasto?

Las facturas de LLM más temibles no vienen de un uso estable. Vienen de un bucle de reintentos que dispara diez mil llamadas durante la noche, de una clave de API filtrada o de un lanzamiento que llega más lejos de lo previsto. La limitación de peticiones y los topes de gasto son las protecciones frente a eso.

La limitación de peticiones te permite poner un tope de peticiones por ventana de tiempo, por gateway. Ajústalo justo por encima de tu pico real y un proceso descontrolado chocará con el techo en lugar de con el proveedor. Los límites de gasto y de peticiones van más allá: en cuanto un gateway supera el número de peticiones o el presupuesto que configuraste, deja de reenviar llamadas hasta que la ventana se reinicia. Eso convierte un riesgo sin límite en un máximo conocido.

El compromiso es real, así que configúralos con criterio. Un tope demasiado ajustado estrangula a usuarios legítimos durante un pico genuino, algo que para ellos se percibe como una caída del servicio. Basa las cifras en tu tráfico pico real más un margen, y avisa cuando se acerque al límite en lugar de solo cuando lo supere, para que una persona pueda reaccionar antes de que se rechace a usuarios reales.

Flujo de decisión que muestra qué le ocurre a una factura de LLM descontrolada con y sin un límite de peticiones y un tope de gasto

¿Cómo se configura Cloudflare AI Gateway?

La configuración es deliberadamente mínima. Creas un gateway en el panel de Cloudflare y luego apuntas el SDK de tu proveedor actual a la URL del gateway. Sin cambiar de SDK, sin reescribir los puntos donde haces las llamadas.

Los pasos:

  1. En el panel de Cloudflare, abre AI y luego AI Gateway, y crea un gateway. Anota su ID de cuenta y su ID de gateway.
  2. Cambia la URL base que usa tu SDK por el endpoint del gateway para ese proveedor.
  3. Opcionalmente, activa la caché, establece un TTL por defecto y configura los límites de peticiones o de gasto en los ajustes del gateway.
  4. Despliega y vigila la pestaña de analíticas para ver la tasa de aciertos de caché, el coste y la latencia.

Este es el único cambio que hace el enrutamiento, usando como ejemplo el SDK de OpenAI para Node:

import OpenAI from "openai";

// Point the existing SDK at the gateway. Nothing else changes.
const client = new OpenAI({
  apiKey: process.env.OPENAI_API_KEY,
  baseURL:
    "https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai",
});

const completion = await client.chat.completions.create({
  model: "gpt-4o-mini",
  messages: [{ role: "user", content: "Summarize this ticket." }],
});

La caché se puede activar para todo el gateway, o controlarse por petición mediante una cabecera, lo cual resulta útil cuando algunas respuestas se pueden cachear con seguridad y otras deben mantenerse actualizadas. Estableces el tiempo de vida en segundos:

const completion = await client.chat.completions.create(
  {
    model: "gpt-4o-mini",
    messages: [{ role: "user", content: "Summarize this ticket." }],
  },
  {
    headers: {
      "cf-aig-cache-ttl": "3600",
    },
  }
);

Esa es toda la integración para un proveedor. Anthropic, Google y los demás siguen el mismo patrón con su propio segmento de ruta en la URL del gateway. Si tu aplicación ya usa una sustitución de baseURL en línea para el entorno de staging, esto encaja en el mismo lugar de tu configuración.

Cloudflare AI Gateway frente a construir tu propio proxy

No necesitas estrictamente Cloudflare para nada de esto. Un proxy de caché es un patrón conocido, y herramientas como LiteLLM y Helicone cubren un terreno que se solapa. La elección correcta depende de cuánta lógica de enrutamiento necesites y de si quieres gestionar tú mismo la infraestructura. Así se comparan las principales opciones.

Opción
Ideal para
Caché
Límite de peticiones y topes de gasto
Autoalojado
Opción

Cloudflare AI Gateway

Ideal para

Control rápido, sin infraestructura que gestionar

Caché

Exacta y por similitud

Límite de peticiones y topes de gasto

Autoalojado

No, edge gestionado

Opción

LiteLLM

Ideal para

Enrutamiento multiproveedor y lógica de respaldo

Caché

Sí, con Redis

Límite de peticiones y topes de gasto

Autoalojado

Opción

Helicone

Ideal para

Observabilidad y analíticas ante todo

Caché

Límite de peticiones y topes de gasto

Limitado

Autoalojado

En la nube o autoalojado

Opción

Proxy a medida

Ideal para

Una regla que ningún producto cubre

Caché

Constrúyelo

Límite de peticiones y topes de gasto

Constrúyelo

Autoalojado

Para la mayoría de los equipos del mercado medio, la respuesta honesta es que Cloudflare AI Gateway cubre el 80 por ciento de los casos con el menor esfuerzo: caché, protecciones y visibilidad por petición con un cambio de una sola línea y sin servidores que gestionar. Recurre a LiteLLM cuando necesites un enrutamiento multiproveedor real, cadenas de respaldo entre modelos o una interfaz unificada para muchos proveedores. Recurre a un proxy a medida solo cuando tengas una regla que ningún producto cubre y el tiempo de ingeniería para mantenerlo. Construir el tuyo propio para ahorrarte la cuota de un servicio gestionado suele costar más en mantenimiento de lo que ahorra.

Cuándo Cloudflare AI Gateway es la elección equivocada

Ninguna herramienta está libre de compromisos, y un gateway es una dependencia más en la ruta de tus peticiones. Prescinde de él, o piénsatelo dos veces, en estos casos.

  • Tus prompts son casi todos únicos. Si la caché no puede ayudar y ya cuentas con observabilidad, el gateway añade un salto a cambio de poca ganancia.
  • Tienes normas estrictas de residencia de datos o de privacidad. El registro de peticiones y respuestas puede capturar prompts que contienen datos personales. Confirma qué se registra y dónde antes de activar el registro completo, y mantén los campos sensibles fuera de los prompts.
  • Necesitas un enrutamiento complejo hoy. El gateway no es un enrutador completo. Si tu necesidad principal es el balanceo de carga ponderado o el respaldo entre cinco proveedores, un enrutador específico encaja mejor.
  • No puedes aceptar otra dependencia externa. El edge de Cloudflare es fiable, pero sigue siendo un salto entre tú y el proveedor. Para un sistema con restricciones estrictas de proveedor único, puede que no supere la revisión.

Ninguno de estos es motivo para evitarlo por defecto. Son motivos para decidir a propósito en lugar de añadirlo porque es fácil.

Cómo controla Redwerk los costes de LLM en producción

La mayoría de los problemas de coste de LLM no son problemas del modelo. Son decisiones de arquitectura tomadas antes de que nadie vigilara la factura: sin capa de caché, sin techo de gasto, prompts que arrastran más contexto del que la tarea necesita y sin visibilidad por función de lo que cuesta realmente cada llamada.

Redwerk cuenta con ingenieros que ya han lanzado sobre el edge de Cloudflare y los principales SDKs de LLM, así que el gateway, una estrategia sensata de claves de caché y las protecciones de gasto se incorporan durante el onboarding en lugar de después de una factura sorpresa. Esa es la ventaja del tech-match: no estás pagando a un equipo para que aprenda la tecnología a costa de tu presupuesto. También mantenemos visible la curva de coste prevista desde el principio, para que un responsable de producto vea a dónde va el gasto antes de comprometerlo, no después.

Si estás añadiendo funciones de IA y quieres que sean tan baratas de operar como buenas, nuestro equipo de desarrollo de IA y ML las construye con el control de costes diseñado desde el inicio, y nuestros ingenieros de desarrollo web a medida integran el gateway y las protecciones en tu aplicación actual. Para profundizar en el despliegue de IA en producción, consulta nuestras guías sobre cómo construir una búsqueda semántica con LLM dentro de tu producto SaaS y cómo reducir el coste del modelo con la destilación.

Preguntas frecuentes

¿Funciona Cloudflare AI Gateway con modelos de OpenAI, Anthropic y Google?

Sí. Es compatible con los principales proveedores, incluidos OpenAI, Anthropic, Google AI Studio, Mistral y Groq, además de Cloudflare Workers AI. Conservas el SDK de tu proveedor actual y cambias solo la URL base por el endpoint del gateway para cada proveedor que enrutes.

¿Cuánto cuesta Cloudflare AI Gateway?

Las funciones básicas del gateway, la caché, la limitación de peticiones, los reintentos y las analíticas, son gratuitas para empezar. Solo pagas por la retención ampliada de registros y por el almacenamiento de mayor volumen en los planes de pago. Los costes de tokens del proveedor siguen aplicándose en cada fallo de caché, ya que esas llamadas llegan al modelo con normalidad.

¿Almacenar en caché las respuestas de LLM perjudica la calidad de las respuestas?

La caché de coincidencia exacta devuelve la respuesta idéntica para una petición idéntica, lo cual es seguro para prompts deterministas. La caché por similitud puede devolver una respuesta generada para una consulta parecida pero distinta, así que prueba la exactitud con tráfico real antes de activarla para respuestas de cara al usuario.

¿Es Cloudflare AI Gateway un sustituto de LiteLLM o Helicone?

Se solapa en la caché y la observabilidad, pero no es un enrutador multiproveedor completo. Los equipos que necesitan enrutamiento ponderado o cadenas de respaldo entre varios proveedores suelen elegir LiteLLM, mientras que los equipos que quieren protecciones rápidas y visibilidad por petición sin infraestructura eligen el gateway.

¿Puede Cloudflare AI Gateway frenar una factura de LLM descontrolada?

Sí. La limitación de peticiones y los topes de gasto o de peticiones por gateway detienen un bucle o un cliente abusivo antes de que las llamadas lleguen al proveedor. Establece los umbrales a partir de tu tráfico pico real más un margen, porque un tope demasiado bajo estrangulará a usuarios legítimos durante un pico genuino.

Vea como Redwerk se hizo cargo del desarrollo central de una plataforma de optimizacion de IA y la llevo a un exitoso lanzamiento de producto

Este campo es obligatorio. no es un correo electrónico comercial