Límites y control de gasto
Qué pasa cuando se agota el presupuesto, cuando se supera el ritmo de peticiones y cuando un proveedor falla.
El tope es duro
Cada key lleva el presupuesto del mes. Al agotarlo la key se pausa hasta el reinicio del ciclo, o hasta subir de plan. No hay consumo por encima del plan, ni una factura sorpresa al mes siguiente.
El tope se valida contra la base autoritativa antes de admitir cada petición, no después de procesarla. Es la diferencia entre un tope que existe y uno que avisa tarde.
Ritmo de peticiones por plan
Los límites viajan con la key y se aplican en vivo. Superarlos devuelve un 429 con el contrato de siempre: reintentá con espera creciente, que es lo que el SDK de OpenAI ya hace por defecto.
| Plan | Peticiones/min | Tokens/min |
|---|---|---|
| start | 60 | 40 000 |
| pro | 300 | 200 000 |
| scale | 1 000 | 800 000 |
Si un proveedor falla
El gateway reintenta con un modelo equivalente sin que tu aplicación se entere: la respuesta llega por el mismo endpoint y con el mismo formato. No hay nada que implementar del lado tuyo.
Qué no incluye
Vale saberlo antes de diseñar sobre eso: hoy no hay ajuste fino de modelos, ni pago por consumo medido fuera del plan, ni retención garantizada de prompts o residencia de datos, ni moderación de contenido o detección de datos personales.
Son cosas que están en el camino, no promesas: si tu caso depende de alguna, conviene preguntarlo antes de integrar.