Sin un presupuesto de tiempo
start_within: defaultstart_within: defaultReenviada exactamente como la enviaste
Precio completo, inicia de inmediato
Del modelo exacto que elegiste
Encontramos inferencia más económica en el plazo que establezcas.
// costo y latencia promedio en 72,781 solicitudes (2026-08-08)
Pregunta lo que quieras y ejecutaremos dos solicitudes en paralelo para que puedas ver los ahorros de costos y las compensaciones de latencia.
esperando tu solicitud
esperando tu solicitud
La gente pregunta "¿Cuál es el truco?" No hay ninguno. Nos das un presupuesto de tiempo. Encontramos inferencia más barata. No interferimos con tu solicitud.
start_within: defaultstart_within: defaultReenviada exactamente como la enviaste
Precio completo, inicia de inmediato
Del modelo exacto que elegiste
start_within: 30sstart_within: 30sReenviada exactamente como la enviaste
Mitad de precio si inicia a tiempo
Precio completo si flex excede el plazo
Del modelo exacto que elegiste
Cuando haces una solicitud, se cumple utilizando computación de borde. Usamos Cloudflare workers, que se implementa en más de 300 ciudades. Nuestro propio enrutamiento añade de 1 a 5 milisegundos en un arranque en frío.
Si envías un parámetro incorrecto, no lo eliminamos silenciosamente para forzar un éxito. Cuando el proveedor rechaza una solicitud, te enviamos el código de estado y el error. De esa manera, puedes depurar basándote en tus intenciones y no encontrar un error semanas después del lanzamiento.
Apúntanos la URL base y pasa tu clave. Trabajamos con clientes de OpenAI, Anthropic y Gemini, y podemos enrutar Claude a través de Amazon Bedrock o Gemini a través de Google Vertex AI con tu propia clave de nube mediante una cadena de ruta de proveedor opcional. Para usar FlexInference, solo necesitas agregar un nuevo campo: `start_within`.
Cada error se devuelve con el formato del SDK que invocaste, para que tu cliente lo analice sin cambios. Contiene un código legible por máquina, la solución exacta y una doc_url. Nuestro servidor MCP va más allá. Herramientas de codificación como Claude y Cursor pueden buscar en la documentación, consultar cualquier error code e inspeccionar tus claves y uso a través de OAuth. Así, tus agentes corrigen sus propios errores y no tienes que supervisarlos constantemente.
Suba los registros del mes pasado (no los almacenamos) de OpenRouter/Anthropic/OpenAI/Google y le informaremos cuánto podría ahorrar.
Trae tu propia clave
Claves gestionadas
import OpenAI from "openai";
const BASE =
"https://api.flexinference.com/v1";
const client = new OpenAI({
baseURL: BASE,
apiKey: "flex_live_...",
});
const resp = await client
.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{
role: "user",
content: "Summarize this thread.",
}],
start_within: "00h-00m-30s",
} as any);Un enrutador LLM con conciencia de plazos para OpenAI, Gemini y Anthropic. Es compatible con OpenAI, por lo que mantienes tu SDK y apuntas la URL base hacia nosotros. Ejecútalo de dos maneras: trae tu propia clave de proveedor, o déjanos tener las claves con Managed. Agrega un plazo `start_within` y competiremos con un nivel más económico, luego te devolveremos el modelo que solicitaste. La carrera se ejecuta en ambos ahora. BYOK es gratis en cualquier volumen, sin tarjeta.
Un campo que cada solicitud necesita, ya sea en el cuerpo o como valor predeterminado en la clave. Establézcalo en default, priority, auto, o una duración como 00h-00m-30s. Una duración compite con un nivel más económico para el modelo que eligió, luego escala a estándar si la carrera se pierde. Esa carrera se ejecuta tanto en BYOK como en Gestionado, para OpenAI y Gemini. En Gestionado, una duración de claude entre 3 y 10 minutos compite con el nivel más económico de Claude en su lugar. ¿No puede encontrar uno más económico a tiempo? Aún así obtiene su respuesta, la servimos como estándar. ¿Usa una herramienta que no puede agregar un campo? Ponga la fecha límite en la clave cuando la cree, y el cuerpo aún gana cada vez que envía una.
En todo nuestro tráfico, la carrera flex reduce el costo combinado en aproximadamente un 49%, por aproximadamente un 20% más de tiempo hasta el primer token. También evitas el recargo que otros enrutadores aplican a las solicitudes predeterminadas, automáticas y prioritarias. Ese recargo nos molestaba, así que no lo añadimos. Tus números dependen de tus modelos, proveedores y la fecha límite que establezcas.
Ambos enrutan de la misma manera. Lo que cambia es quién posee las claves y cómo paga. Elija BYOK si ya tiene claves de proveedor. Usted aporta la clave, el uso del modelo se factura a su proveedor y nuestro servicio es gratuito a cualquier volumen, sin suscripción, asignación ni excedente. Elija Gestionado para omitir el registro del proveedor. Lo servimos con nuestras propias credenciales de proveedor agrupadas y el costo del modelo se extrae de una billetera que usted carga. La carrera flex se ejecuta de cualquier manera para OpenAI y Gemini, y la carrera de Claude se ejecuta solo en Gestionado.
Los modelos compatibles de OpenAI, Gemini y Anthropic, aunque solo los compatibles con flex participan en la carrera. Un modelo que no tenemos es rechazado por nombre con `model_not_carried` en lugar de ser sustituido silenciosamente. Fija una ruta con un array de proveedores: openai, google o anthropic. ¿Quieres el mismo modelo con tu propia clave de nube? Vertex y Bedrock lo ofrecen BYOK, nivel estándar, sin flex. Managed ofrece OpenAI, Anthropic y Gemini directamente, además de Cloudflare Workers AI para modelos de código abierto.