Sans budget temps
start_within: defaultstart_within: defaultTransmise exactement comme vous l'avez envoyée
Prix plein, démarrage immédiat
Du modèle exact que vous avez choisi
Nous vous trouvons une inférence moins chère dans le délai que vous définissez.
// coût et latence médians pour 72,781 requêtes (au 2026-08-08)
Posez n'importe quelle question et nous exécuterons deux requêtes en parallèle afin que vous puissiez constater les économies de coûts et les compromis de latence.
en attente de votre requête
en attente de votre requête
Les gens demandent « Où est le piège ? » Il n'y en a pas. Vous nous donnez un budget temps. Nous trouvons une inférence moins chère. Nous ne modifions pas votre requête.
start_within: defaultstart_within: defaultTransmise exactement comme vous l'avez envoyée
Prix plein, démarrage immédiat
Du modèle exact que vous avez choisi
start_within: 30sstart_within: 30sTransmise exactement comme vous l'avez envoyée
Moitié prix si le démarrage est à temps
Prix plein si flex dépasse le délai
Du modèle exact que vous avez choisi
Lorsque vous faites une requête, elle est exécutée via le calcul en périphérie (edge compute). Nous utilisons les workers Cloudflare, déployés dans plus de 300 villes. Notre propre routage ajoute 1 à 5 millisecondes lors d'un démarrage à froid.
Si vous envoyez un paramètre incorrect, nous ne le supprimons pas silencieusement pour forcer un succès. Lorsque le fournisseur rejette une requête, nous vous renvoyons le code d'état et l'erreur. Ainsi, vous pouvez déboguer en fonction de vos intentions et ne pas découvrir un bug des semaines après le lancement.
Pointez l'URL de base vers nous et transmettez votre clé. Nous fonctionnons avec les clients OpenAI, Anthropic et Gemini, et pouvons router Claude via Amazon Bedrock ou Gemini via Google Vertex AI avec votre propre clé cloud via une chaîne de routage de fournisseur optionnelle. Pour utiliser FlexInference, il vous suffit d'ajouter un seul nouveau champ, start_within.
Chaque erreur est renvoyée dans le format du SDK que vous avez appelé, afin que votre client puisse la traiter sans modification. Elle contient un code lisible par machine, la correction exacte et une `doc_url`. Notre serveur MCP va plus loin. Des outils de codage comme Claude et Cursor peuvent rechercher dans la documentation, consulter n'importe quel code d'erreur et inspecter vos clés et votre utilisation via OAuth. Ainsi, vos agents corrigent leurs propres erreurs, et vous n'avez pas à les surveiller constamment.
Téléchargez les journaux du mois dernier (nous ne les stockons pas) depuis OpenRouter/Anthropic/OpenAI/Google et nous vous indiquerons combien vous pourriez économiser.
Apportez votre propre clé
Clés gérées
import OpenAI from "openai";
const BASE =
"https://api.flexinference.com/v1";
const client = new OpenAI({
baseURL: BASE,
apiKey: "flex_live_...",
});
const resp = await client
.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{
role: "user",
content: "Summarize this thread.",
}],
start_within: "00h-00m-30s",
} as any);Un routeur LLM sensible aux délais pour OpenAI, Gemini et Anthropic. Il est compatible OpenAI, vous conservez donc votre SDK et pointez l'URL de base vers nous. Utilisez-le de deux manières : apportez votre propre clé de fournisseur (BYOK) ou laissez-nous gérer les clés avec Managed. Ajoutez un délai start_within et nous mettons en concurrence un niveau moins cher, puis nous vous renvoyons le modèle que vous avez demandé. La course fonctionne désormais sur les deux. BYOK est gratuit quel que soit le volume, sans carte.
Un champ requis par chaque requête, soit dans le corps, soit par défaut sur la clé. Définissez-le sur default, priority, auto, ou une durée comme 00h-00m-30s. Une durée met en concurrence un niveau moins cher pour le modèle que vous avez choisi, puis passe au standard si la course est perdue. Cette course fonctionne à la fois en mode BYOK et Géré, pour OpenAI et Gemini. En mode Géré, une durée Claude entre 3 et 10 minutes met en concurrence le niveau moins cher de Claude à la place. Impossible de trouver moins cher à temps ? Vous recevez toujours votre réponse, nous la servons au standard. Vous utilisez un outil qui ne peut pas ajouter de champ ? Mettez la date limite sur la clé lorsque vous la créez, et le corps l'emporte toujours lorsqu'il en envoie une.
Sur l'ensemble de notre trafic, la course flex réduit le coût combiné d'environ 49%, pour environ 20% de temps supplémentaire avant le premier token. Vous évitez également la majoration que d'autres routeurs appliquent par défaut aux requêtes `auto` et `priority`. Cette majoration nous agaçait, donc nous ne l'ajoutons pas. Vos chiffres dépendent de vos modèles, de vos fournisseurs et du délai que vous avez fixé.
Les deux acheminent de la même manière. Ce qui change, c'est qui détient les clés et comment vous payez. Choisissez BYOK si vous avez déjà des clés de fournisseur. Vous apportez la clé, l'utilisation du modèle est facturée à votre fournisseur, et notre service est gratuit quel que soit le volume, sans abonnement, allocation ou dépassement. Choisissez Géré pour éviter l'inscription auprès du fournisseur. Nous le servons sur nos propres identifiants de fournisseur mutualisés et le coût du modèle est prélevé sur un portefeuille que vous chargez. La course flex fonctionne dans les deux cas pour OpenAI et Gemini, et la course de Claude ne fonctionne qu'en mode Géré.
Les modèles OpenAI, Gemini et Anthropic pris en charge, bien que seuls ceux compatibles flex participent à la course. Un modèle que nous ne proposons pas est refusé par son nom avec `model_not_carried` plutôt que d'être substitué silencieusement. Épinglez une route avec un tableau de fournisseurs : openai, google ou anthropic. Vous voulez le même modèle avec votre propre clé cloud ? Vertex et Bedrock le servent en BYOK, niveau standard, sans flex. Managed sert directement OpenAI, Anthropic et Gemini, ainsi que Cloudflare Workers AI pour les modèles open source.