Un routeur qui réduit les coûts de 49%

Nous vous trouvons une inférence moins chère dans le délai que vous définissez.

49%coûts
$3.13
sans FlexInference
$1.61
avec FlexInference
$ / 1M tokens
+20%latence
305 ms
sans FlexInference
366 ms
avec FlexInference
Temps jusqu'au premier token (ms)

// coût et latence médians pour 72,781 requêtes (au 2026-08-08)

Quelques-unes des façons de réduire vos coûts de moitié

  • OpenScience
    +9.3% Latence-50.0% Coût
  • OpenCode
    -37.5% Latence-50.0% Coût
  • OpenWork
    +6.9% Latence-48.5% Coût

Essayez par vous-même

Posez n'importe quelle question et nous exécuterons deux requêtes en parallèle afin que vous puissiez constater les économies de coûts et les compromis de latence.

votre requête
0/100

course flex

en attente de votre requête

requête par défaut

en attente de votre requête

Nous ne changeons jamais votre modèle et vous réalisez quand même des économies.

Les gens demandent « Où est le piège ? » Il n'y en a pas. Vous nous donnez un budget temps. Nous trouvons une inférence moins chère. Nous ne modifions pas votre requête.

Sans budget temps

start_within: default
Coût standard$1.00

Avec un budget temps (course flex)

start_within: 30s
Coût Flex réduit$0.50

Conçu pour que vous ne déboguiez pas à 2h du matin

  • Routage en 3 ms dans 300 villes.

    Lorsque vous faites une requête, elle est exécutée via le calcul en périphérie (edge compute). Nous utilisons les workers Cloudflare, déployés dans plus de 300 villes. Notre propre routage ajoute 1 à 5 millisecondes lors d'un démarrage à froid.

  • Nous échouons rapidement et bruyamment.

    Si vous envoyez un paramètre incorrect, nous ne le supprimons pas silencieusement pour forcer un succès. Lorsque le fournisseur rejette une requête, nous vous renvoyons le code d'état et l'erreur. Ainsi, vous pouvez déboguer en fonction de vos intentions et ne pas découvrir un bug des semaines après le lancement.

  • Votre client existant fonctionne sans modification.

    Pointez l'URL de base vers nous et transmettez votre clé. Nous fonctionnons avec les clients OpenAI, Anthropic et Gemini, et pouvons router Claude via Amazon Bedrock ou Gemini via Google Vertex AI avec votre propre clé cloud via une chaîne de routage de fournisseur optionnelle. Pour utiliser FlexInference, il vous suffit d'ajouter un seul nouveau champ, start_within.

  • Erreurs que votre agent peut corriger lui-même.

    Chaque erreur est renvoyée dans le format du SDK que vous avez appelé, afin que votre client puisse la traiter sans modification. Elle contient un code lisible par machine, la correction exacte et une `doc_url`. Notre serveur MCP va plus loin. Des outils de codage comme Claude et Cursor peuvent rechercher dans la documentation, consulter n'importe quel code d'erreur et inspecter vos clés et votre utilisation via OAuth. Ainsi, vos agents corrigent leurs propres erreurs, et vous n'avez pas à les surveiller constamment.

Découvrez combien vous pourriez économiser

Téléchargez les journaux du mois dernier (nous ne les stockons pas) depuis OpenRouter/Anthropic/OpenAI/Google et nous vous indiquerons combien vous pourriez économiser.

Apportez vos propres clés, ou laissez-nous les gérer pour vous.

Apportez votre propre clé

Gratuit
  • Support gratuit pour Anthropic, OpenAI, Google AI Studio, Bedrock, Vertex, Foundry et Cloudflare Workers AI
  • Course flex gratuite pour économiser 49% pour 20% de temps supplémentaire avant le premier token
  • Logs, analyses et suivi des coûts gratuits
  • Requêtes illimitées chaque mois
  • Aucun abonnement ni dépassement, jamais
  • Aucuns frais par requête, quels qu'ils soient.
  • Aucune carte de crédit requise
  • Vos clés de fournisseur sont chiffrées AES-256-GCM au repos, déchiffrées uniquement en mémoire pour transmettre votre requête
  • Nous ne stockons ni n'enregistrons jamais vos invites ou les sorties de vos modèles

Clés gérées

10 %
  • Tout ce qui est inclus dans Bring Your Own Key
  • Limites de débit API plus élevées instantanément
  • Course Flex pour les modèles Anthropic
  • Masquage optionnel des PII pour une conformité instantanée
  • Coûts des modèles répercutés, sans majoration
  • Stockage des traces optionnel
  • Alertes de dépenses et de solde
  • Support complet avec BYOK par fournisseur
  • Remboursement du solde sur votre carte

Trois autres façons de réduire vos coûts

  • Classification d'images Gemini
    +20.2% Latence-38.9% Coût
  • Recherche approfondie OpenAI
    -30.1% Latence-44.8% Coût
  • Agent de navigateur OpenAI
    +9.7% Latence-51.5% Coût

Pas de nouvelles sémantiques SDK à apprendre.

import OpenAI from "openai";

const BASE =
  "https://api.flexinference.com/v1";

const client = new OpenAI({
  baseURL: BASE,
  apiKey: "flex_live_...",
});

const resp = await client
  .chat.completions.create({
    model: "gemini-2.5-flash",
    messages: [{
      role: "user",
      content: "Summarize this thread.",
    }],
    start_within: "00h-00m-30s",
  } as any);

Foire aux questions

  • Un routeur LLM sensible aux délais pour OpenAI, Gemini et Anthropic. Il est compatible OpenAI, vous conservez donc votre SDK et pointez l'URL de base vers nous. Utilisez-le de deux manières : apportez votre propre clé de fournisseur (BYOK) ou laissez-nous gérer les clés avec Managed. Ajoutez un délai start_within et nous mettons en concurrence un niveau moins cher, puis nous vous renvoyons le modèle que vous avez demandé. La course fonctionne désormais sur les deux. BYOK est gratuit quel que soit le volume, sans carte.

  • Un champ requis par chaque requête, soit dans le corps, soit par défaut sur la clé. Définissez-le sur default, priority, auto, ou une durée comme 00h-00m-30s. Une durée met en concurrence un niveau moins cher pour le modèle que vous avez choisi, puis passe au standard si la course est perdue. Cette course fonctionne à la fois en mode BYOK et Géré, pour OpenAI et Gemini. En mode Géré, une durée Claude entre 3 et 10 minutes met en concurrence le niveau moins cher de Claude à la place. Impossible de trouver moins cher à temps ? Vous recevez toujours votre réponse, nous la servons au standard. Vous utilisez un outil qui ne peut pas ajouter de champ ? Mettez la date limite sur la clé lorsque vous la créez, et le corps l'emporte toujours lorsqu'il en envoie une.

  • Sur l'ensemble de notre trafic, la course flex réduit le coût combiné d'environ 49%, pour environ 20% de temps supplémentaire avant le premier token. Vous évitez également la majoration que d'autres routeurs appliquent par défaut aux requêtes `auto` et `priority`. Cette majoration nous agaçait, donc nous ne l'ajoutons pas. Vos chiffres dépendent de vos modèles, de vos fournisseurs et du délai que vous avez fixé.

  • Les deux acheminent de la même manière. Ce qui change, c'est qui détient les clés et comment vous payez. Choisissez BYOK si vous avez déjà des clés de fournisseur. Vous apportez la clé, l'utilisation du modèle est facturée à votre fournisseur, et notre service est gratuit quel que soit le volume, sans abonnement, allocation ou dépassement. Choisissez Géré pour éviter l'inscription auprès du fournisseur. Nous le servons sur nos propres identifiants de fournisseur mutualisés et le coût du modèle est prélevé sur un portefeuille que vous chargez. La course flex fonctionne dans les deux cas pour OpenAI et Gemini, et la course de Claude ne fonctionne qu'en mode Géré.

  • Les modèles OpenAI, Gemini et Anthropic pris en charge, bien que seuls ceux compatibles flex participent à la course. Un modèle que nous ne proposons pas est refusé par son nom avec `model_not_carried` plutôt que d'être substitué silencieusement. Épinglez une route avec un tableau de fournisseurs : openai, google ou anthropic. Vous voulez le même modèle avec votre propre clé cloud ? Vertex et Bedrock le servent en BYOK, niveau standard, sans flex. Managed sert directement OpenAI, Anthropic et Gemini, ainsi que Cloudflare Workers AI pour les modèles open source.