Ohne Zeitbudget
start_within: defaultstart_within: defaultGenau wie gesendet weitergeleitet
Voller Preis, startet sofort
Vom exakten Modell, das Sie ausgewählt haben
Wir finden günstigere Inferenz innerhalb des von Ihnen festgelegten Zeitfensters.
// Mediankosten und -latenz über 72,781 Anfragen (Stand: 2026-08-08)
Fragen Sie alles, und wir führen zwei Anfragen parallel aus, damit Sie die Kosteneinsparungen und Latenz-Kompromisse sehen können.
Warten auf Ihre Anfrage
Warten auf Ihre Anfrage
Man fragt: „Wo ist der Haken?“ Es gibt keinen. Sie geben uns ein Zeitbudget. Wir finden günstigere Inferenz. Wir manipulieren Ihre Anfrage nicht.
start_within: defaultstart_within: defaultGenau wie gesendet weitergeleitet
Voller Preis, startet sofort
Vom exakten Modell, das Sie ausgewählt haben
start_within: 30sstart_within: 30sGenau wie gesendet weitergeleitet
Halber Preis bei rechtzeitigem Start
Voller Preis, wenn flex das Zeitfenster verpasst
Vom exakten Modell, das Sie ausgewählt haben
Wenn Sie eine Anfrage stellen, wird diese über Edge Compute ausgeführt. Wir verwenden Cloudflare Workers, die in über 300 Städten bereitgestellt werden. Unser eigenes Routing fügt bei einem Kaltstart 1-5 Millisekunden hinzu.
Wenn Sie einen falschen Parameter senden, entfernen wir ihn nicht stillschweigend, um einen Erfolg zu erzwingen. Wenn der Provider eine Anfrage ablehnt, senden wir Ihnen den Statuscode und den Fehler zurück. So können Sie basierend auf Ihren Absichten debuggen und finden nicht erst Wochen nach dem Start einen Fehler.
Richten Sie die Basis-URL auf uns und übergeben Sie Ihren Schlüssel. Wir arbeiten mit OpenAI-, Anthropic- und Gemini-Clients und können Claude über Amazon Bedrock oder Gemini über Google Vertex AI mit Ihrem eigenen Cloud-Schlüssel über eine optionale Provider-Route-Kette routen. Um FlexInference zu verwenden, müssen Sie lediglich ein einziges neues Feld hinzufügen: start_within.
Jeder Fehler wird in der Form des aufgerufenen SDKs zurückgegeben, sodass Ihr Client ihn unverändert parsen kann. Er enthält einen maschinenlesbaren Code, die genaue Lösung und eine doc_url. Unser MCP-Server geht noch weiter. Coding-Tools wie Claude und Cursor können die Dokumentation durchsuchen, jeden Fehlercode nachschlagen und Ihre Schlüssel und Nutzung über OAuth überprüfen. So beheben Ihre Agenten ihre eigenen Fehler, und Sie müssen sie nicht ständig überwachen.
Laden Sie die Protokolle des letzten Monats (wir speichern sie nicht) von OpenRouter/Anthropic/OpenAI/Google hoch, und wir zeigen Ihnen, wie viel Sie sparen könnten.
Bring Your Own Key
Managed Keys
import OpenAI from "openai";
const BASE =
"https://api.flexinference.com/v1";
const client = new OpenAI({
baseURL: BASE,
apiKey: "flex_live_...",
});
const resp = await client
.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{
role: "user",
content: "Summarize this thread.",
}],
start_within: "00h-00m-30s",
} as any);Ein deadline-bewusster LLM-Router für OpenAI, Gemini und Anthropic. Er ist OpenAI-kompatibel, sodass Sie Ihr SDK behalten und die Basis-URL auf uns richten können. Betreiben Sie ihn auf zwei Arten: Bringen Sie Ihren eigenen Provider-Schlüssel mit, oder lassen Sie uns die Schlüssel mit Managed verwalten. Fügen Sie eine start_within-Deadline hinzu, und wir starten einen Race mit einem günstigeren Tier und liefern Ihnen dann das von Ihnen angeforderte Modell zurück. Der Race läuft jetzt auf beiden. BYOK ist bei jedem Volumen kostenlos, keine Karte erforderlich.
Ein Feld, das jede Anfrage benötigt, entweder im Body oder als Standardwert auf dem Schlüssel. Setzen Sie es auf default, priority, auto oder eine Dauer wie 00h-00m-30s. Eine Dauer lässt eine günstigere Stufe für das von Ihnen gewählte Modell antreten und wechselt dann zum Standard, wenn der Wettlauf verloren geht. Dieser Wettlauf läuft sowohl auf BYOK als auch auf Managed, für OpenAI und Gemini. Auf Managed lässt eine Claude-Dauer zwischen 3 und 10 Minuten stattdessen Claudes günstigere Stufe antreten. Kann die günstigere Option nicht rechtzeitig gefunden werden? Sie erhalten trotzdem Ihre Antwort, wir liefern sie als Standard. Verwenden Sie ein Tool, das kein Feld hinzufügen kann? Legen Sie die Deadline beim Erstellen auf den Schlüssel, und der Body gewinnt immer noch, wenn er eine sendet.
Über unseren gesamten Traffic hinweg senkt das flex-Rennen die Gesamtkosten um etwa 49%, bei einer um etwa 20% längeren Zeit bis zum ersten Token. Sie überspringen auch den Aufpreis, den andere Router für Standard-, Auto- und Prioritätsanfragen erheben. Dieser Aufpreis hat uns gestört, also fügen wir ihn nicht hinzu. Ihre Zahlen hängen von Ihren Modellen, Anbietern und der von Ihnen festgelegten Frist ab.
Beide Routen funktionieren auf die gleiche Weise. Was sich ändert, ist, wer die Schlüssel besitzt und wie Sie bezahlen. Wählen Sie BYOK, wenn Sie bereits Anbieter-Schlüssel haben. Sie stellen den Schlüssel bereit, die Modellnutzung wird Ihrem Anbieter in Rechnung gestellt, und unser Dienst ist bei jedem Volumen kostenlos, ohne Abonnement, Freimenge oder Überschreitung. Wählen Sie Managed, um die Anbieterregistrierung zu überspringen. Wir stellen den Dienst über unsere eigenen gebündelten Anbieter-Anmeldeinformationen bereit, und die Modellkosten werden von einem von Ihnen aufgeladenen Guthaben abgezogen. Der flex race läuft sowohl für OpenAI als auch für Gemini, und Claudes race läuft nur auf Managed.
Die unterstützten OpenAI-, Gemini- und Anthropic-Modelle, wobei nur die flex-fähigen am Race teilnehmen. Ein Modell, das wir nicht führen, wird namentlich mit `model_not_carried` abgelehnt, anstatt stillschweigend ersetzt zu werden. Pinnen Sie eine Route mit einem Provider-Array, openai, google oder anthropic. Möchten Sie dasselbe Modell mit Ihrem eigenen Cloud-Schlüssel verwenden? Vertex und Bedrock stellen es BYOK, Standard-Tier, ohne flex bereit. Managed bietet OpenAI, Anthropic und Gemini direkt an, plus Cloudflare Workers AI für Open-Source-Modelle.