Ein Router, der die Kosten um 49% senkt

Wir finden günstigere Inferenz innerhalb des von Ihnen festgelegten Zeitfensters.

49%Kosten
$3.13
ohne FlexInference
$1.61
mit FlexInference
$ / 1 Mio. Tokens
+20%Latenz
305 ms
ohne FlexInference
366 ms
mit FlexInference
Zeit bis zum ersten Token (ms)

// Mediankosten und -latenz über 72,781 Anfragen (Stand: 2026-08-08)

So können Sie Ihre Kosten halbieren

  • OpenScience
    +9.3% Latenz-50.0% Kosten
  • OpenCode
    -37.5% Latenz-50.0% Kosten
  • OpenWork
    +6.9% Latenz-48.5% Kosten

Probieren Sie es selbst aus

Fragen Sie alles, und wir führen zwei Anfragen parallel aus, damit Sie die Kosteneinsparungen und Latenz-Kompromisse sehen können.

Ihre Anfrage
0/100

flex Wettrennen

Warten auf Ihre Anfrage

Standardanfrage

Warten auf Ihre Anfrage

Wir tauschen Ihr Modell niemals aus und erzielen trotzdem Einsparungen für Sie.

Man fragt: „Wo ist der Haken?“ Es gibt keinen. Sie geben uns ein Zeitbudget. Wir finden günstigere Inferenz. Wir manipulieren Ihre Anfrage nicht.

Ohne Zeitbudget

start_within: default
Standardkosten$1.00

Mit Zeitbudget (flex-Rennen)

start_within: 30s
Flex-reduzierte Kosten$0.50

Entwickelt, damit Sie nicht um 2 Uhr morgens debuggen müssen

  • 3 ms Routing über 300 Städte.

    Wenn Sie eine Anfrage stellen, wird diese über Edge Compute ausgeführt. Wir verwenden Cloudflare Workers, die in über 300 Städten bereitgestellt werden. Unser eigenes Routing fügt bei einem Kaltstart 1-5 Millisekunden hinzu.

  • Wir scheitern schnell und deutlich.

    Wenn Sie einen falschen Parameter senden, entfernen wir ihn nicht stillschweigend, um einen Erfolg zu erzwingen. Wenn der Provider eine Anfrage ablehnt, senden wir Ihnen den Statuscode und den Fehler zurück. So können Sie basierend auf Ihren Absichten debuggen und finden nicht erst Wochen nach dem Start einen Fehler.

  • Ihr bestehender Client funktioniert unverändert.

    Richten Sie die Basis-URL auf uns und übergeben Sie Ihren Schlüssel. Wir arbeiten mit OpenAI-, Anthropic- und Gemini-Clients und können Claude über Amazon Bedrock oder Gemini über Google Vertex AI mit Ihrem eigenen Cloud-Schlüssel über eine optionale Provider-Route-Kette routen. Um FlexInference zu verwenden, müssen Sie lediglich ein einziges neues Feld hinzufügen: start_within.

  • Fehler, die Ihr Agent selbst beheben kann.

    Jeder Fehler wird in der Form des aufgerufenen SDKs zurückgegeben, sodass Ihr Client ihn unverändert parsen kann. Er enthält einen maschinenlesbaren Code, die genaue Lösung und eine doc_url. Unser MCP-Server geht noch weiter. Coding-Tools wie Claude und Cursor können die Dokumentation durchsuchen, jeden Fehlercode nachschlagen und Ihre Schlüssel und Nutzung über OAuth überprüfen. So beheben Ihre Agenten ihre eigenen Fehler, und Sie müssen sie nicht ständig überwachen.

Finden Sie heraus, wie viel Sie sparen könnten

Laden Sie die Protokolle des letzten Monats (wir speichern sie nicht) von OpenRouter/Anthropic/OpenAI/Google hoch, und wir zeigen Ihnen, wie viel Sie sparen könnten.

Bringen Sie Ihre eigenen Keys mit, oder lassen Sie uns diese für Sie verwalten.

Bring Your Own Key

Kostenlos
  • Kostenloser Support für Anthropic, OpenAI, Google AI Studio, Bedrock, Vertex, Foundry und Cloudflare Workers AI
  • Kostenloser flex-Wettlauf, um 49% zu sparen bei 20% längerer Zeit bis zum ersten Token
  • Kostenlose Logs, Analysen und Kostenverfolgung
  • Unbegrenzte Anfragen jeden Monat
  • Kein Abonnement und keine Mehrkosten
  • Keine Gebühren pro Anfrage jeglicher Art
  • Keine Kreditkarte erforderlich
  • Ihre Anbieter-Schlüssel sind im Ruhezustand AES-256-GCM verschlüsselt und werden nur im Arbeitsspeicher entschlüsselt, um Ihre Anfrage weiterzuleiten
  • Wir speichern oder protokollieren niemals Ihre Prompts oder Modellausgaben

Managed Keys

10%
  • Alles in Bring Your Own Key
  • Höhere API-Ratenlimits sofort
  • Flex-Rennen für Anthropic-Modelle
  • Optionale PII-Maskierung für sofortige Compliance
  • Modellkosten werden weitergegeben, keine Aufschläge
  • Optionale Trace-Speicherung
  • Ausgaben- und Guthabenalarme
  • Voller Support mit BYOK pro Anbieter
  • Verbleibendes Guthaben wird auf Ihre Karte zurückerstattet

Drei weitere Wege, Ihre Kosten zu senken

  • Gemini Bildklassifizierung
    +20.2% Latenz-38.9% Kosten
  • OpenAI Tiefenrecherche
    -30.1% Latenz-44.8% Kosten
  • OpenAI Browser-Agent
    +9.7% Latenz-51.5% Kosten

Keine neuen SDK-Semantiken zu lernen.

import OpenAI from "openai";

const BASE =
  "https://api.flexinference.com/v1";

const client = new OpenAI({
  baseURL: BASE,
  apiKey: "flex_live_...",
});

const resp = await client
  .chat.completions.create({
    model: "gemini-2.5-flash",
    messages: [{
      role: "user",
      content: "Summarize this thread.",
    }],
    start_within: "00h-00m-30s",
  } as any);

Häufig gestellte Fragen

  • Ein deadline-bewusster LLM-Router für OpenAI, Gemini und Anthropic. Er ist OpenAI-kompatibel, sodass Sie Ihr SDK behalten und die Basis-URL auf uns richten können. Betreiben Sie ihn auf zwei Arten: Bringen Sie Ihren eigenen Provider-Schlüssel mit, oder lassen Sie uns die Schlüssel mit Managed verwalten. Fügen Sie eine start_within-Deadline hinzu, und wir starten einen Race mit einem günstigeren Tier und liefern Ihnen dann das von Ihnen angeforderte Modell zurück. Der Race läuft jetzt auf beiden. BYOK ist bei jedem Volumen kostenlos, keine Karte erforderlich.

  • Ein Feld, das jede Anfrage benötigt, entweder im Body oder als Standardwert auf dem Schlüssel. Setzen Sie es auf default, priority, auto oder eine Dauer wie 00h-00m-30s. Eine Dauer lässt eine günstigere Stufe für das von Ihnen gewählte Modell antreten und wechselt dann zum Standard, wenn der Wettlauf verloren geht. Dieser Wettlauf läuft sowohl auf BYOK als auch auf Managed, für OpenAI und Gemini. Auf Managed lässt eine Claude-Dauer zwischen 3 und 10 Minuten stattdessen Claudes günstigere Stufe antreten. Kann die günstigere Option nicht rechtzeitig gefunden werden? Sie erhalten trotzdem Ihre Antwort, wir liefern sie als Standard. Verwenden Sie ein Tool, das kein Feld hinzufügen kann? Legen Sie die Deadline beim Erstellen auf den Schlüssel, und der Body gewinnt immer noch, wenn er eine sendet.

  • Über unseren gesamten Traffic hinweg senkt das flex-Rennen die Gesamtkosten um etwa 49%, bei einer um etwa 20% längeren Zeit bis zum ersten Token. Sie überspringen auch den Aufpreis, den andere Router für Standard-, Auto- und Prioritätsanfragen erheben. Dieser Aufpreis hat uns gestört, also fügen wir ihn nicht hinzu. Ihre Zahlen hängen von Ihren Modellen, Anbietern und der von Ihnen festgelegten Frist ab.

  • Beide Routen funktionieren auf die gleiche Weise. Was sich ändert, ist, wer die Schlüssel besitzt und wie Sie bezahlen. Wählen Sie BYOK, wenn Sie bereits Anbieter-Schlüssel haben. Sie stellen den Schlüssel bereit, die Modellnutzung wird Ihrem Anbieter in Rechnung gestellt, und unser Dienst ist bei jedem Volumen kostenlos, ohne Abonnement, Freimenge oder Überschreitung. Wählen Sie Managed, um die Anbieterregistrierung zu überspringen. Wir stellen den Dienst über unsere eigenen gebündelten Anbieter-Anmeldeinformationen bereit, und die Modellkosten werden von einem von Ihnen aufgeladenen Guthaben abgezogen. Der flex race läuft sowohl für OpenAI als auch für Gemini, und Claudes race läuft nur auf Managed.

  • Die unterstützten OpenAI-, Gemini- und Anthropic-Modelle, wobei nur die flex-fähigen am Race teilnehmen. Ein Modell, das wir nicht führen, wird namentlich mit `model_not_carried` abgelehnt, anstatt stillschweigend ersetzt zu werden. Pinnen Sie eine Route mit einem Provider-Array, openai, google oder anthropic. Möchten Sie dasselbe Modell mit Ihrem eigenen Cloud-Schlüssel verwenden? Vertex und Bedrock stellen es BYOK, Standard-Tier, ohne flex bereit. Managed bietet OpenAI, Anthropic und Gemini direkt an, plus Cloudflare Workers AI für Open-Source-Modelle.