Um roteador que reduz o custo em 49%

Encontramos inferência mais barata no período de tempo que você definir.

49%custos
$3.13
sem FlexInference
$1.61
com FlexInference
$ / 1M tokens
+20%latência
305 ms
sem FlexInference
366 ms
com FlexInference
Tempo para o primeiro token (ms)

// custo e latência medianos em 72,781 requisições (2026-08-08)

Algumas das maneiras de reduzir seus custos pela metade

  • OpenScience
    Latência +9.3%Custo -50.0%
  • OpenCode
    Latência -37.5%Custo -50.0%
  • OpenWork
    Latência +6.9%Custo -48.5%

Experimente você mesmo

Pergunte qualquer coisa e executaremos duas requisições em paralelo para que você possa ver a economia de custos e as compensações de latência.

sua requisição
0/100

flex race

aguardando sua requisição

requisição padrão

aguardando sua requisição

Nunca trocamos seu modelo e ainda assim geramos economia.

As pessoas perguntam "Qual é a pegadinha?" Não há nenhuma. Você nos dá um orçamento de tempo. Nós encontramos inferência mais barata. Não mexemos na sua solicitação.

Sem um orçamento de tempo

start_within: default
Custo padrão$1.00

Com um orçamento de tempo (corrida flex)

start_within: 30s
Custo com desconto Flex$0.50

Construído para você não depurar às 2 da manhã

  • Roteamento de 3 ms em 300 cidades.

    Quando você faz uma requisição, ela é atendida usando computação de borda. Usamos workers do Cloudflare, que são implantados em mais de 300 cidades. Nosso próprio roteamento adiciona 1-5 milissegundos em uma inicialização a frio.

  • Falhamos rápido e alto.

    Se você enviar um parâmetro errado, não o removemos silenciosamente para forçar um sucesso. Quando o provedor rejeita uma solicitação, enviamos o código de status e o erro de volta para você. Dessa forma, você pode depurar com base em suas intenções e não encontrar um bug semanas após o lançamento.

  • Seu cliente existente funciona sem alterações.

    Aponte a URL base para nós e passe sua chave. Trabalhamos com clientes OpenAI, Anthropic e Gemini, e podemos rotear Claude através do Amazon Bedrock ou Gemini através do Google Vertex AI em sua própria chave de nuvem via uma cadeia de rota de provedor opcional. Para usar o FlexInference, você só precisa adicionar um único campo novo, start_within.

  • Erros que seu agente pode corrigir sozinho.

    Cada erro retorna no formato do SDK que você chamou, para que seu cliente o analise sem alterações. Ele contém um código legível por máquina, a correção exata e uma doc_url. Nosso servidor MCP vai além. Ferramentas de codificação como Claude e Cursor podem pesquisar a documentação, procurar qualquer código de erro e inspecionar suas chaves e uso via OAuth. Assim, seus agentes corrigem seus próprios erros, e você não fica preso a supervisioná-los.

Descubra o quanto você pode economizar

Carregue os logs do mês passado (não os armazenamos) do OpenRouter/Anthropic/OpenAI/Google e informaremos o quanto você poderia economizar.

Traga suas próprias chaves, ou deixe-nos gerenciá-las para você.

Bring Your Own Key

Grátis
  • Suporte gratuito para Anthropic, OpenAI, Google AI Studio, Bedrock, Vertex, Foundry e Cloudflare Workers AI
  • Corrida flex gratuita para economizar 49% com 20% a mais de tempo para o primeiro token
  • Logs, análises e rastreamento de custos gratuitos
  • Requisições ilimitadas todo mês
  • Sem assinatura e sem excedentes, nunca
  • Sem cobranças por requisição de qualquer tipo
  • Não é necessário cartão de crédito
  • Suas chaves de provedor são criptografadas em repouso com AES-256-GCM, descriptografadas apenas na memória para encaminhar sua solicitação
  • Nunca armazenamos ou registramos seus prompts ou saídas de modelo

Chaves Gerenciadas

10%
  • Tudo em Bring Your Own Key
  • Limites de taxa de API mais altos instantaneamente
  • Corrida Flex para modelos Anthropic
  • Mascaramento de PII opcional para conformidade instantânea
  • Custos de modelo repassados, sem margens
  • Armazenamento de rastreamento opcional
  • Alertas de gastos e saldo
  • Suporte completo com BYOK por provedor
  • Reembolsos em dinheiro restantes para seu cartão

Mais três maneiras de reduzir seus custos

  • Classificação de Imagens Gemini
    Latência +20.2%Custo -38.9%
  • Pesquisa Aprofundada OpenAI
    Latência -30.1%Custo -44.8%
  • Agente de Navegador OpenAI
    Latência +9.7%Custo -51.5%

Nenhuma nova semântica de SDK para aprender.

import OpenAI from "openai";

const BASE =
  "https://api.flexinference.com/v1";

const client = new OpenAI({
  baseURL: BASE,
  apiKey: "flex_live_...",
});

const resp = await client
  .chat.completions.create({
    model: "gemini-2.5-flash",
    messages: [{
      role: "user",
      content: "Summarize this thread.",
    }],
    start_within: "00h-00m-30s",
  } as any);

Perguntas Frequentes

  • Um roteador LLM com reconhecimento de prazo para OpenAI, Gemini e Anthropic. É compatível com OpenAI, então você mantém seu SDK e aponta a URL base para nós. Execute-o de duas maneiras: traga sua própria chave de provedor ou deixe-nos gerenciar as chaves com o Managed. Adicione um prazo start_within e nós competimos com uma camada mais barata, então devolvemos o modelo que você pediu. A corrida agora acontece em ambos. BYOK é gratuito em qualquer volume, sem cartão.

  • Um campo que toda requisição precisa, seja no corpo ou como padrão na chave. Defina-o como default, priority, auto, ou uma duração como 00h-00m-30s. Uma duração compete com uma camada mais barata para o modelo que você escolheu, então escala para o padrão se a corrida perder. Essa corrida funciona tanto em BYOK quanto em Gerenciado, para OpenAI e Gemini. Em Gerenciado, uma duração de claude entre 3 e 10 minutos compete com a camada mais barata de Claude. Não consegue encontrar uma opção mais barata a tempo? Você ainda recebe sua resposta, nós a servimos no padrão. Usando uma ferramenta que não pode adicionar um campo? Coloque o prazo na chave ao criá-la, e o corpo ainda prevalece sempre que enviar um.

  • Em todo o nosso tráfego, a corrida flex reduz o custo combinado em cerca de 49%, por aproximadamente 20% mais tempo para o primeiro token. Você também pula a sobretaxa que outros roteadores aplicam a solicitações padrão, automáticas e prioritárias. Essa sobretaxa nos incomodava, então não a adicionamos. Seus números dependem de seus modelos, provedores e do prazo que você definir.

  • Ambos roteiam da mesma forma. O que muda é quem detém as chaves e como você paga. Escolha BYOK se você já tiver chaves de provedor. Você traz a chave, o uso do modelo é cobrado do seu provedor, e nosso serviço é gratuito em qualquer volume, sem assinatura, cota ou excedente. Escolha Gerenciado para pular o registro do provedor. Nós o servimos em nossas próprias credenciais de provedor agrupadas e o custo do modelo é retirado de uma carteira que você carrega. A corrida flex funciona de qualquer forma para OpenAI e Gemini, e a corrida de Claude funciona apenas em Gerenciado.

  • Os modelos OpenAI, Gemini e Anthropic suportados, embora apenas os compatíveis com flex participem da corrida. Um modelo que não oferecemos é recusado pelo nome com model_not_carried em vez de ser silenciosamente substituído. Fixe uma rota com um array de provedores, openai, google ou anthropic. Quer o mesmo modelo em sua própria chave de nuvem? Vertex e Bedrock o servem BYOK, camada padrão, sem flex. O Managed serve OpenAI, Anthropic e Gemini diretamente, além do Cloudflare Workers AI para modelos de código aberto.