Sem um orçamento de tempo
start_within: defaultstart_within: defaultEncaminhada exatamente como você enviou
Preço total, inicia imediatamente
Do modelo exato que você escolheu
Encontramos inferência mais barata no período de tempo que você definir.
// custo e latência medianos em 72,781 requisições (2026-08-08)
Pergunte qualquer coisa e executaremos duas requisições em paralelo para que você possa ver a economia de custos e as compensações de latência.
aguardando sua requisição
aguardando sua requisição
As pessoas perguntam "Qual é a pegadinha?" Não há nenhuma. Você nos dá um orçamento de tempo. Nós encontramos inferência mais barata. Não mexemos na sua solicitação.
start_within: defaultstart_within: defaultEncaminhada exatamente como você enviou
Preço total, inicia imediatamente
Do modelo exato que você escolheu
start_within: 30sstart_within: 30sEncaminhada exatamente como você enviou
Metade do preço se iniciar a tempo
Preço total se flex perder o prazo
Do modelo exato que você escolheu
Quando você faz uma requisição, ela é atendida usando computação de borda. Usamos workers do Cloudflare, que são implantados em mais de 300 cidades. Nosso próprio roteamento adiciona 1-5 milissegundos em uma inicialização a frio.
Se você enviar um parâmetro errado, não o removemos silenciosamente para forçar um sucesso. Quando o provedor rejeita uma solicitação, enviamos o código de status e o erro de volta para você. Dessa forma, você pode depurar com base em suas intenções e não encontrar um bug semanas após o lançamento.
Aponte a URL base para nós e passe sua chave. Trabalhamos com clientes OpenAI, Anthropic e Gemini, e podemos rotear Claude através do Amazon Bedrock ou Gemini através do Google Vertex AI em sua própria chave de nuvem via uma cadeia de rota de provedor opcional. Para usar o FlexInference, você só precisa adicionar um único campo novo, start_within.
Cada erro retorna no formato do SDK que você chamou, para que seu cliente o analise sem alterações. Ele contém um código legível por máquina, a correção exata e uma doc_url. Nosso servidor MCP vai além. Ferramentas de codificação como Claude e Cursor podem pesquisar a documentação, procurar qualquer código de erro e inspecionar suas chaves e uso via OAuth. Assim, seus agentes corrigem seus próprios erros, e você não fica preso a supervisioná-los.
Carregue os logs do mês passado (não os armazenamos) do OpenRouter/Anthropic/OpenAI/Google e informaremos o quanto você poderia economizar.
Bring Your Own Key
Chaves Gerenciadas
import OpenAI from "openai";
const BASE =
"https://api.flexinference.com/v1";
const client = new OpenAI({
baseURL: BASE,
apiKey: "flex_live_...",
});
const resp = await client
.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{
role: "user",
content: "Summarize this thread.",
}],
start_within: "00h-00m-30s",
} as any);Um roteador LLM com reconhecimento de prazo para OpenAI, Gemini e Anthropic. É compatível com OpenAI, então você mantém seu SDK e aponta a URL base para nós. Execute-o de duas maneiras: traga sua própria chave de provedor ou deixe-nos gerenciar as chaves com o Managed. Adicione um prazo start_within e nós competimos com uma camada mais barata, então devolvemos o modelo que você pediu. A corrida agora acontece em ambos. BYOK é gratuito em qualquer volume, sem cartão.
Um campo que toda requisição precisa, seja no corpo ou como padrão na chave. Defina-o como default, priority, auto, ou uma duração como 00h-00m-30s. Uma duração compete com uma camada mais barata para o modelo que você escolheu, então escala para o padrão se a corrida perder. Essa corrida funciona tanto em BYOK quanto em Gerenciado, para OpenAI e Gemini. Em Gerenciado, uma duração de claude entre 3 e 10 minutos compete com a camada mais barata de Claude. Não consegue encontrar uma opção mais barata a tempo? Você ainda recebe sua resposta, nós a servimos no padrão. Usando uma ferramenta que não pode adicionar um campo? Coloque o prazo na chave ao criá-la, e o corpo ainda prevalece sempre que enviar um.
Em todo o nosso tráfego, a corrida flex reduz o custo combinado em cerca de 49%, por aproximadamente 20% mais tempo para o primeiro token. Você também pula a sobretaxa que outros roteadores aplicam a solicitações padrão, automáticas e prioritárias. Essa sobretaxa nos incomodava, então não a adicionamos. Seus números dependem de seus modelos, provedores e do prazo que você definir.
Ambos roteiam da mesma forma. O que muda é quem detém as chaves e como você paga. Escolha BYOK se você já tiver chaves de provedor. Você traz a chave, o uso do modelo é cobrado do seu provedor, e nosso serviço é gratuito em qualquer volume, sem assinatura, cota ou excedente. Escolha Gerenciado para pular o registro do provedor. Nós o servimos em nossas próprias credenciais de provedor agrupadas e o custo do modelo é retirado de uma carteira que você carrega. A corrida flex funciona de qualquer forma para OpenAI e Gemini, e a corrida de Claude funciona apenas em Gerenciado.
Os modelos OpenAI, Gemini e Anthropic suportados, embora apenas os compatíveis com flex participem da corrida. Um modelo que não oferecemos é recusado pelo nome com model_not_carried em vez de ser silenciosamente substituído. Fixe uma rota com um array de provedores, openai, google ou anthropic. Quer o mesmo modelo em sua própria chave de nuvem? Vertex e Bedrock o servem BYOK, camada padrão, sem flex. O Managed serve OpenAI, Anthropic e Gemini diretamente, além do Cloudflare Workers AI para modelos de código aberto.