无时间预算
start_within: defaultstart_within: default按您发送的原样转发
全价,立即启动
来自您选择的精确模型
随意提问,我们将并行运行两个请求,以便您查看成本节省和延迟权衡。
等待您的请求
等待您的请求
人们会问“有什么陷阱吗?”没有陷阱。您给我们一个时间预算。我们找到更便宜的推理服务。我们不会干扰您的请求。
start_within: defaultstart_within: default按您发送的原样转发
全价,立即启动
来自您选择的精确模型
start_within: 30sstart_within: 30s按您发送的原样转发
及时启动可享半价
如果 flex 错过窗口,则按全价计费
来自您选择的精确模型
当您发出请求时,它通过边缘计算完成。我们使用部署在 300 多个城市的 Cloudflare workers。我们自己的路由在冷启动时会增加 1-5 毫秒。
如果您发送了错误的参数,我们不会悄悄地将其删除以强制成功。当提供商拒绝请求时,我们会将状态码和错误返回给您。这样您就可以根据您的意图进行调试,而不会在发布几周后才发现错误。
将基本 URL 指向我们并传递您的密钥。我们与 OpenAI、Anthropic 和 Gemini 客户端兼容,并且可以通过可选的提供商路由链,通过 Amazon Bedrock 路由 Claude 或通过 Google Vertex AI 路由 Gemini,使用您自己的云密钥。要使用 FlexInference,您只需添加一个新字段 `start_within`。
每个错误都以您调用的 SDK 格式返回,因此您的客户端可以不变地解析它。它包含机器可读的代码、确切的修复方法和 doc_url。我们的 MCP 服务器更进一步。像 Claude 和 Cursor 这样的编码工具可以搜索文档,查找任何错误代码,并通过 OAuth 检查您的密钥和使用情况。因此,您的代理可以自行修复错误,您无需一直照看它们。
上传您上个月来自 OpenRouter/Anthropic/OpenAI/Google 的日志(我们不存储它们),我们将报告您能节省多少。
自带密钥
托管密钥
import OpenAI from "openai";
const BASE =
"https://api.flexinference.com/v1";
const client = new OpenAI({
baseURL: BASE,
apiKey: "flex_live_...",
});
const resp = await client
.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{
role: "user",
content: "Summarize this thread.",
}],
start_within: "00h-00m-30s",
} as any);一个跨 OpenAI、Gemini 和 Anthropic 的、支持截止日期的 LLM 路由器。它与 OpenAI 兼容,因此您可以保留您的 SDK 并将基本 URL 指向我们。有两种运行方式:自带提供商密钥,或让我们使用托管服务持有密钥。添加 `start_within` 截止日期,我们将竞速更便宜的层级,然后将您请求的模型返回给您。竞速现在在两种模式下都运行。BYOK 免费,不限流量,无需银行卡。
每个请求都需要的一个字段,可以在请求体中设置,也可以作为密钥的默认值。将其设置为 default、priority、auto,或一个时长,例如 00h-00m-30s。时长会为您选择的模型竞速更便宜的层级,如果竞速失败则升级到标准服务。该竞速在 BYOK 和 Managed 模式下均适用于 OpenAI 和 Gemini。在 Managed 模式下,3 到 10 分钟的 claude 时长会改为竞速 Claude 的更便宜层级。如果未能及时找到更便宜的选项?您仍然会收到响应,我们将提供标准服务。如果使用的工具无法添加字段?在创建密钥时将截止时间设置在密钥上,并且请求体发送的截止时间始终优先。
在我们所有的流量中,`flex` 竞速将综合成本降低约 49%,同时首次 token 的时间大约增加 20%。您还可以避免其他路由器对默认、自动和优先级请求收取的额外费用。我们对此额外费用感到不满,因此我们不收取。您的具体数据取决于您的模型、提供商和您设定的截止日期。
两者路由方式相同。不同之处在于谁持有密钥以及您如何支付。如果您已有提供商密钥,请选择 BYOK。您提供密钥,模型使用费由您的提供商计费,我们的服务在任何用量下均免费,无订阅费、额度或超额费用。选择“托管”以跳过提供商注册。我们使用自己的共享提供商凭据提供服务,模型费用从您充值的钱包中扣除。flex 竞速对于 OpenAI 和 Gemini 均适用,而 Claude 的竞速仅在“托管”模式下运行。
支持 OpenAI、Gemini 和 Anthropic 模型,但只有支持 flex 的模型才会参与竞速。我们不提供的模型会因 model_not_carried 而被拒绝,而不是悄悄替换。使用提供商数组、openai、google 或 anthropic 锁定路由。想在您自己的云密钥上使用相同的模型?Vertex 和 Bedrock 提供 BYOK 标准层,无 flex。托管服务直接提供 OpenAI、Anthropic 和 Gemini,以及 Cloudflare Workers AI 用于开源模型。