一个将成本降低49%的路由器

在您设定的时间窗口内,我们为您找到更便宜的推理服务。

49%成本
$3.13
不使用FlexInference
$1.61
使用FlexInference
美元 / 100万 token
+20%延迟
305 ms
不使用FlexInference
366 ms
使用FlexInference
首个token响应时间 (毫秒)

// 72,781 次请求的平均成本和延迟(截至 2026-08-08)

将成本减半的方法

  • OpenScience
    +9.3% 延迟-50.0% 成本
  • OpenCode
    -37.5% 延迟-50.0% 成本
  • OpenWork
    +6.9% 延迟-48.5% 成本

亲自试用

随意提问,我们将并行运行两个请求,以便您查看成本节省和延迟权衡。

您的请求
0/100

flex 竞速

等待您的请求

默认请求

等待您的请求

我们从不更换您的模型,仍能为您节省开支。

人们会问“有什么陷阱吗?”没有陷阱。您给我们一个时间预算。我们找到更便宜的推理服务。我们不会干扰您的请求。

无时间预算

start_within: default
Standard 成本$1.00

有时间预算(flex 竞速)

start_within: 30s
Flex 优惠成本$0.50

旨在让您无需在凌晨 2 点调试

  • 300 个城市间 3 毫秒路由。

    当您发出请求时,它通过边缘计算完成。我们使用部署在 300 多个城市的 Cloudflare workers。我们自己的路由在冷启动时会增加 1-5 毫秒。

  • 我们快速且明确地失败。

    如果您发送了错误的参数,我们不会悄悄地将其删除以强制成功。当提供商拒绝请求时,我们会将状态码和错误返回给您。这样您就可以根据您的意图进行调试,而不会在发布几周后才发现错误。

  • 您现有的客户端无需更改即可工作。

    将基本 URL 指向我们并传递您的密钥。我们与 OpenAI、Anthropic 和 Gemini 客户端兼容,并且可以通过可选的提供商路由链,通过 Amazon Bedrock 路由 Claude 或通过 Google Vertex AI 路由 Gemini,使用您自己的云密钥。要使用 FlexInference,您只需添加一个新字段 `start_within`。

  • 您的代理可自行修复的错误。

    每个错误都以您调用的 SDK 格式返回,因此您的客户端可以不变地解析它。它包含机器可读的代码、确切的修复方法和 doc_url。我们的 MCP 服务器更进一步。像 Claude 和 Cursor 这样的编码工具可以搜索文档,查找任何错误代码,并通过 OAuth 检查您的密钥和使用情况。因此,您的代理可以自行修复错误,您无需一直照看它们。

了解您能节省多少

上传您上个月来自 OpenRouter/Anthropic/OpenAI/Google 的日志(我们不存储它们),我们将报告您能节省多少。

自带密钥,或由我们为您管理。

自带密钥

免费
  • 免费支持 Anthropic、OpenAI、Google AI Studio、Bedrock、Vertex、Foundry 和 Cloudflare Workers AI
  • 免费 Flex 竞价,可节省 49% 成本,但首次生成时间会增加约 20%
  • 免费日志、分析和成本跟踪
  • 每月无限请求
  • 永远无订阅,无超额费用
  • 无任何形式的按请求收费
  • 无需信用卡
  • 您的提供商密钥在静态时采用 AES-256-GCM 加密,仅在内存中解密以转发您的请求
  • 我们从不存储或记录您的提示或模型输出

托管密钥

10%
  • 包含 Bring Your Own Key 的所有功能
  • 即时获得更高的 API 速率限制
  • 适用于 Anthropic 模型的 Flex 竞速
  • 可选的 PII 遮蔽,即时合规
  • 模型成本直通,无加价
  • 可选的跟踪存储
  • 支出和余额警报
  • 全面支持每个提供商的 BYOK
  • 剩余现金退款至您的银行卡

另外三种降低成本的方法

  • Gemini 图像分类
    +20.2% 延迟-38.9% 成本
  • OpenAI 深度研究
    -30.1% 延迟-44.8% 成本
  • OpenAI 浏览器代理
    +9.7% 延迟-51.5% 成本

无需学习新的 SDK 语义。

import OpenAI from "openai";

const BASE =
  "https://api.flexinference.com/v1";

const client = new OpenAI({
  baseURL: BASE,
  apiKey: "flex_live_...",
});

const resp = await client
  .chat.completions.create({
    model: "gemini-2.5-flash",
    messages: [{
      role: "user",
      content: "Summarize this thread.",
    }],
    start_within: "00h-00m-30s",
  } as any);

常见问题

  • 一个跨 OpenAI、Gemini 和 Anthropic 的、支持截止日期的 LLM 路由器。它与 OpenAI 兼容,因此您可以保留您的 SDK 并将基本 URL 指向我们。有两种运行方式:自带提供商密钥,或让我们使用托管服务持有密钥。添加 `start_within` 截止日期,我们将竞速更便宜的层级,然后将您请求的模型返回给您。竞速现在在两种模式下都运行。BYOK 免费,不限流量,无需银行卡。

  • 每个请求都需要的一个字段,可以在请求体中设置,也可以作为密钥的默认值。将其设置为 default、priority、auto,或一个时长,例如 00h-00m-30s。时长会为您选择的模型竞速更便宜的层级,如果竞速失败则升级到标准服务。该竞速在 BYOK 和 Managed 模式下均适用于 OpenAI 和 Gemini。在 Managed 模式下,3 到 10 分钟的 claude 时长会改为竞速 Claude 的更便宜层级。如果未能及时找到更便宜的选项?您仍然会收到响应,我们将提供标准服务。如果使用的工具无法添加字段?在创建密钥时将截止时间设置在密钥上,并且请求体发送的截止时间始终优先。

  • 在我们所有的流量中,`flex` 竞速将综合成本降低约 49%,同时首次 token 的时间大约增加 20%。您还可以避免其他路由器对默认、自动和优先级请求收取的额外费用。我们对此额外费用感到不满,因此我们不收取。您的具体数据取决于您的模型、提供商和您设定的截止日期。

  • 两者路由方式相同。不同之处在于谁持有密钥以及您如何支付。如果您已有提供商密钥,请选择 BYOK。您提供密钥,模型使用费由您的提供商计费,我们的服务在任何用量下均免费,无订阅费、额度或超额费用。选择“托管”以跳过提供商注册。我们使用自己的共享提供商凭据提供服务,模型费用从您充值的钱包中扣除。flex 竞速对于 OpenAI 和 Gemini 均适用,而 Claude 的竞速仅在“托管”模式下运行。

  • 支持 OpenAI、Gemini 和 Anthropic 模型,但只有支持 flex 的模型才会参与竞速。我们不提供的模型会因 model_not_carried 而被拒绝,而不是悄悄替换。使用提供商数组、openai、google 或 anthropic 锁定路由。想在您自己的云密钥上使用相同的模型?Vertex 和 Bedrock 提供 BYOK 标准层,无 flex。托管服务直接提供 OpenAI、Anthropic 和 Gemini,以及 Cloudflare Workers AI 用于开源模型。