एक राउटर जो लागत को 49% तक कम करता है

हम आपके द्वारा निर्धारित समय सीमा में आपको सस्ता अनुमान ढूंढते हैं।

49%लागत
$3.13
FlexInference के बिना
$1.61
FlexInference के साथ
$ / 1M टोकन
+20%विलंबता
305 ms
FlexInference के बिना
366 ms
FlexInference के साथ
पहले टोकन तक का समय (ms)

// 72,781 अनुरोधों पर औसत लागत और विलंबता (2026-08-08)

अपनी लागत को आधा करने के कुछ तरीके

  • OpenScience
    +9.3% विलंबता-50.0% लागत
  • OpenCode
    -37.5% विलंबता-50.0% लागत
  • OpenWork
    +6.9% विलंबता-48.5% लागत

इसे स्वयं आज़माएँ

कुछ भी पूछें और हम दो अनुरोधों को समानांतर में चलाएँगे ताकि आप लागत बचत और विलंबता के लाभ-हानि देख सकें।

आपका अनुरोध
0/100

flex race

आपके अनुरोध का इंतज़ार है

डिफ़ॉल्ट अनुरोध

आपके अनुरोध का इंतज़ार है

हम आपके मॉडल को कभी नहीं बदलते और फिर भी आपको बचत दिलाते हैं।

लोग पूछते हैं "इसमें क्या कैच है?" कोई नहीं है। आप हमें एक समय बजट देते हैं। हम सस्ता अनुमान ढूंढते हैं। हम आपके अनुरोध में कोई हस्तक्षेप नहीं करते।

समय बजट के बिना

start_within: default
Standard लागत$1.00

समय बजट के साथ (flex दौड़)

start_within: 30s
flex-रियायती लागत$0.50

इसलिए बनाया गया ताकि आपको रात 2 बजे डीबग न करना पड़े

  • 300 शहरों में 3 ms की रूटिंग।

    जब आप कोई अनुरोध करते हैं तो उसे एज कंप्यूट का उपयोग करके पूरा किया जाता है। हम Cloudflare workers का उपयोग करते हैं जो 300+ शहरों में तैनात है। हमारी अपनी रूटिंग कोल्ड स्टार्ट पर 1-5 मिलीसेकंड जोड़ती है।

  • हम तेज़ी से और ज़ोर से विफल होते हैं।

    यदि आप एक गलत पैरामीटर भेजते हैं तो हम सफलता के लिए इसे चुपचाप नहीं हटाते हैं। जब प्रोवाइडर एक अनुरोध को अस्वीकार करता है, तो हम स्थिति कोड और त्रुटि आपको वापस भेजते हैं। इस तरह आप अपने इरादों के आधार पर डीबग कर सकते हैं और लॉन्च करने के हफ्तों बाद कोई बग नहीं ढूंढेंगे।

  • आपका मौजूदा क्लाइंट अपरिवर्तित काम करता है।

    बेस URL को हमारी ओर इंगित करें और अपनी key पास करें। हम OpenAI, Anthropic, और Gemini क्लाइंट्स के साथ काम करते हैं, और एक वैकल्पिक प्रोवाइडर रूट चेन के माध्यम से आपके अपने क्लाउड key पर Claude को Amazon Bedrock के माध्यम से या Gemini को Google Vertex AI के माध्यम से रूट कर सकते हैं। FlexInference का उपयोग करने के लिए आपको केवल एक नया फ़ील्ड, start_within, जोड़ने की आवश्यकता है।

  • आपका एजेंट खुद ठीक कर सकने वाली त्रुटियाँ।

    हर त्रुटि उसी SDK के रूप में वापस आती है जिसे आपने कॉल किया था, इसलिए आपका क्लाइंट इसे अपरिवर्तित रूप से पार्स करता है। इसमें एक मशीन-पठनीय कोड, सटीक समाधान और एक doc_url होता है। हमारा MCP सर्वर इससे भी आगे जाता है। Claude और Cursor जैसे कोडिंग टूल दस्तावेज़ों को खोज सकते हैं, किसी भी error code को देख सकते हैं, और OAuth के माध्यम से आपकी keys और उपयोग का निरीक्षण कर सकते हैं। इस प्रकार आपके एजेंट अपनी गलतियाँ खुद ठीक करते हैं, और आपको उनकी देखभाल में फँसना नहीं पड़ता।

पता करें कि आप कितनी बचत कर सकते हैं

पिछले महीने के लॉग (हम उन्हें संग्रहीत नहीं करते) OpenRouter/Anthropic/OpenAI/Google से अपलोड करें और हम बताएंगे कि आप कितनी बचत कर सकते हैं।

अपनी कुंजियाँ लाएँ, या हमें उन्हें आपके लिए चलाने दें।

अपनी Key लाएँ

मुफ्त
  • Anthropic, OpenAI, Google AI Studio, Bedrock, Vertex, Foundry, और Cloudflare Workers AI के लिए निःशुल्क सहायता
  • पहले टोकन के लिए 20% अधिक समय के साथ 49% बचाने के लिए मुफ़्त flex रेस
  • निःशुल्क लॉग, विश्लेषण और लागत ट्रैकिंग
  • हर महीने असीमित अनुरोध
  • कोई सदस्यता नहीं और कभी कोई अतिरिक्त शुल्क नहीं
  • किसी भी प्रकार का प्रति-अनुरोध शुल्क नहीं
  • क्रेडिट कार्ड की आवश्यकता नहीं है
  • आपकी प्रदाता keys आराम की स्थिति में AES-256-GCM एन्क्रिप्टेड होती हैं, आपके अनुरोध को अग्रेषित करने के लिए केवल मेमोरी में डिक्रिप्ट की जाती हैं
  • हम आपके प्रॉम्प्ट या मॉडल आउटपुट को कभी संग्रहीत या लॉग नहीं करते हैं

प्रबंधित कुंजियाँ

10%
  • Bring Your Own Key में सब कुछ
  • तुरंत उच्चतर API दर सीमाएँ
  • Anthropic मॉडल के लिए Flex रेस
  • तुरंत अनुपालक बनने के लिए वैकल्पिक PII मास्किंग
  • मॉडल लागतें सीधे पास की जाती हैं, कोई मार्कअप नहीं
  • वैकल्पिक ट्रेस स्टोरेज
  • खर्च और शेष राशि अलार्म
  • प्रति प्रदाता BYOK के साथ पूर्ण समर्थन
  • शेष नकद वापसी आपके कार्ड पर

अपनी लागत कम करने के तीन और तरीके

  • Gemini इमेज वर्गीकरण
    +20.2% विलंबता-38.9% लागत
  • OpenAI डीप रिसर्च
    -30.1% विलंबता-44.8% लागत
  • OpenAI ब्राउज़र एजेंट
    +9.7% विलंबता-51.5% लागत

सीखने के लिए कोई नई SDK सिमेंटिक्स नहीं।

import OpenAI from "openai";

const BASE =
  "https://api.flexinference.com/v1";

const client = new OpenAI({
  baseURL: BASE,
  apiKey: "flex_live_...",
});

const resp = await client
  .chat.completions.create({
    model: "gemini-2.5-flash",
    messages: [{
      role: "user",
      content: "Summarize this thread.",
    }],
    start_within: "00h-00m-30s",
  } as any);

अक्सर पूछे जाने वाले प्रश्न

  • OpenAI, Gemini, और Anthropic पर एक डेडलाइन-अवेयर LLM राउटर। यह OpenAI-संगत है, इसलिए आप अपना SDK रखते हैं और बेस URL को हमारी ओर इंगित करते हैं। इसे दो तरीकों से चलाएं: अपनी स्वयं की प्रोवाइडर key लाएं, या हमें मैनेज्ड के साथ keys रखने दें। एक start_within डेडलाइन जोड़ें और हम एक सस्ते टियर को रेस करते हैं, फिर आपको वह मॉडल वापस देते हैं जो आपने मांगा था। रेस अब दोनों पर चलती है। BYOK किसी भी वॉल्यूम पर मुफ़्त है, कोई कार्ड नहीं।

  • एक फ़ील्ड जिसकी हर रिक्वेस्ट को आवश्यकता होती है, या तो बॉडी में या key पर डिफ़ॉल्ट के रूप में। इसे default, priority, auto, या 00h-00m-30s जैसी अवधि पर सेट करें। एक अवधि आपके द्वारा चुने गए मॉडल के लिए एक सस्ते टियर को दौड़ में लगाती है, फिर यदि दौड़ हार जाती है तो मानक पर बढ़ जाती है। वह दौड़ BYOK और मैनेज्ड दोनों पर चलती है, OpenAI और Gemini के लिए। मैनेज्ड पर, 3 से 10 मिनट के बीच की claude अवधि इसके बजाय Claude के सस्ते टियर को दौड़ में लगाती है। समय पर सस्ता नहीं मिल रहा? आपको फिर भी अपना रिस्पॉन्स मिलता है, हम इसे मानक के रूप में सेवा देते हैं। एक ऐसे टूल का उपयोग कर रहे हैं जो फ़ील्ड नहीं जोड़ सकता? इसे बनाते समय डेडलाइन को key पर रखें, और जब भी बॉडी एक भेजती है तो वह अभी भी जीत जाती है।

  • हमारे सभी ट्रैफ़िक में, flex रेस मिश्रित लागत को लगभग 49% तक कम करती है, पहले टोकन के लिए लगभग 20% अधिक समय के लिए। आप अन्य राउटर द्वारा डिफ़ॉल्ट, ऑटो और प्राथमिकता अनुरोधों पर लगाए गए अतिरिक्त शुल्क को भी छोड़ देते हैं। उस अतिरिक्त शुल्क ने हमें परेशान किया, इसलिए हम इसे नहीं जोड़ते हैं। आपकी संख्याएँ आपके मॉडल, प्रदाताओं और आपके द्वारा निर्धारित समय-सीमा पर निर्भर करती हैं।

  • दोनों एक ही तरीके से रूट होते हैं। जो बदलता है वह यह है कि keys कौन रखता है और आप कैसे भुगतान करते हैं। यदि आपके पास पहले से प्रोवाइडर keys हैं तो BYOK चुनें। आप key लाते हैं, मॉडल उपयोग का बिल आपके प्रोवाइडर को जाता है, और हमारी सेवा किसी भी वॉल्यूम पर मुफ्त है, बिना किसी सब्सक्रिप्शन, भत्ते या ओवरएज के। प्रोवाइडर साइनअप को छोड़ने के लिए मैनेज्ड चुनें। हम इसे अपने स्वयं के पूल्ड प्रोवाइडर क्रेडेंशियल पर सेवा देते हैं और मॉडल की लागत आपके द्वारा लोड किए गए वॉलेट से ली जाती है। OpenAI और Gemini के लिए flex रेस दोनों तरह से चलती है, और Claude की रेस केवल मैनेज्ड पर चलती है।

  • समर्थित OpenAI, Gemini, और Anthropic मॉडल, हालांकि केवल flex-सक्षम वाले ही रेस चलाते हैं। जो मॉडल हम नहीं रखते हैं, उसे चुपचाप बदलने के बजाय model_not_carried के साथ नाम से अस्वीकार कर दिया जाता है। प्रोवाइडर ऐरे, openai, google, या anthropic के साथ एक रूट पिन करें। अपने स्वयं के क्लाउड key पर वही मॉडल चाहते हैं? Vertex और Bedrock इसे BYOK, स्टैंडर्ड टियर, बिना flex के प्रदान करते हैं। मैनेज्ड OpenAI, Anthropic, और Gemini को सीधे सेवा प्रदान करता है, साथ ही ओपन-सोर्स मॉडल के लिए Cloudflare Workers AI भी।