समय बजट के बिना
start_within: defaultstart_within: defaultजैसा आपने भेजा, ठीक वैसा ही अग्रेषित किया गया
पूरी कीमत, तुरंत शुरू होता है
आपके द्वारा चुने गए सटीक मॉडल से
हम आपके द्वारा निर्धारित समय सीमा में आपको सस्ता अनुमान ढूंढते हैं।
// 72,781 अनुरोधों पर औसत लागत और विलंबता (2026-08-08)
कुछ भी पूछें और हम दो अनुरोधों को समानांतर में चलाएँगे ताकि आप लागत बचत और विलंबता के लाभ-हानि देख सकें।
आपके अनुरोध का इंतज़ार है
आपके अनुरोध का इंतज़ार है
लोग पूछते हैं "इसमें क्या कैच है?" कोई नहीं है। आप हमें एक समय बजट देते हैं। हम सस्ता अनुमान ढूंढते हैं। हम आपके अनुरोध में कोई हस्तक्षेप नहीं करते।
start_within: defaultstart_within: defaultजैसा आपने भेजा, ठीक वैसा ही अग्रेषित किया गया
पूरी कीमत, तुरंत शुरू होता है
आपके द्वारा चुने गए सटीक मॉडल से
start_within: 30sstart_within: 30sजैसा आपने भेजा, ठीक वैसा ही अग्रेषित किया गया
यदि यह समय पर शुरू होता है तो आधी कीमत
यदि flex समय-सीमा चूक जाता है तो पूरी कीमत
आपके द्वारा चुने गए सटीक मॉडल से
जब आप कोई अनुरोध करते हैं तो उसे एज कंप्यूट का उपयोग करके पूरा किया जाता है। हम Cloudflare workers का उपयोग करते हैं जो 300+ शहरों में तैनात है। हमारी अपनी रूटिंग कोल्ड स्टार्ट पर 1-5 मिलीसेकंड जोड़ती है।
यदि आप एक गलत पैरामीटर भेजते हैं तो हम सफलता के लिए इसे चुपचाप नहीं हटाते हैं। जब प्रोवाइडर एक अनुरोध को अस्वीकार करता है, तो हम स्थिति कोड और त्रुटि आपको वापस भेजते हैं। इस तरह आप अपने इरादों के आधार पर डीबग कर सकते हैं और लॉन्च करने के हफ्तों बाद कोई बग नहीं ढूंढेंगे।
बेस URL को हमारी ओर इंगित करें और अपनी key पास करें। हम OpenAI, Anthropic, और Gemini क्लाइंट्स के साथ काम करते हैं, और एक वैकल्पिक प्रोवाइडर रूट चेन के माध्यम से आपके अपने क्लाउड key पर Claude को Amazon Bedrock के माध्यम से या Gemini को Google Vertex AI के माध्यम से रूट कर सकते हैं। FlexInference का उपयोग करने के लिए आपको केवल एक नया फ़ील्ड, start_within, जोड़ने की आवश्यकता है।
हर त्रुटि उसी SDK के रूप में वापस आती है जिसे आपने कॉल किया था, इसलिए आपका क्लाइंट इसे अपरिवर्तित रूप से पार्स करता है। इसमें एक मशीन-पठनीय कोड, सटीक समाधान और एक doc_url होता है। हमारा MCP सर्वर इससे भी आगे जाता है। Claude और Cursor जैसे कोडिंग टूल दस्तावेज़ों को खोज सकते हैं, किसी भी error code को देख सकते हैं, और OAuth के माध्यम से आपकी keys और उपयोग का निरीक्षण कर सकते हैं। इस प्रकार आपके एजेंट अपनी गलतियाँ खुद ठीक करते हैं, और आपको उनकी देखभाल में फँसना नहीं पड़ता।
पिछले महीने के लॉग (हम उन्हें संग्रहीत नहीं करते) OpenRouter/Anthropic/OpenAI/Google से अपलोड करें और हम बताएंगे कि आप कितनी बचत कर सकते हैं।
अपनी Key लाएँ
प्रबंधित कुंजियाँ
import OpenAI from "openai";
const BASE =
"https://api.flexinference.com/v1";
const client = new OpenAI({
baseURL: BASE,
apiKey: "flex_live_...",
});
const resp = await client
.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{
role: "user",
content: "Summarize this thread.",
}],
start_within: "00h-00m-30s",
} as any);OpenAI, Gemini, और Anthropic पर एक डेडलाइन-अवेयर LLM राउटर। यह OpenAI-संगत है, इसलिए आप अपना SDK रखते हैं और बेस URL को हमारी ओर इंगित करते हैं। इसे दो तरीकों से चलाएं: अपनी स्वयं की प्रोवाइडर key लाएं, या हमें मैनेज्ड के साथ keys रखने दें। एक start_within डेडलाइन जोड़ें और हम एक सस्ते टियर को रेस करते हैं, फिर आपको वह मॉडल वापस देते हैं जो आपने मांगा था। रेस अब दोनों पर चलती है। BYOK किसी भी वॉल्यूम पर मुफ़्त है, कोई कार्ड नहीं।
एक फ़ील्ड जिसकी हर रिक्वेस्ट को आवश्यकता होती है, या तो बॉडी में या key पर डिफ़ॉल्ट के रूप में। इसे default, priority, auto, या 00h-00m-30s जैसी अवधि पर सेट करें। एक अवधि आपके द्वारा चुने गए मॉडल के लिए एक सस्ते टियर को दौड़ में लगाती है, फिर यदि दौड़ हार जाती है तो मानक पर बढ़ जाती है। वह दौड़ BYOK और मैनेज्ड दोनों पर चलती है, OpenAI और Gemini के लिए। मैनेज्ड पर, 3 से 10 मिनट के बीच की claude अवधि इसके बजाय Claude के सस्ते टियर को दौड़ में लगाती है। समय पर सस्ता नहीं मिल रहा? आपको फिर भी अपना रिस्पॉन्स मिलता है, हम इसे मानक के रूप में सेवा देते हैं। एक ऐसे टूल का उपयोग कर रहे हैं जो फ़ील्ड नहीं जोड़ सकता? इसे बनाते समय डेडलाइन को key पर रखें, और जब भी बॉडी एक भेजती है तो वह अभी भी जीत जाती है।
हमारे सभी ट्रैफ़िक में, flex रेस मिश्रित लागत को लगभग 49% तक कम करती है, पहले टोकन के लिए लगभग 20% अधिक समय के लिए। आप अन्य राउटर द्वारा डिफ़ॉल्ट, ऑटो और प्राथमिकता अनुरोधों पर लगाए गए अतिरिक्त शुल्क को भी छोड़ देते हैं। उस अतिरिक्त शुल्क ने हमें परेशान किया, इसलिए हम इसे नहीं जोड़ते हैं। आपकी संख्याएँ आपके मॉडल, प्रदाताओं और आपके द्वारा निर्धारित समय-सीमा पर निर्भर करती हैं।
दोनों एक ही तरीके से रूट होते हैं। जो बदलता है वह यह है कि keys कौन रखता है और आप कैसे भुगतान करते हैं। यदि आपके पास पहले से प्रोवाइडर keys हैं तो BYOK चुनें। आप key लाते हैं, मॉडल उपयोग का बिल आपके प्रोवाइडर को जाता है, और हमारी सेवा किसी भी वॉल्यूम पर मुफ्त है, बिना किसी सब्सक्रिप्शन, भत्ते या ओवरएज के। प्रोवाइडर साइनअप को छोड़ने के लिए मैनेज्ड चुनें। हम इसे अपने स्वयं के पूल्ड प्रोवाइडर क्रेडेंशियल पर सेवा देते हैं और मॉडल की लागत आपके द्वारा लोड किए गए वॉलेट से ली जाती है। OpenAI और Gemini के लिए flex रेस दोनों तरह से चलती है, और Claude की रेस केवल मैनेज्ड पर चलती है।
समर्थित OpenAI, Gemini, और Anthropic मॉडल, हालांकि केवल flex-सक्षम वाले ही रेस चलाते हैं। जो मॉडल हम नहीं रखते हैं, उसे चुपचाप बदलने के बजाय model_not_carried के साथ नाम से अस्वीकार कर दिया जाता है। प्रोवाइडर ऐरे, openai, google, या anthropic के साथ एक रूट पिन करें। अपने स्वयं के क्लाउड key पर वही मॉडल चाहते हैं? Vertex और Bedrock इसे BYOK, स्टैंडर्ड टियर, बिना flex के प्रदान करते हैं। मैनेज्ड OpenAI, Anthropic, और Gemini को सीधे सेवा प्रदान करता है, साथ ही ओपन-सोर्स मॉडल के लिए Cloudflare Workers AI भी।