HI ▾
API कुंजी पाएँ

Open AI API मूल्य निर्धारण: उत्पादन चेकलिस्ट

उत्पादन अनुप्रयोग बनाते समय, LLM API मूल्य निर्धारण को समझना महत्वपूर्ण है क्योंकि टोकन लागत इनपुट और आउटपुट टोकन के बीच काफी भिन्न होती है। यह गाइड बिना सेंसर और मानक LLMs चलाने की वास्तविक लागत को विभाजित करती है, आपको छिपी हुई फीस के बिना सटीक बजट बनाने में मदद करती है।

अपडेट किया गया

मुख्य बिंदु

  • इनपुट टोकन आउटपुट टोकन से सस्ते हैं, इसलिए प्रॉम्प्ट लंबाई को अनुकूलित करने से सीधे आपकी बिल कम होती है।
  • स्ट्रीमिंग कुल लागत को नहीं बदलता है, क्योंकि आप डिलीवरी विधि की परवाह किए बिना अंतिम टोकन गणना के लिए भुगतान करते हैं।
  • पे-एज़-यू-गो मॉडल मासिक न्यूनतम को समाप्त कर देते हैं, जो अनिश्चित ट्रैफिक पैटर्न के लिए आदर्श हैं।
  • बिना सेंसर मॉडल अक्सर प्रमुख प्रदाताओं के समान मूल्य संरचना रखते हैं लेकिन सामग्री फ़िल्टरिंग ओवरहेड को हटा देते हैं।

टोकन लागत को समझना

बड़े भाषा मॉडल पाठ को टोकन नामक इकाइयों में प्रोसेस करते हैं। एक टोकन लगभग चार अक्षर या शब्द का एक अंश होता है। आप जो टोकन भेजते हैं (इनपुट) और मॉडल द्वारा जनरेट किए गए टोकन (आउटपुट) दोनों के लिए भुगतान करते हैं। यह द्वैध-मूल्य निर्धारण संरचना अधिकांश LLM API, जिसमें OpenAI और विभिन्न बिना सेंसर विकल्प शामिल हैं, के लिए मानक है।

इनपुट टोकन में आपका सिस्टम प्रॉम्प्ट, बातचीत का इतिहास और उपयोगकर्ता क्वेरी शामिल है। आउटपुट टोकन मॉडल की प्रतिक्रिया है। यदि आप एक लंबी कॉन्टेक्स्ट विंडो भेजते हैं लेकिन एक छोटा उत्तर प्राप्त करते हैं, तो आपकी लागत इनपुट मूल्य द्वारा प्रभावी होती है। इसके विपरीत, विस्तृत मॉडल या जटिल तर्क कार्यों में आउटपुट लागत बढ़ जाती है।

अधिकांश प्रदाता इनपुट और आउटपुट टोकन के लिए अलग-अलग दरें लागू करते हैं। इनपुट आमतौर पर सस्ता होता है क्योंकि टेक्स्ट जनरेट करने में टेक्स्ट पढ़ने की तुलना में अधिक कंप्यूटेशनल प्रयास की आवश्यकता होती है। इस अनुपात को समझने से आपको कोड लिखने से पहले लागत का अनुमान लगाने में मदद मिलती है। दोनों दिशाओं के लिए प्रति मिलियन टोकन दरें हमेशा जांचें।

इनपुट बनाम आउटपुट मूल्य निर्धारण

इनपुट टोकन की लागत आमतौर पर आउटपुट टोकन की तुलना में प्रति मिलियन कम होती है। उदाहरण के लिए, एक सामान्य दर इनपुट टोकन के प्रति मिलियन टोकन के लिए $0.25 और आउटपुट टोकन के प्रति मिलियन टोकन के लिए $1.00 हो सकती है। यह चार गुना अंतर इस बात का संकेत देता है कि आपकी प्रॉम्प्ट इंजीनियरिंग रणनीति आपके बजट को महत्वपूर्ण रूप से प्रभावित करती है।

जब आप अपने सिस्टम प्रॉम्पट को डिज़ाइन करते हैं, तो उसे संक्षिप्त रखें। उन आवश्यक निर्देशों या अनावश्यक संदर्भ को हटा दें जिनकी मॉडल को क्वेरी का उत्तर देने के लिए आवश्यक नहीं है। आपके इनपुट में हर अतिरिक्त टोकन लागत में जोड़ता है, भले ही मॉडल उसे अनदेखा कर दे।

जब मॉडल विस्तृत होते हैं तो आउटपुट लागत बढ़ जाती है। कुछ मॉडल, विशेष रूप से बिना सेंसर वेरिएंट, अधिक विस्तृत या भटकते हुए उत्तर दे सकते हैं। यदि आपको सटीक, छोटे उत्तर चाहिए, तो आप अपने सिस्टम प्रॉम्प्ट में विशिष्ट निर्देशों के साथ मॉडल को निर्देशित कर सकते हैं। इससे आउटपुट टोकन उपयोग कम होता है और आपकी बिल कम होती है।

हमेशा इनपुट और आउटपुट लागत को जोड़कर कुल लागत की गणना करें। यह न मानें कि सस्ता इनपुट दर आपकी खर्च को प्रभावी बनाता है यदि आपका उपयोग मामला लंबी प्रतिक्रियाएँ उत्पन्न करता है।

कुल लागत की गणना

एक API कॉल की कुल लागत की गणना करने के लिए, इनपुट टोकन की संख्या को प्रति मिलियन इनपुट मूल्य से गुणा करें, फिर आउटपुट टोकन और प्रति मिलियन आउटपुट मूल्य के गुणनफल को जोड़ें। यह सूत्र अधिकांश LLM APIs पर लागू होता है, जिसमें अनलिमिटेड AI API और OpenAI जैसे प्रमुख प्रदाता शामिल हैं।

  • लागत = (इनपुट टोकन / 1,000,000) × इनपुट मूल्य + (आउटपुट टोकन / 1,000,000) × आउटपुट मूल्य

उदाहरण के लिए, यदि आप 500 इनपुट टोकन भेजते हैं और 100 आउटपुट टोकन प्राप्त करते हैं, जो क्रमशः प्रति मिलियन $0.25 और $1.00 पर हैं, तो लागत नगण्य होती है। हालांकि, इसे प्रतिदिन हजारों अनुरोधों तक बढ़ाने से लागत तेजी से बढ़ जाती है।

अपने अनुप्रयोग में एक लागत अनुमानक बनाने के लिए इस सूत्र का उपयोग करें। भविष्य की लागतों की भविष्यवाणी करने के लिए अपने लॉग में टोकन उपयोग ट्रैक करें। कई डेवलपर उत्पादन में उपयोग किए गए टोकन की मात्रा को कम आंकते हैं, जिससे अप्रत्याशित बिल आते हैं।

स्केल के लिए बजट बनाना

LLM उपयोग के लिए बजट बनाने में ट्रैफिक पैटर्न की भविष्यवाणी की आवश्यकता होती है। यदि आपके अनुप्रयोग की उपयोगिता पूर्वानुमेय है, जैसे कि दैनिक क्वेरी की एक निश्चित संख्या, तो आप मासिक लागत का आसानी से अनुमान लगा सकते हैं। परिवर्तनीय ट्रैफिक के लिए, अनावश्यक क्षमता के लिए अधिक भुगतान करने से बचने के लिए पे-एज़-यू-गो मॉडल का उपयोग करें।

प्रीपेड क्रेडिट मॉडल लचीलापन प्रदान करते हैं। आप आवश्यकता के अनुसार टॉप-अप करते हैं, बिना किसी मासिक सदस्यता शुल्क के। कुछ प्रदाता बड़े टॉप-अप के लिए बोनस प्रदान करते हैं, जो प्रति टोकन आपकी प्रभावी लागत को कम कर सकते हैं। यह फ्लक्चुएटिंग डिमांड वाले इंडी डेवलपर या स्टार्टअप्स के लिए उपयोगी है।

अपने उपयोग की निकटता से निगरानी करें। अपने डैशबोर्ड में अलर्ट सेट करें ताकि जब खर्च एक थ्रेशोल्ड तक पहुँच जाए तो आपको सूचित किया जा सके। यह लूप या अप्रत्याशित ट्रैफिक स्पाइक्स से चल रही लागत को रोकता है। पे-एज़-यू-गो संरचनाएं सुनिश्चित करती हैं कि आप केवल उसी के लिए भुगतान करें जिसका आप उपयोग करते हैं, जो परीक्षण और स्केलिंग के लिए आदर्श हैं।

प्रॉम्प्ट लंबाई को अनुकूलित करना

प्रॉम्प्ट अनुकूलन इनपुट लागत कम करने का सबसे सीधा तरीका है। अपने सिस्टम प्रॉम्पट को संक्षिप्त रखें और अनावश्यक जानकारी हटा दें। फ़ी-शॉट उदाहरणों का उपयोग सावधानी से करें, क्योंकि प्रत्येक उदाहरण हर अनुरोध में टोकन जोड़ता है।

प्रॉम्प्ट में केवल प्रासंगिक संदर्क्ष को इंजेक्ट करने के लिए रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) का उपयोग करने पर विचार करें। इससे हर बार एक बड़ा दस्तावेज़ भेजने की तुलना में टोकन गणना कम हो जाती है। हालाँकि, RAG आपके आर्किटेक्चर में लेटेंसी और जटिलता जोड़ता है।

असीमित AI API के लिए, जो 100,000-टोकन की कॉन्टेक्स्ट विंडो का समर्थन करता है, आप यदि आवश्यक हो तो लंबे संदर्भों को संभाल सकते हैं। लेकिन याद रखें कि प्रत्येक टोकन की कीमत होती है। अनावश्यक व्हाइटस्पेस को हटाएं और जहां भी संभव हो निर्देशों को मिलाएं।

मॉडल प्रदर्शन और टोकन दक्षता के बीच संतुलन खोजने के लिए विभिन्न प्रॉम्प्ट संरचनाओं का परीक्षण करें। छोटे प्रॉम्प्ट सटीकता को कम कर सकते हैं, इसलिए लागत के साथ-साथ गुणवत्ता की निगरानी करें।

स्ट्रीमिंग लागत को संभालना

स्ट्रीमिंग टोकन को जनरेट होते ही डिलीवर करता है, लंबी प्रतिक्रियाओं के लिए बेहतर उपयोगकर्ता अनुभव प्रदान करता है। हालाँकि, स्ट्रीमिंग कुल लागत को कम नहीं करता है। आप डेटा की डिलीवरी की परवाह किए बिना पूर्ण इनपुट और आउटपुट टोकन गणना के लिए भुगतान करते हैं।

कुछ डेवलपर मानते हैं कि स्ट्रीमिंग सस्ता है क्योंकि यह तेज़ लगता है। यह गलत है। कंप्यूटेशनल लागत समान है। स्ट्रीमिंग केवल लेटेंसी प्रोफ़ाइल को बदलता है, मूल्य निर्धारण मॉडल को नहीं।

जब उपयोगकर्ता अनुप्रयोग महत्वपूर्ण हो, जैसे चैट इंटरफेस में, स्ट्रीमिंग का उपयोग करें। बैच प्रोसेसिंग के लिए या जब आपको आगे बढ़ने से पहले पूरी प्रतिक्रिया की आवश्यकता हो, तो गैर-स्ट्रीमिंग का उपयोग करें। दोनों विधियाँ समान टोकन-आधारित शुल्क लगाती हैं।

सुनिश्चित करें कि आपका क्लाइंट कोड स्ट्रीमिंग को सही ढंग से संभालता है ताकि आंशिक गणना से बचा जा सके। कुछ APIs अपूर्ण टोकन के लिए चार्ज करते हैं, इसलिए स्ट्रीम पूरा होने के बाद हमेशा अंतिम टोकन गणना की पुष्टि करें।

उपयोग की निगरानी

उपयोग की निगरानी लागत नियंत्रण के लिए महत्वपूर्ण है। इनपुट और आउटपुट टोकन को अलग-अलग ट्रैक करें। इससे आपको यह पहचानने में मदद मिलती है कि आपके अनुप्रयोग के कौन से हिस्से लागत को बढ़ा रहे हैं।

हर अनुरोध के लिए टोकन गणना रिकॉर्ड करने के लिए लॉगिंग सेट करें। उपयोगकर्ता प्रति या फीचर प्रति औसत लागत की गणना करने के लिए इस डेटा का उपयोग करें। उन आउटलायर्स की पहचान करें जहाँ टोकन उपयोग असामान्य रूप से अधिक है।

अधिकतर APIs डैशबोर्ड एनालिटिक्स प्रदान करते हैं। लागत प्रवृत्तियों को दृश्यमान करने के लिए इन टूल्स का उपयोग करें। यदि आपको आउटपुट टोकन में अचानक वृद्धि दिखाई देती है, तो जांचें कि क्या मॉडल विस्तृत हो रहा है या क्या आपके प्रॉम्प्ट बहुत खुले हैं।

अपने API कुंजी के उपयोग की नियमित समीक्षा करें। यदि कोई कुंजी लीक हो जाती है तो संपर्क को सीमित करने के लिए कुंजियों को कालानुक्रमिक रूप से बदलें। अधिकांश APIs आपको अपने खाते के इतिहास या शेष राशि को खोए बिना नई कुंजियां जनरेट करने की अनुमति देते हैं।

वैकल्पिक विकल्पों की तुलना

LLM APIs की तुलना करते समय, शीर्षक मूल्य से परे देखें। मॉडल गुणवत्ता, लेटेंसी और विश्वसनीयता जैसे कारकों पर विचार करें। कुछ प्रदाता कम इनपुट मूल्य लेकिन उच्च आउटपुट मूल्य प्रदान करते हैं। अन्य तेज़ प्रतिक्रिया समय के लिए अधिक चार्ज करते हैं।

अनलिमिटेड AI API एक सीधा पे-एज़-यू-गो मॉडल प्रदान करता है जिसमें कोई मासिक शुल्क नहीं है। यह वयस्क या विवादास्पद विषयों के लिए उपयुक्त एक बिना सेंसर मॉडल प्रदान करता है, जो विशिष्ट उपयोग मामलों के लिए मूल्यवान हो सकता है। इसकी तुलना उन प्रदाताओं से करें जो सामग्री को फ़िल्टर करते हैं, जो आपके एप्लिकेशन के व्यवहार को प्रभावित कर सकते हैं।

बेस URL संगतता जांचें। अधिकांश APIs OpenAI फॉर्मेट का पालन करते हैं, जिससे प्रदाता बदलना आसान होता है। सुनिश्चित करें कि आपका SDK कॉन्फ़िगरेशन प्रदाता के एंडपॉइंट का समर्थन करता है। यह लचीलापन आपको तब बदलने की अनुमति देता है यदि मूल्य बदल जाते हैं या गुणवत्ता कम हो जाती है।

हमेशा प्रदाता की वेबसाइट पर नवीनतम मूल्य जांचें। दरों में बिना सूचना बदलाव किया जा सकता है। कुल लागत की तुलना करते समय किसी भी बोनस क्रेडिट या छूट को शामिल करें।

प्रश्न और उत्तर

क्या अनलिमिटेड AI API पे-एज़-यू-गो है?

हाँ, असीमित AI API पे-एज़-यू-गो प्रीपेड क्रेडिट मॉडल पर काम करता है। मासिक सदस्यता या न्यूनतम खर्च की कोई आवश्यकता नहीं है। आप जब आवश्यक हो टॉप-अप करते हैं, और अप्रयुक्त क्रेडिट कभी समाप्त नहीं होता।

अनलिमिटेड AI API प्रति टोकन कितना चार्ज करता है?

अनलिमिटेड AI API इनपुट टोकन के प्रति मिलियन टोकन के लिए $0.25 और आउटपुट टोकन के प्रति मिलियन टोकन के लिए $1.00 चार्ज करता है। ये दरें पारदर्शी हैं और सभी अनुरोधों पर लागू होती हैं, स्ट्रीमिंग या फ़ंक्शन कॉलिंग के लिए कोई छिपा शुल्क नहीं है।

क्या स्ट्रीमिंग का खर्च नॉन-स्ट्रीमिंग से अधिक है?

नहीं, स्ट्रीमिंग कुल लागत को प्रभावित नहीं करता है। आप इनपुट और आउटपुट टोकन की समान संख्या के लिए भुगतान करते हैं, चाहे आप प्रतिक्रिया रियल-टाइम में प्राप्त करें या एक पूर्ण ब्लॉक के रूप में। स्ट्रीमिंग केवल उपयोगकर्ता अनुभव को बेहतर बनाता है, अपेक्षित लेटेंसी कम करके।

API का उपयोग करने के लिए कोई छिपी हुई फीस है?

कोई छिपी हुई फीस नहीं है। आप केवल उपभोग किए गए टोकन के लिए भुगतान करते हैं। कनेक्शन, रीट्राइज़ या फ़ंक्शन कॉलिंग के लिए कोई शुल्क नहीं है। लागत केवल प्राइसिंग पेज पर सूचीबद्ध इनपुट और आउटपुट टोकन दरों तक सीमित हैं।

आपकी कुंजी बस एक फ़ॉर्म दूर है

एक खाता बनाएं, कुंजी कॉपी करें, बेस URL बदलें। सेटअप यही है।

API कुंजी पाएँ