繁中 ▾
取得 API 金鑰

Open AI API 定價: 生產環境 檢查清單

在構建生產環境應用程式時,了解 LLM API 定價至關重要,因為輸入和輸出 token 的成本差異顯著。本指南將拆解運行無審查和標準 LLM 的實際成本,幫助你準確預算且無隱藏費用。

更新

重點

  • 輸入 token 比輸出 token 便宜,因此優化提示詞長度可直接降低你的帳單。
  • 串流輸出不會改變總成本,因為無論交付方式為何,你都是為最終 token 數量付費。
  • 按量付費模式消除了月度最低消費,使其非常適合不可預測的流量模式。
  • 無審查模型的定價結構通常與主要供應商類似,但移除了內容過濾的額外成本。

了解 Token 成本

大型語言模型以稱為 token 的單位處理文本。一個 token 大約是四個字符或單詞的一部分。你為發送的 token(輸入)和模型生成的 token(輸出)付費。這種雙重定價結構是大多數 LLM API 的標準,包括 OpenAI 和各種無審查替代方案。

輸入 token 包括你的系統提示詞、對話歷史和使用者查詢。輸出 token 是模型的回應。如果你發送長上下文視窗但得到短回答,你的成本主要由輸入價格主導。相反,冗長的模型或複雜的推理任務會增加輸出成本。

大多數供應商對輸入和輸出 token 收取不同的費率。輸入通常較便宜,因為生成文本比閱讀它需要更多的計算力。了解此比率有助於你在編寫程式碼之前估算成本。始終檢查雙向的每百萬 token 費率。

輸入與輸出定價

輸入 token 每百萬的成本通常低於輸出 token。例如,常見的費率可能是每百萬輸入 token $0.25,而每百萬輸出 token $1.00。這種四倍的差異意味著你的提示詞工程策略會顯著影響你的預算。

設計系統提示詞時,請保持簡潔。移除模型不需要用來回答查詢的不必要指示或冗餘上下文。輸入中的每個額外 token 都會增加成本,即使模型忽略了它。

當模型冗長時,輸出成本會上升。某些模型,特別是無審查變體,可能會提供更詳細或漫無邊際的回應。如果你需要精確的短回答,你可以在系統提示詞中給模型具體指示。這會減少輸出 token 的使用量並降低帳單。

始終通過添加輸入和輸出費用來計算總成本。如果你的用例生成長回應,不要假設較便宜的輸入費率會主導你的支出。

計算總成本

要計算 API 呼叫的總成本,請將輸入 token 數量乘以每百萬輸入價格,然後加上輸出 token 數量與每百萬輸出價格的乘積。此公式適用於大多數 LLM API,包括 無限 AI API 和 OpenAI 等主要供應商。

  • 成本 = (輸入 Token / 1,000,000) × 輸入價格 + (輸出 Token / 1,000,000) × 輸出價格

例如,如果你發送 500 個輸入 token 並收到 100 個輸出 token,費率分別為每百萬 $0.25 和 $1.00,則成本微乎其微。然而,將其擴展到每天數千次請求會迅速累積。

使用此公式在應用程式中構建成本估算器。在日誌中追蹤 token 使用情況以預測未來支出。許多開發人員低估了生產環境中使用的 token 數量,導致意外帳單。

規模化預算

為 LLM 使用進行預算需要預測流量模式。如果你的應用程式具有可預測的使用情況,例如固定的每日查詢數量,你可以輕鬆估算月度成本。對於變量流量,使用按量付費模式以避免為未使用的容量多付錢。

預付額度模式提供靈活性。你需要時儲值,沒有月費。某些供應商為較大的儲值提供獎勵,這可以降低每個 token 的有效成本。這對於需求波動的小型開發人員或初創公司很有用。

密切監控你的使用情況。在儀表板上設置警報,當支出達到閾值時通知你。這可以防止迴圈或意外流量激增導致成本失控。按量付費結構確保你只為使用的內容付費,使其非常適合測試和擴展。

優化提示詞長度

提示詞優化是降低輸入成本最直接的方法。保持系統提示詞簡潔並移除冗餘資訊。謹慎使用少樣本範例,因為每個範例都會為每次請求增加 token。

考慮使用檢索增強生成 (RAG) 僅將相關上下文注入提示詞。這比每次發送大文件都要減少 token 數量。然而,RAG 會增加架構的延遲和複雜性。

對於支援 100,000 token 上下文視窗的 無限 AI API,如果有必要你可以使用較長的上下文。但請記住每個 token 都有成本。儘可能修剪不必要的空白並合併指示。

測試不同的提示詞結構以在模型效能和 token 效率之間找到平衡。較短的提示詞可能會降低準確性,因此請在監控質量的同時監控成本。

處理串流成本

串流輸出在生成時交付 token,為長回應提供更好的使用者體驗。然而,串流輸出不會降低總成本。無論數據如何交付,你仍然需要為完整的輸入和輸出 token 數量付費。

一些開發人員認為串流輸出更便宜,因為它感覺更快。這是錯誤的。計算成本是相同的。串流輸出僅改變延遲配置,而不是定價模型。

當使用者體驗很重要時使用串流輸出,例如在聊天介面中。對於批量處理或需要整個回應才能繼續的情況,使用非串流輸出。兩種方法都會產生相同的基於 token 的費用。

確保你的客戶端程式碼正確處理串流輸出,以避免 token 計數不完整。某些 API 會對不完整的 token 收費,因此請務必在串流完成後驗證最終的 token 數量。

監控使用情況

監控使用情況對於成本控制至關重要。分別追蹤輸入和輸出 token。這允許你識別應用程式中哪些部分推動了成本。

設置日誌以記錄每個請求的 token 計數。使用此數據計算每個使用者或每個功能的平均成本。識別 token 使用量異常高的異常值。

許多 API 提供儀表板分析。使用這些工具可視化支出趨勢。如果你注意到輸出 token 突然增加,請調查模型是否變得冗長,或者你的提示詞是否過於開放。

定期審查你的 API 金鑰使用情況。定期輪換金鑰以限制金鑰洩露時的風險。大多數 API 允許你生成新金鑰而不丟失帳戶歷史記錄或餘額。

比較替代方案

比較 LLM API 時,不要只看廣告價格。請考慮模型品質、延遲和可靠性等因素。某些供應商提供較低的輸入價格,但輸出價格較高。其他供應商則對較快的回應時間收取更高費用。

無限 AI API 提供簡單的按量付費模式,無月費。它提供適合成人或爭議性主題的無審查模型,這對於特定用例可能很有價值。將此與過濾內容的供應商進行比較,這可能會影響應用程式的行為。

檢查 Base URL 兼容性。大多數 API 遵循 OpenAI 格式,使得切換供應商變得容易。確保你的 SDK 配置支援供應商的端點。這種靈活性允許你在價格變化或質量下降時切換。

請務必至供應商網站確認最新價格。費率可能會在未經通知的情況下變更。比較總成本時,請將任何贈送額度或折扣納入考量。

問答

無限 AI API 是按量付費嗎?

是的,無限 AI API 採用預付額度按量付費模式。沒有月費訂閱或最低消費要求。你需要時儲值,未使用的額度不會過期。

無限 AI API 每個 token 的費用是多少?

無限 AI API 對輸入 token 收取每百萬個 $0.25,對輸出 token 收取每百萬個 $1.00。費率透明,適用於所有請求,串流輸出或函式呼叫均無隱藏費用。

串流輸出的費用比非串流高嗎?

不會,串流輸出不會影響總費用。無論你是即時收到回應還是收到完整區塊,你支付的輸入和輸出 token 數量相同。串流輸出僅能透過降低感知延遲來改善使用者體驗。

使用 API 有任何隱藏費用嗎?

沒有隱藏費用。你只需為消耗的 token 付費。連線、重試或函式呼叫均不收費。唯一的費用就是定價頁面上列出的輸入和輸出 token 費率。

只差一張表單,即可取得金鑰

建立帳戶、複製金鑰、更改 Base URL。這就是完整的設定。

取得 API 金鑰