Open AI API Bảng giá: Danh sách kiểm tra Sản phẩm
Khi xây dựng các ứng dụng sản xuất, việc hiểu bảng giá API LLM là rất quan trọng vì chi phí token khác biệt đáng kể giữa token đầu vào và đầu ra. Hướng dẫn này phân tích chi phí thực tế khi chạy các mô hình LLM không kiểm duyệt và tiêu chuẩn, giúp bạn dự toán ngân sách chính xác mà không có phí ẩn.
Cập nhật
Điểm chính
- Token đầu vào rẻ hơn token đầu ra, vì vậy việc tối ưu hóa độ dài prompt trực tiếp giảm hóa đơn của bạn.
- Truyền phát (streaming) không làm thay đổi tổng chi phí, vì bạn chỉ trả tiền cho số lượng token cuối cùng bất kể phương thức truyền tải.
- Các mô hình trả theo mức sử dụng loại bỏ các mức tối thiểu hàng tháng, khiến chúng lý tưởng cho các mẫu lưu lượng không dự đoán được.
- Các mô hình không kiểm duyệt thường có cấu trúc giá tương tự các nhà cung cấp lớn nhưng loại bỏ chi phí lọc nội dung.
Hiểu chi phí token
Các mô hình ngôn ngữ lớn xử lý văn bản theo các đơn vị gọi là token. Một token tương đương khoảng bốn ký tự hoặc một phần của từ. Bạn trả tiền cho cả token bạn gửi (đầu vào) và token mô hình tạo ra (đầu ra). Cấu trúc định giá kép này là tiêu chuẩn trên hầu hết các API LLM, bao gồm OpenAI và các lựa chọn thay thế không kiểm duyệt khác.
Token đầu vào bao gồm prompt hệ thống, lịch sử hội thoại và truy vấn của người dùng. Token đầu ra là phản hồi của mô hình. Nếu bạn gửi một cửa sổ ngữ cảnh dài nhưng nhận được câu trả lời ngắn, chi phí của bạn chủ yếu đến từ giá đầu vào. Ngược lại, các mô hình dài dòng hoặc các nhiệm vụ suy luận phức tạp làm tăng chi phí đầu ra.
Hầu hết các nhà cung cấp tính phí khác nhau cho token đầu vào và đầu ra. Đầu vào thường rẻ hơn vì việc tạo văn bản đòi hỏi nhiều nỗ lực tính toán hơn việc đọc nó. Hiểu tỷ lệ này giúp bạn ước tính chi phí trước khi viết mã. Luôn kiểm tra các tỷ lệ trên mỗi triệu token cho cả hai hướng.
Giá đầu vào so với đầu ra
Token đầu vào thường có giá thấp hơn trên mỗi triệu so với token đầu ra. Ví dụ, tỷ lệ phổ biến có thể là $0,25 cho mỗi triệu token đầu vào so với $1,00 cho mỗi triệu token đầu ra. Sự khác biệt gấp bốn lần này có nghĩa là chiến lược kỹ thuật prompt của bạn ảnh hưởng đáng kể đến ngân sách của bạn.
Khi bạn thiết kế prompt hệ thống, hãy giữ nó ngắn gọn. Loại bỏ các hướng dẫn không cần thiết hoặc ngữ cảnh dư thừa mà mô hình không cần để trả lời truy vấn. Mọi token bổ sung trong đầu vào của bạn đều làm tăng chi phí, ngay cả khi mô hình bỏ qua nó.
Chi phí đầu ra tăng khi các mô hình dài dòng. Một số mô hình, đặc biệt là các biến thể không kiểm duyệt, có thể cung cấp các phản hồi chi tiết hơn hoặc lan man. Nếu bạn cần câu trả lời chính xác, ngắn gọn, bạn có thể hướng dẫn mô hình bằng các hướng dẫn cụ thể trong prompt hệ thống. Điều này giảm việc sử dụng token đầu ra và giảm hóa đơn của bạn.
Luôn tính toán tổng chi phí bằng cách cộng chi phí đầu vào và đầu ra. Đừng giả định rằng tỷ lệ đầu vào rẻ hơn chiếm ưu thế chi tiêu của bạn nếu trường hợp sử dụng của bạn tạo ra các phản hồi dài.
Tính toán tổng chi phí
Để tính toán tổng chi phí của một lệnh gọi API, hãy nhân số lượng token đầu vào với giá đầu vào trên mỗi triệu, sau đó cộng tích của token đầu ra và giá đầu ra trên mỗi triệu. Công thức này áp dụng cho hầu hết các API LLM, bao gồm API AI không giới hạn và các nhà cung cấp lớn như OpenAI.
- Chi phí = (Token đầu vào / 1.000.000) × Giá đầu vào + (Token đầu ra / 1.000.000) × Giá đầu ra
Ví dụ, nếu bạn gửi 500 token đầu vào và nhận 100 token đầu ra với giá $0,25 và $1,00 trên mỗi triệu tương ứng, chi phí là rất nhỏ. Tuy nhiên, mở rộng điều này lên hàng nghìn yêu cầu mỗi ngày sẽ tích lũy nhanh chóng.
Sử dụng công thức này để xây dựng trình ước tính chi phí trong ứng dụng của bạn. Theo dõi mức sử dụng token trong nhật ký của bạn để dự đoán chi phí trong tương lai. Nhiều nhà phát triển đánh giá thấp khối lượng token được sử dụng trong môi trường sản xuất, dẫn đến hóa đơn không mong đợi.
Dự toán ngân sách cho quy mô lớn
Dự toán ngân sách cho việc sử dụng LLM đòi hỏi dự báo các mẫu lưu lượng. Nếu ứng dụng của bạn có mức sử dụng dự đoán được, chẳng hạn như một số lượng truy vấn hàng ngày cố định, bạn có thể ước tính chi phí hàng tháng một cách dễ dàng. Đối với lưu lượng biến động, hãy sử dụng mô hình trả theo mức sử dụng để tránh trả quá nhiều cho dung lượng không sử dụng.
Các mô hình tín dụng trả trước cung cấp sự linh hoạt. Bạn nạp tiền khi cần, không có phí đăng ký hàng tháng. Một số nhà cung cấp cung cấp tiền thưởng cho các lần nạp tiền lớn hơn, có thể giảm chi phí hiệu dụng trên mỗi token của bạn. Điều này hữu ích cho các nhà phát triển độc lập hoặc công ty khởi nghiệp với nhu cầu biến động.
Theo dõi mức sử dụng của bạn một cách chặt chẽ. Thiết lập các cảnh báo trong bảng điều khiển của bạn để thông báo cho bạn khi chi tiêu đạt đến một ngưỡng nhất định. Điều này ngăn chặn chi phí tăng vọt từ các vòng lặp hoặc các đợt lưu lượng không mong đợi. Các cấu trúc trả theo mức sử dụng đảm bảo bạn chỉ trả tiền cho những gì bạn sử dụng, khiến chúng lý tưởng cho việc kiểm tra và mở rộng.
Tối ưu hóa độ dài prompt
Tối ưu hóa prompt là cách trực tiếp nhất để giảm chi phí đầu vào. Hãy giữ prompt hệ thống của bạn ngắn gọn và loại bỏ thông tin dư thừa. Sử dụng các ví dụ few-shot một cách tiết kiệm, vì mỗi ví dụ đều thêm token vào mọi yêu cầu.
Hãy xem xét việc sử dụng quá trình tạo tăng cường truy xuất (RAG) để chỉ đưa ngữ cảnh liên quan vào prompt. Điều này giảm số lượng token so với việc gửi một tài liệu lớn mỗi lần. Tuy nhiên, RAG thêm độ trễ và độ phức tạp vào kiến trúc của bạn.
Đối với API AI không giới hạn, hỗ trợ cửa sổ ngữ cảnh 100.000 token, bạn có thể chấp nhận các ngữ cảnh dài hơn nếu cần. Nhưng hãy nhớ rằng mỗi token đều tốn tiền. Cắt bỏ khoảng trắng không cần thiết và kết hợp các hướng dẫn khi có thể.
Kiểm tra các cấu trúc prompt khác nhau để tìm sự cân bằng giữa hiệu suất mô hình và hiệu quả token. Các prompt ngắn hơn có thể giảm độ chính xác, vì vậy hãy theo dõi chất lượng cùng với chi phí.
Xử lý chi phí truyền phát
Truyền phát phân phối token khi chúng được tạo, cung cấp trải nghiệm người dùng tốt hơn cho các phản hồi dài. Tuy nhiên, truyền phát không giảm tổng chi phí. Bạn vẫn trả tiền cho tổng số lượng token đầu vào và đầu ra, bất kể dữ liệu được phân phối như thế nào.
Một số nhà phát triển giả định rằng truyền phát rẻ hơn vì nó nhanh hơn. Điều này không đúng. Chi phí tính toán là như nhau. Truyền phát chỉ thay đổi hồ sơ độ trễ, không phải mô hình định giá.
Sử dụng truyền phát khi trải nghiệm người dùng quan trọng, chẳng hạn như trong các giao diện trò chuyện. Sử dụng không truyền phát cho xử lý hàng loạt hoặc khi bạn cần toàn bộ phản hồi trước khi tiếp tục. Cả hai phương pháp đều chịu cùng các khoản phí dựa trên token.
Đảm bảo mã khách hàng của bạn xử lý truyền phát đúng cách để tránh các bộ đếm token không đầy đủ. Một số API tính phí cho các token không đầy đủ, vì vậy hãy luôn xác minh số lượng token cuối cùng sau khi luồng hoàn tất.
Theo dõi mức sử dụng
Theo dõi mức sử dụng là rất quan trọng để kiểm soát chi phí. Theo dõi token đầu vào và đầu ra riêng biệt. Điều này cho phép bạn xác định các phần của ứng dụng đang thúc đẩy chi phí.
Thiết lập ghi nhật ký để ghi lại số lượng token cho mỗi yêu cầu. Sử dụng dữ liệu này để tính toán chi phí trung bình trên mỗi người dùng hoặc mỗi tính năng. Xác định các điểm ngoại lệ nơi mức sử dụng token cao bất thường.
Nhiều API cung cấp phân tích bảng điều khiển. Sử dụng các công cụ này để trực quan hóa các xu hướng chi tiêu. Nếu bạn nhận thấy sự tăng đột biến bất thường trong token đầu ra, hãy điều tra xem mô hình có trở nên dài dòng hay không hoặc nếu các prompt của bạn quá mở.
Định kỳ xem xét việc sử dụng khóa API của bạn. Xoay khóa định kỳ để hạn chế tiếp xúc nếu khóa bị xâm phạm. Hầu hết các API cho phép bạn tạo khóa mới mà không mất lịch sử tài khoản hoặc số dư của bạn.
So sánh các lựa chọn thay thế
Khi so sánh các API LLM, bạn không nên chỉ nhìn vào giá niêm yết. Hãy cân nhắc các yếu tố như chất lượng mô hình, độ trễ và độ tin cậy. Một số nhà cung cấp khác có giá đầu vào thấp hơn nhưng giá đầu ra cao hơn. Một số khác tính phí cao hơn cho thời gian phản hồi nhanh hơn.
API AI không giới hạn cung cấp mô hình trả theo mức sử dụng đơn giản, không có phí hàng tháng. Nó cung cấp một mô hình không kiểm duyệt phù hợp cho các chủ đề người lớn hoặc gây tranh cãi, điều này có thể có giá trị cho các trường hợp sử dụng cụ thể. So sánh điều này với các nhà cung cấp khác lọc nội dung, điều này có thể ảnh hưởng đến hành vi ứng dụng của bạn.
Kiểm tra khả năng tương thích của Base URL. Hầu hết các API tuân theo định dạng OpenAI, giúp dễ dàng chuyển đổi nhà cung cấp. Đảm bảo cấu hình SDK của bạn hỗ trợ các endpoint của nhà cung cấp. Sự linh hoạt này cho phép bạn chuyển đổi nếu giá thay đổi hoặc chất lượng giảm.
Luôn xác minh giá mới nhất trên trang web của nhà cung cấp. Giá có thể thay đổi mà không cần báo trước. Hãy tính đến các tín dụng bổ sung hoặc giảm giá khi so sánh tổng chi phí.
Hỏi đáp
API AI không giới hạn có theo mô hình trả tiền theo từng lần sử dụng không?
Có, API AI không giới hạn hoạt động theo mô hình tín dụng trả trước trả tiền theo từng lần sử dụng. Không có gói đăng ký hàng tháng hay yêu cầu chi tiêu tối thiểu. Bạn chỉ cần nạp tiền khi cần, và tín dụng chưa sử dụng sẽ không bị mất.
API AI không giới hạn tính phí bao nhiêu cho mỗi token?
API AI không giới hạn tính $0.25 cho mỗi triệu token đầu vào và $1.00 cho mỗi triệu token đầu ra. Các mức giá này minh bạch và áp dụng cho tất cả các yêu cầu, không có phí ẩn cho truyền phát (streaming) hay gọi hàm.
Truyền phát (streaming) có tốn nhiều chi phí hơn không?
Không, truyền phát (streaming) không ảnh hưởng đến tổng chi phí. Bạn trả tiền cho cùng một số lượng token đầu vào và đầu ra bất kể bạn nhận phản hồi theo thời gian thực hay dưới dạng khối hoàn chỉnh. Truyền phát chỉ cải thiện trải nghiệm người dùng bằng cách giảm độ trễ cảm nhận.
Có bất kỳ khoản phí ẩn nào khi sử dụng API không?
Không có phí ẩn. Bạn chỉ trả tiền cho các token đã sử dụng. Không có phí kết nối, thử lại hay gọi hàm. Chi phí duy nhất là mức giá token đầu vào và đầu ra được liệt kê trên trang giá.
Khóa của bạn chỉ cách một biểu mẫu
Tạo tài khoản, sao chép khóa, thay đổi base URL. Đó là toàn bộ quy trình thiết lập.