Free Tier không phải là số dư miễn phí của Paid Tier

Gemini API chia dự án thành hai cách sử dụng chính. Free Tier cho phép gọi một số model trong giới hạn tốc độ và hạn mức miễn phí. Paid Tier mở giới hạn cao hơn, context caching, Batch API và các model nâng cao; các lượt gọi bằng khóa thuộc dự án trả phí được tính theo bảng giá tương ứng.

Theo tài liệu thanh toán của Google, tài khoản mới bắt đầu ở Free Tier. Khi nâng cấp, dự án cần liên kết tài khoản thanh toán và trong nhiều trường hợp nạp trước tối thiểu 10 USD. Vì vậy, không nên hiểu rằng hệ thống sẽ tự dùng hết “quota miễn phí” rồi mới bắt đầu tính tiền trên cùng một khóa Paid Tier.

Bảng giá các model Gemini phổ biến

Các mức dưới đây là giá Standard cho mỗi một triệu token, tính bằng USD, theo bảng giá Gemini Developer API cập nhật ngày 21/7/2026.

ModelFree TierInputOutput, gồm token suy luậnPhù hợp
Gemini 3.6 Flash1,50 USD7,50 USDAgent, mã nguồn, tài liệu và đa phương thức
Gemini 3.5 Flash1,50 USD9,00 USDỨng dụng cần năng lực Flash thế hệ trước
Gemini 3.5 Flash-Lite0,30 USD2,50 USDTác vụ agent khối lượng lớn, dịch và xử lý dữ liệu
Gemini 3.1 Flash-Lite0,25 USD cho văn bản, ảnh, video; 0,50 USD cho âm thanh1,50 USDPhân loại, trích xuất và tác vụ đơn giản cần tiết kiệm

“Có Free Tier” nghĩa là token input và output được miễn phí trong hạn mức áp dụng cho model đó. Hạn mức tốc độ thay đổi theo model và tài khoản, nên cần kiểm tra trực tiếp trong Google AI Studio thay vì xem chữ “miễn phí” như một cam kết về lưu lượng cố định.

Công thức tính chi phí cơ bản

Chi phí một lượt gọi có thể ước tính bằng: số token input nhân đơn giá input, cộng số token output nhân đơn giá output. Token suy luận nội bộ được Google tính vào phần output đối với các model trong bảng.

Ví dụ: một tác vụ dùng Gemini 3.6 Flash nhận 100.000 token input và tạo tổng cộng 20.000 token output sẽ có chi phí khoảng 0,15 USD + 0,15 USD = 0,30 USD ở mức Standard. Con số này chưa gồm grounding, lưu context cache hoặc công cụ phát sinh phí.

Điểm dễ bị bỏ qua là output thường đắt hơn input nhiều lần. Việc giới hạn độ dài câu trả lời, giảm vòng lặp agent và thiết kế điều kiện dừng tốt có thể tạo khác biệt lớn hơn việc rút ngắn vài dòng prompt.

Batch, Flex và Priority khác Standard ra sao?

  • Batch: phù hợp công việc không cần trả kết quả ngay. Với Gemini 3.6 Flash, giá Batch là 0,75 USD cho input và 3,75 USD cho output mỗi triệu token, bằng một nửa mức Standard.
  • Flex: đổi độ ổn định về thời điểm xử lý lấy chi phí thấp hơn. Cần kiểm tra khả năng hỗ trợ trên từng model trước khi xây luồng phụ thuộc thời gian.
  • Priority: dành cho tải cần mức ưu tiên cao hơn và có đơn giá cao hơn Standard. Đây không phải lựa chọn mặc định cho ứng dụng thông thường.

Context caching và grounding có thể tạo hóa đơn riêng

Context caching giúp tái sử dụng một phần ngữ cảnh dài thay vì gửi và xử lý lại toàn bộ ở mỗi lượt gọi. Gemini 3.6 Flash tính 0,15 USD cho mỗi triệu token được đọc từ cache, kèm phí lưu trữ 1 USD cho mỗi triệu token mỗi giờ. Caching chỉ có lợi khi cùng một ngữ cảnh được dùng lại đủ nhiều lần.

Grounding bằng Google Search hoặc Google Maps không được mở ở Free Tier cho Gemini 3.6 Flash. Ở Paid Tier, Google cho 5.000 prompt mỗi tháng dùng chung trong nhóm Gemini 3, sau đó tính 14 USD cho 1.000 truy vấn tìm kiếm. Một prompt có thể phát sinh nhiều truy vấn và từng truy vấn có thể được tính riêng.

Free và Paid khác nhau cả về dữ liệu

Google nêu rằng nội dung ở Free Tier có thể được dùng để cải thiện sản phẩm, trong khi dữ liệu của Paid Tier không được dùng cho mục đích này theo điều khoản của dịch vụ trả phí. Đây là khác biệt quan trọng với tài liệu nội bộ, dữ liệu khách hàng hoặc các quy trình có yêu cầu bảo mật.

Paid Tier cũng không đồng nghĩa chi phí không giới hạn. Google áp dụng cấp sử dụng và trần thanh toán theo lịch sử tài khoản; dự án trả trước cần còn số dư dương để tiếp tục phục vụ request.

Nên chọn model nào?

  • Chọn Gemini 3.1 Flash-Lite cho phân loại, trích xuất trường dữ liệu và các bước đơn giản có lưu lượng lớn.
  • Chọn Gemini 3.5 Flash-Lite khi cần model Lite mới hơn cho agent và xử lý đa phương thức nhưng vẫn ưu tiên chi phí.
  • Chọn Gemini 3.6 Flash khi tác vụ có nhiều bước, cần gọi công cụ hoặc yêu cầu chất lượng mã và suy luận tốt hơn.
  • Dùng Batch cho tổng hợp báo cáo, gắn nhãn hoặc xử lý kho tài liệu không cần phản hồi tức thời.

Axios xem đợt model mới là dấu hiệu thị trường chuyển sang tối ưu hiệu quả theo từng loại workload. Bài toán đúng vì thế không phải “model nào rẻ nhất”, mà là “model nào hoàn thành tác vụ với tổng token, độ trễ và tỷ lệ lỗi thấp nhất”.

Nguồn tham khảo