Gemini 3.6 Flash nhắm tới bài toán chi phí của tác nhân AI

Google phát hành Gemini 3.6 Flash ngày 21/7/2026 như một phiên bản ổn định dành cho các quy trình tác nhân AI, lập trình và xử lý tri thức. Theo thông báo chính thức của Google, mô hình đã có trên Gemini API, Google AI Studio, Gemini Enterprise, ứng dụng Gemini và nền tảng Antigravity.

Trọng tâm của lần phát hành này không nằm ở việc mở rộng kích thước mô hình, mà ở hiệu quả khi hoàn thành tác vụ. Google cho biết Gemini 3.6 Flash dùng ít hơn 17% token đầu ra so với 3.5 Flash trên Artificial Analysis Index, đồng thời cần ít bước suy luận và ít lần gọi công cụ hơn trong các quy trình nhiều bước. Mức giá API được công bố là 1,50 USD cho một triệu token đầu vào và 7,50 USD cho một triệu token đầu ra; mức đầu ra của 3.5 Flash trước đó là 9 USD.

Những thay đổi đáng chú ý

  • Ngữ cảnh dài và đầu vào đa phương thức: tài liệu Gemini API ghi nhận cửa sổ đầu vào 1.048.576 token, đầu ra tối đa 65.536 token, hỗ trợ văn bản, hình ảnh, video, âm thanh và PDF.
  • Công cụ cho quy trình tác nhân: mô hình hỗ trợ thực thi mã, gọi hàm, tìm kiếm tệp, kết quả có cấu trúc, nối đất bằng Google Search và Google Maps; khả năng sử dụng máy tính hiện ở trạng thái xem trước.
  • Phạm vi tính năng vẫn có giới hạn: Gemini 3.6 Flash không hỗ trợ tạo hình ảnh, tạo âm thanh hoặc Live API. Đây là khác biệt quan trọng khi chọn mô hình cho ứng dụng thời gian thực hay sản phẩm sáng tạo đa phương tiện.

Hiệu năng tăng, nhưng cần đọc đúng cách

Model card của Google DeepMind công bố Gemini 3.6 Flash đạt 49% trên DeepSWE, so với 37% của 3.5 Flash; 83,0% trên OSWorld-Verified, so với 78,4%; và 63,9% trên MLE-Bench, so với 49,7%. Các kết quả cho thấy hướng cải thiện rõ ở lập trình dài hạn, sử dụng máy tính và kỹ thuật máy học.

Dù vậy, đây chủ yếu là số liệu do Google công bố trên bộ đánh giá và cấu hình do hãng lựa chọn. Bài viết của Cinco Días thuộc El País xác nhận việc phát hành, mức giá và các kênh phân phối, nhưng chưa cung cấp một đánh giá độc lập toàn diện về chất lượng mô hình. Vì thế, các con số benchmark nên được xem là điểm khởi đầu cho kiểm thử, không phải cam kết hiệu năng trong mọi ứng dụng.

Điều này có ý nghĩa gì?

Với nhóm phát triển tác nhân AI, chi phí thực tế không chỉ đến từ giá mỗi token. Một tác vụ có thể lặp nhiều vòng suy luận, gọi nhiều công cụ và tạo lượng đầu ra lớn trước khi hoàn thành. Nếu Gemini 3.6 Flash thực sự giảm được số vòng xử lý và lượng token như Google công bố, tổng chi phí cho mỗi tác vụ có thể giảm đáng kể ngay cả khi giá đầu vào không đổi.

Điểm này đặc biệt đáng chú ý với các hệ thống xử lý tài liệu, lập trình tự động hoặc vận hành quy trình doanh nghiệp có lưu lượng cao. Tuy nhiên, nhóm triển khai tại Việt Nam vẫn nên đo riêng độ chính xác tiếng Việt, độ trễ, mức tiêu thụ token và tỷ lệ tác vụ hoàn thành trên dữ liệu thật. Một mô hình rẻ hơn theo bảng giá chưa chắc rẻ hơn nếu phải sửa lỗi hoặc chạy lại nhiều lần.

Giới hạn cần lưu ý

Google thừa nhận Gemini 3.6 Flash vẫn có thể tạo thông tin sai, phản hồi chậm hoặc gặp lỗi hết thời gian chờ. Model card cũng ghi ngày cắt dữ liệu kiến thức là tháng 3/2026, nhưng một số lĩnh vực có thể chỉ được cập nhật đến tháng 1/2025. Các ứng dụng yêu cầu thông tin mới vẫn cần nối đất bằng nguồn bên ngoài và cơ chế kiểm chứng.

Cùng đợt này, Google còn giới thiệu Gemini 3.5 Flash-Lite cho lưu lượng lớn và Gemini 3.5 Flash Cyber cho an ninh mã nguồn. Flash Cyber chỉ được cung cấp cho cơ quan chính phủ và đối tác tin cậy trong chương trình giới hạn, nên không nên nhầm với phạm vi phát hành rộng của Gemini 3.6 Flash.

Nguồn tham khảo