
Google ra mắt ba mô hình gồm Gemini 3.6 Flash: Tiết kiệm 17% chi phí Token, tốc độ nhanh gấp đôi
Tuyển chọn TechFlowTuyển chọn TechFlow

Google ra mắt ba mô hình gồm Gemini 3.6 Flash: Tiết kiệm 17% chi phí Token, tốc độ nhanh gấp đôi
Các mô hình này được thiết kế riêng cho hiệu quả, độ trễ và độ tin cậy cần thiết để xây dựng AI Agent ở quy mô lớn.
Tác giả: Google DeepMind
Biên dịch: TechFlow
Lời dẫn từ TechFlow: Ba mô hình mới được Google phát hành lần này đều tập trung giải quyết những nỗi đau thực tế trong thương mại hóa AI Agent — chi phí và tốc độ. 3.6 Flash tiết kiệm 17% token so với thế hệ trước, giá thấp hơn nhưng chất lượng tốt hơn; 3.5 Flash-Lite đạt tốc độ 350 token/giây, là mô hình series 3.5 nhanh nhất hiện nay; trong khi mô hình an ninh mạng chuyên biệt Flash Cyber nhắm vào thị trường cần thiết là sửa lỗi lỗ hổng code. Đây không phải là trò chơi điểm chuẩn hiệu suất, mà là mở đường cho việc triển khai AI Agent quy mô lớn.
Google DeepMind hôm nay phát hành ba mô hình Gemini mới: 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber. Các mô hình này được thiết kế riêng cho hiệu quả, độ trễ và độ tin cậy cần thiết để xây dựng AI Agent quy mô lớn.
Gemini 3.6 Flash: Hiệu quả hơn, chất lượng hơn
3.6 Flash được cải thiện trực tiếp dựa trên phản hồi của các nhà phát triển về 3.5 Flash. Nó không chỉ tiến xa hơn trong công việc mã hóa và kiến thức mà còn nâng cao đáng kể hiệu quả token. Theo Artificial Analysis Index, 3.6 Flash giảm 17% mức tiêu thụ token đầu ra so với 3.5 Flash. Trong một số bài kiểm tra chuẩn nhất định như DeepSWE của Datacurve, mức giảm lên tới 65%. Các bước suy luận và gọi công cụ cần thiết để hoàn thành quy trình làm việc nhiều bước cũng ít hơn.
Sự cải thiện hiệu quả này đi kèm với mức giá thấp hơn. Với mức giá 1.5 USD mỗi triệu token đầu vào và 7.5 USD mỗi triệu token đầu ra, 3.6 Flash giảm tổng chi phí cho mỗi tác vụ Agent, giúp việc xây dựng và chạy Agent kinh tế hơn.
Dù hiệu quả hơn, hiệu suất của 3.6 Flash trong các trường hợp sử dụng khác nhau cũng vượt trội hơn 3.5 Flash:
Chỉnh sửa code chính xác hơn, giảm các sửa đổi và vòng lặp thực thi không cần thiết, đạt 49% trên DeepSWE (3.5 Flash là 37%), và cải thiện đáng kể lên 63.9% trên benchmark nghiên cứu học máy MLE Bench (3.5 Flash là 49.7%)
Cải thiện khả năng thao tác máy tính, điểm OSWorld-Verified đạt 83.0% (3.5 Flash là 78.4%). Thao tác máy tính hiện đã có sẵn dưới dạng công cụ client tích hợp thông qua Gemini API và Gemini Enterprise
Hiệu suất công việc kiến thức tốt hơn, ví dụ điểm benchmark GDPval-AA v2 đạt 1421 (3.5 Flash là 1349). Các khách hàng như Hebbia và Harvey nhận thấy nó đặc biệt xuất sắc trong các tác vụ đa phương thức như phân tích tài liệu, biểu đồ và dữ liệu, soạn thảo báo cáo
Phản hồi từ khách hàng cho thấy 3.6 Flash là một bước tiến về cả chi phí và chất lượng, cân bằng hiệu quả token, độ chính xác và tốc độ trong các quy trình làm việc phức tạp và tác vụ kiến thức.
Thiết kế bảo mật
3.6 Flash được trang bị các biện pháp bảo vệ an toàn tiên tiến được tăng cường, bao gồm các lĩnh vực hóa học, sinh học, phóng xạ và hạt nhân (CBRN) cũng như lạm dụng tấn công mạng. Các biện pháp bảo vệ này giúp mô hình tăng cường đáng kể khả năng kháng lại các cuộc tấn công jailbreak. Đồng thời, mô hình được huấn luyện để giảm thiểu việc từ chối các mục đích có ích.
Gemini 3.5 Flash-Lite: Sinh ra để mở quy mô quy trình làm việc Agent
3.5 Flash-Lite được thiết kế riêng cho các tác vụ độ trễ thấp và kịch bản phát triển cần thông lượng cao, như tìm kiếm Agent và xử lý tài liệu.
3.5 Flash-Lite là mô hình nhanh nhất trong series 3.5. Theo đo lường của Artificial Analysis, tốc độ chạy đạt 350 token đầu ra mỗi giây. Với mức giá 0.3 USD mỗi triệu token đầu vào và 2.5 USD mỗi triệu token đầu ra, và chất lượng vượt trội hơn nhiều so với 3.1 Flash-Lite, mang lại tỷ lệ chi phí hiệu quả tuyệt vời cho các nhà phát triển và khách hàng chạy các tác vụ sản xuất lưu lượng lớn.
3.5 Flash-Lite hỗ trợ mở rộng hiệu quả hệ thống Agent. Ở các mức độ suy nghĩ khác nhau, mô hình này vượt trội đáng kể so với 3.1 Flash-Lite. Các nhà phát triển có thể cấu hình mô hình theo khối lượng công việc: sử dụng mức suy nghĩ tối thiểu và thấp cho các tác vụ số lượng lớn, ưu tiên thực thi độ trễ thấp, chi phí thấp; hoặc bật mức suy nghĩ cao hơn để xử lý các khối lượng công việc Agent con nhiều bước. Mô hình này hiện cũng bao gồm thao tác máy tính như một công cụ tích hợp, hỗ trợ đáng tin cậy các tác vụ Agent xuyên giao diện.
Nó có cải thiện đáng kể trong các tác vụ mã hóa và Agent, ví dụ điểm Terminal-Bench 2.1 đạt 54% (3.1 Flash-Lite là 31%), ngữ cảnh dài như GDM-MRCR v2 đạt 72.2% (3.1 Flash-Lite là 60.1%), thực thi tác vụ thực tế như GDPval-AA v2 đạt 1140 (3.1 Flash-Lite là 642).
Trên thực tế, trong nhiều đánh giá Agent và mã hóa, 3.5 Flash-Lite thậm chí vượt qua cả 3 Flash, bao gồm SWE-Bench Pro (54.2% so với 49.6%) và OSWorld-Verified (74.0% so với 65.1%), trở thành lựa chọn nhanh hơn và mạnh mẽ hơn cho các khối lượng công việc 2.5 và 3 Flash.
Các khách hàng ban đầu nhấn mạnh sự kết hợp độc đáo về tốc độ, trí thông minh và hiệu quả chi phí của 3.5 Flash-Lite trong việc mở rộng quy trình làm việc Agent và các tác vụ xử lý dữ liệu.
Gemini 3.5 Flash Cyber trong CodeMender: Phát hiện và sửa lỗi lỗ hổng hiệu quả
Tốc độ mà các mô hình AI phát hiện lỗ hổng bảo mật đã vượt quá tốc độ mà các hệ thống hiện tại sửa chữa chúng. Đối phó với mối đe dọa ngày càng nghiêm trọng này đòi hỏi một phương pháp bảo mật phần mềm vừa hiệu quả vừa mạnh mẽ.
Hiệu suất và hiệu quả của Flash khiến nó trở thành nền tảng lý tưởng để phát hiện, xác minh và vá các vấn đề bảo mật code ở quy mô lớn. Gemini 3.5 Flash Cyber được xây dựng dựa trên 3.5 Flash, được tinh chỉnh chuyên biệt để phát hiện và sửa chữa lỗ hổng an ninh mạng, với giá mỗi token thấp hơn các mô hình lớn.
Trong CodeMender, nhiều Agent 3.5 Flash Cyber phối hợp làm việc để tạo ra một báo cáo tổng hợp duy nhất, đạt mức độ cạnh tranh tiên phong trên benchmark phổ biến CyberGym.
Do tính chất sử dụng kép của công nghệ này, chúng tôi đã áp dụng cách triển khai thận trọng. Mô hình này sẽ sớm được cung cấp chuyên biệt cho chính phủ và các đối tác đáng tin cậy thông qua CodeMender dưới dạng các dự án thí điểm truy cập hạn chế. Điều này sẽ cho phép các nhà phòng thủ tuyến đầu phát hiện và sửa chữa trước khi các lỗ hổng quan trọng bị khai thác, đồng thời giảm thiểu rủi ro lạm dụng rộng rãi hơn.
Bắt đầu sử dụng ngay
3.6 Flash và 3.5 Flash-Lite có sẵn từ hôm nay:
Các nhà phát triển có thể sử dụng thông qua Gemini API của Google AI Studio và Android Studio. 3.6 Flash cũng có sẵn trong Google Antigravity
Doanh nghiệp có thể sử dụng trên nền tảng Gemini Enterprise Agent. 3.6 Flash cũng có sẵn trong ứng dụng Gemini Enterprise
Mọi người đều có thể sử dụng thông qua ứng dụng Gemini. 3.5 Flash-Lite cũng đang được triển khai trên Google Search
Chúng tôi hoan nghênh phản hồi để cải thiện các mô hình Gemini trong tương lai và mong đợi sẽ sớm phát hành 3.5 Pro.
Chào mừng tham gia cộng đồng chính thức TechFlow
Nhóm Telegram:https://t.me/TechFlowDaily
Tài khoản Twitter chính thức:https://x.com/TechFlowPost
Tài khoản Twitter tiếng Anh:https://x.com/BlockFlow_News














