Google ra mắt Gemini 3.8 Flash: Hiệu suất tiệm cận mô hình hàng đầu Claude Opus 5, hiệu quả chi phí vẫn là lợi thế cạnh tranh cốt lõi
Ngày 2 tháng 9, Google ra mắt hai mô hình mới: Gemini 3.8 Flash và Gemini 3.8 Flash Cyber.
Gemini 3.8 Flash tập trung nâng cao khả năng lập trình và tác tử AI với chi phí 0,75 USD/triệu token đầu vào và 3,75 USD/triệu token đầu ra, đạt hiệu suất cạnh tranh trong các bài kiểm tra chuẩn so với các mô hình chi phí cao hơn.
Gemini 3.8 Flash Cyber hướng đến phòng thủ an ninh mạng, chuyên phát hiện lỗ hổng và khắc phục tự động, chỉ cung cấp cho các đội ngũ đã qua kiểm duyệt thông qua chương trình Fairwind.

TradingKey - Google (GOOGL) đã ra mắt hai mô hình mới vào ngày 2 tháng 9 theo giờ Miền Đông: Gemini 3.8 Flash và Gemini 3.8 Flash Cyber. Đây là mô hình thuộc dòng Flash thứ ba được Google ra mắt trong 6 tuần qua, tiếp tục duy trì các đặc tính tốc độ cao và chi phí thấp của Gemini 3.7 Flash trước đó, đồng thời tăng cường hơn nữa khả năng tạo mã, suy luận phức tạp, các tác vụ tác tử và năng lực an ninh mạng.
Mô hình đầu tiên được định vị cho kỹ thuật phần mềm, tác tử AI và các tác vụ suy luận đa bước trong các lĩnh vực chuyên môn; mô hình sau tập trung vào việc phát hiện lỗ hổng và khắc phục tự động, chỉ khả dụng cho các nhà phòng thủ bảo mật đáng tin cậy đã qua kiểm duyệt.
Mặc dù hai mô hình hướng tới các trường hợp sử dụng khác nhau, cả hai đều dựa trên cùng một lõi trí tuệ nền tảng và liên tục đánh giá, tối ưu hóa đầu ra của mô hình thông qua các vòng lặp tác tử kéo dài.
Gemini 3.8 Flash: Nâng cao khả năng lập trình dài hạn và các tác vụ Agent
Nâng cấp chính trong Gemini 3.8 Flash tập trung vào việc xử lý các tác vụ phức tạp, liên tục đòi hỏi gọi công cụ nhiều lượt. Google cho biết trong các bài kiểm tra được lựa chọn, hiệu suất của mô hình này tiệm cận với hiệu suất của các mô hình chủ lực có chi phí cao hơn.
Trong bài kiểm tra chuẩn kỹ thuật phần mềm dài hạn DeepSWE v1.1, Gemini 3.8 Flash đạt 73,7%, cao hơn mức 65,3% của Gemini 3.7 Flash, đồng thời vượt qua 72,7% của GPT-5.6 Sol và 69,6% của GPT-5.6 Terra, chỉ kém một chút so với 74,0% của Claude Opus 5.

Nguồn: Google
Trong các tác vụ chuyên ngành, Gemini 3.8 Flash cũng thể hiện khả năng cạnh tranh mạnh mẽ. Trong đó, HLE-Verified bao gồm các câu hỏi đa ngành thuộc các lĩnh vực khoa học, công nghệ, nhân văn và kiến thức chuyên môn, nơi Gemini 3.8 Flash cũng vượt qua mức 31,0% của Claude Sonnet 5, 51,1% của GPT-5.6 Terra, 54,4% của Claude Opus 5 và 54,5% của GPT-5.6 Sol.
Về giá cả, Gemini 3.8 Flash duy trì mức giá ban đầu của Gemini 3.7 Flash: 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra.
So với đó, giá token đầu vào và đầu ra của Claude Opus 5 lần lượt là 5 USD và 25 USD; đối với GPT-5.6 Sol là 4 USD và 20 USD; và đối với GPT-5.6 Terra là 2 USD và 12 USD.
Điều này có nghĩa là Gemini 3.8 Flash tiệm cận hoặc thậm chí vượt qua các mô hình lớn hơn trong một số bài kiểm tra chuẩn về lập trình và suy luận, nhưng với chi phí gọi API thấp hơn đáng kể. Đối với các nhà phát triển đang muốn triển khai đại lý mã nguồn (code agent), phân tích tự động và quy trình làm việc doanh nghiệp, hiệu quả chi phí của mô hình này có thể đóng vai trò là điểm bán hàng chủ đạo.
Gemini 3.8 Flash Cyber: Tập trung vào phát hiện lỗ hổng và khắc phục tự động
Gemini 3.8 Flash Cyber là một mô hình quan trọng khác được ra mắt lần này, chủ yếu hướng đến các kịch bản phòng thủ an ninh mạng. Google cho biết mô hình này sẽ không được cung cấp rộng rãi, mà thay vào đó sẽ được cung cấp cho các đội ngũ phòng thủ đã qua kiểm duyệt và đáng tin cậy thông qua chương trình Fairwind mới.
Trong bài đánh giá phát hiện lỗ hổng CyberGym được sử dụng phổ biến trong ngành an ninh mạng, Gemini 3.8 Flash Cyber đạt 86,2%, cao hơn mức 77,5% của Gemini 3.5 Flash Cyber, đồng thời vượt qua mức 83,6% của GPT-5.6 Sol, 83,8% của Mythos 5 và 85,6% của GPT-5.5-Cyber.
Trong thử nghiệm kịch bản thực tế nội bộ bao gồm 20 ngôn ngữ lập trình, Gemini 3.8 Flash Cyber đạt tỷ lệ phát hiện lỗ hổng thành công là 71,0%, cao hơn mức 58,9% của Gemini 3.7 Flash và 46,6% của Gemini 3.5 Flash Cyber.
Về tự động khắc phục sự cố, Gemini 3.8 Flash Cyber đạt tỷ lệ pass@1 là 47,2% trong bài thử nghiệm CWE-Bench do Collinear thực hiện, tiệm cận mức 47,8% của các mô hình hàng đầu, mặc dù Google nhấn mạnh chi phí của mô hình này thấp hơn.
Nội dung này được dịch bằng trí tuệ nhân tạo và đã được hiệu đính cho dễ hiểu hơn. Chỉ mang tính chất tham khảo.
Bài viết đề xuất













Bình luận (0)
Nhấn vào nút $ , nhập ký hiệu, và chọn để liên kết với một cổ phiếu, ETF, hoặc mã khác.