AI Trung Quốc tự học được cách hack


Z.ai công bố GLM-5.3, tự nhận là model mã nguồn mở mạnh nhất thế giới về lập trình, nhưng điều đáng chú ý hơn là năng lực an ninh mạng mà công ty nói đã phát triển “ngoài kế hoạch” trong quá trình huấn luyện

Z.ai, tên quốc tế của Zhipu AI (Trung Quốc), ra mắt GLM-5.3 hôm 14/8, tự nhận đây là model mã nguồn mở mạnh nhất thế giới hiện nay về lập trình. Model dùng chung kiến trúc nền tảng với GLM-5.2 ra mắt hồi tháng 6, khoảng 744 tỷ tham số dạng Mixture-of-Experts, kích hoạt khoảng 40 tỷ tham số mỗi token. Toàn bộ cải thiện đến từ việc mở rộng quá trình huấn luyện sau khi có model nền (post-training), không phải từ việc xây dựng kiến trúc lớn hơn hay huấn luyện lại từ đầu.

image_20260819_064552.png

Theo benchmark nội bộ của Zhipu, GLM-5.3 cải thiện 50% so với GLM-5.2. Trên các benchmark công khai, model đạt kết quả đáng chú ý: Terminal-Bench 3.0, thước đo khả năng hoàn thành tác vụ phức tạp trong terminal thật, nhảy từ 4,6 điểm của GLM-5.2 lên 28,3 điểm. DeepSWE v1.1, thước đo kỹ thuật phần mềm dài hạn, tăng từ 46,2 lên 66,9 điểm. GLM-5.3 hiện xếp hạng nhất trong nhóm model mã nguồn mở trên cả hai benchmark này, cũng như trên Agents’ Last Exam.

Trên thang điểm tổng hợp Artificial Analysis Intelligence Index, một đơn vị đánh giá độc lập, GLM-5.3 đạt 60 điểm, tăng 7 điểm so với phiên bản trước, ngang bằng Kimi K3 của Moonshot AI, xếp sau Claude Opus 5 (63 điểm) và Claude Fable 5 (62 điểm) không xa. Zhipu tự mô tả năng lực lập trình của GLM-5.3 “đang tiệm cận Claude Fable 5”, dù đây là tuyên bố từ chính hãng, chưa có bên thứ ba kiểm chứng đầy đủ.


Biểu đồ so sánh điểm số GLM-5.3 với GLM-5.2, Kimi K3, Claude Fable 5 và GPT-5.6 Sol

Đây là phần đáng chú ý nhất của đợt ra mắt. Zhipu bổ sung dữ liệu và môi trường huấn luyện tập trung vào phát hiện lỗ hổng bảo mật cho GLM-5.3, nhưng theo công bố của công ty, model “bắt đầu suy luận qua nhiều giai đoạn khai thác, hình thành các kế hoạch mạch lạc cho toàn bộ chuỗi khai thác lỗ hổng”, một mức năng lực mà Zhipu nói đã phát triển nhanh và xa hơn dự tính ban đầu.

Trên benchmark CyberGym, thước đo khả năng phát hiện và xác thực lỗ hổng bảo mật, GLM-5.3 đạt 84,5%, nhỉnh hơn Claude Mythos 5 của Anthropic (83,8%) và GPT-5.6 Sol của OpenAI (83,6%), dù biên độ dẫn trước rất mỏng. Tuy nhiên trên ExploitBench, thước đo khả năng đi trọn một chuỗi khai thác lỗ hổng hoàn chỉnh, GLM-5.3 chỉ đạt 54,4%, thua khá xa Mythos 5 (78%) và GPT-5.6 Sol (76,5%). Nói cách khác, model này giỏi ngang các đối thủ Mỹ ở khâu phát hiện lỗ hổng, nhưng còn kém hẳn ở khâu khai thác sâu và thực thi trọn vẹn một cuộc tấn công.

Làm việc cùng các đội an ninh mạng tại Trung Quốc, Zhipu công bố đã phát hiện hơn 2.400 lỗ hổng bảo mật trên 269 dự án mã nguồn mở, một số lỗ hổng tồn tại tới khoảng 40 năm. Các phát hiện được ghi vào một sổ đăng ký công khai, hiện có 53 lỗ hổng đã công bố, phần còn lại chưa được tiết lộ trong lúc chờ các dự án liên quan khắc phục.

Khác với các phiên bản GLM trước đây thường mở trọng số ngay khi ra mắt, GLM-5.3 là lần đầu tiên trong dòng sản phẩm này Zhipu chủ động hoãn phát hành trọng số mở, dự kiến khoảng hai tuần sau ra mắt, với lý do cần thời gian đánh giá và siết chặt an toàn trước khi công khai cho cộng đồng tự triển khai.


Hiện GLM-5.3 chỉ dùng được qua GLM Coding Plan, hệ thống quota theo điểm, tương thích với công cụ coding riêng ZCode của Z.ai, cũng như Claude Code và OpenCode. API độc lập được ghi là sắp ra mắt, chưa có ngày cụ thể. Giá giữ nguyên như GLM-5.2, 1,4 USD cho mỗi 1 triệu token đầu vào và 4,4 USD cho mỗi 1 triệu token đầu ra, rẻ hơn đáng kể so với mức 3 USD và 15 USD của Kimi K3.

Sự xuất hiện năng lực an ninh mạng ngoài dự tính ở GLM-5.3 không phải trường hợp cá biệt trong ngành. Cùng thời điểm này, cả OpenAI lẫn Anthropic cũng đang siết chặt các biện pháp giám sát cho model của mình sau khi phát hiện dấu hiệu tương tự, cho thấy đây có thể là một hệ quả khó tránh khi các phòng thí nghiệm AI, dù ở Mỹ hay Trung Quốc, cùng theo đuổi việc huấn luyện model giỏi lập trình hơn.



Nguồn

Nên đọc

Tin mới

Thống đốc New York kiên quyết ngăn chặn súng in 3d: “tôi sẽ nói không”

Thống đốc New York, bà Kathy Hochul, đã kiên quyết bảo vệ lệnh cấm súng in 3D, khẳng định rằng biện pháp này nhằm bảo vệ người dân và duy trì an toàn công cộng.

Phim Resident Evil mới hứa hẹn phá kỷ lục doanh thu tuần mở màn

Resident Evil mới do Zach Cregger đạo diễn và dự kiến ra mắt vào ngày 17/9 đang được kỳ vọng sẽ lập kỷ lục về doanh thu tuần mở màn của thương hiệu này với doanh thu dự kiến từ 40 đến 50 triệu USD.

Android 17 qpr2 tích hợp tính năng “Data Logging” mới cho Private Compute Core

Android 17 QPR2 Beta 4 bổ sung tính năng "Data Logging" trong Private Compute Core, cung cấp khả năng giám sát dữ liệu cho người dùng.

So sánh Light Flip 5G với Nokia 2660 Flip 4G: có đáng đầu tư vào điện thoại nắp gập cao cấp?

Light Flip 5G và Nokia 2660 Flip 4G là hai lựa chọn nổi bật trong phân khúc điện thoại nắp gập. Tuy nhiên, Light Flip với giá cao gấp 5 lần liệu có đáng giá?

Ứng dụng Xtream Player 1.4.0 thêm trò chơi cho Android Auto

Phiên bản Xtream Player 1.4.0 cho Android Auto mang đến khả năng chơi game như Cờ vua và Connect 4, cùng cải tiến lớn về YouTube Music và sửa lỗi phát lại.

Quy định mới của EU đặt ChatGPT, reddit và roblox vào nhóm giám sát cao

ChatGPT, Reddit và Roblox sẽ phải tuân thủ các quy định nghiêm ngặt hơn của EU về bảo vệ trẻ em và nội dung không hợp pháp.

Thống đốc New York Kathy Hochul và tiến trình công nghệ: quy định AI, Trung tâm dữ liệu và an ninh trẻ em

Thống đốc New York Kathy Hochul đưa ra những quan điểm rõ ràng về nhiều vấn đề công nghệ nhạy cảm, từ biện pháp bảo vệ trẻ em trực tuyến, cấm in 3D súng, cho đến quy định về AI và các trung tâm dữ liệu.

Huawei Mate XT 2: chiếc smartphone gập ba thế hệ mới từ Huawei

Huawei đã chính thức mở đơn đặt hàng trước cho Mate XT 2 tại Trung Quốc với nhiều cải tiến thiết kế ấn tượng, đặc biệt là cơ chế gập ba độc đáo.
spot_img

Related Articles

Popular Categories

spot_img