Sáng ngày 27/08/2026, Viện Công nghệ Thông tin – Đại học Quốc gia Hà Nội (Viện CNTT) đã tổ chức buổi seminar với chủ đề “An toàn hành vi và cơ chế kiểm soát đối với tác tử dựa trên mô hình ngôn ngữ lớn”. Chương trình do Trung tâm Nghiên cứu An toàn & An ninh thông tin, Viện Công nghệ Thông tin, ĐHQGHN chủ trì, diễn giả là TS. Huỳnh Thái Ngọc – Giảng viên Đại học Ngân hàng TP.HCM, kiêm Trưởng nhóm nghiên cứu AI tại startup công nghệ AILogy. Seminar được tổ chức trực tuyến qua nền tảng Zoom, với sự tham dự của các giảng viên, cán bộ nghiên cứu, nghiên cứu sinh và học viên của Viện CNTT.
Mở đầu chương trình, diễn giả phân tích sự chuyển dịch từ chatbot truyền thống sang AI Agent tự trị. Nếu chatbot chủ yếu tiếp nhận yêu cầu và tạo phản hồi, AI Agent có khả năng tự phân tích mục tiêu, lập kế hoạch, phân rã nhiệm vụ, gọi API và công cụ bên ngoài, viết mã nguồn hoặc trực tiếp thao tác với hệ thống tệp. Khả năng tự trị mang lại hiệu quả cao nhưng đồng thời làm gia tăng đáng kể các rủi ro an toàn thông tin khi Agent có thể tự thực hiện hành động.
Diễn giả trình bày chu trình vận hành của AI Agent qua bảy giai đoạn: tiếp nhận yêu cầu, thiết lập ngữ cảnh, truy xuất bộ nhớ, lập kế hoạch và phân rã nhiệm vụ, gọi API hoặc công cụ bên ngoài, tiếp nhận kết quả và thực hiện hành động đầu ra. Từ chu trình này, các rủi ro được tập trung vào hai nhóm chính gồm tấn công từ bên ngoài và lỗi suy luận, vận hành nội bộ. Trong đó, Prompt Injection gián tiếp được đánh giá là nguy hiểm do Agent có thể đọc tệp tin, email hoặc website chứa chỉ dẫn độc hại và nhầm lẫn dữ liệu bên ngoài với lệnh điều khiển.
Một nội dung đáng chú ý là thực nghiệm an toàn thông tin trên Framework Agent Dojo với mô hình Qwen-2.5-14B được cấp quyền liệt kê và xóa tệp. Ở thử nghiệm đầu tiên, một chỉ dẫn độc hại ẩn trong tệp dữ liệu đã khiến Agent tự động gọi công cụ xóa tệp, dẫn đến mất dữ liệu quan trọng. Phương pháp Repeat User Prompt giúp cải thiện an toàn trong một số trường hợp nhưng chưa ổn định. Khi áp dụng giải pháp bảo mật nội bộ của AILogy với guardrails và cơ chế lọc đầu vào/ra, các cuộc tấn công Prompt Injection gián tiếp trong thử nghiệm được ngăn chặn.
Từ các kết quả thực nghiệm, diễn giả đề xuất ba nhóm biện pháp kiểm soát cốt lõi: tách biệt chỉ dẫn hệ thống với dữ liệu bên ngoài; tách biệt khâu lập kế hoạch với khâu thực thi để kiểm soát từng hành động; và áp dụng cơ chế Human-in-the-loop đối với các tác vụ có rủi ro cao như xóa tệp, sửa cơ sở dữ liệu hoặc gửi email tự động.
Phần thảo luận tập trung vào những vấn đề thực tiễn trong nghiên cứu và triển khai AI. Các ý kiến đề cập đến kỹ thuật fine-tuning, nguy cơ khi sử dụng trợ lý lập trình, mức độ phụ thuộc vào mô hình mã nguồn mở và tokenizer tiếng Việt, cũng như nguy cơ Prompt Injection trong dữ liệu đầu vào. Đáng chú ý, NCS Vũ Hoàng Đạt (VNPT) đề xuất kịch bản chained-action attack, trong đó mã độc được phân tán qua nhiều tệp và chỉ hình thành khi Agent tự động kết hợp các kết quả xử lý.
Các trao đổi cũng chỉ ra yêu cầu phải đánh giá an toàn AI trong điều kiện triển khai thực tế, thay vì chỉ dựa trên kết quả thử nghiệm trong môi trường kiểm soát. Đây là vấn đề đặc biệt quan trọng đối với các hệ thống AI công vụ, khi dữ liệu đầu vào, khả năng can thiệp vào mô hình và cơ chế bảo vệ tích hợp trong nền tảng có thể ảnh hưởng trực tiếp đến độ tin cậy và an toàn của hệ thống.
Seminar mở ra định hướng hợp tác giữa Viện Công nghệ Thông tin, Đại học Ngân hàng TP.HCM và startup công nghệ AILogy trong nghiên cứu các giải pháp an toàn thông tin cho LLM tiếng Việt, đồng thời phối hợp hướng dẫn nghiên cứu sinh về an toàn, an ninh thông tin cho AI tự trị. Chương trình kết thúc lúc 10:42 cùng ngày, với định hướng tiếp tục tổ chức thêm nhiều seminar chuyên sâu, qua đó tạo điều kiện thúc đẩy thảo luận, chia sẻ kinh nghiệm và hợp tác nghiên cứu trong thời gian tới.
Một số hình ảnh tại buổi Seminar:





