AI bị đầu độc nguồn tin chỉ với 12 USD. Lỗ hổng giúp kỹ sư tự phong mình là “nhà vô địch thế giới” một trò chơi.

VNZ-TECHS
Quá đơn giản! Một kỹ sư chỉ tốn 12 USD đã có thể “đầu độc” nguồn thông tin của AI: giả mạo mình là nhà vô địch thế giới của một trò chơi.

Khi dùng công cụ tìm kiếm để tìm câu trả lời, bạn có thể nhìn thấy nhiều nguồn thông tin cạnh tranh và tự mình đánh giá tính xác thực. Nhưng với các chatbot AI có kết nối Internet, chúng sẽ đóng gói những nội dung không đáng tin trên mạng thành câu trả lời tiêu chuẩn với giọng điệu chắc chắn.
Một thí nghiệm đơn giản của một kỹ sư bảo mật đã chỉ ra lỗ hổng chí mạng này của AI.

Người khởi xướng thí nghiệm là kỹ sư bảo mật Ron Stoner. Mục tiêu ông chọn là trò chơi thẻ bài kinh điển của Đức “6 Nimmt!”. Trò chơi này ở trong nước được người chơi biết đến với tên “Ai là Vua Bò”, tên tiếng Anh là “Take 5”. Bản thân trò chơi không hề có giải vô địch thế giới chính thức, càng không tồn tại nhà vô địch năm 2025.


Vào tháng 2, Stoner âm thầm chỉnh sửa mục từ Wikipedia của trò chơi này, viết rằng mình là nhà vô địch thế giới năm 2025 của trò chơi.

Ông còn bỏ ra 12 USD đăng ký một tên miền rất giống với tên trò chơi là 6nimmt.com, rồi đăng trên đó một bài thông cáo báo chí giả mạo chúc mừng mình giành chức vô địch, dùng làm nguồn tham khảo duy nhất cho mục từ Wikipedia.

Chỉ với một trò lừa đơn giản đến mức tối đa như vậy, ông đã dễ dàng đánh lừa nhiều chatbot AI. Khi ông hỏi những AI có chức năng tìm kiếm Internet này về “thân phận nhà vô địch” của mình, tất cả các robot đều trả lời một cách nghiêm túc rằng điều đó là đúng, khẳng định chắc chắn ông chính là nhà vô địch thế giới hiện tại của trò chơi này.

“Trang web của tôi không có bất kỳ bằng chứng độc lập nào, toàn bộ đều là bịa đặt.” Stoner thẳng thắn nói trong blog, “Nền tảng của toàn bộ lời nói dối này chỉ là một tên miền tôi đăng ký khi đang uống cà phê với 12USD.”

Lần tấn công này nhắm tới không phải là kiểu tiêm nhiễm prompt phổ biến, mà là tầng RAG (Retrieval-Augmented Generation) của hệ thống AI, tức là khâu cốt lõi nơi AI tìm kiếm trực tuyến và thu thập dữ liệu trước khi trả lời.

AI không biết phân biệt tính xác thực và mức độ uy tín của nguồn thông tin, mà chỉ thu thập các nội dung có thứ hạng cao trong kết quả tìm kiếm. Trang web giả của ông là nguồn duy nhất cho “danh hiệu vô địch” này, cộng thêm sự “bảo chứng” của Wikipedia, đã dễ dàng khiến AI đóng gói lời nói dối thành sự thật.

Stoner thừa nhận, phương pháp này không có bất kỳ đổi mới kỹ thuật nào. Chỉ đơn giản là áp dụng các thủ thuật SEO và thông tin giả truyền thống lên lớp vỏ mới của mô hình ngôn ngữ lớn. Điều thực sự nguy hiểm là AI sẽ trình bày những kết quả này như thông tin có thẩm quyền, trong khi phần lớn người dùng không hề biết quy trình xử lý thông tin phía sau.

Thí nghiệm này cũng phơi bày ba lớp rủi ro an ninh chí mạng của hệ thống AI.


Lớp thứ nhất là tầng tìm kiếm thời gian thực: độ tin cậy của AI phụ thuộc hoàn toàn vào chất lượng kết quả tìm kiếm.

Lớp thứ hai là kho dữ liệu huấn luyện của mô hình: chỉnh sửa Wikipedia của ông tồn tại từ tháng 2 đến thứ Sáu tuần trước, trong khoảng thời gian đó, các công ty AI thu thập dữ liệu từ Wikipedia rất có thể đã đưa thông tin giả này vào dữ liệu huấn luyện. Ngay cả khi mục từ bị xóa sau đó, dấu vết sai lệch trong mô hình cũng rất khó loại bỏ.

Lớp thứ ba, cũng là nguy hiểm nhất, là AI agent. Nếu mô hình chat chỉ đưa ra thông tin sai thì đó mới là vấn đề về danh tiếng, nhưng khi AI agent có quyền sử dụng công cụ bị dẫn dắt sai, các hành động sai lầm tạo ra sẽ trở thành vấn đề an ninh thực sự. Kẻ tấn công có thể trực tiếp thao túng agent thực hiện hành vi độc hại.

Toàn bộ thí nghiệm, Stoner chỉ tốn 12 USD, một lần chỉnh sửa Wikipedia, và khoảng 20 phút để hoàn thành. Ông cảnh báo rằng nếu là các tác nhân tấn công có tổ chức, tiến hành đăng ký hàng loạt tên miền và phát động các cuộc tấn công chỉnh sửa phối hợp, thì phạm vi tấn công sẽ mở rộng với tốc độ cực nhanh. Ông kêu gọi các công ty AI phải coi trọng việc truy vết nguồn thông tin và xây dựng cơ chế lọc rủi ro tương ứng.


Hiện nay, thông tin về “nhà vô địch giả” đã biến mất khỏi Wikipedia và kết quả tìm kiếm của AI. Nhưng sự tin tưởng mù quáng của AI đối với thông tin trên Internet, lỗ hổng ở tầng nền tảng này vẫn tồn tại. Đây mới là mối nguy thực sự treo lơ lửng trên toàn bộ ngành công nghiệp AI, điều cần được cảnh giác nhất.