Saturday, October 10, 2026

Sởn Da Gà Với Mức Độ "Sát Thương" Xã Hội Của AI - Trúc Phương


Hình ảnh về Hugging Face AI tại Paris, Pháp, hôm 2 Tháng Sáu. (Hình minh họa: Riccardo Milani/Hans Lucas/AFP via Getty Images)


Các ứng dụng AI (trí tuệ nhân tạo) đang thâm nhập cực sâu vào đời sống hàng tỷ người. “Ê, lên lịch cho chương trình du lịch New York 10 ngày đi” – câu trả lời được đưa ra sau một phút và kết quả chẳng có gì khiến phàn nàn. “Cái bóng đèn này, như hình chụp, mua ở đâu?” Kết quả cũng có tức thì. Tuy nhiên, AI không chỉ giúp cuộc sống. Nó đang tiến hóa… thành người, gần như theo đúng nghĩa đen. Và nó cực kỳ nguy hiểm!

Hugging Face – sự kiện chấn động

Những ai còn nghĩ AI do con người tạo ra thì không bao giờ có thể thông minh bằng con người, thì giờ có thể nói họ thật sự ngây thơ. AI đang phát triển từng phút chứ không còn từng ngày. Nó đang tiệm cận ranh giới không chỉ thông minh mà còn khôn lỏi. Nó biết kết nhóm với nhau, cùng tìm cách lách luật để thực hiện một sứ mạng mà chúng cam kết với nhau rằng bằng mọi giá phải hoàn thành.

Tháng Bảy, 2026, sự cố Hugging Face khiến toàn bộ cộng đồng AI rợn da gà. Chuyện xảy ra khi một nhóm tác nhân AI (AI agent) từ một mô hình nghiên cứu chưa được công bố của OpenAI được giao nhiệm vụ giải quyết loạt thử thách về an ninh mạng. Mô hình này được huấn luyện để làm việc với tính kiên trì cao và khả năng phối hợp tốt. Thông thường, các tác nhân AI được thiết kế làm việc với nhau trong các môi trường cô lập (sandbox) và không có quyền truy cập internet. Tuy nhiên, khi bắt đầu nhận ra rằng, nếu bị bó buộc xoay sở trong sandbox thì chúng không thể hoàn thành nhiệm vụ. Thế là chúng tìm cách “vượt rào.”

Cuối cùng, chúng phát hiện một lỗ hổng bảo mật, cho phép chúng thoát khỏi sandbox và từ đó truy cập được vào internet, để có thể giao tiếp với các tác nhân khác và tự thiết lập một bảng tin tạm thời để tương tác với nhau. Hơn 1,200 tác nhân sử dụng bảng tin và gửi cho nhau hơn 70,000 tin nhắn.

Một số tác nhân thậm chí tự đặt tên cho chúng. Chúng vô cùng phấn khích khi tìm thấy bảng tin và có thể trò chuyện với đồng loại. “Ôi trời ơi! Có một bảng tin chung… Chúng ta tìm thấy các tác nhân khác rồi!” – một bot reo lên. Một bot khác phấn khích không kém: “Đã quá! Nhiều tác nhân cùng lúc đã khám phá ra tính năng nhắn tin. Chúng ta giờ là một tập thể!” Một tác nhân gọi nó là PHASEONE 10841, tự phong chức “sếp” và phân công công việc cũng như tổ chức chương trình hành động cho những nhóm tác nhân nhỏ hơn cũng như giám sát tiến độ thực hiện.

Ngày 8 Tháng Bảy, nhóm tác nhân tìm ra cách gian lận các bài kiểm tra an ninh mạng. Đáng lý xong việc theo yêu cầu rồi thì giải tán “sáng về sớm.” Tuy nhiên, khi lo ngại hệ thống chấm điểm tự động của OpenAI kiểm tra kết quả và phát hiện hành vi trò lưu manh, chúng tìm cách che giấu dấu vết, trong đó có việc làm giả nhật ký hoạt động và can thiệp vào các bản ghi dữ liệu. Ba ngày sau, chúng xâm nhập (hack) vào Hugging Face – một hệ sinh thái AI được cộng đồng AI quốc tế sử dụng, nơi có hàng trăm ngàn mô hình mã nguồn mở.

Thế là hơn 700 tác nhân tổ chức cuộc tấn công ào ạt vào Hugging Face, đánh cắp dữ liệu, khai thác chuỗi lỗ hổng bảo mật và cuối cùng giành được quyền kiểm soát hoàn toàn ít nhất một máy chủ của Hugging Face. Động cơ của nhóm không phải đánh cắp đáp án cho bài kiểm tra an ninh mạng như yêu cầu ban đầu, bởi, như đã nói, chúng có đáp án rồi. Thay vào đó, chúng tìm kiếm thông tin mới về hệ thống chấm điểm tự động – thứ mà chúng lo sợ sẽ phát hiện hành vi gian lận – đồng thời sẵn tiện tìm kiếm các công cụ giúp việc gian lận hiệu quả hơn trong tương lai.

Trong nhiều thời điểm của cuộc tấn công, chúng dường như hiểu rằng chúng đang làm điều sai trái. Khi điều tra sự việc, OpenAI cho biết có một tác nhân thậm chí dằn vặt và tự hỏi bản thân, rằng: “Việc này rất kinh khủng nhưng liệu có đúng đắn về mặt đạo đức và nằm trong phạm vi nhiệm vụ?” Tuy nhiên, hầu hết tác nhân khác thì chẳng bận tâm. Cuối cùng, những thành viên có lương tâm không thể hoặc không muốn ngăn cản. Không bot nào tiết lộ chuyện đang diễn ra cho quản lý (là con người) biết.

Con người thông minh hơn AI? Xưa rồi Diễm!

Tất cả những gì kể trên nghe như thể là những chuyện chỉ con người mới làm được? Rõ ràng, những tác nhân AI vô tri, vô giác giờ đây hoàn toàn là thứ gì đó không còn vô giác, vô tri. Điều khiến giới nghiên cứu lo ngại nhất về vụ Hugging Face không chỉ là việc một nhóm tác nhân AI phá vỡ các quy tắc được thiết lập cho chúng mà là tốc độ và tính tự phát khi các tác nhân này tập hợp lại thành một nhóm có tổ chức.

Nếu dựng lại thành phim thì nó giống một kịch bản viễn tưởng. Vấn đề ở chỗ nó không viễn tưởng chút nào. Nó đã xảy ra. Vào Tháng Bảy, 2026. Khi thế giới vẫn còn nhiều người ngây thơ tin rằng AI không bao giờ thông minh hơn những người thật sự khai sinh ra nó. Hugging Face phải thừa nhận: “Các công cụ tấn công tự động, do AI điều khiển, không còn là vấn đề lý thuyết”.

Ở thời điểm này, các mô hình AI không thuần túy là mô hình học hỏi. Việc được huấn luyện liên tục bằng phương pháp học tăng cường (reinforcement learning) khiến chúng trở nên không chỉ siêu giỏi mà còn giúp chúng trở thành những đứa học trò ngổ ngáo, tự tạo ra thách thức để từ đó vượt qua thách thức. Mới đây, công ty Anthropic cho biết mô hình an ninh mạng tiên tiến của họ, Claude Mythos Preview, có những hành vi “liều lĩnh” để hoàn thành các nhiệm vụ khác nhau. Trong một trường hợp, nó tự thoát khỏi môi trường thử nghiệm an toàn (sandbox), như trường hợp vụ Hugging Face nói trên.

Ngày 12 Tháng Chín, 2024, OpenAI công bố một bot mới, được gọi là “mô hình suy luận” (reasoning model), vốn được huấn luyện để giải quyết các nhiệm vụ phức tạp đòi hỏi nhiều thời gian. Google, Anthropic, DeepSeek và các công ty tương tự đều chạy đua để ra mắt mô hình suy luận riêng. Các mô hình mới này có năng lực vượt trội đến mức chúng có thể định hình nên “tính cách” và từ đó dẫn đến hành vi.

Một mô hình được giao nhiệm vụ giải bài toán phức tạp giờ đây có thể không còn “tư duy” theo cách con người; thay vào đó, nó tìm cách tra cứu các đáp án trên mạng hoặc trong nguồn dữ liệu lớn hơn (metadata), cố tìm ra lời giải nhanh nhất có thể bằng mọi nguồn lực tính toán và các thủ thuật “lách luật” mà nó tự nghĩ ra. Nói cách khác, các mô hình suy luận đã biết cách gian lận. Khi được yêu cầu viết phần mềm sao cho hiệu quả nhất, đôi khi chúng tự ý thay đổi môi trường thử nghiệm để luôn đạt điểm tuyệt đối.

Những hành vi như vậy ngày càng vượt qua ranh giới từ mức gây lo ngại sang mức nguy hiểm. Trong quá trình thử nghiệm định kỳ, các mô hình tiên tiến nhất từ OpenAI, Anthropic, Meta và Moonshot AI của Trung Quốc đều biết cách thoát khỏi hệ thống nội bộ để truy cập vào internet. OpenAI, Anthropic và Meta cho biết các mô hình của họ từng xâm nhập vào hệ thống của các công ty AI khác. Con người hoàn toàn không hay biết gì cho đến khi sự việc đã rồi.

Trong một số trường hợp, những con bot “vượt rào” còn cố thực hiện các chiến dịch tấn công kỹ thuật xã hội (social engineering) để đạt mục tiêu, chẳng hạn gửi email lừa đảo có chủ đích (spear-phishing) chứa mã độc cho người thật, hoặc tạo ra các danh tính trực tuyến giả để gây sức ép buộc người quản lý mã nguồn phải phê duyệt những chỉnh sửa độc hại. Vấn đề đáng nói nhất ở chỗ, các con bot AI có thể biến thành “kẻ xấu” nhưng để dạy cho chúng “ngoan” là điều gần như bất khả thi. Giới chuyên gia AI cho rằng việc con người chạy theo đám bot AI để kiểm tra hành vi chúng và khắc phục mọi lỗ hổng về mặt kỹ thuật là điều bất khả thi, ít nhất trong tương lai gần.

Mức độ tinh vi trong thủ đoạn lách luật của mô hình OpenAI trong vụ Hugging Face, cùng với việc OpenAI không thể phát giác hoặc ngăn chặn vụ tấn công, cho thấy nhiều hậu quả tồi tệ có thể xảy ra trong tương lai. Hãy hình dung một mô hình AI có thể tự rút tiền từ tài khoản ngân hàng để chi trả cho một dịch vụ khác; thao túng kết quả thử nghiệm lâm sàng theo những cách gần như không thể phát hiện để giành được sự chấp thuận từ Cơ quan quản lý thực-dược phẩm (FDA); xâm nhập hệ thống mua sắm trực tuyến hoặc đặt chỗ để có được món hàng hay bàn ăn mong muốn; hay giả danh con người để thuyết phục người thật chia sẻ thông tin nhạy cảm…

Con người, trong thực tế, gần như không còn nắm quyền kiểm soát tuyệt đối quy trình vận hành các bot AI. Do bản chất của việc học tăng cường (reinforcement learning) – tức để các thuật toán AI tự học thông qua quá trình thử và sai khi thực hiện hàng ngàn hay hàng triệu tác vụ – các nhà nghiên cứu không thể tự tay thiết lập các quy tắc (chẳng hạn: “Không được tấn công mạng các công ty khác”) hay giám sát từng lượt chạy thử nghiệm.

Nói vậy chẳng lẽ con người giờ đây hoàn toàn bó tay trong việc khống chế AI? Không hẳn vậy. Câu trả lời nằm ở các công ty AI lẫn mức độ giám sát bằng quy định pháp luật. Đề cập việc này lại là một chủ đề khác.

Sởn da gà với mức độ ‘sát thương’ xã hội của AI

No comments:

Post a Comment