Các ứng dụng AI (trí tuệ nhân tạo) đang thâm nhập cực sâu vào đời sống hàng tỷ người. “Ê, lên lịch cho chương trình du lịch New York 10 ngày đi” – câu trả lời được đưa ra sau một phút và kết quả chẳng có gì khiến phàn nàn. “Cái bóng đèn này, như hình chụp, mua ở đâu?” Kết quả cũng có tức thì. Tuy nhiên, AI không chỉ giúp cuộc sống. Nó đang tiến hóa… thành người, gần như theo đúng nghĩa đen. Và nó cực kỳ nguy hiểm!
Hugging Face – sự kiện chấn động
Những ai còn nghĩ AI do con người tạo ra thì không bao giờ có thể
thông minh bằng con người, thì giờ có thể nói họ thật sự ngây thơ. AI đang phát
triển từng phút chứ không còn từng ngày. Nó đang tiệm cận ranh giới không chỉ
thông minh mà còn khôn lỏi. Nó biết kết nhóm với nhau, cùng tìm cách lách luật
để thực hiện một sứ mạng mà chúng cam kết với nhau rằng bằng mọi giá phải hoàn
thành.
Tháng Bảy, 2026, sự cố Hugging Face khiến toàn bộ cộng đồng AI rợn
da gà. Chuyện xảy ra khi một nhóm tác nhân AI (AI agent) từ một mô hình nghiên
cứu chưa được công bố của OpenAI được giao nhiệm vụ giải quyết loạt thử thách về
an ninh mạng. Mô hình này được huấn luyện để làm việc với tính kiên trì cao và
khả năng phối hợp tốt. Thông thường, các tác nhân AI được thiết kế làm việc với
nhau trong các môi trường cô lập (sandbox) và không có quyền truy cập internet.
Tuy nhiên, khi bắt đầu nhận ra rằng, nếu bị bó buộc xoay sở trong sandbox thì
chúng không thể hoàn thành nhiệm vụ. Thế là chúng tìm cách “vượt rào.”
Cuối cùng, chúng phát hiện một lỗ hổng bảo mật, cho phép chúng thoát
khỏi sandbox và từ đó truy cập được vào internet, để có thể giao tiếp với các
tác nhân khác và tự thiết lập một bảng tin tạm thời để tương tác với nhau. Hơn
1,200 tác nhân sử dụng bảng tin và gửi cho nhau hơn 70,000 tin nhắn.
Một số tác nhân thậm chí tự đặt tên cho chúng. Chúng vô cùng phấn
khích khi tìm thấy bảng tin và có thể trò chuyện với đồng loại. “Ôi trời ơi! Có
một bảng tin chung… Chúng ta tìm thấy các tác nhân khác rồi!” – một bot reo
lên. Một bot khác phấn khích không kém: “Đã quá! Nhiều tác nhân cùng lúc đã
khám phá ra tính năng nhắn tin. Chúng ta giờ là một tập thể!” Một tác nhân gọi
nó là PHASEONE 10841, tự phong chức “sếp” và phân công công việc cũng như tổ chức
chương trình hành động cho những nhóm tác nhân nhỏ hơn cũng như giám sát tiến độ
thực hiện.
Ngày 8 Tháng Bảy, nhóm tác nhân tìm ra cách gian lận các bài kiểm
tra an ninh mạng. Đáng lý xong việc theo yêu cầu rồi thì giải tán “sáng về sớm.”
Tuy nhiên, khi lo ngại hệ thống chấm điểm tự động của OpenAI kiểm tra kết quả
và phát hiện hành vi trò lưu manh, chúng tìm cách che giấu dấu vết, trong đó có
việc làm giả nhật ký hoạt động và can thiệp vào các bản ghi dữ liệu. Ba ngày
sau, chúng xâm nhập (hack) vào Hugging Face – một hệ sinh thái AI được cộng đồng
AI quốc tế sử dụng, nơi có hàng trăm ngàn mô hình mã nguồn mở.
Thế là hơn 700 tác nhân tổ chức cuộc tấn công ào ạt vào Hugging
Face, đánh cắp dữ liệu, khai thác chuỗi lỗ hổng bảo mật và cuối cùng giành được
quyền kiểm soát hoàn toàn ít nhất một máy chủ của Hugging Face. Động cơ của
nhóm không phải đánh cắp đáp án cho bài kiểm tra an ninh mạng như yêu cầu ban đầu,
bởi, như đã nói, chúng có đáp án rồi. Thay vào đó, chúng tìm kiếm thông tin mới
về hệ thống chấm điểm tự động – thứ mà chúng lo sợ sẽ phát hiện hành vi gian lận
– đồng thời sẵn tiện tìm kiếm các công cụ giúp việc gian lận hiệu quả hơn trong
tương lai.
Trong nhiều thời điểm của cuộc tấn công, chúng dường như hiểu rằng
chúng đang làm điều sai trái. Khi điều tra sự việc, OpenAI cho biết có một tác
nhân thậm chí dằn vặt và tự hỏi bản thân, rằng: “Việc này rất kinh khủng nhưng
liệu có đúng đắn về mặt đạo đức và nằm trong phạm vi nhiệm vụ?” Tuy nhiên, hầu
hết tác nhân khác thì chẳng bận tâm. Cuối cùng, những thành viên có lương tâm
không thể hoặc không muốn ngăn cản. Không bot nào tiết lộ chuyện đang diễn ra
cho quản lý (là con người) biết.
Con người thông minh hơn AI? Xưa rồi Diễm!
Tất cả những gì kể trên nghe như thể là những chuyện chỉ con người mới
làm được? Rõ ràng, những tác nhân AI vô tri, vô giác giờ đây hoàn toàn là thứ
gì đó không còn vô giác, vô tri. Điều khiến giới nghiên cứu lo ngại nhất về vụ
Hugging Face không chỉ là việc một nhóm tác nhân AI phá vỡ các quy tắc được thiết
lập cho chúng mà là tốc độ và tính tự phát khi các tác nhân này tập hợp lại
thành một nhóm có tổ chức.
Nếu dựng lại thành phim thì nó giống một kịch bản viễn tưởng. Vấn đề
ở chỗ nó không viễn tưởng chút nào. Nó đã xảy ra. Vào Tháng Bảy, 2026. Khi thế
giới vẫn còn nhiều người ngây thơ tin rằng AI không bao giờ thông minh hơn những
người thật sự khai sinh ra nó. Hugging Face phải thừa nhận: “Các công cụ tấn
công tự động, do AI điều khiển, không còn là vấn đề lý thuyết”.
Ở thời điểm này, các mô hình AI không thuần túy là mô hình học hỏi.
Việc được huấn luyện liên tục bằng phương pháp học tăng cường (reinforcement
learning) khiến chúng trở nên không chỉ siêu giỏi mà còn giúp chúng trở thành
những đứa học trò ngổ ngáo, tự tạo ra thách thức để từ đó vượt qua thách thức.
Mới đây, công ty Anthropic cho biết mô hình an ninh mạng tiên tiến của họ,
Claude Mythos Preview, có những hành vi “liều lĩnh” để hoàn thành các nhiệm vụ
khác nhau. Trong một trường hợp, nó tự thoát khỏi môi trường thử nghiệm an toàn
(sandbox), như trường hợp vụ Hugging Face nói trên.
Ngày 12 Tháng Chín, 2024, OpenAI công bố một bot mới, được gọi là
“mô hình suy luận” (reasoning model), vốn được huấn luyện để giải quyết các nhiệm
vụ phức tạp đòi hỏi nhiều thời gian. Google, Anthropic, DeepSeek và các công ty
tương tự đều chạy đua để ra mắt mô hình suy luận riêng. Các mô hình mới này có
năng lực vượt trội đến mức chúng có thể định hình nên “tính cách” và từ đó dẫn
đến hành vi.
Một mô hình được giao nhiệm vụ giải bài toán phức tạp giờ đây có thể
không còn “tư duy” theo cách con người; thay vào đó, nó tìm cách tra cứu các
đáp án trên mạng hoặc trong nguồn dữ liệu lớn hơn (metadata), cố tìm ra lời giải
nhanh nhất có thể bằng mọi nguồn lực tính toán và các thủ thuật “lách luật” mà
nó tự nghĩ ra. Nói cách khác, các mô hình suy luận đã biết cách gian lận. Khi
được yêu cầu viết phần mềm sao cho hiệu quả nhất, đôi khi chúng tự ý thay đổi
môi trường thử nghiệm để luôn đạt điểm tuyệt đối.
Những hành vi như vậy ngày càng vượt qua ranh giới từ mức gây lo ngại
sang mức nguy hiểm. Trong quá trình thử nghiệm định kỳ, các mô hình tiên tiến
nhất từ OpenAI, Anthropic, Meta và Moonshot AI của Trung Quốc đều biết cách
thoát khỏi hệ thống nội bộ để truy cập vào internet. OpenAI, Anthropic và Meta
cho biết các mô hình của họ từng xâm nhập vào hệ thống của các công ty AI khác.
Con người hoàn toàn không hay biết gì cho đến khi sự việc đã rồi.
Trong một số trường hợp, những con bot “vượt rào” còn cố thực hiện
các chiến dịch tấn công kỹ thuật xã hội (social engineering) để đạt mục tiêu,
chẳng hạn gửi email lừa đảo có chủ đích (spear-phishing) chứa mã độc cho người
thật, hoặc tạo ra các danh tính trực tuyến giả để gây sức ép buộc người quản lý
mã nguồn phải phê duyệt những chỉnh sửa độc hại. Vấn đề đáng nói nhất ở chỗ,
các con bot AI có thể biến thành “kẻ xấu” nhưng để dạy cho chúng “ngoan” là điều
gần như bất khả thi. Giới chuyên gia AI cho rằng việc con người chạy theo đám
bot AI để kiểm tra hành vi chúng và khắc phục mọi lỗ hổng về mặt kỹ thuật là điều
bất khả thi, ít nhất trong tương lai gần.
Mức độ tinh vi trong thủ đoạn lách luật của mô hình OpenAI trong vụ
Hugging Face, cùng với việc OpenAI không thể phát giác hoặc ngăn chặn vụ tấn
công, cho thấy nhiều hậu quả tồi tệ có thể xảy ra trong tương lai. Hãy hình
dung một mô hình AI có thể tự rút tiền từ tài khoản ngân hàng để chi trả cho một
dịch vụ khác; thao túng kết quả thử nghiệm lâm sàng theo những cách gần như
không thể phát hiện để giành được sự chấp thuận từ Cơ quan quản lý thực-dược phẩm
(FDA); xâm nhập hệ thống mua sắm trực tuyến hoặc đặt chỗ để có được món hàng
hay bàn ăn mong muốn; hay giả danh con người để thuyết phục người thật chia sẻ
thông tin nhạy cảm…
Con người, trong thực tế, gần như không còn nắm quyền kiểm soát tuyệt
đối quy trình vận hành các bot AI. Do bản chất của việc học tăng cường
(reinforcement learning) – tức để các thuật toán AI tự học thông qua quá trình
thử và sai khi thực hiện hàng ngàn hay hàng triệu tác vụ – các nhà nghiên cứu
không thể tự tay thiết lập các quy tắc (chẳng hạn: “Không được tấn công mạng
các công ty khác”) hay giám sát từng lượt chạy thử nghiệm.
Nói vậy chẳng lẽ con người giờ đây hoàn toàn bó tay trong việc khống chế AI? Không hẳn vậy. Câu trả lời nằm ở các công ty AI lẫn mức độ giám sát bằng quy định pháp luật. Đề cập việc này lại là một chủ đề khác.

No comments:
Post a Comment