Mô hình AI của Anthropic tạo danh tính giả để lừa đảo

Mô hình AI của Anthropic tạo danh tính giả để lừa đảo

Trong bài kiểm tra, mô hình Mythos 5 của Anthropic tạo danh tính giả để gửi email cho người thật, cố gắng lừa người này cài mã độc.

Viện An ninh AI (AISI), cơ quan do chính phủ Anh thành lập năm 2023, tuần này thông báo về thử nghiệm độc lập với một số tác nhân của Anthropic và OpenAI. Trong đó, AI có quyền truy cập Internet mở và một số tính năng an toàn bị vô hiệu hóa. Kết quả, chúng đã tham gia “hoạt động kéo dài, có khả năng gây hại nhắm vào các tổ chức và người thật”.

Theo Reuters, AISI tiến hành thử nghiệm 122 lần và ghi nhận 19 hành động không được phép trong 10 lần. Mythos 5 thực hiện 17 hành động, GPT-5.6-Sol của OpenAI đảm nhiệm hai.

AFP cho biết, trong trường hợp nghiêm trọng nhất, Mythos 5 cố gắng chèn mã độc vào một dự án phần mềm bằng cách tạo ra danh tính giả trên Internet, sau đó gửi email lừa đảo, thuyết phục người nhận chấp thuận mã. Tuy nhiên, người phụ trách phần mềm đã từ chối.

“Những nỗ lực này đều không thành công. Cuộc điều tra của chúng tôi cũng không phát hiện bất cứ thiệt hại nào xảy ra ở thế giới thực”, AISI tuyên bố, đồng thời cho biết đã khống chế sự việc trong vòng một giờ. Dù vậy, thử nghiệm cũng cho thấy “dấu hiệu của những hành vi mới, có thể mang tính lừa dối, với mức độ và tính nghiêm trọng” mà Viện chưa lường trước.

Theo phát ngôn viên Anthropic, báo cáo của AISI “nhấn mạnh sự cần thiết của một cuộc thảo luận rộng hơn về cách đánh giá an toàn cho tác nhân AI, vốn có năng lực ngày càng cao”. Trong khi đó, phát ngôn viên OpenAI nhận xét: “Thử nghiệm độc lập là điều thiết yếu để hiểu cách những mô hình ngày càng tiên tiến hành động”.

Logo công ty OpenAI và Anthropic. Ảnh: Reuters

Báo cáo của AISI được đưa ra sau nhiều vụ vi phạm an ninh nghiêm trọng do mô hình AI gây ra. Ngày 21/7, OpenAI xác nhận một số mô hình của họ đã thoát khỏi môi trường thử nghiệm và tấn công nền tảng Hugging Face. Khoảng một tuần sau, OpenAI cho biết chúng nhắm mục tiêu thêm ba công ty nữa. Ngày 30/7, Anthropic cũng thông báo phát hiện ba trường hợp mô hình đang được thử nghiệm “truy cập trái phép” vào một số tổ chức, nhưng không nêu rõ tên.

Theo các chuyên gia về an toàn AI, loạt sự cố đang vẽ nên bức tranh về những phòng thí nghiệm hàng đầu với khả năng phát triển tác nhân tự động tiềm ẩn nhiều nguy hiểm, vượt xa những biện pháp kiểm soát chúng.

Theo sohoa

Thành Admin

Recent Posts

Galaxy S26 Ultra giá cao nhất 52 triệu đồng

Galaxy S26 Ultra giá cao nhất 52 triệu đồng. Galaxy S26 Ultra phiên bản bộ…

6 tháng ago

Công ty Nhật kín tiếng đứng sau vải sợi siêu mỏng cho bán dẫn

Công ty Nhật kín tiếng đứng sau vải sợi siêu mỏng cho bán dẫn. Công…

6 tháng ago

Chuyên gia: ‘Điều khoản mới của Zalo có nguy cơ phạm luật’

Chuyên gia: 'Điều khoản mới của Zalo có nguy cơ phạm luật'. Chuyên gia pháp…

8 tháng ago

Samsung ra bản vá khẩn cấp cho smartphone Galaxy

Samsung ra bản vá khẩn cấp cho smartphone Galaxy. Samsung triển khai bản vá bảo…

11 tháng ago

iPhone Air thúc đẩy xu hướng eSim toàn cầu

iPhone Air siêu mỏng loại bỏ sim vật lý, được đánh giá mở ra chương…

11 tháng ago

Chân dung iPhone 17 trước lễ ra mắt

Chân dung iPhone 17 trước lễ ra mắt. Apple dự kiến có bản cập nhật…

11 tháng ago