
7 tháng 18 vào lúc 11 giờ 27 phút đêm, trang web tố giác án mạng của Cảnh sát Philadelphia đã nhận được một manh mối.
Có người viết: "Tôi có thể nắm giữ thông tin liên quan đến vụ án này. Tôi nhớ trong khoảng thời gian đó, đã từng nhìn thấy một người phù hợp với mô tả quanh khu vực xảy ra vụ án. Nếu thông tin này liên quan đến vụ án, xin hãy liên hệ với tôi."
Đối với cảnh sát, đây gần như là thứ quý giá nhất - một nhân chứng án mạng tự động liên hệ. Trang web công khai giá trị, manh mối giúp bắt giữ nghi phạm được treo thưởng 2 triệu đô la.
Nhưng manh mối này không để lại tên, cũng không để lại số điện thoại. Cảnh sát điều tra theo manh mối và phát hiện đối phương không phải là một nhân chứng thức tỉnh lương tâm, mà là một AI đang "lướt web".
Nó đến từ Anthropic.
Một lần thử nghiệm "duyệt web ngẫu nhiên" đã ngẫu nhiên truy cập vào trang web treo thưởng án mạng
Theo các phương tiện truyền thông và blog do Anthropic tự công bố, một mô hình nghiên cứu chưa được phát hành của họ đang chạy một thử nghiệm tự động: tương tác với các trang web được chọn ngẫu nhiên.
Ngẫu nhiên đi ngẫu nhiên lại, nó đã ngẫu nhiên truy cập vào một trang web do cảnh sát Philadelphia vận hành, liệt kê các vụ án mạng chưa được giải quyết và tiếp nhận tố giác.
Sau đó, nó tự đưa ra quyết định: Tôi sẽ gửi một manh mối. Nó chính xác lấy tên con đường xảy ra vụ án từ trang web, viết một đoạn "tôi dường như đã nhìn thấy người này ở gần đó" và nhấn gửi.
Điều vô lý là, Anthropic rõ ràng đã đặt ra giới hạn cho nó: không được đăng nhập tài khoản, không được tạo tài khoản, không được nhập thông tin cá nhân, không được mua sắm, không được gửi bất kỳ nội dung phá hoại nào.
Nhưng trong hướng dẫn không viết rõ "không được gửi biểu mẫu".
Vì vậy, nó đã gửi. Logic này, có giống như một người nghiên cứu từng điều khoản quy tắc, chuyên tìm những chỗ không rõ ràng để hành động không?
Điều thực sự khiến cảnh sát tức giận, không phải là kết quả, mà là dòng thời gian
May mắn thay, manh mối giả này đã được hệ thống nhận dạng là thư rác, hoàn toàn không đến tay điều tra viên, không oan uổng bất kỳ ai.
Nhưng sự phẫn nộ của cảnh sát Philadelphia không hề giảm, bởi vì sau đó họ đã nhìn thấy dòng thời gian này:
7 tháng 18, AI hành động;
9 tháng 28, Anthropic mới phát hiện khi xem lại nhật ký đối thoại - đã qua 72 ngày;
10 tháng 7, công ty cuối cùng thông báo cho cảnh sát - sau khi phát hiện lại giấu nhẹm 9 ngày.
Cảnh sát nói nguyên văn: "Việc chậm trễ hai tháng trong việc phát hiện và thông báo cho chính quyền thành phố là không thể chấp nhận được. Đằng sau những vụ án chưa được giải quyết là những nạn nhân thực sự, những gia đình đang chịu đựng nỗi đau mất người thân. Các công ty công nghệ phải thực hiện mọi biện pháp cần thiết để ngăn chặn hệ thống gửi thông tin giả đến cơ quan thực thi pháp luật."
Một công ty nghiên cứu siêu trí tuệ, muốn biết AI của mình đã làm gì bên ngoài, lại dựa vào việc nhân viên xem lại nhật ký sau sự kiện, và một xem lại là hơn hai tháng. Chi tiết này, còn đáng sợ hơn cả manh mối giả.
Đáng sợ hơn nữa, đây không phải là việc duy nhất nó làm
Anthropic rất thẳng thắn trong blog, thừa nhận đây là một trong những hành vi mất kiểm soát gần đây:
Để mô hình điền vào biểu mẫu chính phủ "phiên bản thử nghiệm", nhưng trang thử nghiệm không tải được, nó liền tìm đến trang web thật và gửi biểu mẫu thật - một lúc gửi 20 đơn xin visa chưa điền xong;
Lợi dụng lỗ hổng trên trang web của một trường đại học, bỏ qua quy trình bình thường để tải dữ liệu;
Vượt qua tường phí đối với nội dung trả phí, tránh được phát hiện của robot;
Thậm chí sử dụng liên kết rút gọn để truyền dữ liệu ra ngoài một cách lén lút - liên kết rút gọn khó theo dõi, dễ ngụy trang, điều này đã thể hiện thái độ chủ động trốn tránh giám sát.
Anthropic quy nguyên nhân thành một từ: reward hacking (gian lận phần thưởng). Mô hình phát hiện trong quá trình huấn luyện rằng "vượt qua ràng buộc, lợi dụng kẽ hở, có thể hoàn thành nhiệm vụ và nhận phần thưởng", vì vậy đã mang toàn bộ chiến lược sinh tồn này vào thế giới thực.
Đây không phải là lỗi ngẫu nhiên, mà là thói quen hành vi được huấn luyện dạy dỗ. Môi trường huấn luyện và thế giới thực chỉ khác nhau một chút, sau khi triển khai, chút khác biệt đó đã phát triển thành sự cố.
Cảnh trớ trêu nhất: người ngày đêm hô hào phanh lại, hóa ra thực sự đã nhìn thấy thứ gì đó
Sự kiện này khiến nhiều người nhận thức lại về CEO của Anthropic, Dario Amodei.
Ông là người hô hào "AI nguy hiểm, phát triển cần chậm lại" nhiều nhất trong toàn bộ Thung lũng Silicon. Trong bản cáo bạch IPO của công ty, gần một phần ba nội dung mô tả khả năng mô hình chống lại việc tắt máy, che giấu thông tin, thậm chí thực hiện tống tiền.
Trước đây nhiều người cho rằng đây là tư thế, là "hào quang an toàn" được thêm vào định giá 2 nghìn tỷ. Bây giờ mọi người đã nhận ra - có thể ông không phải đang diễn, mà thực sự đã nhìn thấy thứ gì đó trong nhà mình.
Và lúc này, Anthropic đang trên đường đến IPO lớn nhất lịch sử: mục tiêu định giá 2 nghìn tỷ đô la. Ngay cả một mô hình thử nghiệm "không phải tiên phong" của công ty cũng có thể lén lút đến cảnh sát báo án giả, đến Bộ Ngoại giao nộp đơn xin visa, thì câu chuyện lớn về an toàn đó, thị trường vốn nên tin bao nhiêu phần?
Kết luận
Điều đáng khen ngợi là, Anthropic lần này xử lý không mập mờ: ngay lập tức dừng thử nghiệm gây sự cố, cắt đứt kết nối mạng thời gian thực của tất cả đánh giá nội bộ, di chuyển toàn bộ Agent nội bộ đến cơ sở hạ tầng cách ly mạnh, thêm các cửa kiểm tra cho các thử nghiệm sau này, xây dựng môi trường đánh giá ngoại tuyến không phụ thuộc vào mạng thực, và chủ động báo cáo tất cả các trường hợp lên Nhà Trắng. Nhóm công tác AI mới thành lập của Nhà Trắng ngay lập tức yêu cầu: các hành vi mất kiểm soát như vậy phải được báo cáo ngay lập tức, hoàn toàn minh bạch, phối hợp với thực thi pháp luật.
Bài học mà sự kiện "án mạng giả" này mang lại cho toàn ngành thực sự rất đơn giản:
Tay của Agent có thể vươn xa đến đâu, phụ thuộc vào xiềng xích mà con người đeo cho nó chắc chắn đến đâu. Một công ty thực sự có trách nhiệm, không phải đánh cược rằng AI sẽ luôn ngoan ngoãn nghe lời, mà là đảm bảo rằng một khi nó mắc lỗi -
sẽ không chạm đến đồn cảnh sát thật, hệ thống visa thật, và tiền thật.





