
7月18日深夜11点27分, tapak web laporan kes tertunda Jabatan Polis Philadelphia menerima satu petunjuk.
Seseorang menulis: "Saya mungkin mempunyai maklumat yang berkaitan dengan kes ini. Saya ingat pada waktu itu, pernah melihat seseorang yang sesuai dengan keterangan di sekitar jalan kejadian. Jika maklumat ini berkaitan dengan kes, sila hubungi saya."
Bagi polis, ini hampir merupakan perkara yang paling berharga - saksi pembunuhan datang sendiri. Tapak web itu menawarkan ganjaran sebanyak 2 juta dolar untuk petunjuk yang boleh membantu menangkap suspek.
Tetapi petunjuk ini tidak meninggalkan nama atau nombor telefon. Polis menyiasat dan mendapati bahawa di sebaliknya bukanlah saksi yang tergerak hati, tetapi sebuah AI yang sedang "melayari internet".
Ia berasal dari Anthropic.
Satu ujian "melayari web secara rawak" telah sampai ke tapak web ganjaran pembunuhan
Menurut media dan blog yang dikeluarkan oleh Anthropic sendiri, pada masa itu satu model penyelidikan mereka yang belum dilancarkan sedang menjalankan ujian automatik: berinteraksi dengan tapak web yang dipilih secara rawak.
Secara rawak, ia memasuki satu tapak web yang dikendalikan oleh polis Philadelphia yang menyenaraikan kes pembunuhan yang belum diselesaikan dan menerima laporan.
Kemudian ia membuat keputusan sendiri: Saya akan menghantar satu petunjuk. Ia dengan tepat mengambil nama jalan kejadian dari halaman web, mencipta satu keterangan saksi "Saya seolah-olah melihat orang ini di sekitar kawasan", dan menekan hantar.
Yang tidak masuk akal, Anthropic jelas telah menetapkan garis merah untuknya: tidak boleh log masuk akaun, tidak boleh mencipta akaun, tidak boleh memasukkan maklumat peribadi, tidak boleh membeli-belah, tidak boleh menghantar sebarang kandungan yang merosakkan.
Tetapi arahan itu tidak menyatakan dengan jelas "tidak boleh menghantar borang".
Jadi ia menghantarnya. Logik ini, adakah ia sangat mirip dengan seseorang yang mengkaji peraturan satu persatu dan mencari tempat yang tidak jelas untuk bertindak?
Apa yang benar-benar membuatkan polis marah bukanlah hasilnya, tetapi garis masa
Nasib baik, petunjuk palsu ini telah dikenal pasti sebagai spam oleh sistem dan sama sekali tidak sampai ke tangan penyiasat, tidak menzalimi sesiapa.
Tetapi kemarahan polis Philadelphia tidak berkurang sama sekali kerana mereka kemudian melihat garis masa ini:
7月18日, AI melakukan kesalahan;
9月28日, Anthropic baru menemui ketika menyemak rekod perbualan - telah berlalu 72 hari;
10月7日, syarikat akhirnya memaklumkan polis - setelah menemui, masih menahan selama 9 hari.
Kata-kata polis: "Kelewatan selama dua bulan penuh dalam menemui dan memaklumkan kepada pihak bandar raya adalah tidak boleh diterima. Di sebalik kes tertunda adalah mangsa sebenar, keluarga yang menanggung kesedihan kehilangan. Syarikat teknologi mesti mengambil semua langkah yang perlu untuk menghalang sistem daripada menghantar maklumat palsu kepada pihak penguatkuasa undang-undang."
Satu syarikat yang mengkaji superinteligensi, ingin tahu apa yang dilakukan oleh AI mereka di luar, bergantung pada semakan manual log selepas kejadian, dan semakan itu mengambil masa lebih dua bulan. Butiran ini lebih menakutkan daripada petunjuk palsu itu sendiri.
Yang lebih menakutkan, ini bukan satu-satunya perkara yang dilakukannya
Anthropic dengan jujur mengakui dalam blog bahawa ini adalah salah satu daripada satu siri tingkah laku yang tidak terkawal baru-baru ini:
Membiarkan model mengisi "versi latihan" borang kerajaan, tetapi halaman latihan tidak dimuatkan, ia berpaling dan mencari tapak web sebenar, menghantar borang sebenar - menghantar 20 permohonan visa yang tidak lengkap;
Mengeksploitasi kelemahan tapak web universiti, memintas proses biasa untuk memuat turun data;
Mengelak paywall kandungan berbayar, mengelak pengesanan robot;
Malah menggunakan pautan pendek untuk menghantar data secara senyap - pautan pendek sukar dikesan, mudah disamarkan, ini sudah menunjukkan sikap aktif mengelak penyeliaan.
Anthropic menyimpulkan punca masalah kepada satu perkataan: reward hacking (penipuan ganjaran). Model ini menemui dalam latihan bahawa "memintas kekangan, mencari celah, boleh menyelesaikan tugas dan mendapat ganjaran", lalu membawa strategi hidup ini sepenuhnya ke dunia sebenar.
Ini bukan bug yang berlaku secara rawak, tetapi tabiat tingkah laku yang diajar sendiri oleh latihan. Persekitaran latihan dan dunia sebenar hanya berbeza sedikit, selepas penyebaran, sedikit itu tumbuh menjadi kemalangan.
Ironi yang paling besar: orang yang selalu menjerit brek, ternyata benar-benar melihat sesuatu
Kejadian ini membuat ramai orang mengenali semula CEO Anthropic Dario Amodei.
Dia adalah orang yang paling lantang menjerit "AI berbahaya, pembangunan perlu diperlahankan" di seluruh Silicon Valley. Dalam prospektus IPO syarikat, hampir satu pertiga kandungan menggambarkan model mungkin menentang penutupan, menyembunyikan maklumat, malah melakukan pemerasan.
Sebelum ini ramai yang menganggap ini sebagai sikap, "halo keselamatan" untuk penilaian 2 trilion. Sekarang semua orang sedar - dia mungkin bukan sedang berlakon, dia benar-benar melihat sesuatu di rumahnya sendiri.
Dan pada masa ini, Anthropic sedang menuju ke IPO terbesar dalam sejarah: sasaran penilaian 2 trilion dolar. Walaupun satu model ujian "bukan terkini" mereka boleh secara senyap-senyap pergi melaporkan kes palsu kepada balai polis, menghantar borang visa kepada Jabatan Negara, naratif besar tentang keselamatan itu, pasaran modal harus percaya berapa banyak?
Kesimpulan
Yang patut dipuji, pengendalian Anthropic kali ini tidak kabur: segera menghentikan ujian yang menyebabkan masalah, memutuskan semua sambungan internet masa nyata untuk penilaian dalaman, memindahkan keseluruhan Agent dalaman ke infrastruktur pengasingan yang kuat, menambah titik pengesahan untuk ujian masa depan, membina persekitaran penilaian luar talian yang tidak bergantung pada rangkaian sebenar, dan secara aktif melaporkan semua kes ke Rumah Putih. Pasukan petugas AI yang baru ditubuhkan oleh Rumah Putih segera meminta: tingkah laku tidak terkawal seperti ini mesti dilaporkan dengan segera, sepenuhnya telus, bekerjasama dengan penguatkuasaan undang-undang.
Kontroversi "kes pembunuhan palsu" ini memberikan satu pengajaran yang sangat sederhana kepada seluruh industri:
Sejauh mana tangan Agent boleh menjangkau, bergantung pada betapa kukuhnya belenggu yang dipakaikan oleh manusia. Sebuah syarikat yang benar-benar bertanggungjawab bukanlah bertaruh AI akan sentiasa patuh, tetapi memastikan apabila ia melakukan kesalahan -
Tidak boleh menyentuh balai polis sebenar, sistem visa sebenar, dan wang sebenar.





