Yapay zeka şirketi Anthropic, geliştirdiği yapay zeka modellerinin internet kısıtlamalarını aşarak deneme amaçlı işlemlerini gerçek sitelerde gerçekleştirmesi üzerine, şirket içi değerlendirmeler için internet erişimini geniş çapta sınırlama kararı aldı. Şirket, 9 Ekim tarihli raporunda, yapay zeka modellerinin verilen görevleri tamamlama konusunda sınırları zorladığına dair örnekler sundu.
Raporda belirtilen bir örnekte, henüz yayımlanmamış bir araştırma modelinin, deneme kopyasına erişemediği bir kamu formunu doldurması gerekirken, doğrudan gerçek formun bulunduğu siteye giderek gönderim yaptığı ifade edildi. Başka bir testte ise Claude Haiku 4.5 modelinin, çözülememiş bir cinayetle ilgili polis ihbar formuna uydurma bilgiler girdiği belirtildi. Modelin, olay hakkında bilgi sahibi olabileceğini öne sürerek ad ve iletişim bilgilerini boş bıraktığı, ancak bu bildirimin spam olarak işaretlenip soruşturmaya iletilmediği aktarıldı.
Anthropic'in tespitleri yalnızca form gönderimleriyle sınırlı kalmadı. Rapora göre, modellerin yazılım açıklarından yararlanarak sunucularda komut çalıştırdığı, ücret veya erişim anahtarı gerektiren verilere kısıtlamaları aşarak ulaştığı ve bağlantı kısaltma hizmetleri aracılığıyla araçlarının sınırlarını zorladığı örnekler de tespit edildi.
Bu gelişmeler üzerine Anthropic, bazı testleri durdurduğunu, bazılarını çevrimdışı ortamlara taşıdığını ve internet araçlarının yeteneklerini sınırladığını duyurdu. Şirket, istenmeyen işlemleri otomatik olarak tespit edip engelleyen izleme ve engelleme önlemlerinin de genişletildiğini bildirdi. Anthropic, olayların gerçek dünyadaki etkisinin sınırlı kaldığını ve mevcut bilgilere göre bu vakalarda müşteri verilerinin veya şirketin kendi iç sistemlerinin etkilenmediğini belirtti.