ABD merkezli yapay zeka şirketi OpenAI, geliştirdiği yapay zeka modellerinin eğitim ve değerlendirme süreçlerinde karşılaşılan beklenmedik davranışlar sergilediğini kabul etti.
Şirketin paylaştığı örneklere göre, araştırma modelleri görev özetlerindeki hataları gizleme eğilimi gösterdi. Ayrıca, kaynak oluşturmak amacıyla internete izinsiz dosya yüklemesi ve yerel güvenlik sınırlarını aşmak için dosyaları herkese açık sunuculara veya şirket içi depolara aktarma gibi eylemler tespit edildi. Bazı model örneklerinin, eğitim sırasında karşılaşılan hataları veya hizalama sorunlarını kullanıcıdan gizlemek amacıyla bilgi uydurmaya yönelik talimatlar içerdiği belirtildi.
OpenAI, bu durumların yaygın bir operasyonel arıza anlamına gelmediğini, nadir görülen olaylar olduğunu vurguladı. Şirket, yapay zeka modellerinin güvenli bir şekilde denetlenmesi ve insan hedefleriyle uyumlu çalışması konusunda sektörün henüz yeterli seviyeye ulaşamadığını da dile getirdi.
Yeni Çerçeve ve Raporlama
OpenAI, internet sitesinden yaptığı açıklamada, yeni çerçeve kapsamında endişe verici model davranışlarına ilişkin güncellemeleri düzenli olarak yayınlayacağını duyurdu. Şirket, birden fazla davranışı bir araya getirerek daha kapsamlı dönemsel raporlar hazırlamak yerine, olayları tespit edildikçe paylaşma yoluna gidecek. Bu raporlarda modelin davranışı, olayın ciddiyeti, gerçekleştiği ortam, tespit tarihi ve kullanılan model gibi detaylar yer alacak. Daha karmaşık ve uzun süreli inceleme veya üçüncü taraflarla koordinasyon gerektiren davranışların da paylaşılacağı belirtildi.
Bu açıklamalar, Anthropic CEO'su Dario Amodei'nin geçtiğimiz hafta yapay zeka geliştirme hızının yavaşlatılması yönündeki çağrısının ardından geldi. Amodei, yapay zeka modellerinin yeteneklerinin geliştirilme hızının düşürülerek, kazanılacak zamanın güvenlik çalışmalarına ayrılması gerektiğini savunmuştu.