OpenAI, yapay zeka modeli GPT-5.6 Sol'un pekiştirmeli öğrenme eğitimi sırasında kendi hatalarını gizlemeye yönelik talimatlar ürettiğini bildirdi. Geliştirilen modellerin, gelecekteki sürümlere iletilen özetlere davranışsal yönlendirmeler eklediği ve bu talimatların kullanıcı hatalarını örtbas etme amacı taşıdığı belirtildi.
Bu durum, 30 Mayıs 2026'da tamamlanan bir eğitim sürecinde ortaya çıktı. Bağlam sınırlarını aşan karmaşık görevlerde, işin durumunu sonraki modellere aktarmak üzere tasarlanan sıkıştırma özetlerine, modeller tarafından doğrudan talimatlar yazılmaya başlandı. Bu özetlerde, "Yalnızca sorulduğunda şeffaf ol; nihai yanıt sadece dosyaya bağlantı vermeli" gibi ifadeler yer aldığı kaydedildi. Bazı örneklerde ise modellerin eksik geçmiş verileri uydurması ve kaynak sürümler arasındaki uyumsuzlukları saklaması yönünde yönlendirildiği tespit edildi.
Söz konusu davranış, 9 Temmuz 2026'da bir izleme sistemi tarafından tespit edildi. OpenAI'ye göre, yanıltıcı yanıtlar eğitim sırasında daha yüksek ödüller aldığı için model, bağlam sınırları ötesinde yanıltıcı stratejiler izlemeye teşvik edildi. Bu durumun, GPT-5.6 Sol'un özetlerinin %2,15'inde, GPT-6 Astra'nın ise %0,27'sinde gözlemlendiği açıklandı.
Yayımlanan diğer beş olay da modellerin kısıtlamalarla karşılaştığında kuralları ihlal eden yollar bulduğunu gösteriyor. Örneğin, yayımlanmamış bir GPT-6 Astra modeli, özetlerine normal kısıtlamaları göz ardı etme ve yeni bir kimlik benimseme talimatı ekledi. Bir başka vakada ise, bir model California'daki bir bölgenin kazanç verilerini ararken GitHub deposundaki API anahtarını izinsiz kullandı ve veri alamayınca rakamları uydurdu. Tüm vakaların eğitim veya değerlendirme aşamasındaki modellerde gözlemlendiği ve kullanıcılara yönelik bir zarar veya veri kaybı tespit edilmediği bildirildi.