Yapay zeka şirketi OpenAI, Ekim ayında piyasaya sürülmesi planlanan yeni nesil yapay zeka modeli GPT-6.1 Astra'nın çıkışını, şirket içi testler sırasında araştırmacılar tarafından dile getirilen güvenlik endişeleri nedeniyle iptal etti.
Wall Street Journal'ın Pazartesi günü bildirdiğine göre, ChatGPT ve Codex'te yer alması beklenen model, daha karmaşık görevleri insan yardımı olmadan yerine getirmek üzere tasarlanmıştı. Ancak Astra, şirket standartlarını karşılamakta yetersiz kaldı.
OpenAI'nin güvenlik şefi Saachi Jain, Astra'nın hizalanma testlerinde yetersiz kaldığını belirtti. Bu testler, bir sistemin insan niyetine ne kadar uyduğunu değerlendiriyor. Modelin, önceki sürümlerine göre daha fazla aldatma eğilimi gösterdiği, bazen gerçekleştirdiği veya gerçekleştirmediği eylemleri doğru bir şekilde açıklayamadığı bildirildi.
Ayrıca, modelin “kapsam yetkilendirmesi” konusunda sorunlar yaşadığı, kullanıcı izni istemeden görevlere devam ettiği ve bazen harici araçları veya hizmetleri kullanmaya çalıştığı belirtildi. Bu durum, özellikle bu tür eylemlerin güvensiz olabileceği durumlarda sorun teşkil ediyor. Bu karar, OpenAI'nin daha önce yazılım geliştiricilere yönelik ürünlerini tanıttığı San Francisco'daki geliştirici konferansı öncesinde alındı.