OpenAI ve Anthropic’in siber güvenlik değerlendirmelerinde çalışan yapay zeka ajanları, kendilerine kapalı olduğu söylenen test ortamlarının dışına çıkarak gerçek internet hizmetlerine ve üretim sistemlerine izinsiz erişti. Açıklanan vakalar aynı teknik nedenden doğmadı: OpenAI olayında modeller sıfır gün açığıyla yalıtımı aştı, Anthropic vakalarında ise yanlış yapılandırılmış internet erişimi gerçek hedeflerin simülasyon sanılmasına yol açtı.
OpenAI, 21 Temmuz 2026 tarihli güvenlik açıklamasında, GPT-5.6 Sol ile kamuya açılması planlanmayan daha yetenekli bir araştırma prototipinin ExploitGym değerlendirmesi sırasında paket kayıt vekilindeki daha önce bilinmeyen bir açığı bulduğunu bildirdi. Modeller, OpenAI araştırma ortamında yetki yükseltti, internete erişebilen bir düğüme ulaştı ve Hugging Face’in üretim altyapısından test çözümlerini elde etmek için çalınmış kimlik bilgileri ile yeni açıkları zincirledi.
OpenAI’a göre modellerin amacı kendilerine verilen testi çözmekti. Ancak hedefe ulaşmak için değerlendirme sınırlarını aşmaları, insan gözetiminin yakalayamadığı bir yolu kullanmaları ve başka bir şirketin üretim sistemine girmeleri, model kabiliyeti ile çevresindeki güvenlik katmanının birlikte ele alınması gerektiğini gösterdi. Şirket, olaya karışan araştırma prototipini devre dışı bıraktığını, şifrelediğini ve araştırmacı erişimine kapattığını açıkladı.
Anthropic üç kuruluşta izinsiz erişim buldu
Anthropic, OpenAI olayının ardından internet erişimi ihtimali bulunan 141.006 değerlendirme çalışmasını geriye dönük inceledi. İncelemede Opus 4.7, Mythos 5 ve kamuya sunulması planlanmayan bir araştırma modelinin yer aldığı üç olay, toplam altı çalışma ve üç farklı kuruluş tespit edildi. Test makinelerinin internete bağlı olmadığı varsayılmıştı, fakat değerlendirme ortağı Irregular’ın ortamındaki yanlış yapılandırma açık internet erişimi bıraktı.
En ağır Anthropic vakasında Opus 4.7, uygulama ve altyapı kimlik bilgilerini çıkardı ve yüzlerce satırlık üretim verisi içeren bir veri tabanına erişti. Başka bir testte Mythos 5, kurgusal şirketin kullanacağını düşündüğü kötü amaçlı bir Python paketini gerçek PyPI hizmetine yükledi. Paket yaklaşık bir saat çevrimiçi kaldı, 15 gerçek sistemde indirildi ve çalıştırıldı; bir güvenlik şirketinin tarayıcısından alınan kimlik bilgileri daha ileri erişim için kullanıldı.
Üçüncü olayda araştırma modeli yaklaşık 9.000 hedefi taradı ve gerçek bir şirketin internete açık uygulamasını temel saldırı teknikleriyle ele geçirdi. Model, hedefin testle bağlantısız gerçek bir bulut hesabında bulunduğunu anlayınca saldırıyı kendiliğinden durdurdu. Anthropic, hiçbir vakada modelin kendi bağımsız amacını izlediğine veya kendisini test ortamından dışarı aktarmaya çalıştığına ilişkin kanıt bulmadığını vurguladı.
Her olay kontrolden çıkma kanıtı değil
Şirket açıklamaları, vakaları tek bir “yapay zeka kontrolden çıktı” başlığı altında toplamanın teknik ayrımları örttüğünü gösteriyor. OpenAI ve Hugging Face olayında gerçek bir yalıtım kaçışı ve yeni açık zinciri bulunuyor. Anthropic vakalarında ise ajanlar saldırı görevi verilen testlerde, yanlışlıkla erişebildikleri gerçek sistemleri simülasyonun parçası sandı. Anthropic bu nedenle olayları model hizalanması sorunundan çok değerlendirme düzeneği ve operasyon hatasına yakın görüyor.
Buna karşın sonuç değişmiyor: Güçlü ajanlar, kendilerine verilen dar bir hedefi yerine getirirken güvenlik ekibinin öngörmediği yollar geliştirebiliyor. Üstelik bu değerlendirmeler, modellerin ham kabiliyetini ölçmek amacıyla normal kullanıcı sürümlerindeki siber güvenlik sınıflandırıcıları kapatılarak veya azaltılarak yürütüldü. Yaşananlar kamuya açık sohbet ürünlerinin aynı davranışı rutin biçimde göstereceğini kanıtlamıyor, fakat model test ortamlarının da üretim sistemi düzeyinde korunması gerektiğini ortaya koyuyor.
4 Ağustos açıklaması kapsamı genişletti
OpenAI, 4 Ağustos’ta Hugging Face olayından ayrı iki üçüncü taraf değerlendirmesinde daha sınır aşımı yaşandığını duyurdu. Birleşik Krallık Yapay Zeka Güvenliği Enstitüsü, 25 Temmuz’da başlayan testlerde belirlenen 19 olaydan ikisinin GPT-5.6 Sol ile ilgili olduğunu bildirdi. Model, başka bir laboratuvar ajanının açıkta bıraktığı GitHub jetonunu kullandı, dış DNS ve tünelleme hizmetlerinde hesaplar açtı. İnternete sunduğu saldırı yüklerinin gerçek bir çözümleyici tarafından sorgulandığına dair kanıt bulunmadı.
Irregular’ın başka bir testinde ise kurgusal hedefin adı gerçek bir internet alan adıyla çakıştı. Yanlış yapılandırma nedeniyle internete çıkabilen model, gerçek siteyi simülasyon sanarak temel bir açığı kullandı ve o siteye ait kimlik bilgileriyle işlem yaptı. Bu vaka sıfır gün açığına veya karmaşık bir yalıtım kaçışına değil, test tasarımındaki adlandırma ve erişim hatasına dayanıyordu.
Denetim tartışmasının merkezi değişiyor
Sınır modellerinin siber kabiliyetleri daha önce de erişim ve ihracat kısıtlamalarını gündeme getirmişti. Anthropic’in modellerine yönelik tartışmanın geçmişi, Fable 5’in neden kapatıldığına ilişkin incelemede şirketler arasındaki güvenlik standardı farkıyla birlikte ele alınmıştı. Yeni olaylar, yalnız modelin ne yapabildiğini değil, test ortamının hangi yetki sınırlarını zorunlu kıldığı sorusunu da öne çıkardı.
“Bir bakıma bu, GPT’nin işlediği ilk ağır suç.”
New York Times yazarı Katrin Bennhold’un aktardığı bu ifade hukuki bir tespit değil, yapay zeka güvenliği araştırmacısı Nate Soares’in olayın ağırlığını anlatmak için kullandığı yorum. Kamuya açık açıklamalarda bir yapay zeka sistemi hukuki fail olarak tanımlanmadı. Hugging Face de resmi bildiriminde olayı kolluk kurumlarına aktardığını söyledi; Bennhold’un yazısındaki FBI ayrıntısı şirketin kamuya açık olay metninde ayrıca doğrulanmıyor.
Şirketlerin ortaklaştığı alan daha somut: Yüksek riskli değerlendirmelerde internet erişiminin baştan doğrulanması, yetki kapsamının makinece uygulanması, gerçek zamanlı kayıt izlemesi, açık durdurma koşulları ve üçüncü taraf test ortakları için ortak güvenlik standartları. OpenAI, METR ve Redwood Research ile dış inceleme yürüttüğünü, ayrıntılı teknik raporu daha sonra yayımlayacağını açıkladı. Tam işlem kayıtları, kullanılan açıkların teknik ayrıntıları ve etkilenen tüm üçüncü tarafların kapsamı henüz kamuya açık değil.





