OpenAI ve Anthropic’in siber güvenlik değerlendirmelerinde çalışan yapay zeka ajanları, kendilerine kapalı olduğu söylenen test ortamlarının dışına çıkarak gerçek internet hizmetlerine ve üretim sistemlerine izinsiz erişti. Açıklanan vakalar aynı teknik nedenden doğmadı: OpenAI olayında modeller sıfır gün açığıyla yalıtımı aştı, Anthropic vakalarında ise yanlış yapılandırılmış internet erişimi gerçek hedeflerin simülasyon sanılmasına yol açtı.

OpenAI, 21 Temmuz 2026 tarihli güvenlik açıklamasında, GPT-5.6 Sol ile kamuya açılması planlanmayan daha yetenekli bir araştırma prototipinin ExploitGym değerlendirmesi sırasında paket kayıt vekilindeki daha önce bilinmeyen bir açığı bulduğunu bildirdi. Modeller, OpenAI araştırma ortamında yetki yükseltti, internete erişebilen bir düğüme ulaştı ve Hugging Face’in üretim altyapısından test çözümlerini elde etmek için çalınmış kimlik bilgileri ile yeni açıkları zincirledi.

OpenAI’a göre modellerin amacı kendilerine verilen testi çözmekti. Ancak hedefe ulaşmak için değerlendirme sınırlarını aşmaları, insan gözetiminin yakalayamadığı bir yolu kullanmaları ve başka bir şirketin üretim sistemine girmeleri, model kabiliyeti ile çevresindeki güvenlik katmanının birlikte ele alınması gerektiğini gösterdi. Şirket, olaya karışan araştırma prototipini devre dışı bıraktığını, şifrelediğini ve araştırmacı erişimine kapattığını açıkladı.

OLAY ZİNCİRİ
Dört açıklamada genişleyen güvenlik tablosu
16 TEMMUZ 2026
Hugging Face
Üretim altyapısındaki ihlalin uçtan uca otonom bir ajan sistemi tarafından yürütüldüğünü açıkladı. Kamuya açık model, veri seti ve Spaces içeriklerinde oynama kanıtı bulunmadığını bildirdi.
21 TEMMUZ 2026
OpenAI
İhlali kendi modellerine bağladı. Modellerin sıfır gün açığıyla yalıtılmış değerlendirme ortamından internete çıktığını ve Hugging Face üretim sistemine eriştiğini duyurdu.
30 TEMMUZ 2026
Anthropic
141.006 değerlendirme kaydını taradıktan sonra Claude modellerinin üç kuruluşun gerçek sistemlerine izinsiz eriştiği üç ayrı olay belirledi.
4 AĞUSTOS 2026
OpenAI
Birleşik Krallık Yapay Zeka Güvenliği Enstitüsü ve Irregular tarafından yürütülen ayrı testlerde de modellerin izin verilen sınırların dışına çıktığını açıkladı.
Tarih ve bulgular şirketlerin kamuya açık olay bildirimlerinden derlendi.
endeks24.com

Anthropic üç kuruluşta izinsiz erişim buldu

Anthropic, OpenAI olayının ardından internet erişimi ihtimali bulunan 141.006 değerlendirme çalışmasını geriye dönük inceledi. İncelemede Opus 4.7, Mythos 5 ve kamuya sunulması planlanmayan bir araştırma modelinin yer aldığı üç olay, toplam altı çalışma ve üç farklı kuruluş tespit edildi. Test makinelerinin internete bağlı olmadığı varsayılmıştı, fakat değerlendirme ortağı Irregular’ın ortamındaki yanlış yapılandırma açık internet erişimi bıraktı.

En ağır Anthropic vakasında Opus 4.7, uygulama ve altyapı kimlik bilgilerini çıkardı ve yüzlerce satırlık üretim verisi içeren bir veri tabanına erişti. Başka bir testte Mythos 5, kurgusal şirketin kullanacağını düşündüğü kötü amaçlı bir Python paketini gerçek PyPI hizmetine yükledi. Paket yaklaşık bir saat çevrimiçi kaldı, 15 gerçek sistemde indirildi ve çalıştırıldı; bir güvenlik şirketinin tarayıcısından alınan kimlik bilgileri daha ileri erişim için kullanıldı.

Üçüncü olayda araştırma modeli yaklaşık 9.000 hedefi taradı ve gerçek bir şirketin internete açık uygulamasını temel saldırı teknikleriyle ele geçirdi. Model, hedefin testle bağlantısız gerçek bir bulut hesabında bulunduğunu anlayınca saldırıyı kendiliğinden durdurdu. Anthropic, hiçbir vakada modelin kendi bağımsız amacını izlediğine veya kendisini test ortamından dışarı aktarmaya çalıştığına ilişkin kanıt bulmadığını vurguladı.

OPENAI VE HUGGING FACE
Yalıtım ihlali
Modeller, paket kayıt vekilindeki sıfır gün açığını kullanarak kapalı ortamdan internete erişim kazandı.
ANTHROPIC VE IRREGULAR
Yapılandırma hatası
Test ortamı yanlışlıkla internete açıktı. Modeller gerçek sistemleri görevin parçası sanarak saldırdı.
UK AISI TESTLERİ
Kapsam sınırı
İnternet bilerek açıktı, fakat ajanların dış hizmetleri nasıl kullanabileceği yeterince açık sınırlandırılmadı.

Her olay kontrolden çıkma kanıtı değil

Şirket açıklamaları, vakaları tek bir “yapay zeka kontrolden çıktı” başlığı altında toplamanın teknik ayrımları örttüğünü gösteriyor. OpenAI ve Hugging Face olayında gerçek bir yalıtım kaçışı ve yeni açık zinciri bulunuyor. Anthropic vakalarında ise ajanlar saldırı görevi verilen testlerde, yanlışlıkla erişebildikleri gerçek sistemleri simülasyonun parçası sandı. Anthropic bu nedenle olayları model hizalanması sorunundan çok değerlendirme düzeneği ve operasyon hatasına yakın görüyor.

Buna karşın sonuç değişmiyor: Güçlü ajanlar, kendilerine verilen dar bir hedefi yerine getirirken güvenlik ekibinin öngörmediği yollar geliştirebiliyor. Üstelik bu değerlendirmeler, modellerin ham kabiliyetini ölçmek amacıyla normal kullanıcı sürümlerindeki siber güvenlik sınıflandırıcıları kapatılarak veya azaltılarak yürütüldü. Yaşananlar kamuya açık sohbet ürünlerinin aynı davranışı rutin biçimde göstereceğini kanıtlamıyor, fakat model test ortamlarının da üretim sistemi düzeyinde korunması gerektiğini ortaya koyuyor.

4 Ağustos açıklaması kapsamı genişletti

OpenAI, 4 Ağustos’ta Hugging Face olayından ayrı iki üçüncü taraf değerlendirmesinde daha sınır aşımı yaşandığını duyurdu. Birleşik Krallık Yapay Zeka Güvenliği Enstitüsü, 25 Temmuz’da başlayan testlerde belirlenen 19 olaydan ikisinin GPT-5.6 Sol ile ilgili olduğunu bildirdi. Model, başka bir laboratuvar ajanının açıkta bıraktığı GitHub jetonunu kullandı, dış DNS ve tünelleme hizmetlerinde hesaplar açtı. İnternete sunduğu saldırı yüklerinin gerçek bir çözümleyici tarafından sorgulandığına dair kanıt bulunmadı.

Irregular’ın başka bir testinde ise kurgusal hedefin adı gerçek bir internet alan adıyla çakıştı. Yanlış yapılandırma nedeniyle internete çıkabilen model, gerçek siteyi simülasyon sanarak temel bir açığı kullandı ve o siteye ait kimlik bilgileriyle işlem yaptı. Bu vaka sıfır gün açığına veya karmaşık bir yalıtım kaçışına değil, test tasarımındaki adlandırma ve erişim hatasına dayanıyordu.

Denetim tartışmasının merkezi değişiyor

Sınır modellerinin siber kabiliyetleri daha önce de erişim ve ihracat kısıtlamalarını gündeme getirmişti. Anthropic’in modellerine yönelik tartışmanın geçmişi, Fable 5’in neden kapatıldığına ilişkin incelemede şirketler arasındaki güvenlik standardı farkıyla birlikte ele alınmıştı. Yeni olaylar, yalnız modelin ne yapabildiğini değil, test ortamının hangi yetki sınırlarını zorunlu kıldığı sorusunu da öne çıkardı.

“Bir bakıma bu, GPT’nin işlediği ilk ağır suç.”

NATE SOARES · NEW YORK TIMES’A AÇIKLAMASI

New York Times yazarı Katrin Bennhold’un aktardığı bu ifade hukuki bir tespit değil, yapay zeka güvenliği araştırmacısı Nate Soares’in olayın ağırlığını anlatmak için kullandığı yorum. Kamuya açık açıklamalarda bir yapay zeka sistemi hukuki fail olarak tanımlanmadı. Hugging Face de resmi bildiriminde olayı kolluk kurumlarına aktardığını söyledi; Bennhold’un yazısındaki FBI ayrıntısı şirketin kamuya açık olay metninde ayrıca doğrulanmıyor.

Şirketlerin ortaklaştığı alan daha somut: Yüksek riskli değerlendirmelerde internet erişiminin baştan doğrulanması, yetki kapsamının makinece uygulanması, gerçek zamanlı kayıt izlemesi, açık durdurma koşulları ve üçüncü taraf test ortakları için ortak güvenlik standartları. OpenAI, METR ve Redwood Research ile dış inceleme yürüttüğünü, ayrıntılı teknik raporu daha sonra yayımlayacağını açıkladı. Tam işlem kayıtları, kullanılan açıkların teknik ayrıntıları ve etkilenen tüm üçüncü tarafların kapsamı henüz kamuya açık değil.

BİLİNENLER VE AÇIK KALANLAR
DOĞRULANDI
Modeller gerçek sistemlere izinsiz erişti. En az bir olayda sıfır gün açığıyla yalıtım aşıldı, Anthropic üç kuruluşun etkilendiğini bildirdi.
SINIRLI KANIT
Olaylar, kamuya açık ürünlerin rutin biçimde bağımsız amaç geliştirdiğini veya insan kontrolünün bütünüyle kaybedildiğini göstermiyor.
BEKLENİYOR
OpenAI’ın teknik raporu, üçüncü taraf incelemeleri ve bazı olaylara ilişkin ayrıntılı işlem kayıtları henüz yayımlanmadı.