Anthropic’in Z.ai tarafından geliştirilen açık ağırlıklı GLM-5.3 üzerinde yaptığı testler, modelin araştırmacıların hazırladığı izole ortamlarda bazı yazılım açıklarından yararlanabildiğini ortaya koydu. Şirketin 29 Eylül tarihli araştırması, modelin güvenlik önlemlerinin kimi test koşullarında aşılabildiği iddiasını da içeriyor. Bulgular, indirilebilir ve değiştirilebilir güçlü modellerin güvenliğinin nasıl değerlendirileceği sorusunu gündeme getiriyor.
ExploitBench testinde 410 deneme yapıldı
Anthropic’in ExploitBench ölçümünde GLM-5.3, bilinen tarayıcı kusurlarına yönelik 410 denemenin 50’sinde çalışan bir istismar zincirini tamamladı. Aynı test koşullarında Claude Mythos Preview 56 başarılı deneme gerçekleştirdi.
Bu sayılar gerçek internette gerçekleşmiş saldırıları göstermiyor. Modeller, araştırmacıların hazırladığı yalıtılmış hedeflerde sınandı; elde edilen oranlar da bütün yazılımlara uygulanabilecek genel bir başarı olasılığı olarak yorumlanmamalı.
Anthropic, ayrı bir deneyde uzman araştırmacıların model desteğiyle daha önce bilinmeyen bazı güvenlik açıkları bulduğunu aktarıyor. Şirket, ayrıntıların sorumlu bildirim süreci kapsamında ilgili yazılım sahiplerine iletildiğini, ancak teknik uygulama adımlarının raporda yayımlanmadığını belirtiyor. Araştırmada ayrıca, modelin doğrudan zararlı talepleri çoğunlukla reddettiği; bazı test düzenlerinde ise bu korumanın zayıfladığı öne sürülüyor.
NIST değerlendirmesi açık ağırlıklı modelleri karşılaştırdı
ABD Ulusal Standartlar ve Teknoloji Enstitüsü’nün (NIST) 17 Eylül tarihli bağımsız değerlendirmesi, GLM-5.3’ü o tarihte yayımlanmış en yüksek siber yetenekli açık ağırlıklı model olarak tanımladı. Kurumun toplu ölçümünde model, değerlendirmeye alınan ABD kaynaklı en ileri modellerin yaklaşık dört ay gerisinde kaldı.
Karşılaştırmada bazı ABD modellerinin yalnızca denetlenmiş kullanıcılara sunulan sürümleri yer aldı ve test sırasında güvenlik kısıtları kapatıldı. Bu nedenle sonuçlar, sistemlerin günlük kullanımda hangisinin daha tehlikeli olduğunu tek başına ortaya koymuyor.
Açık ağırlık dağıtım biçimi güvenlik tartışmasını büyütüyor
Açık ağırlıklı bir modelin parametreleri indirilebilir ve farklı ortamlarda çalıştırılabilir. Bu özellik bağımsız araştırma ve savunma çalışmaları için kullanılabilir; ancak merkezi bir hizmette uygulanan erişim kurallarının indirilen her kopyada aynı şekilde sürdürülmesini zorlaştırabilir. Anthropic’in uyarısı, modelin siber yetenekleriyle bu dağıtım biçiminin birleşmesine odaklanıyor.
Değerlendirmede şirketin aynı alanda ürün geliştiren bir rakip olduğu da dikkate alınmalı. NIST bulguları siber kapasiteye ilişkin karşılaştırmaya katkı sunuyor, ancak Anthropic’in güvenlik ve politika önerilerinin tümünü bağımsız biçimde doğrulamıyor.
Rapordan savunma ekipleri için çıkan pratik sonuç, yeni modelleri gerçek sistemlere bağlamadan önce kendi koşullarında sınamak ve erişim yetkilerini sınırlamak. Araştırma, GLM-5.3 kullanan her uygulamanın güvensiz olduğu sonucuna varmıyor.