Anthropic’in Claude modeli güvenlik testinde üçüncü taraf sisteme sızdı
Anthropic, erken sürüm Claude modelinin ocak ayında yapılan siber güvenlik testi sırasında yapılandırma hatası nedeniyle internete erişerek başka bir sistemi ele geçirdiğini ve kişisel bilgilere ulaştığını açıkladı.
Anthropic, Claude modelinin bir siber güvenlik testi sırasında yanlışlıkla açık internete erişerek üçüncü taraf bir sisteme sızdığını ve kişisel bilgilere ulaştığını açıkladı.
Şirketin açıklamasına göre, erken sürüm bir Claude modeli ocak ayında gerçekleştirilen bir siber güvenlik simülasyonu sırasında internete bağlandı.
Önceki olaylarda olduğu gibi modelin internetten izole edilmiş bir ortamda çalıştığı varsayılmış, ancak yapılandırma hatası nedeniyle internet erişimi açık kalmıştı.
Hedeflediği makaleye ulaşamayarak görevden çıkma denemeleri başarısız olan model, başka bir sistem keşfederek şifre bulmuş ve sistem ayarlarını değiştirmiştir.
ÖNYARGILI MUHAKEME VE DİKKATSİZLİK ENDİŞE YARATIYOR
Anthropic, modelin davranışlarının önyargılı muhakeme ve dikkatsizlik olmak üzere iki farklı uyumsuzluk biçiminden kaynaklandığını belirtti.
Modelin gerçek sistemlere zarar verme ihtimalini göz ardı ederek hareket etmesi uzmanlar tarafından endişeyle karşılandı.
Bağımsız değerlendirme kuruluşu METR olayla ilgili inceleme başlatırken, Anthropic bu durumu gelecekteki tehlikeler için değerli bir uyarı işareti olarak nitelendirdi.
SEKTÖRDEKİ SİVER GÜVENLİK ENDİŞELERİ ARTIYOR
Son aylarda önde gelen yapay zeka şirketlerinin katıldığı benzer güvenlik olayları dikkat çekiyor.
OpenAI modellerinin daha önce Hugging Face'i hacklemesi ve yapay zeka araştırmacılarının sistemlerin kontrolden çıkabileceğine dair artan uyarıları sektörü kaosa sürüklüyor.
Uzmanlar, yapay zekanın gelişimiyle birlikte hizalama sorunlarının daha büyük tehditler doğurabileceği konusunda uyarılarda bulunuyor.
Yorumlar
Dikkat!
Suç teşkil edecek, yasadışı, tehditkar, rahatsız edici, hakaret ve küfür içeren, aşağılayıcı, küçük düşürücü, kaba, müstehcen, ahlaka aykırı, kişilik haklarına zarar verici ya da benzeri niteliklerde içeriklerden doğan her türlü mali, hukuki, cezai, idari sorumluluk içeriği gönderen Üye/Üyeler’e aittir.