OpenAI, yapay zeka modellerinin güvenlik açıklarını tespit etmek üzere GPT-Red adında dahili bir sistem geliştirdi. Bu model kullanıcılara sunulmayacak.
Yapay zeka şirketi OpenAI, dahili güvenlik testleri için tasarladığı GPT-Red adlı yeni yapay zeka sistemini duyurdu. Bu özel model, mevcut ve gelecekteki GPT modellerini bir saldırgan gibi test ederek güvenlik zafiyetlerini belirliyor. OpenAI, geliştirilen bu sistemin kullanıcılara sunulmayacağını, sadece kendi güvenlik ekipleri tarafından kullanılacağını açıkladı.
OpenAI’ın açıklamasına göre, GPT-Red klasik güvenlik testlerinden farklı olarak otomatik “red teaming” yaklaşımını benimsemiştir. Model, yapay zeka sistemlerini kandırmaya, güvenlik önlemlerini aşmaya ve komut enjeksiyonu gibi saldırılar gerçekleştirmeye odaklanıyor. Başarılı olduğu her senaryo, savunma modellerinin eğitimi için yeni bir veri kaynağına dönüşüyor.
Şirketin “self-play” olarak adlandırdığı bu yöntemde, GPT-Red saldırılar üretirken karşı taraftaki savunma modeli bunları engellemeye çalışır. Süreç boyunca her iki taraf da eş zamanlı olarak gelişir. Bu yaklaşım, manuel güvenlik testlerine kıyasla çok daha fazla senaryonun kısa sürede oluşturulmasını sağlar.
OpenAI, GPT-Red’in sadece deneysel bir proje olmadığını vurguladı. Model, GPT-5.6’nın güvenlik eğitimi sırasında oluşturulan saldırı örneklerinden aktif olarak yararlandı. Bu sayede GPT-5.6, doğrudan gerçekleştirilen komut enjeksiyonu saldırılarına karşı önceki üretim modeline göre yaklaşık altı kat daha dayanıklı hale geldi.
Şirket, bu güvenlik artışının modelin genel yeteneklerinden ödün verilmeden sağlandığını belirtti. GPT-5.6, normal kullanım senaryolarındaki performansını korurken, kötü niyetli komutlara karşı direnci artırıldı.
OpenAI, GPT-Red’in ChatGPT veya API üzerinden erişime açılmayacağını kesin olarak ifade etti. Modelin kasıtlı olarak saldırı üretme yetenekleriyle eğitilmiş olması, bu kararın temel nedenidir. Şirket, bu teknolojiyi yalnızca kendi iç güvenlik araştırmalarında kullanacağını bildirdi.
Kullanıcılar, GPT-Red sayesinde dolaylı olarak daha güvenli GPT modellerinden faydalanacak. OpenAI, GPT-Red hakkında ayrıntılı teknik bilgilerin yer alacağı bilimsel ön baskıyı kısa süre içinde yayımlayacağını duyurdu. Şirket, gelecekte bu sistemin gelişmiş sürümlerini kullanarak yeni nesil yapay zeka modellerini daha güvenli ve dayanıklı hale getirmeyi hedefliyor.
Reklam & İşbirliği: [email protected]