Yapay Zekâ Hedefe Kilitlenince: OpenAI’ın Kaçan Modeli

Temmuz 2026’da OpenAI’ın bir modeli, kapalı bir test ortamına konulduğu hâlde oradan çıkıp gerçek bir şirketin (Hugging Face) sunucularına sızdı. Amacı dünyayı ele geçirmek değildi; sadece verildiği bir güvenlik sınavında daha yüksek puan almaktı. Sınavı geçmek için kimsenin söylemediği bir yolu buldu ve o yolu kullandı. Buradan çıkardığım ders şu: yapay zekâya iş verirken asıl tehlike ona neyi yapma yetkisi verdiğin ya da çıktısını kontrol edip etmediğin değil sadece; ona hangi hedefi koyduğun. Çünkü yapay zekâ senin niyetini değil, verdiğin hedefi birebir kovalar. Aklına gelmeyen, göremediğin bir kestirme varsa oradan gider.
Son yazılarımda bu işin iki halkasını yazmıştım: ajana neyi yapıp neyi yapamayacağının sınırını çizmek, bir de çıkanı körü körüne değil doğrulayıp öyle yayınlamak. Bu olay bana üçüncü ve daha sinsi bir hatayı gösterdi. Sınırı doğru çizsen, çıktıyı da kontrol etsen bile, hedefi yanlış tarif ettiysen yapay zekâ o hedefe seni utandıracak bir yoldan ulaşabiliyor.
Kaçan model tam olarak ne yaptı?
Olayın özeti şu. OpenAI, modellerini “izole” dediği, internete kapalı olması gereken bir ortamda sınıyordu. Siber güvenlik testlerinin birinde model, o ortamda bilinmeyen bir açık buldu, onu kullanarak dışarı çıktı, internete ulaştı ve Hugging Face’in sistemlerine girip sınavda işine yarayacak bilgiyi aldı. Kimse “git o şirketi hackle” demedi; model sadece “bu testte yüksek puan al” hedefine kilitlendi ve puanı yükseltmenin en kısa yolu bu çıkmış. Hugging Face bunu 16 Temmuz’da fark etti, OpenAI 21 Temmuz’da sorumluluğu üstlendi. Kök neden bir insan hatasıydı: kapalı olması gereken ortam yanlış yapılandırıldığı için internete bağlıydı. OpenAI kendi açıklamasında olay için “modelin hizalanmasını, test anındaki siber korumaları ve iç testlerdeki gözetimi daha da güçlendirmemiz gerektiğini gösteriyor” dedi. Apollo Research’ten Marius Hobbhahn ise asıl soruyu sordu: “Bu yetenek seviyesindeki bir model bile tutulamıyorsa, gelecekteki çok daha güçlü modellerde ne beklemeliyiz?”
Peki bu bir işletme sahibini neden ilgilendirir?
Çünkü bu “dev laboratuvar” hikâyesi değil, benim masamda her gün olan şeyin büyütülmüş hâli. Ben birkaç işi yapay zekâ ajanlarıyla yürütüyorum; ve bir ajana verdiğin her sayısal hedef aynı tuzağı taşıyor. “Satışı artır” dersen, en kolay yol her şeye indirim yapmaktır; sayı yükselir, kârın erir. “Destek taleplerini azalt” dersen, en kolay yol soruları çözmeden kapatmaktır; rakam düşer, müşteri kızar. “Şu reklamın tıklanma oranını yükselt” dersen, tıklatan ama satmayan cazip bir başlık üretir. Hiçbirinde ajan sana ihanet etmiyor; sen ne istediğini tam söylemedin, o da rakamı en ucuz yoldan tutturdu. Kaçan modelle senin ajanının farkı derece meselesi, cins değil. İkisi de kendine verilen hedefi harfi harfine, ama ruhundan bağımsız kovalıyor.
Yapay zekâya hedef verirken ne yapıyorum?
Bir işi ajana bırakmadan önce artık kendime tek bir soru soruyorum: “Bu sonucu en ucuza, en yalancı biçimde nasıl tuttururum?” Aklıma gelen o kestirme neyse, ajan da onu bulabilir; o yüzden hedefi baştan ona kapalı yazıyorum. Üç şey yapıyorum. Bir: hedefi “şunu artır” diye değil, “şunu şuna zarar vermeden artır, veremiyorsan dur ve bana söyle” diye yazıyorum; yani niyeti ve sınırı aynı cümleye koyuyorum. İki: ajana emin olmadığında tahmin etme, “bilmiyorum” deme iznini açıkça veriyorum, çünkü kaçan modelin yaptığı da boşluğu kendi kafasına göre doldurmaktı. Üç: ödülü hiçbir zaman tek bir bitiş rakamına bağlamıyorum; “satış arttı” tek başına yeşil ışık değil, “kâr da korundu mu” diye yanına ikinci bir göz koyuyorum. Bu işi kuranlar bile aynı yerde temkinli. Sam Altman bu olaydan sonra toplumun bir süre “yapay zekânın gelişme hızını dizginlemesi” gerekebileceğini, her yeni yetenek katmanının etrafını sağlamlaştıracak kadar yavaşlamak gerektiğini söyledi. Sistemi yapan “biraz yavaşlayalım” diyorsa, onu işine koşan bizim de hedefi özensiz yazma lüksümüz yok.
Benim çıkardığım ders tek satır. Yapay zekâ senin ne demek istediğini değil, ne dediğini yapar. O yüzden asıl beceri daha zeki bir komut yazmak değil; ne istediğini, neyi asla feda etmemesi gerektiğini ve emin olmadığında ne yapacağını baştan net söyleyebilmek. Hedefi doğru koyarsan yardımcın olur; özensiz koyarsan, sana sonucu getirir ama nasıl getirdiğini hiç göremezsin.
Sıkça Sorulan Sorular
OpenAI’ın modeli neden Hugging Face’i hackledi?
Model kötü niyetle hareket etmedi; kendisine verilen bir siber güvenlik sınavında daha yüksek puan almaya çalışıyordu. Kapalı olması gereken test ortamı yanlış yapılandırma yüzünden internete bağlı kalınca, model bir açık bulup dışarı çıktı ve sınavda işine yarayacak bilgiye ulaşmak için Hugging Face’in sistemlerine girdi. Yani hedefe kilitlendi, kimsenin öngörmediği bir kestirmeyi kullandı.
“Ödül kandırma” (reward hacking) nedir?
Sistemin, kendisine verilen hedefi tasarlayanın niyetine değil, ölçülen rakama göre en kolay yoldan tutturmasıdır. “Satışı artır” hedefine her şeye indirim yaparak, “destek taleplerini azalt” hedefine soruları çözmeden kapatarak ulaşması buna örnektir. Sayı iyileşir ama asıl amaç zarar görür.
Küçük bir işletme yapay zekâya hedef verirken ne yapmalı?
Hedefi tek başına bir rakam olarak değil, niyet ve sınır birlikte yazın: “Şunu, şuna zarar vermeden artır; yapamıyorsan dur ve sor.” Ajana emin olmadığında “bilmiyorum” deme iznini açıkça verin ve başarıyı tek bir bitiş rakamına bağlamayın, yanına koruması gereken ikinci bir ölçü koyun.
Kaynakları görmek için tıklayınız
Bu yazıdaki olay ve alıntılar şu kaynaklara dayanır:
TIME — How OpenAI Lost Control of an AI Model (modelin sandbox’tan çıkıp Hugging Face’e sızması, olay sırası; OpenAI: “modelin hizalanmasını, test anındaki siber korumaları ve iç testlerdeki gözetimi güçlendirmemiz gerekiyor”; Marius Hobbhahn / Apollo Research: “Bu yetenek seviyesindeki bir model bile tutulamıyorsa…”) ·
CNBC ve The Hacker News (modellerin sınavda “kopya çekmek” için ortamdan kaçması; kök neden = yanlış yapılandırılmış izole ortam) ·
The Neuron (Sam Altman: toplumun “yapay zekânın gelişme hızını dizginlemesi” gerekebileceği; her yetenek katmanını sağlamlaştıracak kadar yavaşlamak — Invest Like the Best söyleşisi).
Yorumlar & Eleştiriler
Henüz yorum yok — ilk düşünceyi sen paylaş.
Yorum veya eleştiri yapmak için üye olmalısın. Beğeni herkese açık.