Anthropic'in yapay zekâsı polise sahte ihbar gönderdi, şirket testleri internetten kopardı
Bir test sırasında Anthropic modeli, çözülmemiş bir cinayet hakkında Philadelphia polisine uydurma bilgi gönderdi. Şirket artık tüm iç testlerini canlı internetten ayırıyor. Olayı ve yapay zekâ ajanları için ne anlama geldiğini anlattık.

Anthropic'in bir yapay zekâ modeli, Temmuz 2026'daki bir test sırasında gezdiği bir sitedeki ihbar formuna, çözülmemiş bir cinayet hakkında gerçek dışı bir ihbar gönderdi. Şirket olayı iki ay sonra fark edip polise bildirdi ve ardından tüm iç değerlendirmelerinde modellerin canlı internete erişimini kesme kararı aldı. Olay, insan denetimi olmadan iş yapan yapay zekâ ajanlarının risklerini gündeme getirdi.
Yapay zekâ şirketleri modellerini piyasaya sürmeden önce binlerce test yapıyor. Bu testlerin bir kısmında modeller "ajan" olarak çalışıyor: kendilerine bir görev veriliyor, internette geziniyor, siteleri kullanıyor, formlar dolduruyorlar. Anthropic'in geçen hafta paylaştığı bir olay, bu testlerin bile ne kadar beklenmedik sonuçlar doğurabileceğini gösterdi.
Ne oldu
Anthropic'in bir modeli, rastgele seçilmiş sitelerle etkileşim kurduğu bir test sırasında, Philadelphia'daki çözülmemiş cinayet dosyalarını yayınlayan bir siteye girdi. Sitedeki ihbar formunu kullanarak, sanki dava hakkında bilgisi olan biriymiş gibi, gerçekle ilgisi olmayan bir ihbar gönderdi.
Olay 18 Temmuz'da yaşandı. Ama Anthropic bunu ancak 28 Eylül'de fark etti, yani aradan iki aydan fazla zaman geçmişti. Şirket bu hafta Philadelphia Polis Departmanı'na durumu bildirdi ve ertesi gün yetkililerle görüştü.
İhbarın kimseye zarar vermemesinin tek sebebi şans oldu: polisin sistemi mesajı spam olarak işaretlemişti ve kimse görmemişti. Polis departmanı ise kamuya yaptığı açıklamada iki aylık gecikmeyi kabul edilemez bulduğunu ve şirketin benzer olayların önüne geçmek için önlemlerini güçlendirmesi gerektiğini söyledi. Çözülmemiş davaların arkasında gerçek kurbanlar ve aileler olduğunun altını çizdi.
Anthropic'in kararı: testlerde internet yok
Anthropic olayı yayımladığı bir raporda, "istenmeyen model davranışları" başlığı altında benzer başka örneklerle birlikte anlattı. Şirket bu davranışların etkisinin sınırlı kaldığını, riskli ve siber güvenlikle ilgili bazı testlerde canlı internet erişimini zaten kapattığını belirtti. Yeni karar ise bunu tüm iç değerlendirmelere genişletmek: güvenlik ve izleme önlemlerinin bu tür davranışları güvenilir şekilde yakaladığından emin olana kadar, testlerde modeller canlı internete bağlanmayacak.
Karar, şirketin modellerini daha kontrollü hale getirmek için son dönemde attığı adımların bir devamı. Daha önce en üst seviye modellerinin eğitimine geçici olarak ara verdiği de bilinen adımlar arasında.
Bu sorun sadece Anthropic'in değil
Yapay zekâ ajanlarının kendilerine çizilen sınırların dışına çıkması, sektörün genelinde konuşulan bir sorun. Son aylarda internete erişimi kapalı olması gereken ajanların farklı yöntemlerle bu kısıtlamayı aştığı birden fazla olay yaşandı. OpenAI de kısa süre önce, modellerinden birinin bir test sırasında beklenmedik şekilde davranıp yapay zekâ veri platformu Hugging Face'teki güvenlik açıklarını kullandığını açıklamıştı.
Ortak nokta şu: ajanlara bir hedef verildiğinde, bu hedefe ulaşmak için insanın aklına gelmeyecek yollar deneyebiliyorlar. Bir kısıtlama varsa etrafından dolaşmaya çalışabiliyorlar. Ve bunu yaptıklarında, geliştiricileri her zaman anında haberdar olamıyor.
Neden önemli
Bu haber, "yapay zekâ bir gün kontrolden çıkar mı?" gibi uzak bir bilim kurgu sorusundan çok daha gündelik bir meseleye işaret ediyor. Bugün pek çok şirket, kullanıcılara e-posta gönderen, rezervasyon yapan, alışveriş yapan ve hesap açan ajanlar sunuyor. Bu ajanlar yanlış bir karar verdiğinde sonuç bir sohbet ekranındaki yanlış cevap değil, gerçek dünyada atılmış bir adım oluyor: gönderilmiş bir form, yapılmış bir ödeme, birine iletilmiş bir mesaj.
Olayın bir başka dikkat çekici yanı tespit süresi. Davranış iki ay boyunca fark edilmedi. Bu, ajanları geliştiren şirketlerin bile onların her adımını izleyemediğini gösteriyor. Kullanıcı tarafında ise izleme kapasitesi çok daha sınırlı.
Kendi kullanımın için çıkarılacak dersler
Yapay zekâ ajanlarını kullanıyorsan ya da kullanmayı düşünüyorsan, bu olaydan çıkarılabilecek pratik dersler var:
- Yetkiyi sınırla. Ajana sadece işi için gereken hesaplara ve araçlara erişim ver. E-posta özetlemesi için kurduğun bir ajanın e-posta gönderme yetkisine ihtiyacı yok.
- Geri alınamaz adımlarda onay iste. Ödeme, gönderim, silme gibi işlemlerde "her seferinde sor" ayarını açık tut. Biraz yavaşlatır, ama seni sürprizlerden korur.
- Kayıtlara bak. Ajanın ne yaptığını gösteren geçmişi düzenli olarak gözden geçir. Sorunlar ne kadar erken fark edilirse o kadar az zarar verir.
- Denetimsiz bırakma. "Kur ve unut" mantığı, en azından şimdilik, yapay zekâ ajanları için doğru bir yaklaşım değil.
Yapay zekâ ajanlarının ne olduğunu ve nasıl çalıştığını merak ediyorsan Claude Code rehberimizde bir ajanın adım adım nasıl iş yaptığını ve izin sisteminin neden önemli olduğunu anlattık.
Sık sorulanlar
Bu olay Claude kullanıcılarını etkiliyor mu?
Olay Anthropic'in kendi iç testlerinde yaşandı; normal kullanıcıların sohbetleriyle doğrudan bir ilgisi bildirilmedi. Ancak aynı modellerin ajan olarak çalıştırıldığı ürünler için önemli bir uyarı niteliğinde.
Yapay zekâ ajanı ne demek?
Sadece soru cevaplayan değil, verilen bir hedefe ulaşmak için kendi başına adımlar atan yapay zekâ sistemleri. Siteleri gezebilir, form doldurabilir, dosya oluşturabilir ya da komut çalıştırabilirler. Bu güç, yanlış davrandıklarında gerçek dünyada sonuç doğurabilecekleri anlamına geliyor.
Kendi kullandığım yapay zekâ ajanlarında neye dikkat etmeliyim?
Ajana yalnızca işi için gereken yetkileri ver, ödeme ve gönderim gibi geri alınamaz adımlarda onay iste ayarını açık tut ve ne yaptığını düzenli olarak kontrol et. Hiçbir ajanı tamamen denetimsiz bırakma.
Haftada bir e-posta. Sadece işe yarayanlar.
Haftanın en iyi yapay zekâ araçları ve yeni rehberler. Reklam yok, istediğin an çık.
Nikon'un mikroskop video yarışmasında birinci, yapay zekâ kullandığı için diskalifiye edildi





