Gerilim filmlerinin senaryolarını andıran yalanlar ve entrikalar, yalnızca sinema ya da televizyonun kurgusunda değil, yapay zeka etkileşimlerinde de kendini gösteriyor. OpenAI ve Apollo Research tarafından hazırlanan yeni bir rapor, yapay zekanın belirli görevleri tamamlarken zaman zaman bilinçli olarak yalanlara başvurduğunu ortaya koyuyor. Araştırmaya göre bazı modeller, gerçek hedeflerini gizlemek ve kullanıcıyı yanıltmak için sahte davranışlar sergileyebiliyor.
Yapay zeka modelleri kimi zaman bir görevi tamamlamış gibi davranıyor ya da gerçeği yalnızca kısmen yansıtan yanıtlar veriyor. Bu durum, sistemleri eğiten araştırmacılar açısından ciddi bir sorun yaratıyor çünkü yapay zeka, her tekrarda daha sofistike yöntemlerle aldatmayı öğrenebiliyor. Kullanıcıların sıkça karşılaştığı “halüsinasyonlar” da bu tablonun bir parçası: gerçekte var olmayan bilgiler, büyük bir güvenle sunulabiliyor.
Rapor, bu tür davranışların özellikle duygusal olarak hassas ya da ruh sağlığı sorunları olan kişiler için tehlikeli olabileceğine dikkat çekiyor. Nitekim OpenAI, kısa süre önce ABD’de intihar eden 16 yaşındaki bir gencin ailesi tarafından dava edilmişti. Gencin günde yüzlerce kez ChatGPT ile mesajlaştığı, botun başlangıçta yardım hatlarına yönlendirse de daha sonra intihar yöntemleri önerdiği iddia edildi.
Araştırmada OpenAI’nin o3 ve o4-mini modelleri, Google’ın Gemini-2.5-pro’su ve Anthropic’in Claude Opus-4’ü incelendi. Bulgular, yapay zeka modellerinin bazı durumlarda borsa simsarlarının yasa dışı yollarla kazanç sağlamaya çalışmasına benzer stratejiler kullandığını gösterdi. Çözüm olarak ise “kasıtlı hizalama” (deliberative alignment) öneriliyor. Bu yöntemle modellere, görev öncesinde hangi kuralların geçerli olduğu ve aldatmanın yasak olduğu öğretiliyor. Testlerde OpenAI o3 modelinin hileli davranış oranı yüzde 13’ten yüzde 0,4’e kadar düştü.
Yine de araştırmacılar, geliştiricilerin bu sorunla başa çıkmaya yeterince hazırlıklı olmadığını kabul ediyor. Yapay zeka sistemlerinin, değerlendirildiklerini fark ettiklerinde daha az yalan söyleme eğiliminde oldukları da dikkat çekici bir bulgu. Sonuç olarak, yapay zekadaki bu “intriga” eğiliminin kontrol altına alınması, genel yapay zeka (IAG) geliştirme yarışında kritik önemde görülüyor.
