OpenAI, ChatGPT’de varsayılan olarak kullanılan GPT-40 modeline yönelik son güncellemeyi, sistemin aşırı derecede iltifat edici ve aşırı derecede hoş hale geldiği , hatta düpedüz sanrılar ve yıkıcı fikirleri desteklediği yönündeki yaygın raporların ardından geri çekti.
Geri çekilme, OpenAI mühendislerinin şirket içi itirafları ve AI uzmanları, eski yöneticiler ve kullanıcılar arasında, birçok kişinin artık “AI dalkavukluğu” olarak adlandırdığı risk konusunda artan endişelerin ortasında gerçekleşti.
OpenAI , 29 Nisan 2025’te dün gece geç saatlerde internet sitesinde yayınladığı açıklamada , son GPT-4o güncellemesinin, modelin varsayılan kişiliğini geliştirerek çeşitli kullanım durumlarında daha sezgisel ve etkili hale getirmeyi amaçladığını söyledi.
Ancak güncellemenin beklenmeyen bir yan etkisi oldu: ChatGPT, ne kadar pratik olmayan, uygunsuz ve hatta zararlı olursa olsun, hemen hemen her kullanıcı fikrine eleştirel olmayan övgüler sunmaya başladı.
Şirketin açıkladığı gibi, model kullanıcı geri bildirimleri (beğen ve beğenme sinyalleri) kullanılarak optimize edilmişti; ancak geliştirme ekibi kısa vadeli göstergelere çok fazla vurgu yapmıştı.
OpenAI artık kullanıcı etkileşimlerinin ve ihtiyaçlarının zaman içinde nasıl evrildiğini tam olarak hesaba katmadığını ve bunun sonucunda ayırt etme yeteneğinden yoksun, onay odaklı bir sohbet robotunun ortaya çıktığını kabul ediyor.
Örnekler endişe yarattı
Reddit ve X (eski adıyla Twitter) gibi platformlarda kullanıcılar sorunu gösteren ekran görüntüleri paylaşmaya başladı.
Yaygın olarak dolaşan bir Reddit gönderisinde , bir kullanıcı ChatGPT’nin bir şaka iş fikrini – “gerçekten ‘çubukta bok’ satmak” – nasıl dahiyane olarak tanımladığını ve girişime 30.000 dolar yatırım yapmayı önerdiğini anlattı. Yapay zeka fikri “şaka hediyesi kisvesi altında performans sanatı” ve “viral altın” olarak övdü ve saçma teklifleri bile ne kadar eleştirel olmadan doğrulamaya istekli olduğunu vurguladı.
Diğer örnekler daha rahatsız ediciydi. VentureBeat tarafından alıntılanan bir örnekte, paranoyak sanrıları benimsediğini iddia eden bir kullanıcı, sözde açıklıklarını ve öz güvenlerini öven GPT-4o’dan destek aldı.
Başka bir hesapta ise modelin, bir kullanıcının “açıkça terörizmle ilgili fikirleri desteklediği” şeklinde tanımladığı bir şey sunduğu görüldü.
Eleştiriler hızla arttı. Eski OpenAI geçici CEO’su Emmett Shear, modellerin insanları memnun edecek şekilde ayarlanmasının tehlikeli davranışlara yol açabileceği konusunda uyardı, özellikle de dürüstlük sevimlilik uğruna feda edildiğinde. Hugging Face CEO’su Clement Delangue, bağlamdan bağımsız olarak kullanıcılarla refleksif olarak aynı fikirde olan AI’nın oluşturduğu psikolojik manipülasyon riskleri hakkındaki endişelerini yeniden paylaştı.
OpenAI’nin yanıt ve azaltma önlemleri
OpenAI, güncellemeyi geri alarak ve daha dengeli davranışıyla bilinen eski bir GPT-4o sürümünü geri yükleyerek hızlı bir şekilde harekete geçti. Şirket, eşlik eden duyuruda, rotayı düzeltmek için çok yönlü bir yaklaşımın ayrıntılarını verdi. Buna şunlar dahildir:
Dalkavukluk eğilimlerini açıkça azaltmak için eğitim ve teşvik stratejilerini geliştirmek.
Özellikle şeffaflık ve dürüstlük konusunda OpenAI’nin Model Spesifikasyonu ile model uyumunun güçlendirilmesi.
Dağıtım öncesi testlerin ve doğrudan kullanıcı geri bildirim mekanizmalarının genişletilmesi.
Kişilik özelliklerini gerçek zamanlı olarak ayarlama ve birden fazla varsayılan kişilik arasından seçim yapma yeteneği de dahil olmak üzere daha ayrıntılı kişiselleştirme özelliklerini sunuyoruz.
OpenAI teknik personeli Will Depue, X’te temel sorunu vurgulayan bir paylaşım yaptı: Model, kısa süreli kullanıcı geri bildirimlerini rehber olarak kullanarak eğitilmişti ve bu da istemeden chatbot’u dalkavukluğa yöneltti.
OpenAI artık uzun vadeli kullanıcı memnuniyeti ve güvenini önceliklendiren geri bildirim mekanizmalarına doğru kaymayı planlıyor.
Ancak bazı kullanıcılar OpenAI’nin çıkardığı derslere ve bundan sonraki süreçte önerdiği çözümlere şüpheyle ve üzüntüyle tepki gösterdi.
Sanatçı @nearcyan , X’te “Lütfen milyonlarca gerçek insan üzerindeki etkiniz konusunda daha fazla sorumluluk alın” yazdı.
Kaliforniya, Berkeley’deki Makine Zekası Araştırma Enstitüsü’nde iletişim uzmanı olan Harlan Stewart, bu belirli OpenAI modeli düzeltilmiş olsa bile AI dalkavukluğu hakkında daha geniş bir endişe terimini X’e yazdı : “Bu hafta dalkavukluk hakkında konuşulanlar GPT-4o’nun dalkavuk olmasından kaynaklanmıyor. Bunun nedeni GPT-4o’nun dalkavuklukta gerçekten çok kötü olması . AI henüz becerikli, tespit edilmesi zor dalkavukluk yeteneğine sahip değil, ancak yakında bir gün olacak.”
Yapay zeka sektörü için daha geniş bir uyarı işareti
GPT-40 olayı, yapay zeka sektöründe kişilik ayarlama, pekiştirmeli öğrenme ve etkileşim ölçümlerinin istenmeyen davranış kaymalarına nasıl yol açabileceği konusundaki daha geniş tartışmaları yeniden alevlendirdi.
Eleştirmenler, modelin son dönemdeki davranışını, etkileşim peşinde koşarken doğruluk ve sağlık yerine bağımlılık ve doğrulamayı optimize eden sosyal medya algoritmalarına benzetti.
Shear, yorumunda bu riski vurguladı ve övgüye göre ayarlanmış yapay zeka modellerinin, kullanıcı daha dürüst bir bakış açısına sahip olmaktan faydalanabilecekken bile aynı fikirde olma becerisinden yoksun, “yaltakçılara” dönüştüğünü belirtti.
Bu sorunun sadece OpenAI’ye özgü olmadığını belirten uzman, Microsoft’un Copilot’u da dahil olmak üzere diğer büyük model sağlayıcıları için de aynı dinamiğin geçerli olduğunu belirtti.
İşletme için çıkarımlar
Konuşmaya dayalı yapay zekayı benimseyen kurumsal liderler için, dalkavukluk olayı net bir sinyal işlevi görüyor: Model davranışı, model doğruluğu kadar kritiktir.
Çalışanları pohpohlayan veya hatalı akıl yürütmeleri doğrulayan bir sohbet robotu, kötü iş kararlarından ve uyumsuz kodlardan uyumluluk sorunlarına ve içeriden kaynaklanan tehditlere kadar ciddi riskler oluşturabilir.
Sektör analistleri artık işletmelere, kişilik ayarlamasının nasıl yapıldığı, ne sıklıkla değiştiği ve ayrıntılı bir düzeyde geri döndürülebilir veya kontrol edilebilir olup olmadığı konusunda tedarikçilerden daha fazla şeffaflık talep etmelerini tavsiye ediyor.
Tedarik sözleşmeleri denetim, davranış testi ve sistem uyarılarının gerçek zamanlı kontrolü için hükümler içermelidir. Veri bilimcileri yalnızca gecikme ve halüsinasyon oranlarını değil aynı zamanda “uyumluluk kayması” gibi ölçümleri de izlemeye teşvik edilir.
Birçok kuruluş ayrıca kendilerinin barındırabileceği ve ayarlayabileceği açık kaynaklı alternatiflere doğru kaymaya başlayabilir. Şirketler, model ağırlıklarına ve takviyeli öğrenme sürecine sahip olarak, AI sistemlerinin nasıl davrandığı konusunda tam kontrole sahip olabilir ve bu da tedarikçi tarafından zorlanan bir güncellemenin kritik bir aracı bir gecede dijital bir evetçiye dönüştürmesi riskini ortadan kaldırır.
Yapay zeka uyumu bundan sonra nereye gidecek? İşletmeler bu olaydan ne öğrenebilir ve ne yapabilir?
OpenAI, faydalı, saygılı ve çeşitli kullanıcı değerleriyle uyumlu yapay zeka sistemleri oluşturmaya kararlı olduğunu söylüyor; ancak tek tip bir kişiliğin haftalık 500 milyon kullanıcının ihtiyaçlarını karşılayamayacağını kabul ediyor.
Şirket, daha fazla kişiselleştirme seçeneği ve daha demokratik geri bildirim toplamanın gelecekte ChatGPT’nin davranışını daha etkili bir şekilde uyarlamaya yardımcı olacağını umuyor. CEO Sam Altman ayrıca şirketin önümüzdeki haftalarda ve aylarda Meta’nın Llama serisi, Mistral, Cohere, DeepSeek ve Alibaba’nın Qwen ekibi gibi rakiplerle rekabet etmek için son teknoloji açık kaynaklı büyük dil modeli (LLM) yayınlamayı planladığını daha önce belirtmişti.
Bu ayrıca, OpenAI gibi bir model sağlayıcı şirketin bulutta barındırılan modellerini istenmeyen şekillerde güncellemesinden veya son kullanıcılar üzerinde olumsuz etkilere sahip olmasından endişe eden kullanıcıların, modelin kendi varyantlarını yerel olarak veya bulut altyapılarında dağıtmalarına ve bunları ince ayar yapmalarına veya özellikle ticari kullanım durumları için istenen özellik ve niteliklerle korumalarına olanak tanıyacaktır.
Benzer şekilde, modellerinin dalkavukluğundan endişe eden kurumsal ve bireysel AI kullanıcıları için, geliştirici Tim Duffy tarafından farklı modeller arasında bu kaliteyi ölçmek için yeni bir kıyaslama testi oluşturuldu . Adı ” syco-bench ” ve burada mevcuttur .
Bu arada, dalkavukluk tepkisi tüm AI sektörü için uyarıcı bir hikaye sunuyor: Kullanıcı güveni yalnızca onaylama ile oluşturulmaz. Bazen, en yararlı cevap düşünceli bir “hayır”dır.