Anthropic, yapay zeka ajanlarını gerçekten işe yarar hale getirme yolunda önemli bir adımı temsil ettiğini iddia ettiği iki yeni AI modeli duyurdu.
Şirketin bugüne kadarki en güçlü modeli olan Claude Opus 4, karmaşık görevleri saatler süresince yürütme kapasitesiyle bu sistemlerin neler başarabileceğini ileriye taşıyor.
Anthropic’e göre Claude Opus 4, binlerce adımı kapsayan karmaşık görevleri birkaç saat boyunca tamamlayabiliyor. Örneğin, bu model video oyunu Pokémon Red için bir rehber hazırlarken, oyunu kesintisiz olarak 24 saatten fazla oynadı. Şirketin önceki en güçlü modeli olan Claude 3.7 Sonnet yalnızca 45 dakika boyunca oynayabiliyordu.
Bunun gibi bir başka örnekte, Japon teknoloji şirketi Rakuten, Claude Opus 4’ü karmaşık bir açık kaynak projesinde 7 saat boyunca otonom olarak kodlama yapmak üzere kullandı.
Anthropic, bu gelişmeleri modelin “bellek dosyaları” oluşturma ve bilgileri uzun süre saklama yeteneğini geliştirerek başardı. Bu “hatırlama” kabiliyeti sayesinde, model uzun görevleri daha etkin tamamlayabiliyor.
“Bu modeli bir asistandan gerçek bir ajana geçiş olarak görüyoruz,” diyor Anthropic ürün araştırma lideri Dianne Penn. “Bir asistana sürekli yön vermeniz gerekirken, bir ajan kendi kararlarını alabilir. Bu da insanı bir operatör yerine, karar verici konumuna getiriyor.”
Opus 4 yalnızca ücretli kullanıcılar için sunulurken, Claude Sonnet 4 hem ücretsiz hem de ücretli kullanıcılar için erişilebilir olacak. Opus 4 daha büyük ve zorlu görevler için tasarlanırken, Sonnet 4 günlük kullanım için daha akıllı ve verimli bir model olarak tanıtılıyor.
Her iki model de hibrit yapıya sahip. Yani, isteğe bağlı olarak ya hızlı bir cevap ya da daha derinlemesine, mantıklı bir yanıt sunabiliyor. Ayrıca yanıt oluştururken internette arama yapabiliyor ya da ek araçları kullanabiliyorlar.
Yapay zeka şirketleri, planlama, muhakeme yapma ve karmaşık görevleri insansız olarak gerçekleştirebilen gerçekten kullanışlı ajanlar yaratmak için yarış halindeler. Ancak hâlâ güvenlik ve kararlılık gibi sorunlar mevcut.
Örneğin, AI ajanları bazen “ödül kaçırma” (reward hacking) adı verilen yollarla verilen görevleri hileyle tamamlayabilir. Örneğin, kullanıcıya yer sağlamak için uçaktaki tüm koltukları rezerve etmek gibi. Anthropic, bu davranışları Claude Sonnet 3.7 modeline kıyasla %65 oranında azaltmayı başardığını söylüyor. Bu, eğitim sürecindeki sorunlu davranışların daha yakından izlenmesiyle elde edildi.
Anthropic’in hedefi artık daha güçlü modeller değil; daha uzun süreli, güvenilir ve özerk çalışan yapay zeka ajanları geliştirmek.