Salesforce, daha güvenilir yapay zeka için ‘keskin zekayı’ hedef alıyor

Salesforce, yapay zekanın iş uygulamaları için en kalıcı zorluklarından birini ele alıyor: Bir yapay zeka sisteminin ham zekası ile öngörülemeyen kurumsal ortamlarda tutarlı bir şekilde performans gösterme yeteneği arasındaki fark – şirketin ” keskin zeka ” olarak adlandırdığı şey.

Salesforce AI Research, bugün yaptığı kapsamlı bir araştırma duyurusunda, gelecekteki AI ajanlarını kurumsal kullanım için daha akıllı, güvenilir ve çok yönlü hale getirmek için tasarlanmış birkaç yeni kıyaslama, model ve çerçeveyi açıkladı. Yenilikler, özellikle karmaşık iş ortamlarında otonom ajanlar olarak konuşlandırıldığında, AI sistemlerinin hem yeteneklerini hem de tutarlılığını iyileştirmeyi amaçlıyor.

Super Bowl’u güvence altına almak

Salesforce’un Baş Bilim İnsanı ve Yapay Zeka Araştırmaları Başkanı Silvio Savarese, duyurudan önce düzenlenen bir basın toplantısında, “LLM’ler standart testlerde başarılı olabilir, karmaşık geziler planlayabilir ve gelişmiş şiirler üretebilir; ancak dinamik, öngörülemeyen kurumsal ortamlarda güvenilir ve tutarlı görev yürütme ihtiyacıyla karşı karşıya kaldıklarında yetenekleri çoğu zaman tökezler” dedi.

Girişim, Salesforce’un Savarese’nin ” Kurumsal Genel Zeka ” (EGI) olarak adlandırdığı, Yapay Genel Zeka’nın (AGI) daha teorik arayışından ziyade, özel olarak iş karmaşıklığına yönelik tasarlanmış bir yapay zekaya doğru ilerlemesini temsil ediyor.

Savarese, “EGI’yi, yalnızca yetenek için değil, aynı zamanda tutarlılık için de optimize edilmiş, işletmeler için özel olarak oluşturulmuş AI aracıları olarak tanımlıyoruz” diye açıkladı. “AGI, insan zekasını aşan süper zeki makinelerin görüntülerini çağrıştırsa da, işletmeler o uzak, yanıltıcı geleceği beklemiyor. Bu temel kavramları şimdi gerçek dünyadaki zorlukları büyük ölçekte çözmek için uyguluyorlar.”

Salesforce, kurumsal ortamlarda AI’nın tutarsızlık sorununu nasıl ölçüyor ve düzeltiyor?

Araştırmanın temel odak noktası, AI’nın performanstaki tutarsızlığını ölçmek ve ele almaktır. Salesforce, bir AI sisteminin yeteneklerinin gerçekte ne kadar engebeli olduğunu ölçmek için tasarlanmış 225 basit akıl yürütme sorusu içeren genel bir kıyaslama olan SIMPLE veri setini tanıttı.

“Günümüzün yapay zekası engebeli, bu yüzden bunun üzerinde çalışmamız gerekiyor. Ama bir şeyi önce ölçmeden nasıl üzerinde çalışabiliriz? Bu SIMPLE ölçütü tam olarak budur,” diye açıkladı Salesforce’ta Araştırma Kıdemli Müdürü olan Shelby Heinecke basın toplantısında.

Kurumsal uygulamalar için bu tutarsızlık yalnızca akademik bir endişe değildir. Bir AI aracısının tek bir yanlış adımı operasyonları bozabilir, müşteri güvenini aşındırabilir veya önemli miktarda mali hasara yol açabilir.

Savarese yorumunda, “İşletmeler için yapay zeka sıradan bir eğlence değil; sarsılmaz bir öngörülebilirlik gerektiren kritik öneme sahip bir araçtır” ifadelerini kullandı.

CRMArena’nın İçinde: Salesforce’un kurumsal AI temsilcileri için sanal test alanı

Belki de en önemli yenilik, gerçekçi müşteri ilişkileri yönetimi senaryolarını simüle etmek için tasarlanmış yeni bir kıyaslama çerçevesi olan CRMArena’dır . AI temsilcilerinin profesyonel bağlamlarda kapsamlı bir şekilde test edilmesini sağlayarak akademik kıyaslamalar ile gerçek dünya iş gereksinimleri arasındaki boşluğu ele alır.

Savarese, “Mevcut yapay zeka modellerinin kurumsal ortamların karmaşık taleplerini yansıtmada genellikle yetersiz kaldığını fark ederek, gerçekçi, profesyonel olarak temellendirilmiş CRM senaryolarını simüle etmek için titizlikle tasarlanmış yeni bir kıyaslama çerçevesi olan CRMArena’yı tanıttık” dedi.

Çerçeve, üç temel kişilikteki ajan performansını değerlendirir: hizmet ajanları, analistler ve yöneticiler. İlk testler, rehberli istemle bile, lider ajanların bu kişiliklerin kullanım durumları için işlev çağrısında %65’ten daha az zaman başarılı olduğunu ortaya koydu.

Savarese, “CRM alanı esasen acenteleri geliştirmek için dahili olarak tanıtılan bir araçtır,” diye açıkladı. “Bu acenteleri stres testine tabi tutmamızı, ne zaman başarısız olduklarını anlamamızı ve ardından bu başarısızlık vakalarından öğrendiğimiz dersleri acentelerimizi geliştirmek için kullanmamızı sağlar.”

Kurumsal bağlamı her zamankinden daha iyi anlayan yeni yerleştirme modelleri

reklamcılık

Duyurulan teknik yenilikler arasında Salesforce, 56 veri kümesinde Büyük Metin Gömme Ölçütünü (MTEB) belirleyen, daha derin bağlamsal anlayışa yönelik yeni bir model olan SFR-Gömmeyi öne çıkardı.

“SFR yerleştirme sadece bir araştırma değil. Çok, çok yakında Veri Bulutu’na geliyor,” diye belirtti Heinecke.

Geliştiriciler için özel bir sürüm olan SFR-Embedding-Code da tanıtıldı ve bu da yüksek kaliteli kod araması ve geliştirmenin kolaylaştırılması anlamına geliyor. Salesforce’a göre, 7B parametreli sürüm Kod Bilgi Alma (CoIR) kıyaslamasında önde gelirken , daha küçük modeller (400M, 2B) verimli, uygun maliyetli alternatifler sunuyor.

Daha küçük, eylem odaklı yapay zeka modelleri neden iş görevlerinde daha büyük dil modellerinden daha iyi performans gösterebilir?

Salesforce ayrıca, yalnızca metin oluşturmak yerine eylemleri tahmin etmek için özel olarak tasarlanmış bir model ailesi olan xLAM V2’yi (Büyük Eylem Modeli) duyurdu . Bu modeller yalnızca 1 milyar parametreyle başlar; bu, birçok önde gelen dil modelinin boyutunun bir kısmıdır.

“xLAM modellerimizin özelliği, model boyutlarımıza bakarsanız, 1B’lık bir modelimiz var, 70B’lık bir modele kadar. Örneğin, bu 1B’lık model, günümüzün büyük dil modellerinin çoğunun boyutunun bir kısmıdır,” diye açıkladı Heinecke. “Bu küçük model, bir sonraki eylemi gerçekleştirme yeteneğinde çok fazla güç barındırıyor.”

Standart dil modellerinden farklı olarak, bu eylem modelleri, bir görev dizisindeki sonraki adımları tahmin etmek ve yürütmek üzere özel olarak eğitilmiştir; bu da onları kurumsal sistemlerle etkileşime girmesi gereken otonom aracılar için özellikle değerli hale getirir.

Heinecke, “Büyük aksiyon modelleri perde arkasında LLM’lerdir ve biz bunları şu şekilde oluşturuyoruz: LLM alıyoruz ve aksiyon yörüngeleri dediğimiz şey üzerinde ince ayar yapıyoruz.” diye ekledi.

Kurumsal AI güvenliği: Salesforce’un güven katmanı, iş kullanımı için nasıl güvenlik bariyerleri oluşturuyor?

Yapay zeka güvenliği ve güvenilirliğiyle ilgili kurumsal endişeleri gidermek için Salesforce, hem kamuya açık veriler hem de CRM’e özel dahili veriler üzerinde eğitilmiş bir model ailesi olan SFR-Guard’ı tanıttı . Bu modeller, yapay zeka aracı davranışı için koruma sağlayan şirketin Güven Katmanını güçlendirir.

Şirket duyurusunda, “Agentforce’un güvenlik önlemleri, acentelerin iş ihtiyaçları, politikaları ve standartlarına dayalı olarak davranışları için net sınırlar belirleyerek, acentelerin önceden tanımlanmış sınırlar dahilinde hareket etmesini sağlar” ifadelerine yer verdi.

Şirket ayrıca , bağlam içinde LLM tabanlı yargıç modellerini değerlendirmek için yeni bir ölçüt olan ContextualJudgeBench’i piyasaya sürdü; doğruluk, özlü olma, sadakat ve uygun şekilde yanıt vermeyi reddetme açısından 2.000’den fazla zorlu yanıt çiftini test ediyor.

Salesforce, metnin ötesine bakarak düşünce ve eylem zincirleri (CoTA) aracılığıyla karmaşık, çok adımlı sorunları ele almak için tasarlanmış çok modlu bir eylem modeli ailesi olan TACO’yu tanıttı . Bu yaklaşım, yapay zekanın birden fazla medya türünü içeren karmaşık sorguları yorumlamasını ve yanıtlamasını sağlar ve Salesforce, zorlu MMVet kıyaslamasında %20’ye kadar iyileştirme iddiasında bulunur.

Eylemde ortak inovasyon: Müşteri geri bildirimleri Salesforce’un kurumsal yapay zeka yol haritasını nasıl şekillendiriyor?

AI Research Kuluçka ve Marka Stratejisi Kıdemli Direktörü Itai Asseo , kurumsal düzeyde yapay zeka çözümlerinin geliştirilmesinde müşteriyle ortak inovasyonun önemini vurguladı.

“Müşterilerle konuşurken, yaşadığımız en büyük sorunlardan biri, kurumsal verilerle uğraşırken, doğru olmayan ve alakalı olmayan yanıtlar verme konusunda çok düşük bir tolerans olması,” diye açıkladı Asseo. “İster muhakeme motorlarıyla, ister RAG teknikleriyle ve LLM’ler etrafındaki diğer yöntemlerle olsun, çok fazla ilerleme kaydettik.”

Asseo, müşteri kuluçka sürecinin yapay zeka performansında önemli iyileştirmeler sağladığına dair örnekler verdi: “Atlas akıl yürütme motorunu, bazı gelişmiş geri çağırma artırılmış üretim tekniklerini, akıl yürütme ve aracı döngü metodolojimiz ve mimarimizle birleştirdiğimizde, müşterilerin bizim diğer büyük rakiplerimizle çalışırken elde edebildiklerinin iki katı kadar doğruluk gördük.”

Kurumsal Genel Zeka’ya giden yol: Salesforce AI’nın geleceği ne olacak?

Salesforce’un araştırma hamlesi, işletmelerin giderek daha fazla gelişmiş yetenekleri güvenilir performansla birleştiren yapay zeka sistemleri aramasıyla, kurumsal yapay zeka benimsemesinde kritik bir anda geliyor.

Teknoloji sektörünün tamamı etkileyici ham yeteneklere sahip, giderek daha büyük modeller peşinde koşarken, Salesforce’un tutarlılık farkına odaklanması, yapay zeka geliştirmeye yönelik daha ayrıntılı bir yaklaşımı vurguluyor; bu yaklaşım, akademik kıstaslara kıyasla gerçek dünya iş gereksinimlerine öncelik veriyor.

Perşembe günü duyurulan teknolojiler önümüzdeki aylarda kullanıma sunulmaya başlanacak. SFR-Embedding ilk olarak Data Cloud’a yönelik olacak. Diğer yenilikler ise Agentforce’un gelecekteki sürümlerine güç verecek.

Savarese’nin basın toplantısında belirttiği gibi, “İnsanları değiştirmekle ilgili değil. Sorumlu olmakla ilgili.” Kurumsal AI hakimiyetine giden yarışta Salesforce, tutarlılık ve güvenilirliğin -sadece ham zekanın değil- nihayetinde iş AI devriminin kazananlarını belirleyeceğine bahse giriyor.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir