Yapay zeka araştırma kuruluşu EleutherAI, yapay zeka modellerinin eğitimi için lisanslı ve açık alan metinlerden oluşan en büyük koleksiyonlardan birini yayınladığını iddia ediyor.
The Common Pile v0.1 adlı veri kümesi, Poolside, Hugging Face ve diğer AI girişimleri ile birlikte birkaç akademik kurumla iş birliği içinde tamamlanması yaklaşık iki yıl sürdü. 8 terabayt boyutunda olan The Common Pile v0.1, EleutherAI’nin lisanssız, telif hakkıyla korunan veriler kullanılarak geliştirilen modellerle aynı performansı gösterdiğini iddia ettiği Comma v0.1-1T ve Comma v0.1-2T adlı iki yeni AI modelini eğitmek için kullanıldı.
OpenAI dahil olmak üzere AI şirketleri, kitap ve araştırma dergileri gibi telif hakkıyla korunan materyaller de dahil olmak üzere web’i tarayarak model eğitim veri kümeleri oluşturmaya dayanan AI eğitim uygulamaları nedeniyle davalara karışmış durumda . Bazı AI şirketlerinin belirli içerik sağlayıcılarıyla lisans anlaşmaları olsa da çoğu, ABD’nin adil kullanım yasal doktrininin, izinsiz telif hakkıyla korunan bir çalışma üzerinde eğitim aldıkları durumlarda onları sorumluluktan koruduğunu savunuyor.
EleutherAI, bu davaların yapay zeka şirketlerinin şeffaflığını “büyük ölçüde azalttığını” ve bunun da modellerin nasıl çalıştığını ve kusurlarının ne olabileceğini anlamayı zorlaştırarak daha geniş yapay zeka araştırma alanına zarar verdiğini savunuyor.
“[Telif hakkı] davaları [model] eğitiminde veri kaynaklama uygulamalarını anlamlı bir şekilde değiştirmedi, ancak şirketlerin uyguladığı şeffaflığı önemli ölçüde azalttı,” diye yazdı EleutherAI’nin yönetici direktörü Stella Biderman, Cuma günü erken saatlerde Hugging Face’te yayınlanan bir blog yazısında . “Konuştuğumuz bazı şirketlerdeki araştırmacılar, yüksek oranda veri merkezli alanlarda yaptıkları araştırmaları yayınlayamamalarının nedeni olarak davaları özellikle belirttiler.”
Hugging Face’in AI geliştirme platformundan ve GitHub’dan indirilebilen Common Pile v0.1, hukuk uzmanlarıyla istişare edilerek oluşturuldu ve Kongre Kütüphanesi ve İnternet Arşivi tarafından dijitalleştirilen 300.000 kamu malı kitap da dahil olmak üzere kaynaklardan yararlanıyor. EleutherAI ayrıca ses içeriğini yazıya dökmek için OpenAI’nin açık kaynaklı konuşma-metne modeli olan Whisper’ı kullandı.
EleutherAI, Comma v0.1-1T ve Comma v0.1-2T’nin, geliştiricilerin tescilli alternatiflerle rekabet edebilecek modeller inşa edebilmelerini sağlamak için Common Pile v0.1’in yeterince dikkatli bir şekilde düzenlendiğinin kanıtı olduğunu iddia ediyor. EleutherAI’ye göre, her ikisi de 7 milyar parametre boyutunda olan ve Common Pile v0.1’in yalnızca bir kısmında eğitilen modeller, kodlama, görüntü anlama ve matematik için kıyaslamalarda Meta’nın ilk Llama AI modeli gibi modellerle rekabet ediyor.
Bazen ağırlık olarak da adlandırılan parametreler, bir yapay zeka modelinin davranışlarını ve yanıtlarını yönlendiren dahili bileşenleridir.
Biderman yazısında, “Genel olarak, lisanssız metnin performansı yönlendirdiği yönündeki yaygın fikrin haksız olduğunu düşünüyoruz,” diye yazdı. “Erişilebilir açık lisanslı ve kamuya açık veri miktarı arttıkça, açık lisanslı içerik üzerinde eğitilen modellerin kalitesinin artmasını bekleyebiliriz.”
Common Pile v0.1, EleutherAI’nin tarihsel yanlışlarını düzeltme çabasının bir parçası gibi görünüyor. Şirket yıllar önce, telif hakkıyla korunan materyaller içeren açık bir eğitim metni koleksiyonu olan The Pile’ı yayınladı. AI şirketleri, modelleri eğitmek için The Pile’ı kullandıkları için eleştirilere ve yasal baskılara maruz kaldılar.
EleutherAI, araştırma ve altyapı ortaklarıyla iş birliği yaparak bundan sonra daha sık açık veri kümeleri yayınlamayı taahhüt ediyor.