Artificial Analysis, yapay zeka modellerinin puanlama sistemini bir hafta içinde üç kez güncelledi. 7 Eylül'de yayımlanan v4.3 sürümünde OpenAI'ın GPT-6 Astra ve Anthropic'in Claude Fable 5.1 modelleri 53 puanda eşitlenirken, maliyet açısından Astra'nın daha avantajlı olduğu belirtildi.
Güncellemeler, sektördeki hızlı ilerlemeyi yansıtıyor. v4.1.1'de Astra 61, Fable 5.1 ise 66 puan almıştı. Yeni kriterler ve testlerin eklenmesiyle puanlar değişti ve gizli test oranları artırıldı. Bu durum, modellerin performansını daha iyi değerlendirmek için önemli bir adım olarak değerlendiriliyor.
Yapay zeka puanlama sistemindeki bu hızlı değişim, kullanıcıların maliyet ve performans dengesini daha iyi anlamalarına yardımcı olacak. Takip edilmesi gereken bir sonraki gelişme, v5 sürümündeki gizli test oranlarının artışı ve yeni kriterlerin etkisi olacak.