Moonshot AI tarafından geliştirilen PerceptionBench kıyaslaması, çok modlu yapay zeka modellerinin mantıksal muhakeme yapabilirliklerinden bağımsız olarak görsel algıda ne derece başarılı olduğunu ölçüyor. Test sonuçlarına göre, yapay zeka alanında öncü sayılan hiçbir model yüzde 60 doğruluk eşiğini aşamıyor.
Karşılaştırmada GPT-5.6 Sol dar bir farkla öncü sırayı alsa da, bu da görsel algı performansının sınırlı kaldığını gösteriyor. Araştırma, daha öncesinde model akıl yürütme hatalarından kaynaklandığı düşünülen pek çok hatalı çıktının aslında görüntü okuma aşamasında meydana geldiğini ortaya çıkarıyor.
Bu bulgu, çok modlu yapay zeka sistemlerinin görsel bilgi işlemede önemli zayıflıklara sahip olduğunu ve mevcut mimarilerin bu konuda iyileştirilmesi gerektirdiğini göstermektedir.





