Anthropic'in Claude Opus 5 modeli, ARC-AGI-3 benchmark'inde %30,2 puanla önemli bir kırılım başardı. Önceki en yüksek başarı kaydı GPT-5.6 Sol tarafından belirlenen %7,8 idi; Opus 5 bu performansı neredeyse dört kattan fazla geride bıraktı.
Benchmark'in geliştiricileri, Opus 5'in bağımsız olarak yansıtma denklemleri (reflection equations) formüle etme davranışı gösterdiğini belirtti. Bu tür bir davranış başka bir modelden daha önce gözlemlenmemiş olup, güçlü mantıksal akıl yürütme yeteneğine işaret etmektedir. Geliştiriciler bu sonucu, modelin soyut problem çözme ve genelleştirme kapasitesinin bir göstergesi olarak değerlendiriyor.




