De acordo com o mais recente benchmark da Artificial Analysis, Claude Opus 5 atingiu uma pontuação de 61 no Índice de Inteligência, ultrapassando por pouco a pontuação de 60 do Fable 5. O GPT-5.6 Sol obteve 59, e o Kimi K3 marcou 57.
O Opus 5 tem uma média de 2,03 dólares por tarefa, 26% abaixo dos 2,75 dólares do Fable 5. O modelo liderou as avaliações nos testes GDPval-AA v2 e AA-Briefcase para trabalho de conhecimento, e ficou em primeiro lugar no índice de agentes de programação quando emparelhado com Claude Code. Conseguiu 89% no Terminal-Bench v2.1, ficando muito perto do desempenho do GPT-5.6 Sol.