Модель Anthropic продемонстрировала результат в 68,8% на бенчмарке ARC-AGI-2, который оценивает абстрактное мышление. Ранее все ИИ показывали нулевой результат, а средний показатель среди 400 живых людей составляет 60%. Каждая задача на ARC-AGI-2 уникальна и требует генерации правил на основе визуальных головоломок. Стоимость выполнения задания составила $3,64.

Команда ARC Prize подтвердила результаты на полуприватной выборке задач. В tests Opus 4.6 были проведены проверки на разных уровнях усилий с фиксированным бюджетом в 120 тысяч токенов. На уровне максимума результат составил 68,8%. В то время как предшествующая модель Opus 4.5 показала только 37,6%.

Хотя в графиках ARC-AGI-2 встречаются и более высокие цифры — примерно 72% у GPT-5.2 (Refine.), создатели бенчмарка продолжают искать идеальные результаты. Приз в $700 тысяч за достижение 85% по-прежнему остается невостребованным. В 2026 году планируется запуск ARC-AGI-3 с новой концепцией, включающей интерактивные среды.