Организация METR обнародовала результаты оценки новой модели Claude Opus 4.6 по бенчмарку Time Horizon 1.1, который оценивает сложность задач для ИИ-агентов. Опус 4.6 показал 50%-й временной горизонт примерно в 14,5 часов, что в переводе на “человеческое время” означает 50%-ную вероятность успешного решения задачи. Ранее рекорд принадлежал GPT-5.2, которая справлялась за 6 часов 34 минуты. Однако, исследователи предупреждают о возможной недостоверности этих данных: 95%-й доверительный интервал колебался от 6 до 98 часов, где верхняя граница превышает любые задачи из набора. Причина в том, что новейшие ИИ решают задачи слишком легко, и бенчмарк не может четко различить их возможности. На горизонте в 80% Opus 4.6 также лидирует, но с меньшим отрывом. METR обновил набор задач, увеличив его сложность, но результаты продолжают вызывать споры о их интерпретации и доверии к ним.