Организация METR, специализирующаяся на оценке возможностей ИИ, обнародовала результаты тестирования Claude Opus 4.5 от компании Anthropic. Эта модель достигла рекорда, продемонстрировав 50%-горизонт в 4 часа 49 минут, что является лучшим показателем среди всех протестированных моделей. Для сравнения, предыдущий рекорд принадлежал GPT-5.1-Codex-Max от OpenAI с результатом 2 часа 53 минуты. METR оценивала не точность ответов, а продолжительность задач, которые ИИ способен выполнять без человеческого вмешательства. Показатель удваивается каждые 7 месяцев, начиная с нескольких секунд у GPT-2 в 2019 году. Однако исследователи предупреждают о необходимости осторожности в интерпретации результатов, так как доверительный интервал составляет от 1 часа 49 минут до 20 часов 25 минут. При более жестком пороге в 80% успеха, горизонт Opus 4.5 снижается до 27 минут, сопоставимого с другими современными моделями. Если текущая тенденция сохранится, к концу десятилетия ИИ сможет выполнять проекты, требующие месяца работы. Однако критики указывают на ограничения методологии METR и недостаток разнообразия в задачах.