Модель GPT-5.4 заняла верхнюю строчку в Vibe Code Bench v1.1, набрав 67,42%, что на 5,7 процентных пункта выше, чем у предшественника GPT-5.3 Codex, который показал результат 61,77%. На третьем месте оказалась Claude Opus 4.6 без режима рассуждений с 57,57%. Этот бенчмарк фокусируется не на исправлении ошибок, а на расширенной способности модели создать полноценное веб-приложение с нуля — от пустой папки до готового сервиса на основе текстовых описаний.
Тест состоял из 100 заданий, разделенных на публичную и тестовую категории. Каждое приложение требовало работы модели в ограниченной среде с доступом к современным инструментам, включая базы данных и системы аутентификации. Кандидаты, включая аналоги известных сервисов и трекеры привычек, имели до пяти часов на выполнение задач, результат оценивался по количеству работающих функций.
Стоит отметить, что при анализе производительности Claude Opus 4.6 показал близкие к лидеру результаты, но с меньшими затратами, что важно для разработчиков. Несмотря на успех, около трети решений GPT-5.4 все еще не соответствуют требованиям, и результаты варьируются: от успешных (87–100% тестов) до практически провальных (0–12,5%). Прогресс за последние полгода впечатляет, так как ранее лучший результат был вдвое скромнее.
