Разработчики компании Cursor представили итоги эксперимента, посвященного масштабированию автономных кодинг-агентов. В рамках проекта было запущено множество агентов, работающих одновременно, которые за несколько недель создали свыше миллиона строк кода. Целью эксперимента было выяснить, возможно ли ускорить процесс разработки, который обычно занимает у команд разработчиков месяцы.

Однако главной сложностью оказалась координация действий агентов. Когда им предоставили равные права и разрешили самостоятельно распределять задачи, лишь небольшая группа из двадцати агентов демонстрировала продуктивность, в то время как остальные ждали освобождения ресурсов. Отсутствие иерархии также приводило к тому, что агенты избегали сложных задач и выполняли только безопасные изменения. Решение проблемы заключалось в разделении ролей: планировщики анализируют код и создают задачи, а исполнители их реализуют и вносят изменения.

Для проверки системы агенты, используя GPT-5.2, получили задание создать браузер с нуля. За неделю работы они сгенерировали более трех миллионов строк кода, включая движок рендеринга на Rust. По словам CEO Cursor, Майкла Труэлла, хотя браузер и работает быстрее простых сайтов, ему еще далеко до уровня WebKit или Chromium. GPT-5.2 показала себя лучше других моделей в длительных задачах, сохраняя фокус и следуя инструкциям. Команда пришла к выводу, что качество промптов важнее, чем выбор модели или система, а масштабирование оказалось успешным, несмотря на существующие проблемы.