Экс-руководитель подразделения ИИ в Tesla, Андрей Карпати, завершил тренировку модели, которая по результатам бенчмарка CORE превзошла GPT-2, используя всего $73 и 3 часа на одном из восьми GPU H100. Для сравнения, оригинальная GPT-2 (с 1,5 млрд параметров) от OpenAI требовало более недели работы на 32 TPU v3 чипах и обошлась в $43 000. Падение цен на 600 раз за последние семь лет стало возможным благодаря быстроразвивающимся технологиям: новейшему оборудованию (H100 вместо TPU v3), улучшенному программному обеспечению (Flash Attention 3, torch.compile) и алгоритмическим усовершенствованиям (например, оптимизатор Muon). Каждый год Карпати оценивает снижение расходов на обучение GPT-2 примерно на 40%. В проекте nanochat использовано около 1000 строк кода и 768 млн параметров с 24 слоями и современными архитектурными решениями. В рамках инициативы запущен лидерборд, где разработчики конкурируют в скорости обучения моделей до уровня GPT-2 — текущий рекорд составляет 3,04 часа.