Команда DeepReinforce анонсировала новую систему CUDA L2, способную автоматически генерировать GPU код для матричного умножения. Эффективность ее работы впечатляет: созданные ею HGEMM ядра показывают производительность на 10–30% выше, чем у библиотек cuBLAS и cuBLASLt, что вызывает большой интерес в индустрии. CUDA L2 меняет традиционные подходы к оптимизации, применяя комбинацию языковой модели и обучения с подкреплением. Вместо фиксированных шаблонов, система создает CUDA ядро с нуля под конкретные размеры матриц, а затем проверяет его на реальном оборудовании. Это позволяет свободно изменять ключевые аспекты ядра, такие как тайлинг и структура циклов. Генератором выступила DeepSeek 671B, обученная на большом количестве примеров, что позволяет обрабатывать около тысячи реальных конфигураций матриц. Тесты подтверждают, что в оффлайн режиме CUDA L2 на 17–22% быстрее torch.matmul и других решений, а в серверных сценариях – до 29%. Авторы публикуют оптимизированные A100 ядра и планируют расширить метод на новые архитектуры, что может сделать CUDA L2 новым стандартом в оптимизации.
Posted on : 06.12.2025 By Redactor
