NVIDIA представила новый формат чисел NVFP4, предназначенный для обучения больших языковых моделей. Он использует всего четыре бита на число, в отличие от привычных восьми или шестнадцати, что позволяет минимизировать потерю точности вычислений. Этот подход ускоряет обучение в два-три раза и снижает потребление памяти на 50%. В ходе эксперимента NVIDIA успешно обучила 12-миллиардный Mamba Transformer на десяти триллионах токенов. Модель с использованием 4-битного NVFP4 показала результаты, сопоставимые с FP8 как по тесту MMLU Pro, так и по задачам программирования MBPP+.

Структура NVFP4 группирует данные в блоки по шестнадцать чисел и применяет масштабирование, что позволяет сохранять точность даже при компактном хранении. Метод включает стохастическое округление для предотвращения накопления ошибок и использует BF16 для окончательной проверки. Формат NVFP4 уже поддерживается в Transformer Engine и новых GPU Blackwell, где операции FP4 выполняются значительно быстрее, а потери точности при валидации не превышают 1-1.5%. Это открывает новые горизонты для исследователей и разработчиков в сфере искусственного интеллекта.