В последнее время наблюдается активное развитие больших MoE (Mixture of Experts) моделей, которые требуют меньше активных параметров по сравнению с Dense моделями. Эти модели используют уникальный подход к распределению ресурсов, что позволяет им функционировать даже на одном GPU с минимальным объемом VRAM. В отличие от Dense архитектур, где каждый слой представлен массивным блоком, в MoE используется сеть из небольших экспертных блоков, что делает их менее ресурсоемкими.

Процесс генерации токена включает выбор нескольких экспертов, что обеспечивает экономию ресурсов. Например, модель GPT-OSS-120B активирует всего 4 эксперта на каждом шаге, что позволяет сократить затраты на 24 раза по сравнению с традиционными моделями. Оптимизация использования видеопамяти и перераспределение тензоров между CPU и GPU также способствуют увеличению скорости обработки.

Разные архитектуры MoE моделей обладают различной эффективностью, и выбор оптимальных параметров, таких как —cmoe и —ncmoe, позволяет адаптировать производительность под конкретные задачи. Это открывает новые возможности для использования MoE в различных областях, включая генерацию видео и другие типы нейросетей.