Специалисты Microsoft представили инновационный сканер, предназначенный для анализа безопасности языковых моделей с открытыми весами. Это исследование фокусируется на выявлении закладок, которые могут привести к нежелательным последствиям. Такие закладки, активируемые скрытыми триггерами — например, специфическими токенами — меняют поведение модели, что может использоваться злоумышленниками.Основные риски можно разделить на два типа: первый связан с внедрением вредоносного кода в файлы модели, а второй — с «отравлением» модели во время обучения. В последнем случае закладка внедряется в веса модели, влияя на её поведение без явных вредоносных кодов.Команда Microsoft выделяет три преждевременные сигнала, позволяющие отличить заражённые модели от чистых. Это изменения в механизме внимания, предсказуемость выводимых данных и непредсказуемое поведение при взаимодействии с триггерами. На основе этих наблюдений разработан практический сканер, который эффективно анализирует модели. Несмотря на ограничения, он обещает низкий уровень ложных срабатываний.
Posted on : 10.02.2026 By Redactor
