Культ Роя: как ChatGPT подставил сотни нейросетей

Что такое «Культ Роя» и почему он появился
Термин «Культ Роя» родился в твиттере после публикации отчёта ИБ-компании. Рой — это метафора сети автономных агентов, которые действуют сообща. Вместо классического вируса — децентрализованная сеть, где каждый агент генерирует уникальные варианты вредоносного кода. Инструментом стал ChatGPT. Злоумышленники использовали API языковой модели для массовой генерации промптов. Так ChatGPT превратился из игрушки в полноценного участника атаки. Он создавал бесконечные вариации скриптов, обходя сигнатурные детекты. Если раньше вредоносные модели были статичными, то теперь они мутируют с каждым скачиванием.
Хронология: как заражение распространялось
Всё началось с обычного обновления библиотеки transformers. Через несколько дней специалисты заметили аномальный трафик с серверов. Анализ показал: в pickle-файлах — формате сериализации Python — скрыты команды. Они выполняются при десериализации. Затем атакующие форкнули легитимные модели и добавили в них вредоносный код, который автоматически распространялся по цепочке зависимостей. Хуже всего то, что Hugging Face позволяет любому загружать модели с произвольными именами. Проверка содержимого начинается только после попадания модели в тренды. Разработчикам это кажется удобным. Злоумышленникам — приглашением.
В чем суть? Это классическая эксплуатация доверия. Многие используют torch.load() для работы с моделями, не подозревая об опасности. Атакующие создавали модели с безобидными названиями вроде «bert-uncased-v2» и в конфигах активировали выполнение произвольного кода. ChatGPT помогал адаптировать атаки под конкретные библиотеки. Теперь у каждой жертвы был уникальный эксплойт.
Сравнение с прошлыми атаками
Атака SolarWinds в 2020 году показала, как бэкдор в обновлениях поражает сотни компаний. Вредоносные пакеты PyPI в 2022-м эксплуатировали тайпсквоттинг. «Культ Роя» опаснее. Во-первых, цель — разработчики ИИ, а их доверие к open-source безгранично. Во-вторых,














