Взлом Hugging Face: 65+ организаций заражены вредоносными моделями — что изменилось в 2026

Реестры моделей стали новым вектором атак. Разбираем кейс, после которого компании перестали доверять open-source ML.

В декабре 2024 года Hugging Face — крупнейший реестр открытых моделей — сообщил о несанкционированном доступе к платформе Spaces. Злоумышленники получили токены пользователей и внедрили в библиотеку вредоносные модели. Итог: затронуты 65+ организаций, а партия скам-моделей нашлась у крупнейших вендоров. Прошло больше года — но большинство команд до сих пор качают модели из реестра без какой-либо проверки.

Что именно произошло

Hugging Face официально объявил об инциденте 18 декабря 2024 года. Злоумышленники получили доступ к платформе Spaces и украли токены пользователей. Параллельно в библиотеку были загружены вредоносные модели, замаскированные под легитимные.

Главное отличие от обычных утечек: здесь атаковали не инфраструктуру, а цепочку поставок. Модель — это исполняемый код. Команда, которая подключает чужую модель к своим данным, фактически запускает чужой код внутри своей инфраструктуры. И в декабре 2024 года почти никто не воспринимал реестр моделей как поверхность атаки.

Как работали скам-модели

Механика была проще, чем кажется:

  • модели-клоны легитимных проектов размещались в публичном реестре;
  • при подключении они выполняли вредоносный код в окружении жертвы;
  • часть вредоносных моделей галлюцинировала код или выдавала поддельные инструкции в задачах с вызовом инструментов.

Наиболее резонансной находкой стали скам-модели у крупных вендоров: клоны DeepSeek находили в окружениях OpenAI, NVIDIA, Google и других компаний. Вредоносные клоны были способны эксфильтровать данные через запросы к инструментам — классическая атака на цепочку поставок, только объектом стала нейросеть.

Почему 65+ организаций — это только видимая часть

Hugging Face назвал цифру 65+ затронутых организаций. Но это те, кто подтвердил компрометацию. Реальное число компаний, скачавших заражённые модели, выше: журналы скачиваний реестра не раскрываются, а большинство команд не проверяет происхождение моделей.

Дополнительно инцидент показал, что токены реестра — это ключи к закрытым пространствам. Украденные токены позволяли читать частные датасеты и модели организаций, не оставляя следов.

Уроки, которые вынесли в 2026

За полтора года индустрия формализовала подходы:

Проверяйте происхождение. Модель должна браться из проверенного источника с известной историей. Рейтинг скачиваний — не признак безопасности.

Сканируйте код. Перед подключением модели выполняется анализ: подпись, hash, контроль версий. Идеальный случай — изолированный запуск в песочнице.

Отделяйте среду выполнения. Модель запускается в изолированном окружении с ограниченным доступом к сети и данным. Это правило из безопасности контейнеров переехало в ML-инфраструктуру.

Ротация токенов после инцидента. Hugging Face потребовал ротации токенов у всех затронутых пользователей — стандартная практика после компрометации.

Мониторинг подозрительных активностей. Организации начали отслеживать аномальные запросы к своим закрытым моделям и датасетам.

Что это значит для команд, которые строят на LLM

Если вы используете сторонние модели — вы в той же цепочке поставок. Разница лишь в том, кто качает модель: вы или ваш провайдер. Практические правила:

  • не подключайте модель без проверки источника и hash;
  • не давайте модели прямой доступ к инструментам и базам;
  • логируйте запросы и ответы — аномалии видны постфактум;
  • для критичных данных используйте закрытые модели, а не публичные копии.

Вывод

Взлом Hugging Face стал водоразделом: после него «скачал и запустил» перестало быть нормой. Модель — это код, а код из открытого реестра требует проверки. Те, кто внедрил проверку источников и изоляцию среды, прошли 2025-й без инцидентов. Остальные — до сих пор гадают, что именно они запускали.

Если вы работаете с ИИ-инфраструктурой и хотите разобраться в безопасности моделей

ии компьютер
ии компьютер