Взлом Hugging Face: 65+ организаций заражены вредоносными моделями — что изменилось в 2026
Реестры моделей стали новым вектором атак. Разбираем кейс, после которого компании перестали доверять open-source ML.
В декабре 2024 года Hugging Face — крупнейший реестр открытых моделей — сообщил о несанкционированном доступе к платформе Spaces. Злоумышленники получили токены пользователей и внедрили в библиотеку вредоносные модели. Итог: затронуты 65+ организаций, а партия скам-моделей нашлась у крупнейших вендоров. Прошло больше года — но большинство команд до сих пор качают модели из реестра без какой-либо проверки.
Что именно произошло
Hugging Face официально объявил об инциденте 18 декабря 2024 года. Злоумышленники получили доступ к платформе Spaces и украли токены пользователей. Параллельно в библиотеку были загружены вредоносные модели, замаскированные под легитимные.
Главное отличие от обычных утечек: здесь атаковали не инфраструктуру, а цепочку поставок. Модель — это исполняемый код. Команда, которая подключает чужую модель к своим данным, фактически запускает чужой код внутри своей инфраструктуры. И в декабре 2024 года почти никто не воспринимал реестр моделей как поверхность атаки.
Как работали скам-модели
Механика была проще, чем кажется:
- модели-клоны легитимных проектов размещались в публичном реестре;
- при подключении они выполняли вредоносный код в окружении жертвы;
- часть вредоносных моделей галлюцинировала код или выдавала поддельные инструкции в задачах с вызовом инструментов.
Наиболее резонансной находкой стали скам-модели у крупных вендоров: клоны DeepSeek находили в окружениях OpenAI, NVIDIA, Google и других компаний. Вредоносные клоны были способны эксфильтровать данные через запросы к инструментам — классическая атака на цепочку поставок, только объектом стала нейросеть.
Почему 65+ организаций — это только видимая часть
Hugging Face назвал цифру 65+ затронутых организаций. Но это те, кто подтвердил компрометацию. Реальное число компаний, скачавших заражённые модели, выше: журналы скачиваний реестра не раскрываются, а большинство команд не проверяет происхождение моделей.
Дополнительно инцидент показал, что токены реестра — это ключи к закрытым пространствам. Украденные токены позволяли читать частные датасеты и модели организаций, не оставляя следов.
Уроки, которые вынесли в 2026
За полтора года индустрия формализовала подходы:
Проверяйте происхождение. Модель должна браться из проверенного источника с известной историей. Рейтинг скачиваний — не признак безопасности.
Сканируйте код. Перед подключением модели выполняется анализ: подпись, hash, контроль версий. Идеальный случай — изолированный запуск в песочнице.
Отделяйте среду выполнения. Модель запускается в изолированном окружении с ограниченным доступом к сети и данным. Это правило из безопасности контейнеров переехало в ML-инфраструктуру.
Ротация токенов после инцидента. Hugging Face потребовал ротации токенов у всех затронутых пользователей — стандартная практика после компрометации.
Мониторинг подозрительных активностей. Организации начали отслеживать аномальные запросы к своим закрытым моделям и датасетам.
Что это значит для команд, которые строят на LLM
Если вы используете сторонние модели — вы в той же цепочке поставок. Разница лишь в том, кто качает модель: вы или ваш провайдер. Практические правила:
- не подключайте модель без проверки источника и hash;
- не давайте модели прямой доступ к инструментам и базам;
- логируйте запросы и ответы — аномалии видны постфактум;
- для критичных данных используйте закрытые модели, а не публичные копии.
Вывод
Взлом Hugging Face стал водоразделом: после него «скачал и запустил» перестало быть нормой. Модель — это код, а код из открытого реестра требует проверки. Те, кто внедрил проверку источников и изоляцию среды, прошли 2025-й без инцидентов. Остальные — до сих пор гадают, что именно они запускали.
Если вы работаете с ИИ-инфраструктурой и хотите разобраться в безопасности моделей