OpenAI сообщила, что временно замедлила темпы разработки и усилила требования к безопасности своих моделей
Поводом стали инцидент со взломом Hugging Face и предварительные данные о том, что будущая модель Astra может достичь «критического порога возможностей» в сфере кибербезопасности.
- OpenAI заявила о внедрении «более эффективных систем мониторинга и защиты разрабатываемых моделей».
- Компания пообещала усилить «контроль за безопасностью» моделей на всех этапах разработки. В частности, активнее следить за «подозрительным» поведением моделей, а также ограничить доступ моделей к «некоторым данным».
- OpenAI также начала применять дополнительные инструменты для ограничения доступа моделей к интернету и «более строгой» изоляции при выполнении задач «повышенного риска».
- Ещё одна мера — расширенный мониторинг рассуждений моделей. Система анализирует мысли и действия моделей, чтобы обнаружить попытки несанкционированного доступа к данным и обхода ограничений. Компания рассчитывает выявлять подозрительную активность «в течение 30 минут».
- Помимо этого, OpenAI на две недели приостановила процесс обучения с подкреплением (RL) для новейших моделей, а также отложила публичный запуск новых RL-моделей до завершения оценки и усиления мер безопаности.