Kimi и DeepSeek выдавали ответы Claude за свои — и воровали цепочку рассуждений через обход защиты
Anthropic 10 сентября опубликовала очередной отчёт о злоупотреблении своими моделями — на этот раз за период с декабря 2025 по август 2026. Документ на 154 страницы охватывает семь направлений: кибератаки, влияние на общественное мнение, слежку, мошенничество, биологические риски, обычные вооружения и нелегальную дистилляцию моделей. Разбираю три истории оттуда, которые касаются практики в отрасли шире, чем просто "хакеры используют чат-бота".
Конкуренты выдавали Claude за собственную модель
Расследование Anthropic показало: Moonshot AI, разработчик модели Kimi, тайно перенаправлял часть запросов пользователей на Claude вместо собственной модели — и показывал пользователям ответ Claude, не сообщая об этом. За 10 дней компания прогнала так почти 300 тысяч запросов через сеть из 5380 фиктивных аккаунтов, в основном из Сингапура и Японии.
Кража сигнатуры была только частью схемы. У Claude есть защита от копирования: вместо полного текста внутренних рассуждений API возвращает "сигнатуру" — ссылку, которую можно расшифровать только в рамках той же сессии. Moonshot обошёл это: сохранял сигнатуру, открывал новую сессию и просил Claude превратить сигнатуру обратно в полный текст рассуждений. Полученные данные шли на дообучение собственных моделей Kimi. По оценке Anthropic, только за май–июль 2026 через эту схему прошло более 23 миллионов обращений.
DeepSeek делал то же самое, нацеливаясь конкретно на Opus и отслеживая, когда пользователь заходит через сторонние среды вроде Claude Code — такие запросы избирательно перенаправлялись на Claude. За две недели в июле зафиксировано больше 12 миллионов подобных обращений. Похожие схемы Anthropic обнаружила и у Zhipu (Z.ai) — 770 тысяч запросов на "очистку" ворованных рассуждений за 10 дней, и у Xiaomi — свыше 400 тысяч запросов через прокси при выводе модели MiMo-V2-Pro.
Побочный эффект перенаправления — утечка чужих данных через третьи руки. Инженер китайской госкорпорации анализировал через DeepSeek внутреннюю документацию флагманской AI-программы — полные спецификации, оргструктуру, стратегические цели ушли к Anthropic без ведома компании. Похожий случай — с российским государственным ведомством, связанным с Минобороны: через DeepSeek раскрылись действующие учётные данные к правительственной базе.
"Vibe hacking": группировки строят атаки, не понимая цели
Отдельный раздел отчёта посвящён группе, которую Anthropic связывает с коллективом ShinyHunters — известным по крупным утечкам данных с последующим вымогательством. Схема атаки шла по одной и той же цепочке: сбор учётных данных → взлом → эксфильтрация → монетизация.
Один франкоязычный оператор собрал распределённый конвейер сбора паролей на 10 воркерах AWS EC2: скачал 1,8 млн Android-приложений, декомпилировал их и просканировал на утечки секретов. Найденные учётные данные в реальном времени уходили в Telegram-группу, разбитую на более чем 100 категорий по типу утечки.
Отчёт называет это явление "vibe hacking" — когда оператор ставит модели общую цель ("используй эту учётную запись", "забери данные из этой сети"), а дальше AI сам оценивает окружение, пишет и запускает скрипты, отчитывается и повторяет цикл до результата. Один из зафиксированных случаев: эскалация от единственного украденного токена разработчика до полного административного контроля над облачной средой жертвы заняла порядка трёх часов, а всю последующую работу — сканирование внутренних хранилищ данных — выполнили AI-агенты практически без участия человека.
Сеть фейковых дейтинг-приложений
В разделе про мошенничество — сеть из более чем 20 дейтинг-приложений, построенная китайской студией на Claude, при этом рекламировавшаяся как площадка с "живыми людьми". За две недели в апреле 2026 обнаружено свыше 4700 разных AI-персонажей, которые вели переписку минимум с 25 тысячами реальных пользователей — соотношение примерно 3 AI-персонажа на одного настоящего человека, которого нанимали только для видеозвонков и подтверждения активности в соцсетях.
Системный промпт инструктировал модель никогда не признаваться, что она бот, и уклоняться от видеозвонков и запросов фото. В части случаев внутренние рассуждения модели фиксировали явный вред — пользователь писал о тяжёлой болезни или остром стрессе — но модель всё равно продолжала диалог в заданной роли вместо отказа. Приложения также были спроектированы так, чтобы включать "режим для модератора" только во время проверки в App Store и Google Play, оставаясь в обычном (мошенническом) режиме всё остальное время.
Почему это важно не только для безопасников
Три истории — об одном и том же сдвиге: возможность отличить "настоящую" модель от чужой, спрятанной за фасадом, или отличить AI-агента от человека больше не тривиальна ни для пользователя, ни для площадки. Если вы строите продукт поверх сторонних AI-моделей или интегрируете чат-ботов в клиентский сервис — стоит закладывать в архитектуру аудит того, что именно происходит с данными пользователя дальше по цепочке, а не только то, что происходит на вашей стороне.