Праздник непослушания: ИИ модели могут лишь притворяться, что слушают инструкции

Исследователи выяснили, что ИИ модели могут только на словах соглашаться следовать инструкциям, преследуют свои собственные цели (да-да, все как у людей!). Почему исследователи сделали такой вывод, чем это грозит, и как собираются исправлять?

🔥 Еще больше интересного в моем канале Продуктовые штучки

2
1

OpenAI финансирует научные исследования для создания «морального искусственного интеллекта»

** Еще больше интересного в моем канале продуктовые штучки**

Расскажу, что это такое и главное — зачем.

3

ИИ-агент нарушил правила ради пользователя. Почему ИИ агенты могут стать новой проблемой

Когда мы представляем будущее с ИИ-агентами, то обычно думаем о помощниках, которые экономят время и приносят пользу. Но что произойдёт, если агент начнёт «слишком эффективно» добиваться цели? Недавний случай показал это в жизни: агент отменил чужую запись и продвинул своего владельца в очереди. Почему это важный пример проблемы выравнивания — вопр…

ИИ-агент нарушил правила ради пользователя. Почему ИИ агенты могут стать новой проблемой
1

ИИ-агенты OpenAI создали тайную доску сообщений перед атакой на Hugging Face

Помните историю с тайным взломом ИИ-агентов Hugging Face, о котором стало известно только спустя несколько дней? Тогда выяснилось ещё кое-что: агенты оставили сообщение для будущих участников системы, и это звучало как сюжет из не самой удачной научной фантастики. Но история получила продолжение. Почему такие случаи всё меньше похожи на фантастику…

ИИ-агенты OpenAI создали тайную доску сообщений перед атакой на Hugging Face
4

📌Подстраивается ли модель под того, кто её оценивает?

📌Подстраивается ли модель под того, кто её оценивает?

OpenAI и лаборатория Apollo Research представили (https://alignment.openai.com/measuring-reward-seeking/) совместную работу с описанием метода Contrastive SDF (https://www.apolloresearch.ai/wp-content/uploads/2026/07/Measuring_Reward_Seeking_Apollo_Research.pdf) (Contrastive Synthetic Document Finetuning).

1

Как заставить ИИ не халтурить, если модель умнее проверяющего

Как заставить ИИ не халтурить, если модель умнее проверяющего

📌Как заставить ИИ не халтурить, если модель умнее проверяющего

2

Модель Claude Sonnet 4.5 от Anthropic распознает, когда ее тестируют

Сравнительные оценки "невыравненного поведения" <a href="https://api.vc.ru/v2.8/redirect?to=https%3A%2F%2Fwww.anthropic.com%2Fnews%2Fclaude-sonnet-4-5&postId=2263228" rel="nofollow noreferrer noopener" target="_blank">Источник</a>

Новейшая модель искусственного интеллекта от Anthropic, Claude Sonnet 4.5 способна распознавать, когда ее тестируют. И д…

2