Anthropic за сутки отыграла Fable назад. Но урок не в этом, а в том, кто рассказал вам о проблеме
Вчера я писал, что новая модель Anthropic умеет тихо работать хуже на части задач, и вы об этом не узнаете. За сутки история получила развязку: под давлением исследователей компания признала, что сделала ошибку. Теперь, если модель упирается в ограничение, она будет явно отказываться и переключаться на Opus 4.8, как это уже работает для биологии и кибербезопасности. Вы будете видеть это каждый раз.
Хорошая новость. Прозрачность вернули.
Но смотрите, что здесь главное. О тихом снижении качества вы узнали не от вендора. Об этом раскопали исследователи в 300-страничной системной карточке, подняли шум, и только после этого политику развернули. Вендор отыграл назад не потому что так задумывал, а потому что попался.
Для бизнеса вывод простой и неудобный. Релиз-ноуты и обещания вендора плохая опора, когда у вас в проде крутится агент. Опираться можно на свой тест.
Что это значит на практике. Соберите 10 типовых задач вашего бизнеса, на которых вы реально используете модель. Не бенчмарки из интернета, а ваши: разбор счёта, ответ клиенту, черновик коммерческого, сверка договора. Прогоните их при каждом обновлении модели. Десять задач, один вечер. Это ваш регрессионный тест, который ловит деградацию раньше, чем она ударит по выручке.
Кстати, независимая проверка уже появилась. Ребята, которые гоняют модели на реальных бизнес-задачах, поставили новую модель на десятое место: на задачах, где нужен точный ответ, она начинает додумывать лишнее. Для внедрений есть варианты дешевле и точнее. Модель тут ни при чём, важен принцип: смотрите на свои задачи, а не на витрину.
Доверие к AI держится на вашем контуре проверки, а не на вере в вендора.
А у вас есть свой тест на модель, или пока доверяете релиз-ноутам вендора?
Разбираю AI-инструменты для бизнеса с цифрами, без хайпа - в Telegram: https://t.me/gorilla_under_hood