Заплатил за Claude втрое больше, а рецензент вслепую выбрал дешёвую модель
130 секунд и 80 центов. Столько модель Fable 5.1 потратила на один мой новостной пост. Opus 5.5 написал тот же пост за 34 секунды и 17 центов.
Я прогнал обе модели на десяти своих новостях, чтобы понять, стоит ли доплачивать за модель классом выше. Короткий ответ: нет. Слепой рецензент выбрал Opus в шести случаях и Fable в четырёх, каждый раз с небольшим перевесом. Платить при этом пришлось бы втрое больше.
Примерно как такси бизнес-класса на два квартала: приедете туда же и не быстрее, а счёт другой.
Зачем мне это
Немного контекста. Я веду две новостные ленты про ИИ, Claude News и Promtime. Новости для них переписывает Claude: берёт источник на английском и делает из него пост на русском по правилам канала. Первая лента для разработчиков: релизы Claude, API, цены. Вторая шире, про ИИ в целом и попроще языком.
Каждый пост делается на двух языках и в нескольких форматах, от длинного для Telegram до короткого для соцсетей. В день набегает несколько десятков запросов на переписывание. На Opus 5.5 это стоит примерно 150 долларов в месяц, на Fable вышло бы около 500.
За такую разницу хочется увидеть результат своими глазами, а не поверить таблице бенчмарков. Бенчмарки чаще меряют математику и код. У меня задача другая: пересказать новость точно, живо и строго по формату.
Стенд для сравнения я руками не писал. Его собрал Claude Code, я ставил задачу и проверял результат.
Как сравнивал
Взял по пять последних опубликованных постов из каждой ленты. Только те, у которых один источник длиной от 600 до 20 000 знаков.
Обе модели получили ровно то, что получает рабочий конвейер: правила канала, описание стиля, примеры хороших постов и подсказку для концовки. Запрос собирал тот же код, что и в бою. Обе вызывались напрямую через API с одинаковыми настройками, по одному прогону на пост.
Оценивал не я. Тексты ушли отдельной сессии Claude под метками A и B, перемешанными для каждого поста. Рецензент не знал, где чья модель. Он сверял цифры и имена с источником и ставил от 1 до 5 по семи критериям: факты, заголовок, структура, язык, концовка, короткий пост для соцсетей и соблюдение правил канала.
Рецензенту на слово тоже не поверили. Пять из найденных им искажений перепроверили по источникам отдельно, все подтвердились. Ещё около двадцати цифр и имён из текстов обеих моделей сверили выборочно, расхождений не нашлось.
Что получилось
Цена и время здесь медианные. Все десять решений рецензент назвал небольшим перевесом, ни одного разгрома.
По отдельным критериям картина такая. Fable чуть точнее в фактах: 4,4 против 4,3. Opus лучше в концовке (4,5 против 4,2) и в коротком посте для соцсетей (4,2 против 3,8).
Есть деталь, которую легко пропустить за общим счётом. В ленте для разработчиков рецензент выбрал Fable в четырёх постах из пяти. В массовой ленте он выбрал Opus во всех пяти. Пять постов слишком мало для твёрдого вывода, но направление понятное: плотный и точный текст выигрывает там, где читатель технарь.
Чем модели всё-таки отличаются
Fable копает глубже. Источником была страница с замерами новой модели Haiku 5.5. Обе модели вынесли в заголовок главное: первого токена ответа ждут 415 секунд. Opus закончил пост тем, что ожидание зато стоит недорого: 10 центов за миллион входных токенов.
Fable заметила то, чего в прайсе не видно. Модель очень многословна, поэтому по стоимости одной задачи она только 46-я из 182. Это и есть настоящая новость. Но этот пост занял у Fable 130 секунд и стоил 80 центов, а у Opus 34 секунды и 17 центов.
Fable хуже держит рамки. В новости про Meta и Microsoft короткий пост для соцсетей вышел у неё на 248 знаков при жёстком потолке 240. У Opus вышло 164. Это единственное нарушение длины на весь прогон, и именно оно решило исход по этому посту. Восемь лишних знаков, и пост проигран.
Fable смелее обобщает и на этом ошибается. В новости про GPT-6 она написала в заголовке: «Sol для платных и Luna для бесплатных». В источнике Luna идёт на тарифы Free и Go, а Go платный. Рецензент снял за это балл и добавил, что без этой ошибки заголовок Fable был бы сильнее.
Почему дорогая модель дороже, чем кажется
По прайсу Fable дороже Opus в 2,5 раза: 10 и 50 долларов за миллион входных и выходных токенов против 4 и 20. На деле пост вышел дороже в 3,2 раза по медиане и в 3,7 раза в среднем. Причины две.
Первая: запрос у меня большой. Каждое переписывание несёт 16–24 тысячи входных токенов: правила канала, описание стиля, примеры хороших постов. Сам источник занимает меньшую часть. У Fable один только вход стоит в среднем 19 центов. Это больше, чем весь вызов Opus вместе с ответом. Fable ещё не написала ни слова, а уже обошлась дороже готового поста.
Вторая: Fable дольше думает. На рассуждение и ответ она тратит в среднем 6,2 тысячи выходных токенов, Opus тратит 3 тысячи. Выходные токены самые дорогие, и время берётся отсюда же: 63 секунды против 29, а в худшем случае 130.
Вывод для расчётов: умножать счёт на разницу в прайсе нельзя. Модель классом выше ещё и расходует больше токенов на ту же задачу.
Чего этот тест не доказывает
- Десять постов и один прогон на каждый. Этого хватает, чтобы увидеть, что большого разрыва нет. Уверенно сказать, какая модель лучше при малой разнице, по такой выборке нельзя.
- Рецензент тоже Claude. Метки были скрыты, но вкус у него может быть смещён в сторону своих.
- В стенде не было двух блоков, которые конвейер добавляет в бою: «мы об этом уже писали» и ссылок на связанные посты.
- Это вывод про одну задачу: пересказ новости по готовому источнику с жёсткими правилами. Про код, длинные рассуждения или работу агентом он ничего не говорит.
Что я решил
Переписывание остаётся на Opus 5.5. Обе модели не выдумали ни одного факта и ошибались по мелочи примерно одинаково часто. Похоже, в моей задаче качество упирается в правила и примеры в запросе, а не в класс модели.
К Fable вернусь, если появится лента, где докопаться до сути важнее, чем уложиться в формат. Пример с Haiku 5.5 показывает, что там она свои деньги отрабатывает.
Если у вас похожая развилка, не верьте ни бенчмаркам, ни ощущениям. Возьмите десять своих настоящих задач, прогоните обе модели и отдайте результат на слепую оценку. У меня двадцать вызовов обошлись в 6 долларов 36 центов. Не проверить стоило бы около 350 в месяц.
Лента, на которой всё это проверялось: Claude News в Telegram.