Я прогнал одну и ту же задачу через три нейросети. Победитель не тот, кого я ждал

Одна и та же рутинная задача предпринимателя — разобрать длинную переписку с клиентом и вытащить из неё конкретные договорённости — через ChatGPT, Claude и Gemini. Ожидал, что выиграет тот, у кого больше на слуху. Не угадал.

Задача была намеренно скучной: никаких творческих промптов и генерации картинок — просто рабочая рутина: 40 сообщений переписки, нужно вытащить даты, суммы, кто на что согласился, и оформить в виде короткого резюме для второй стороны.

ChatGPT уверенно держит формат и хорошо оформляет результат, но иногда додумывает детали, которых в переписке не было — например, додумал срок оплаты, который стороны не оговаривали явно. Для черновика — отлично, для финального документа клиенту — нужна проверка каждой цифры.

Claude оказался аккуратнее именно в фактах: там, где что-то не было сказано прямо, честно писал «не указано», а не заполнял пробел правдоподобной догадкой. Для задач, где ошибка в цифре стоит денег, это перевешивает более гладкое оформление у конкурента.

Gemini хорошо парсит длинный контекст и не путается в порядке сообщений, но резюме получалось суше — просто перечисление фактов без структуры, которую можно сразу отправить клиенту.

Я думал, что для «рабочих» задач разница между топовыми моделями будет несущественной — мол, все более-менее одинаково умные. На практике разница не в общем интеллекте, а в том, где именно модель готова придумать недостающее, а где — честно развести руками. Для юридически значимых деталей (сроки, суммы, обязательства) это критично.

Не выбирай модель по хайпу или по тому, какая на слуху, — тестируй на своей реальной, скучной, рутинной задаче, а не на творческом промпте для впечатления. Если задача связана с фактами, которые нельзя додумывать, — проверь, как модель ведёт себя именно с пробелами в данных, а не только с качеством финального текста.

Разбираю нейросети именно под рабочие сценарии, без хайпа, в Telegram-канале «Нейродозор»: t.me/neurodozor_news