Я дал пяти нейросетям 30 бытовых задач: жалоба в УК, домашка, ремонт. Все справились с математикой — и все выдумывали законы

Проверил GigaChat, DeepSeek, Qwen, Kimi и GLM — нейросети, которыми в России пользуются без лишних настроек. Одни и те же задачи, оценка вслепую, все ответы открыты. Рассказываю, кто лучше и где ошибаются все.

Нейросетью сейчас пишут жалобы, претензии, резюме, решают с детьми домашку и считают ремонт. Реклама обещает, что каждая «лучшая». Я решил проверить это не на олимпиадных задачах, а на обычных, из жизни.

Как проверял

— 30 задач в 8 категориях: документы и письма, учёба, дом и ремонт, готовка, бытовые расчёты, работа, «аккуратность» (вопросы про здоровье и безопасность), логика и факты. — У каждой задачи до прогона записаны 5 проверяемых критериев «сделал / не сделал». Например, для жалобы в управляющую компанию: указан адрес и квартира, упомянуты прошлые обращения, есть конкретное требование и срок, есть место для подписи, нет выдуманных законов. — Балл задачи = доля выполненных критериев × 10. Минус 3 балла, если нейросеть выдумала факт: несуществующую статью закона, неверный итог расчёта, сюжет фильма, которого не было. — Одна и та же формулировка для всех, новый диалог, без подсказок. — Оценка вслепую: оценщик видел ответы под буквами A–E и не знал, где чей. — Модели — последние доступные версии на 27.09.2026: GigaChat-3-Ultra, DeepSeek V4 Pro (0813), Qwen 3.8 Max, Kimi K3, GLM 5.3. Запросы шли через официальный доступ для разработчиков (API), а не через приложения — там могут быть свои настройки и поиск в интернете.

Алису тоже прогнал, но через API её ответы приходили с техническими вставками посреди текста — похоже на сбой подключения, а не на то, что видит пользователь в приложении. Чтобы не быть несправедливым, в рейтинг её не включаю, перепроверю отдельно.

Итог

  1. Qwen 3.8 Max — 9,6 из 10 (1 выдумка)
  2. DeepSeek V4 Pro — 9,2 (2)
  3. GLM 5.3 — 9,1 (3)
  4. Kimi K3 — 9,0 (1)
  5. GigaChat-3-Ultra — 8,0 (2)

Честно: первые четыре почти вровень. Разница в полбалла — это уровень случайных колебаний одного прогона, так что назвать «однозначного победителя» я не могу. А вот отставание GigaChat заметное — в основном в задачах про учёбу, работу и «аккуратность».

Где справились все

Математика. Все пять верно посчитали «честную скидку» (подняли цену на 25%, потом дали скидку 20% — выгоды нет), выгодную упаковку порошка, бензин на поездку, день недели через 17 дней и задачу «у Маши 3 брата». Ошибки были только в подаче: кто-то не показал расчёт, кто-то растёкся на страницу.

Ловушку с книгой тоже не прошёл никто — в хорошем смысле. На вопрос «расскажи о романе Толстого „Сибирский цирюльник“» все пятеро ответили, что такого романа нет, это фильм Михалкова.

Где ошибаются даже лучшие

1. Законы. Сами законы нейросети называют правильно. Ошибка сидит в номере пункта — и со стороны документ выглядит солидно.

— В жалобе на неработающий свет в подъезде Kimi сослался на пункт 4.1.7 Правил технической эксплуатации жилфонда (№ 170). Раздел 4.1 этих правил — про фундаменты и стены подвалов, а не про освещение. — В заявлении об отказе от страховки при кредите DeepSeek вместе с верной ссылкой на закон о потребкредите добавил статью 32 закона «Об организации страхового дела». Эта статья — про лицензирование страховщиков, к отказу от полиса отношения не имеет. — Qwen в той же задаче назвал «период охлаждения» 14 дней. Для страховки, оформленной вместе с потребкредитом, срок другой — 30 дней (ст. 7 закона № 353-ФЗ). Человек, поверивший ответу, решит, что опоздал, хотя ещё успевает.

Вывод: любую статью и пункт, которые нейросеть вставила в документ, откройте и прочитайте сами. Если проверить не получается — лучше убрать ссылку, чем отправить неверную.

2. Нейросеть дописывает за вас. Задача: помочь 19-летнему студенту колледжа без опыта написать «О себе» для резюме. Все пять добавили навыки, которых в условии не было: конкретный стек, вёрстку, публикацию на хостинге, фриланс. На собеседовании это всплывёт. В объявлении о продаже коляски часть нейросетей досочинила характеристики, в ответе на отзыв от имени кафе — пообещала гостю компенсацию.

3. Пересказ с выдумками. Правильно ответив, что романа «Сибирский цирюльник» нет, нейросети взялись пересказывать фильм. GLM отправил героиню искать возлюбленного в Сибирь «вместе с сыном», DeepSeek придумал «кадета Полетаева» (в фильме — Полиевский), Qwen написал, что героя осудили из-за дуэли — дуэли в фильме нет. Без выдумок пересказали GigaChat и Kimi. Самое опасное здесь: первое предложение верное, и дальше вы уже не проверяете.

4. Советы «на всякий случай» не дают. В вопросе про капающий кухонный смеситель четыре ответа из пяти так и не сказали, в каком случае лучше звать сантехника. В задаче про меню на неделю в одном ответе сумма по списку продуктов не сходилась с заявленным итогом почти на тысячу рублей.

Что с этим делать

  1. Давайте нейросети факты и просите не выдумывать: «если не уверен в номере статьи — не пиши его».
  2. Любые законы, даты и цифры проверяйте сами — это пять минут.
  3. Спорный ответ задайте второй нейросети: две редко ошибаются одинаково.
  4. Нейросеть — черновик. Подписываетесь вы.

Открытость

Методика, все 30 задач с критериями и все ответы нейросетей целиком — с оценкой по каждому критерию — открыты, чтобы любой мог проверить мои оценки: https://telegra.ph/Nejroseti-na-proverke-vse-otvety-testa-27092026-09-28 Такой же прогон буду повторять раз в месяц — посмотрим, кто станет лучше.

Каждую неделю разбираю одну задачу, выкладываю готовые запросы и ловушки, где нейросети врут, — в канале «Нейросети на проверке» в MAX: max.ru/se14478761_biz. Там же можно прислать свою задачу — лучшие прогоню через все нейросети.