ChatGPT и таблицы: 2,5 из 10 против заявленных вендором 87% — кому верить перед отчётом
Сотрудник, который поручает чат-боту выгрузку, должен знать не что ChatGPT умеет, а где именно он врёт правдоподобно.
Два числа, которые не сходятся
OpenAI утверждает, что на внутреннем бенчмарке построения финансовой модели точность ChatGPT выросла с 43,7% до 87,3% за одно поколение моделей — это цифра из обзора ChatGPT for Excel, пересказывающего заявление вендора. Через два месяца независимая финансовая школа Wall Street Prep дала тому же инструменту на реальной задаче — построении трёхстраничной модели Apple по данным SEC — 2,5 балла из 10, худший результат среди четырёх протестированных инструментов. В рейтинге Wall Street Prep указано: ChatGPT вписывал итоговые числа напрямую в ячейки вместо формул со ссылками и ошибся в прогнозе количества акций — базовой цифре для любого расчёта на акцию.
Это не «модель устарела за два месяца». Это разные методологии измерения одного и того же навыка. Вендорский бенчмарк меряет то, что удобно измерить и показать в презентации. Независимый тест меряет то, с чем реально столкнётся финансист: полную модель, а не изолированную подзадачу. Если вы принимаете решение — доверять ли числу от ChatGPT в отчёте, — вторая цифра ближе к вашей реальности, чем первая.
Где формулы действительно держатся
Прежде чем ставить крест на инструменте, стоит зафиксировать, где GPT таблицы обрабатывает уверенно, а где — нет. В тесте Talkory на 30 задачах по восьми категориям ChatGPT-4o набрал 69 из 90 баллов — не лидер выборки, но крепкий средний результат. Стандартные ВПР и ПРОСМОТРX на одном чистом листе, СУММЕСЛИМН, сортировка, базовая сводная таблица — здесь ошибка редкость, а не система. Академический бенчмарк SpreadsheetBench на 912 реальных задачах с форумов Excel подтверждает: на первой, более простой версии датасета лучший результат моделей — 70,48%.
А дальше начинается обрыв. На второй версии SpreadsheetBench, где задачи требуют многошаговых workflow и работы с несколькими листами, лучший результат любой модели падает до 34,89%. В том же тесте Talkory многокритериальный ИНДЕКС/ПОИСКПОЗ — задача чуть сложнее одиночного ВПР — дал ChatGPT правильный ответ лишь в 4 случаях из 10, а сгенерированный код Power Query M выглядел синтаксически корректным, но не выполнялся примерно в половине случаев. Граница проходит не между «простыми» и «сложными» задачами в бытовом смысле, а между одним критерием поиска на одном листе и несколькими критериями или несколькими листами. Это ровно та граница, за которой начинается большинство реальных корпоративных выгрузок.
Три теста, один проигравший
Формализованная методология Wall Street Prep— не единственное независимое подтверждение. Старший финансовый руководитель Mike Dion протестировал ChatGPT for Excel против Claude и Copilot на трёх финансовых задачах для F9Finance и занял ChatGPT последнее место во всех трёх: пропущена себестоимость в прогнозной модели, а в сценарном анализе операционная маржа превысила 100% — результат, который любой финансист опознает как бессмысленный с первого взгляда. Дион формулирует жёстко: «The output was missing a core line item and has structural problems that take longer to fix than starting over» — вывод был настолько сломан, что исправлять его дольше, чем построить модель заново.
Это ключевой практический момент: ошибка ChatGPT не всегда выглядит как ошибка. Маржа выше 100% хотя бы бросается в глаза. Число, вписанное напрямую вместо формулы-ссылки, — нет: оно выглядит как обычная цифра в ячейке, пока кто-то не попробует изменить исходные данные и не увидит, что итог не пересчитался.
Аргумент за прогресс — и почему он не отменяет проверку
Здесь стоит признать сильную сторону противоположной позиции. Финансовый аналитик Гленн Хоппер в сравнительном тесте отмечает: за квартал ChatGPT и Claude научились принимать целиком PDF отчёта 10-K вместе с многолистовой книгой в одном комплексном промпте — полгода назад это было невозможно технически, а не просто плохо получалось. Прогресс реален, и отрицать его — заниматься тем же самообманом, в котором обвиняют вендора.
Но прогресс в приёме входных данных— не то же самое, что прогресс в точности вычислений. Причина системная, а не версионная. Препринт о токенизации чисел показывает: GPT-модели разбивают числа на токены непоследовательными блоками по 1-3 цифры, а не посимвольно, как некоторые альтернативные архитектуры. Это порождает воспроизводимые арифметические ошибки именно на крупных и нестандартных числах — ровно тех, что встречаются в финансовых моделях с их шестизначными выручками и дробными долями акций. Пока эта механика токенизации не изменится на архитектурном уровне, каждая новая версия модели будет улучшать понимание контекста и не обязана улучшать саму арифметику. Оптимизм Хоппера и скепсис Диона не противоречат друг другу — они описывают два разных слоя одной системы.
Тест на галлюцинацию
Отдельная опасность— не арифметическая ошибка, а придуманный ответ там, где данных попросту нет. Excel MVP Лейла Гарани показала это на конкретном примере: при загрузке «сырой» выгрузки с кодами вместо названий и без явных формул ChatGPT может домыслить недостающее вместо честного «в файле нет данных для этого расчёта» — разбор её демонстрации приведён в обзоре на Hubsite365. Её формулировка: «Do not treat AI as a black box, and do not upload raw workbooks without checks» — не относиться к ИИ как к чёрному ящику и не загружать сырые книги без проверок. Это иллюстрация механизма на одном подготовленном файле, а не статистика по частоте, но механизм узнаваем: модель обучена отвечать, а не молчать.
Технически расчёты в режиме анализа данных выполняются не «на словах», а через защищённую Python-песочницу — это описано в справке OpenAI о режиме анализа данных, там же указаны практические лимиты: файлы CSV и таблиц ограничены примерно 50 МБ, платным пользователям доступно до 80 загрузок за 3 часа. Знание про песочницу — не гарантия правильного ответа, но объясняет, почему просьба «покажи код, а не готовое число» вообще работает: код можно прочитать и проверить логику, число — нет.
Что делать с выгрузкой сегодня
Сотруднику, которому поручили работу с таблицей, нужен не общий совет «проверяйте ИИ», а конкретный протокол перед тем, как число уходит в отчёт.
Чек-лист «5 проверок перед тем как доверять таблице от ChatGPT»:
- №: 1 • Проверка: Сверить итоговую сумму вручную (калькулятор или отдельная формула) • Что ловит: Ошибки токенизации на крупных числах
- №: 2 • Проверка: Попросить показать формулы или код, а не готовые числа • Что ловит: Значения, вписанные напрямую вместо ссылок (кейс Wall Street Prep)
- №: 3 • Проверка: Задать вопрос, ответа на который в данных нет • Что ловит: Галлюцинацию вместо признания нехватки данных (кейс Гарани)
- №: 4 • Проверка: Сравнить результат с ручной сводной таблицей на том же диапазоне • Что ловит: Скрытые ошибки группировки и фильтрации
- №: 5 • Проверка: Построчно проверить кросс-листовые ссылки • Что ловит: Многокритериальные и многошаговые ошибки (провал на SpreadsheetBench v2)
Три из пяти пунктов— это не паранойя, а прямой ответ на конкретную задокументированную ошибку из реальных тестов, а не абстрактная предосторожность.
Отдельно стоит вопрос выбора инструмента для этой задачи. GigaChat заявляет похожие функции — генерацию формул, объяснение логики, поиск аномалий, сокращение рутины на 40-60% — но сам вендор честно предупреждает пользователя проверять ответы, а независимого теста точности на табличных задачах, сопоставимого по строгости с Wall Street Prep, для него пока нет, судя по странице ГигаЧата для таблиц. Разброс результатов между моделями в тестах Talkory и Wall Street Prep — это и есть аргумент за то, чтобы спорную формулу или выгрузку прогонять через несколько моделей и сравнивать выводы, а не менять подписки под каждую проверку: provod.ai даёт единый OpenAI-совместимый доступ к моделям своего каталога — базовый URL и ключ меняются, клиент остаётся прежним, — так что сверка двух-трёх ответов на одной и той же задаче становится рутинной операцией, а не отдельным проектом.
Главное решение не меняется от версии к версии модели: где бы GPT таблицы ни обрабатывал — простую сводную или финмодель, — число проверяется по формуле-источнику, а не по тому, звучит ли оно правдоподобно.
Источники
- OpenAI, анонс ChatGPT for Excel
- Справка OpenAI о режиме анализа данных
- Wall Street Prep, рейтинг AI-инструментов для финмоделирования
- F9Finance, тест ChatGPT против Claude и Copilot
- SpreadsheetBench, проект и результаты
- Talkory, тест лучших AI для формул Excel 2026
- Hubsite365, разбор демонстрации Лейлы Гарани
- Pasquale Pillitteri, обзор ChatGPT for Excel и Google Sheets
- Гленн Хоппер, сравнительный тест AI-копилотов
- arXiv, препринт о токенизации чисел в языковых моделях
- Sber Developers, страница ГигаЧата для таблиц
provod.ai — соедините LLM и медиамодели в одном сценарии
Пусть одна модель готовит идею и промпт, другая создаёт изображение, а третья собирает видео: общий API упрощает автоматизацию цепочки и управление доступом команды.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Составной сценарий не получает составную наценку: каждый вызов рассчитывается 1:1 по официальной цене соответствующей модели.
Автоматизируйте путь от идеи до ролика: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции