Как собрать ИИ-агента для аналитики данных
Скармливать большой CSV-файл или таблицу Excel напрямую в контекстное окно языковой модели - худший способ анализа данных из всех возможных.
Если в вашей выгрузке пятьдесят тысяч строк, такой запрос моментально сожрет двести тысяч токенов и будет стоить несколько долларов за один вопрос. Хуже того, языковые модели по своей природе плохо считают сложные математические операции в уме. Они путают медиану со средним значением, пропускают скрытые пропуски в данных и с уверенным видом называют неправильные итоговые суммы.
Правильный инженерный подход к аналитике называется Code-as-Action.
Модель вообще не должна читать всю таблицу глазами. Она изучает только структуру колонок и типы данных, после чего сама пишет исполняемый скрипт на Python с библиотекой Pandas, запускает его в локальной песочнице и отдает точный ответ на базе расчетов интерпретатора.
Разбираем архитектуру такого аналитического агента и пишем рабочий код с автоматическим построением графиков.
В чем сила подхода Code-as-Action
Когда аналитик получает новую таблицу на сто мегабайт, он не читает каждую строку подряд.
Сначала специалист смотрит на первые пять строк через метод head(), проверяет типы колонок через info() и запускает математические агрегации через группировки и фильтры.
Кстати, если вы хотите протестировать все самые свежие модели уровня Claude Sonnet 5, GPT-5.6 или Gemini 3 в одном удобном месте и сравнить их ответы без костылей с иностранными картами - на платформе SYNTX.AI это можно сделать за пару кликов.
Агент работает по точно такой же логике.
Вместо того чтобы отправлять в модель миллионы символов сырого текста, мы передаем ей компактный срез мета-данных таблицы объемом меньше тысячи токенов.
Модель понимает, какие поля есть в файле, формулирует математический алгоритм решения задачи на Pandas, а вычисления выполняет процессор вашего сервера на чистом C-коде за десять миллисекунд.
В результате вы получаете стопроцентную точность расчетов и экономите до девяноста девяти процентов бюджета на токенах API.
Архитектура аналитического контура
Процесс обработки любого пользовательского вопроса к данным состоит из четырех последовательных шагов.
Если сгенерированный скрипт падает с ошибкой (например, дата в колонке записана строкой в нестандартном формате), рантайм не прерывает работу.
Текст ошибки возвращается модели, она на лету дописывает преобразование типов через pd.to_datetime() и повторяет запуск до успешного получения результата.
Полный рабочий код агента-аналитика на Python
Соберем автономного аналитика в виде законченного скрипта.
Агент принимает путь к любому CSV-файлу и текстовый вопрос на естественном языке, сам проводит расчеты, сохраняет график в PNG-файл и формирует краткую управленческую выжимку.
Для написания кода и анализа результатов используем скоростную модель DeepSeek V4 Flash или Gemini 3.7 Flash через OpenRouter.
Пример решения реальной задачи на таблице продаж
Представим реальную ситуацию. У вас есть файл с транзакциями интернет-магазина на сто тысяч строк с колонками order_id, created_at, category, revenue, city.
Пользователь задает вопрос: "Покажи динамику выручки по месяцам для категории электроники и назови месяц с максимальными продажами".
Что происходит внутри агента:
На первом шаге агент читает структуру файла, видит, что created_at имеет строковый тип object, а revenue - числовой float64.
На втором шаге модель пишет компактный скрипт на двадцать строк. В коде применяется фильтр по категории, парсинг дат через pd.to_datetime, группировка по месячным периодам df.resample('M') и отрисовка линейного графика с сохранением в PNG.
Скрипт отрабатывает за пятьдесят миллисекунд в локальном процессе Python.
На третьем шаге модель получает точный массив вычисленных чисел и отдает готовый ответ:
"Максимальная выручка в категории электроники зафиксирована в ноябре и составила 14 850 000 рублей. В декабре наблюдается спад продаж на восемнадцать процентов относительно пика. График помесячной динамики сохранен в файл output_chart.png."
Никаких приблизительных оценок и галлюцинаций. Каждая цифра получена из прямого расчета над исходным массивом данных.
Почему этот подход меняет корпоративную аналитику
Концепция Code-as-Action превращает языковую модель из ненадежного математика в профессионального программиста-исследователя.
Компания получает систему, которая способна за секунды отвечать на сложные ad-hoc вопросы к любым базам данных и таблицам без необходимости привлекать штатных дата-сайентистов под каждую рутинную выгрузку.