🔎 Как заставить ИИ читать документы на 50+ страниц без выдумывания фактов

В первой части мы настроили ИИ под себя через пользовательские инструкции (Custom Instructions): роль, стиль и правила ответа.

Во второй разобрали фреймворк RTF и научились ставить нейросети задачу как ТЗ, а не как просьбу в чате.

Ссылки на прошлые гайды есть в конце статьи.
Ссылки на прошлые гайды есть в конце статьи.

Теперь следующий уровень: что делать, если на входе у вас большой массив данных. Например, PDF на 40-50 страниц, финансовый отчет, исследование рынка или транскрипт часового интервью.

Главная ошибка - загрузить файл целиком и написать:

Сделай саммари.

Иногда результат выглядит убедительно, но часто ИИ хорошо пересказывает начало, уверенно подводит итог по концовке, а середину сжимает до общих фраз или заполняет водой.

Почему так происходит

У современных нейросетей есть большое контекстное окно. Простыми словами - это объем текста, который модель может принять за один раз.

Но принять текст и внимательно его обработать - совсем разные вещи.

На длинных документах возникает эффект Lost in the Middle. Если объяснять проще, ИИ часто лучше удерживает фокус в начале и конце текста, а середину обрабатывает слабее.

В бизнес-задачах это критично. Можно пропустить важную метрику, финансовый риск или юридическую оговорку.

Проблема №2 - попытка сделать все одновременно.

Запрос типа «проанализируй документ» заставляет модель сразу читать, искать главное, делать выводы и оформлять текст. Для короткого текста это нормально. Для сложного же документа риск выше: ответ может выглядеть уверенно, но потеряется часть фактов.

Поэтому для больших документов нужен не один большой запрос, а простой процесс: Разбить - Извлечь - Собрать.

Алгоритм работы с большими текстами

Шаг 1. Разбить документ

Большой документ предлагаю лучше делить на логические блоки:

  • главы / разделы
  • блоки отчета: продукт, аудитория, финансы, риски и тд
  • смысловые части интервью
  • отдельные страницы, если у документа плохая структура

Дальше мы будем передавать ИИ не весь файл сразу, а эти куски по очереди.

Шаг 2. Извлечь факты

На этом шаге ИИ не должен быть автором или аналитиком. Его задача простая - работать как внимательный сканер.

Обрабатываем каждый блок отдельным запросом.

❌ Плохой запрос:

​Проанализируй эту часть и сделай выводы.

✅ Лучше:

Извлеки из текста - факты, цифры, тезисы и ограничения. Опирайся только на предоставленный текст. Не добавляй свои выводы. Если какой-то информации нет, то пиши: «В тексте нет данных».

На этом этапе нам нужна чистая база фактов без красивой аналитики.

Шаг 3. Собрать итоговый вывод

Когда факты извлечены по частям, можно переходить к финальной сборке.

Здесь используем фреймворк RTF из прошлого поста. Модель больше не читает огромный исходник, а работает с подготовленной базой: выжимками, цифрами, тезисами и возможными ограничениями.

Пример запроса:

[R] Действуй как бизнес-аналитик. [T] На основе выжимок из всех частей документа собери итоговый анализ. Не добавляй факты, которых нет в выжимках. Раздели подтверждённые факты, выводы и гипотезы. [F] Дай результат в виде таблицы: Тема | Подтвержденные факты | Вывод | Риск | Что проверить вручную.

Так ИИ меньше фантазирует, потому что работает не с простыней текста, а с заранее собранной фактурой.

Готовые промты-сканеры

Сценарий А. Поиск цифр

Подходит для финансовых отчетов, презентаций, исследований рынка и анализа конкурентов.

Действуй как внимательный data-аналитик. Твоя задача — извлечь из текста только факты, цифры, метрики и финансовые показатели. Правила: 1. Опирайся только на этот текст. 2. Не придумывай недостающие данные. 3. Если информации нет, то пиши: «В тексте нет данных». Формат: Выведи результат в виде таблицы с колонками: Показатель | Значение | Период | Формулировка из текста Отдельно под таблицей выпиши списком: - все упоминания выручки; - все упоминания затрат; - все проценты и темпы роста; - спорные данные, которые необходимо проверить вручную.

Сценарий Б. Поиск смыслов

Подходит для статей, лонгридов, интервью, учебных материалов и расшифровок.

Действуй как редактор. Твоя задача — извлечь из текста главные идеи без пересказа всей статьи. Правила: 1. Опирайся только на этот текст. 2. Не добавляй внешние знания. 3. Убирай лирику, повторы и общие фразы. 4. Отделяй тезисы автора от своих интерпретаций. Формат: 1. Главная мысль текста — 1-2 предложения. 2. Три ключевых инсайта. 3. Одно практическое действие, которое можно внедрить. 4. Что автор утверждает, но не доказывает. 5. Какие вопросы остались без ответа.

Не все документы можно безопасно дробить

Для бизнес-отчетов, исследований, статей и интервью - этот подход работает хорошо. Но если документ держится на сложной цепочке связей, то механическое деление может сломать логику.

С юридическими договорами тоже нужно быть осторожнее: важная оговорка в одном разделе может менять смысл другого раздела.

Не забывайте про фактчекинг

Никакой промпт не страхует на 100%. Найденные ИИ цифры, юридические формулировки и метрики всё равно нужно сверять с оригиналом.

Выбор инструмента

Не все LLM модели одинаково хорошо работают с длинными документами. Поэтому для важных задач лучше не верить названию модели или размеру контекстного окна, а сделать короткий тест: загрузить один и тот же фрагмент, попросить извлечь факты и проверить, что модель ничего не пропустила и не придумала.

Вместо вывода

ИИ лучше работает, когда ему дают понятный процесс обработки, а не только когда в него заливают максимум всевозможных данных.

Для больших документов используйте схему:

  1. Разбить документ на части
  2. Извлечь факты из каждой части
  3. Собрать итоговый вывод из отдельных выжимок

И только после этого просите нейронку писать саммари, аналитику, презентацию или стратегию.

Пишу об операционном управлении, процессах и системном подходе к работе с ИИ. Подписывайтесь, чтобы не пропустить следующий гайд.

2