Превращаем Telegram-чат в базу знаний с помощью NotebookLM

Превращаем Telegram-чат в базу знаний с помощью NotebookLM

В чатах, где вы состоите, лежат десятки тысяч сообщений. Кто-то оставлял там контакт подрядчика, кто-то по шагам расписывал процедуру, через которую сам только что прошел, кто-то рассказывал про свой продукт и кидал ссылку. Достать это поиском почти невозможно: он ищет слово, которое надо помнить, и отдает сообщения по одному.

Прием, который меняет расклад, занимает полчаса. Историю чата выгружают файлом и загружают в NotebookLM, и дальше вы задаете вопросы обычным языком агенту, у которого под рукой лежит вся переписка целиком.

Дальше будут слова экспорт, HTML, Markdown. Руками из всего этого делаются два клика в Telegram, остальное берет на себя агент.

Поиск по чату и вопрос к чату это разные вещи

Поиск в Telegram устроен прямолинейно: вводите слово, получаете сообщения, где это слово встречается. Работает он ровно до того момента, пока вы помните формулировку. Дальше начинается беспомощность. Человек мог написать подрядчик, мастер, ребята или вообще переслать контакт без единого слова вокруг. Поиск покажет разрозненные реплики, а картину из них придется собирать самому, листая вверх и вниз.

Вопрос к базе знаний работает по другой механике. Модель читает всю выгруженную историю и отвечает на вопрос, заданный обычным языком. Ответ собирается из десятков сообщений, которые лежат в разных местах и в разные годы, а под каждым тезисом стоит ссылка на исходное сообщение.

Разница видна на вопросах, которые в поисковую строку просто некуда подставить:

  • Кого в чате рекомендовали как исполнителя и что писали уже после работы с ними.
  • Какие сервисы советовали под одну и ту же задачу и какие отзывы за ними тянутся.
  • Какие вопросы клиенты задают чаще всего и какими именно словами их формулируют.
  • Кто из участников занимается темой, близкой к вашей, и чем конкретно.
  • К чему в итоге пришли в споре, который тянулся неделю на четыреста сообщений.
Слева работает память на формулировки, справа обычный вопрос
Слева работает память на формулировки, справа обычный вопрос

Это поиск другого порядка. Вы подключаете агента к закрытой базе знаний конкретного чата, которой больше ни у кого нет и которая не индексируется ничем снаружи.

Поиск отвечает на вопрос, где это было написано. Блокнот отвечает на вопрос, что из этого следует.

Коротко про NotebookLM

NotebookLM это блокнот от Google, который отвечает строго по тем источникам, которые вы в него загрузили. Обычный чат-бот отвечает из всего, что когда-то выучил, и может уверенно выдумать факт. Здесь ответ собирается только по вашим материалам, и под каждым тезисом стоит номер сноски со ссылкой на конкретное место в документе. Нажали на номер, увидели исходный текст, проверили.

Сноски превращают ответ в проверяемый, поэтому им можно пользоваться в работе
Сноски превращают ответ в проверяемый, поэтому им можно пользоваться в работе

Что важно для нашей задачи:

  • Источники грузятся почти любые: PDF и текстовые файлы, Markdown, Google Docs и Slides, ссылки на сайты, YouTube по субтитрам, аудио.
  • Кроме ответов в чате есть студия: сводки и отчеты, таблицы, инфографика, презентации, майндмэпы, аудиообзор в виде диалога двух ведущих.
  • Базовой бесплатной версии хватает под такую задачу с запасом, платить на старте незачем.
  • Лимит бесплатной версии: до 50 источников на блокнот.
  • Блокноту можно один раз задать роль и тон, и он будет держать их во всех ответах.

Полный разбор самого инструмента лежит в отдельном гайде про NotebookLM, здесь дальше только связка с Telegram.

Зачем вообще тащить чат в блокнот

Ответ короткий: знание в чате уже есть, оно просто лежит без структуры. Люди годами отвечают друг другу на вопросы, скидывают контакты, разбирают процедуры и делятся опытом, а весь этот массив живет как лента, по которой можно только скроллить.

Типовые ситуации, в которых выгрузка окупается в первый же вечер.

Профессиональное сообщество. Чат по вашей сфере, где несколько тысяч человек обсуждают инструменты, зарплаты, подрядчиков и кейсы. Из него достается карта: кто чем занимается, что советуют под какие задачи, какие грабли всплывают повторно.

Клиентский чат или поддержка. Здесь лежит готовый материал под продукт: повторяющиеся вопросы, возражения, формулировки самих клиентов. Из этого собирается раздел частых вопросов, тексты на сайт и список правок в продукт.

Чат по бытовому или процедурному вопросу. Сообщества вокруг переезда, документов, обслуживания дома, редкого хобби. Люди там пересказывают собственный опыт прохождения процедур, и эта информация обычно свежее любой инструкции в интернете.

Рабочий чат команды. Договоренности, решения, кто за что отвечал и почему в марте свернули направление. Через полгода этого не помнит никто. В переписке оно лежит целиком.

Собственные заметки. Избранное и чат с самим собой у многих превратились в свалку ссылок и обрывков идей. Как источник для блокнота работают отлично, тем более что это уже полностью ваши данные.

Дальше три шага. Целиком маршрут выглядит так:

Из четырех шагов вашего внимания требует один
Из четырех шагов вашего внимания требует один

Шаг 1. Выгрузить историю чата

Первая развилка отсекает больше половины людей, поэтому начнем с нее.

Кнопка экспорта есть далеко не в каждом клиенте. Она живет только в десктопном Telegram Desktop. На Windows и Linux это обычное приложение с сайта telegram.org. На Mac ситуация путаная: в App Store лежат два разных приложения от Telegram, и экспорт есть у того, которое называется Telegram Lite, потому что это и есть сборка Telegram Desktop. Нативное приложение Telegram для macOS, веб-версия и мобильные приложения выгрузку не умеют.

Дальше все просто. Открываете нужный чат, жмете на три точки в правом верхнем углу, выбираете пункт про экспорт истории чата. Появится окно с настройками, и в нем есть ровно один способ испортить себе вечер: оставить включенными медиафайлы.

Медиа: все галочки сняты // фото, видео, файлы, стикеры, голосовые // с ними выгрузка вырастает в гигабайты и качается часами Формат: HTML // JSON тоже подойдет, если дальше с файлом работает агент Размер: максимальный // ограничение все равно почти никогда не достигается Период: с 1 января 2024 по сегодня Папка: ~/Desktop/chat-export/

Текстовая выгрузка на десятки тысяч сообщений собирается за минуты. Та же выгрузка с медиа качается часами и весит гигабайты, а для анализа нужен только текст.

Жмете кнопку экспорта, ждете. На выходе Telegram отдает папку, внутри которой лежит история в виде нескольких HTML-файлов: большую переписку он режет на части автоматически. У групп с включенными темами кнопка экспорта иногда не появляется в меню. Это известное поведение клиента, обходится выгрузкой отдельных тем или другого чата.

В выгрузке лежат персональные данные живых людей: имена, контакты, обстоятельства их жизни. Держите файлы локально, используйте их для собственной аналитики и не выкладывайте выгрузку никуда наружу.

Шаг 2. Перевести выгрузку в Markdown

HTML-файл от Telegram открывается в браузере и выглядит как чат, но внутри у него служебная разметка, стили и повторяющиеся блоки оформления вокруг каждого сообщения. Модель вытащит из этого только текст, а место в лимитах займет весь файл целиком.

Формат, который агенты и блокноты любят больше всего, это Markdown. Простой текст, где остается дата, автор и сообщение. Файлы становятся в разы легче, а ответы точнее, потому что модель не спотыкается о мусор.

Конвертацию удобнее всего отдать агенту на своем компьютере. Подойдет любой: Claude Code в терминале, Cursor, Codex, что у вас стоит. Просьба формулируется одним абзацем.

На рабочем столе лежит папка chat-export с выгрузкой истории чата из Telegram в HTML. Переведи сообщения в Markdown: дата, автор, текст. Служебную разметку выкинь. Разложи по файлам и сложи в отдельную папку рядом.

Заодно агент отчитывается, сколько сообщений реально лежит в выгрузке. Обычно цифра сильно больше, чем кажется изнутри чата.

Онлайн-конвертеры для этой задачи тоже существуют, но переписку в них лучше не грузить: это чужие персональные данные, и им незачем уезжать на посторонний сервер. Локальный агент делает то же самое за минуту.

Шаг 3. Загрузить в блокнот и начать спрашивать

Заходите на notebooklm.google.com, создаете новый блокнот, жмете загрузку источников и выбираете все файлы из папки с Markdown. Через пару минут они появятся в списке источников слева, а блокнот сам придумает себе название по содержимому.

С этого момента у вас есть бесплатный агент, подключенный к изолированной базе данных вашего чата. Дальше все происходит в обычном окне переписки. Первые вопросы стоит задавать конкретно, с указанием периода и признака:

  • Кто из участников за последний год писал, что занимается такой-то темой. Собери имена и то, что они про себя рассказывали.
  • Найди все обсуждения такого-то инструмента и выпиши аргументы за и против отдельными списками.
  • Собери в хронологии все договоренности по этому проекту и покажи, где решение менялось.
  • Какие вопросы новички задают в первую неделю после вступления в чат.

В ответах будут сноски. Наводите на них курсор и открывайте исходные сообщения: это единственный способ убедиться, что модель ничего не додумала. По опыту, на выгрузке чата она врет заметно реже, чем в обычном чат-боте, ровно потому, что отвечать ей больше не из чего.

Что достается из чата кроме ответов

Ответы в чате это только первый слой. Справа в блокноте живет студия, где та же самая база превращается в готовые материалы.

Студия собирает из выгрузки шесть форматов. Таблица на переписке работает лучше всех
Студия собирает из выгрузки шесть форматов. Таблица на переписке работает лучше всех

Главный прием здесь один. Рядом с кнопкой формата есть стрелка, которая открывает поле для своего промпта. Если нажать саму кнопку, получится базовая генерация на общую тему. Если нажать стрелку и описать, что именно вам нужно, получится то, за чем вы пришли.

Пять срезов, которые собираются из одной и той же выгрузки:

  • Кто есть кто: имя, аккаунт, сфера, чем занимается, ссылка на проект.
  • Рекомендации: кого советовали, под какую задачу, какой отзыв оставили потом.
  • Инструменты: что упоминали, сколько раз, с каким настроением.
  • Вопросы новичков: формулировка, частота, лучший ответ из чата.
  • Открытые темы: что обсуждали и бросили без вывода.

Одна выгрузка выдерживает десяток таких срезов. Смысл в том, чтобы просить узко: широкий запрос дает красивую и бесполезную сводку.

Таблица открывается в формате Google Таблиц и выгружается оттуда файлом. Выглядит она при этом сыровато: колонки как получились, порядок случайный. Лечится это тем же способом, что и все остальное: готовую таблицу отдают агенту и просят привести в порядок, дособрать недостающее и оформить. Руками тут не делается вообще ничего.

На кэмпе Точки над ИИ мы собираем такие связки на живых чатах участников: у кого-то это клиентская переписка, у кого-то профессиональное сообщество на пять тысяч человек. Если материал зашел, похожие кейсы разбираются в модуле про личную эффективность, там же остальные приемы вокруг личной базы знаний.

Настроить блокнот под свою задачу

В блокноте есть кнопка настройки, за которой прячется системный промпт для всех ответов сразу. Туда описывается роль и манера: аналитик, скептик, ментор, дотошный редактор. Можно задать тон, длину ответов, формат выдачи, запреты.

Прием стоит того, чтобы его применить: роль часто решает больше, чем формулировка конкретного вопроса. Скептик по той же истории чата выдаст совсем другой результат, чем восторженный ассистент, который старается ответить хоть что-нибудь. Правила описываются один раз и дальше работают сами.

Готовым блокнотом можно поделиться с командой или партнерами, и по нему же смотреть аналитику: кто заходил, что спрашивал.

Несколько чатов в одном блокноте

Дальше начинается интересное. Один блокнот держит несколько источников, и в него складывают смежные чаты: три сообщества по одной теме, переписку с клиентами за разные годы, рабочие чаты нескольких проектов.

На стыке появляется то, чего нет ни в одном чате по отдельности: повторяющиеся имена, одни и те же рекомендации из разных мест, противоречия между источниками. Получается закрытая база знаний по вашей теме, собранная из живого опыта людей.

Лимит бесплатной версии в 50 источников выбирается быстрее, чем кажется: большая история чата приезжает несколькими файлами. Если упираетесь в потолок, попросите агента склеить файлы в один документ. Одновременно держите в голове обратное правило: чем однороднее подборка в блокноте, тем точнее ответы, поэтому чаты из разных областей жизни лучше разводить по разным блокнотам.

Где связка ломается

Четыре ограничения, о которых лучше знать заранее.

Превращаем Telegram-чат в базу знаний с помощью NotebookLM

Отдельно про правовую сторону. Экспорт это штатная функция Telegram, и выгружаете вы только то, что вам и так доступно как участнику чата. При этом в файлах лежат персональные данные других людей. Разумная практика простая: держать выгрузку локально, использовать ее для собственной аналитики, не публиковать и не превращать в базу для рассылок без согласия людей.

Что запомнить

  • Поиск по чату находит слово, которое надо помнить. Блокнот отвечает на вопрос человеческим языком и собирает ответ из десятков сообщений.
  • Экспорт истории есть только в Telegram Desktop. На Mac это приложение Telegram Lite из App Store, веб и мобильные клиенты выгрузку не умеют.
  • Медиа в настройках экспорта отключаем: текст выгружается за минуты, с фото и видео это гигабайты и часы.
  • HTML переводим в Markdown просьбой к агенту. Файлы легче, ответы точнее, лимит источников расходуется медленнее.
  • Загруженная история превращается в бесплатного агента, подключенного к закрытой базе знаний вашего чата.
  • Сноски под ответами ведут в исходные сообщения. Важные выводы проверяем по ним всегда.
  • Кроме ответов студия делает таблицы, отчеты, инфографику, майндмэпы, аудиообзор и презентации. Просить надо узко, через свой промпт по стрелке рядом с кнопкой.
  • Системный промпт блокнота задает роль на все ответы сразу и часто решает больше, чем формулировка вопроса.
  • Смежные чаты складываются в один блокнот и дают пересечения, которых нет ни в одном из них по отдельности. Лимит бесплатной версии - 50 источников.
  • Выгрузка это снимок на дату. Свежие сообщения добавляются новым экспортом за нужный период.

Один вечер работы превращает архив переписки в источник, к которому можно обращаться с вопросами. Дальше это входит в привычку: любой большой массив текста становится базой знаний.

22
1
1