Как работает LLM-вики и агент Hermes для управления знаниями
Уже писал, что запоминаю информацию, как облако тегов - не могу держать в голове какие-то конкретные данные типа названия сервисов, районов и компаний, а вот прилагательных у меня сколько угодно.
Поэтому общение с моим агентом происходит в формате: «напомни о чем говорил спикер пару недель назад, который рассказывал про классный сервис для обработки объемных документов» и этого хватает, чтобы выдать мне готовый ответ или несколько зацепок, по которым я доберусь до нужной информации. Но как вы понимаете, чтобы получать ответы, LLM-вики нужно наполнять контекстом.
И для этого я использую несколько носимых устройств и парочку ботов (один сидит в телеграме, а другой на звонках в Zoom и Google Meet). Так как же все это работает?
Мой Hermes живет на VPS, я общаюсь с ним через Телеграм. Его единственная задача - вести мой второй мозг: личную базу знаний, которую пишет и поддерживает не человек, а сама модель. Паттерн придумал Андрей Карпатый и назвал это LLM-вики: вики, автором которой выступает LLM.
Внутри два слоя, один работает, как дневник, а второй, как конспект.
1) Первый слой - raw. Это дневник. Сюда дословно и навсегда падает все, что произошло: транскрипты голоса, заметки, пересланные статьи. Эти файлы никогда не редактируются. Дневник нельзя переписать задним числом, иначе он перестанет быть свидетельством.
2) Второй слой - wiki. Это живой конспект. Не свалка заметок, а аккуратные атомарные страницы: одна сущность или концепт на страницу, перекрестные ссылки между ними, мастер-каталог и хронологический лог. И этот конспект мой агент держит в актуальном виде сам.
Дневник отвечает на вопрос что было. Конспект - на вопрос что это значит. Первый дословный и неизменный, второй структурированный и постоянно актуализируется.
Как сырье превращается в память. Когда что-то прилетает, оно мгновенно ложится одним файлом в raw и помечается в реестре как не обработано, мне в Телеграм падает подтверждение. Голос по дороге проходит распознавание и становится дословным транскриптом. На этом шаге ничего не осмысляется, задача только поймать и зафиксировать.
Дальше, по расписанию включается переваривание. Агент читает все необработанное, вытаскивает оттуда сущности, концепты, утверждения и открытые вопросы, и вливает это в вики. Не плодит дубли, а обновляет существующие страницы. Когда я потом задаю вопрос, он идет не в сырье, а в конспект: читает каталог, открывает нужные страницы, синтезирует ответ со ссылками на источники.
Важная штука во всем этом - провенанс. Каждое утверждение в вики помечается: extracted - дословно из источника, inferred - это уже вывод самой модели, ambiguous - источники расходятся. То есть всегда видно, что факт, а что догадка ассистента. Память честно говорит о степени своей уверенности и не выдает свои выводы за мои.
Чем это все кормится:
1) Телеграм - голосовые (через Groq), текст, форварды статей и PDF.
2) TicNote от Mobvoi - ИИ-диктофон на звонки и разговоры: его облако расшифровывает, мой скрипт забирает транскрипт в raw.
3) Omi - опенсорсный рекордер (DevKit2), пишет звук непрерывно на microSD. Я переделал его на свой стек, без облака компании: вынимаю карту, вставляю в Мак, приложение читает только новые записи, Silero VAD режет тишину, Groq Whisper расшифровывает, транскрипт падает в raw. Оттуда агент ингестит в вики.
Что в итоге. Два носимых устройства, одно проприетарное, второе полностью мое, льются в одну трубу. Окружающий захват жизни - разговоры, идеи вслух, звонки - дистиллируется в перелинкованную память, по которой ассистент отвечает на мои СДВГ'шные вопросы.
Подписывайтесь на Telegram Силиконовый Мешок.