Локальная копия интернета с ИИ: Wikipedia, книги, карты и RAG работают вообще без сети
Есть домашние серверы. Есть локальные LLM. Есть Kiwix с офлайн-Wikipedia. А кто-то решил собрать всё это в одну коробку.
Я наткнулся на Project NOMAD — open-source проект, который превращает обычный компьютер в автономный сервер знаний. После первоначальной установки и загрузки контента ему вообще не нужен интернет.
На одном устройстве можно держать Wikipedia, тысячи книг, обучающие курсы, карты, заметки, инструменты для работы с данными и локальный AI с RAG.
Что это вообще такое
NOMAD — скорее оболочка для целого набора self-hosted инструментов.
После установки вы заходите на локальный адрес через браузер и получаете что-то вроде собственного маленького интернета.
Например, можно скачать Wikipedia и другие базы через Kiwix. Причём речь не только об энциклопедии: поддерживаются книги, медицинские справочники, survival-гайды и другой контент.
Для обучения встроен Kolibri — платформа, через которую можно хранить курсы Khan Academy и отслеживать прогресс.
Карты работают через ProtoMaps.
Есть локальные заметки на FlatNotes и CyberChef для кодирования, хеширования, шифрования и всяких операций с данными.
И всё это живёт на вашем железе.
А теперь туда добавили AI
Вот здесь проект становится гораздо интереснее.
В NOMAD есть локальный AI Assistant.
По умолчанию модели запускаются через Ollama, но можно подключить практически любой OpenAI-compatible сервер. Например:
- LM Studio;
- llama.cpp;
- отдельный компьютер с Ollama;
- собственный сервер с моделью.
То есть AI вообще необязательно крутить на том же устройстве, где лежит библиотека.
Например, NOMAD можно поставить на мини-ПК с большим SSD, а LLM запускать на рабочей машине с видеокартой.
Свой локальный RAG
Самая полезная часть для меня — работа с собственными документами.
Можно загрузить документы, после чего NOMAD индексирует их и позволяет задавать вопросы через AI.
Для векторной базы используется Qdrant.
Получается довольно понятная схема:
ваши документы → Qdrant → локальная LLM → ответы по собственной базе знаний.
Без отправки документов в облачный ChatGPT.
Для компании это уже интереснее, чем очередной эксперимент с локальной моделью.
На такой машине теоретически можно собрать внутреннюю базу:
- техническую документацию;
- инструкции;
- регламенты;
- мануалы оборудования;
- базу знаний сотрудников;
- архив проектов.
И разговаривать со всем этим через локальную модель.
Зачем вообще делать «интернет в коробке»
Первая мысль — конечно, какие-нибудь экспедиции, корабли, удалённые поселения и места с плохой связью.
И для этого NOMAD действительно подходит.
Но мне кажется, более интересный сценарий находится гораздо ближе.
Локальная корпоративная база знаний, которая физически не зависит от внешних сервисов.
Сейчас мы постепенно привыкаем к тому, что почти любой AI-инструмент требует соединения с десятком API.
Пропал интернет — половина инфраструктуры превращается в тыкву.
Здесь подход обратный.
Скачать всё заранее и построить систему так, будто интернет завтра исчезнет.
Получается довольно странный гибрид NAS, Wikipedia, LMS, картографического сервера и локального ChatGPT.
И именно поэтому проект интересный.
Какие требования к железу
Сам NOMAD неожиданно лёгкий.
Для базовой оболочки разработчики указывают:
2-ядерный процессор от 2 ГГц, 4 ГБ RAM и около 5 ГБ свободного места.
Но это без серьёзной локальной AI-части и огромной библиотеки.
Для полноценной конфигурации разработчики рекомендуют уже примерно:
32 ГБ RAM; Ryzen 7 / Core i7; RTX 3060 или аналог; от 250 ГБ SSD.
Причём чем больше VRAM, тем более крупные модели можно запускать.
На самом деле я бы здесь ещё сильнее вложился в накопитель. Если начать скачивать Wikipedia, книги, карты нескольких регионов, курсы и модели, сотни гигабайт заканчиваются довольно быстро.
А 1–2 ТБ SSD сейчас уже позволяют собрать весьма приличный автономный архив.
Можно вообще убрать GPU из сервера
Есть ещё один хороший архитектурный момент.
NOMAD позволяет указать адрес другого Ollama или OpenAI-compatible сервера. То есть можно сделать так: маленький энергоэффективный сервер хранит Wikipedia, документы, карты, книги и Qdrant; а большой компьютер с GPU включается только когда нужен AI.
Для домашнего сервера это вполне здравый вариант.
Не обязательно круглосуточно держать RTX 4090 ради возможности иногда спросить что-нибудь у локальной базы знаний.
Телеметрии нет
Разработчики отдельно пишут, что в NOMAD нет встроенной телеметрии.
Интернет требуется при первоначальной установке и, естественно, когда вы хотите скачать новые приложения или обновить локальный контент.
После этого сервер может работать автономно.
Для privacy-сценариев это, пожалуй, одна из главных особенностей проекта.
Особенно если вместе с ним использовать локальную LLM.
Тогда документы, запросы, история работы и сама база знаний остаются внутри вашей сети.
Но есть важный нюанс
У NOMAD сейчас нет встроенной авторизации.
Разработчики сами предупреждают: проект рассчитан на локальную сеть и его не следует просто выставлять наружу в интернет.
Если дать серверу доступ из LAN, контроль доступа придётся организовывать на уровне сети, firewall, VPN или отдельного reverse proxy.
Для домашней коробки это не особо страшно.
Для корпоративного внедрения — уже момент, который нельзя игнорировать.
Самая интересная идея здесь даже не в NOMAD
Мне нравится сам подход. Мы долго двигались в сторону тонкого клиента:
- ничего не хранить;
- ничего не запускать;
- всё отправлять в облако.
А локальные LLM внезапно сделали обратную архитектуру снова интересной.
Если модель помещается на домашнюю видеокарту, Wikipedia занимает вполне подъёмный объём, а терабайтные SSD стоят разумных денег, то появляется другой сценарий:
а зачем вообще облако для части задач?
Можно собрать маленький автономный информационный узел, который продолжит работать независимо от OpenAI, Google, Microsoft и даже от наличия интернета.
Не думаю, что завтра мы все побежим скачивать интернет на домашние серверы.
Но как концепция NOMAD мне очень нравится.
Это уже не просто «запустил Llama локально».
Это попытка собрать вокруг локальной модели целую автономную информационную среду.
Wikipedia знает факты.
Khan Academy хранит обучение.
Карты работают без сети.
Ваши документы лежат рядом.
А локальная LLM становится интерфейсом ко всему этому.
По сути, персональный AI-сервер, который можно отключить от кабеля — и он всё равно продолжит работать.
Project NOMAD: https://github.com/Crosstalk-Solutions/project-nomad
P.S. Я буду ставить такие штуки себе и проверять, что из них реально работает, а что красиво только на GitHub. Результаты — в Telegram «AI здорового человека»