Стандартная схема обещает простую победу: подключаем локальную #llm , вешаем векторную базу (ChromaDB/Pinecone), добавляем #rag — и получаем «умного» #ai ассистента. На практике оказывается, что один только долгосрочный контекст не спасает внутри длинного диалога.