Как устроены современные LLM? Глубокий разбор без маркетинга.

Подавляющее большинство дискуссий о LLM ведется на поверхностном уровне. Многие знают термины «трансформер», «внимание», «предсказание следующего токена», но почти никто не понимает их роль в общей системе.

https://unsplash.com/photos/an-abstract-red-and-orange-background-with-curves-K-DwbsTXliY
https://unsplash.com/photos/an-abstract-red-and-orange-background-with-curves-K-DwbsTXliY

Разобрав каждый элемент глубоко, мы увидим, что модель работает не как загадочная «нейросеть», а как предельно логичный и рациональный вычислительный аппарат, чье поведение полностью определяется структурой данных и инженерными ограничениями.

NB: Термины и сокращения приведены в конце статьи.

Токенизация как основа всей архитектуры

Вход модели это не слова и не предложения, а токены. Вся дальнейшая работа трансформера невозможна без правильной токенизации. Это не механическое разбиение текста на слова, а алгоритм компрессии, который определяет длину последовательности и качество обобщения.

Если модель опирается на символы, последовательности становятся слишком длинными, и вычислительная цена растет квадратично. Если она опирается на целые слова, словарь становится гигантским и перестает работать при малейших вариациях текста. Подслова и особенно байтовые токены заняли оптимальную нишу между этими крайностями.

Байтовый BPE позволяет модели не сталкиваться с «неизвестными словами». Любое слово, сленг, неологизм или опечатка разлагаются на устойчивые куски, которые модель уже видела. В результате токенизация становится миниатюрным языковым компрессором, подстраивающим текст под возможности модели.

От выбора токенизации напрямую зависят стоимость, скорость и качество модели. Именно она определяет, какие структуры языка модель сможет выучить и в каком масштабе.

Пространство токенов и почему модель «думает» статистически

Токены это не только компрессия текста. Каждому токену соответствует вектор в высокомерном пространстве. Это пространство снова и снова корректируется во время обучения. Когда модель предсказывает следующий токен, она по сути ищет направление в этом пространстве, в которое «стремится» смысл фразы.

Это направление задают веса, а вероятность выбирается через софтмакс. Это означает, что модель никогда не оперирует логикой в строгом смысле. Она работает в виде навигации по непрерывному многофакторному полю. Когда говорят, что модели «обучились рассуждать», в действительности это означает, что распределение данных было настолько регулярным, что модель нашла устойчивые геометрические структуры, соответствующие логике и последовательности.

То есть LLM не выводит знание как человек, а реконструирует наиболее вероятную траекторию в многомерном пространстве. Большие модели демонстрируют навыки, которых не было в их явной программе: арифметику, логику, структурирование сложных запросов. Это кажется магией, но объясняется статистическими свойствами больших пространств.

Когда количество параметров и данных пересекает определенный порог, модель начинает представлять абстрактные концепции как стабильные структуры в параметрическом пространстве. Эти структуры затем проявляются как «новые» способности. Это не новизна в человеческом смысле, это сложный побочный продукт большого обучения, аналогичный фазовым переходам в физике.

Внимание как механизм динамического контекста

Трансформер это не просто последовательность матриц и нелинейностей. Его ядро – механизм внимания, который позволяет каждому токену оценить, какие другие токены важны в данный момент. Чтобы понять внимание, нужно отказаться от аналогий с биологическим вниманием. Это чисто вычислительный процесс.

Каждый токен порождает три проекции: запрос, ключ и значение. Запрос определяет, какой вопрос текущий токен задает контексту. Ключ показывает, какие вопросы данный токен может удовлетворить. Значение содержит полезную информацию, которую токен отдаст, если окажется релевантным.

Когда мы вычисляем внимание, мы сравниваем запросы с ключами и получаем карту релевантности. Эта карта используется для сборки нового состояния токена как взвешенной суммы значений других токенов. Это и есть динамическое перераспределение контекста.

Благодаря многоголовому вниманию модель получает возможность смотреть на текст сразу под несколькими углами: грамматическим, смысловым, позиционным, структурным. Некоторые головы обнаруживают дальние связи в документах, другие отслеживают структуру предложений, третьи учатся специфическим задачам вроде связывания переменных в коде.

Работа внимания делает трансформер универсальной машиной контекстного анализа, которая способна реконструировать смысл из распределенной информации.

Авторегрессия и доминирование моделей только с декодером

Современные LLM можно рассматривать как симуляторы продолжения последовательности. Они обучаются предсказывать следующий токен на основе предыдущих. Эта задача настолько проста и масштабируема, что при увеличении параметров модель начинает проявлять многослойные способности: рассуждение, обобщение, понимание структуры задач.

Архитектуры с кодером и декодером, например T5, идеально подходят для перевода и подобных задач, но для универсального интеллекта они оказались слишком специализированными. Модели только с декодером, такие как GPT, Claude, Gemini и LLaMA, получили огромную популярность, потому что имеют одну цель, одно направление вычислений и одну систему оптимизаций.

Авторегрессия естественно интегрируется с подсказками. Примеры, инструкции, размышления по шагам это просто дополнительные токены перед продолжением. Такая модель не нуждается в отдельном механизме понимания. Она интерпретирует контекст как часть последовательности.

Удивительно, но именно эта простота дала мощное масштабирование, когда рост параметров и данных привел к появлению новых свойств — качественно нового поведения, не закодированного вручную.

Выборка как регулятор креативности и точности

Во время генерации модель не выбирает единственный лучший токен. Она генерирует распределение вероятностей. Фактическое слово определяется процедурой выборки. Температура определяет, насколько острой или гладкой будет вероятность. Низкая температура превращает модель в почти детерминированный алгоритм. Высокая дает разнообразие и креативность.

Но температура лишь часть механизма. Ограничители вроде top-k и top-p уменьшают пространство маловероятных вариантов. Они позволяют избежать бессмысленных слов, которые появляются в хвостах распределений.

В продакшене выборка это инструмент управления личностью модели. От неё зависит, звучит ли модель осторожно и четко или свободно и творчески.

Чем глубже система генерации, тем важнее становится выборка. Она может кардинально изменить восприятие модели в реальной работе.

Контекстное окно как вычислительный предел

Каждая модель имеет фиксированную длину контекста. Это не абстракция, а физический предел вычислений. Внимание имеет квадратичную сложность по длине последовательности. Каждый лишний токен увеличивает стоимость и ухудшает способность модели фокусироваться.

Потери контекстного окна возникают, когда внутри последовательности находится много нерелевантного текста. История диалога, повторяющиеся инструкции, фрагменты документов в RAG — все это может занимать большую часть окна, не улучшая качество.

Инженерная работа включает сжатие диалогов, фильтрацию информации, создание механизмов долговременной памяти, перенос части контекста во внешние системы и оптимизацию подсказок. Контекстное окно самый дорогой ресурс модели. Использовать его нужно бережно.

Многие думают, что при выходе за окно внимания модель просто забывает старый текст. На самом деле происходит другое. Внутри окна все токены могут взаимодействовать друг с другом. Но если часть текста исчезла, модель перестает иметь доступ к этой информации не постепенно, а сразу. Это называется тиринг границы внимания. Это приводит к эффекту, когда модель уверенно продолжает текст, опираясь на неверные предпосылки, создавая устойчивые, но ложные цепочки.

Когда модель не знает факт, она не говорит «не знаю». Она выбирает токен с максимальной вероятностью в распределении. Если распределение плоское, модель по прежнему выберет наиболее вероятный токен. Но этот токен может быть полностью неверным. Модель врет уверенно, потому что уверенность это математическая функция, а не понимание истины.

LLM не «понимает» мир. Она моделирует вероятностную поверхность человеческого текста. Если она кажется умной, это потому, что человеческий язык глубоко структурирован. Модель обучается этой структуре. Она повторяет её с впечатляющей точностью, но всегда через призму вероятностей. И именно поэтому LLM можно обмануть неправильными подсказками, странными форматами, двусмысленными задачами. Она не работает сверху вниз, как человек. Она работает снизу вверх, по статистике.

Встраивания и RAG как способ уменьшить галлюцинации

Большие модели не должны знать все данные внутри себя. Это дорого, медленно и неэффективно. RAG превращает LLM в процессор смыслов, который подключается к внешнему хранилищу знаний. Это аналог памяти в компьютерной архитектуре. Модель становится CPU, а векторная база оперативной памятью.

Текст документов разбивают на фрагменты, превращают во встраивания и сохраняют в векторной базе. Когда пользователь задает вопрос, система ищет по семантическому сходству наиболее релевантные фрагменты и передает их модели.

Встраивания представляют смысл текста, а не его форму. Близкие по смыслу фрагменты находятся вблизи друг друга в векторном пространстве.

Такой подход устраняет многие виды галлюцинаций, так как модель начинает опираться на реальные данные, а не на догадки.

Гибридный поиск и проблема буквальных совпадений

Семантический поиск великолепно работает для обычных вопросов. Но в технических и юридических документах важны буквальные совпадения: номера статей, коды идентификаторов, конкретные формулы.

Семантика может сгладить отличие между похожими терминами. Поэтому используют гибридный поиск, объединяющий семантическое сходство с поиском по ключевым словам.

Эта комбинация позволяет системе находить документ, который не просто «похож на тему», а точно содержит нужный факт.

Гибридный подход стал стандартом для корпоративных RAG систем.

RLHF как механизм согласования с человеческими нормами

Чтобы модель не просто генерировала текст, а делала это безопасно, последовательно и социально приемлемо, используется RLHF (обучение с усилением по человеческой обратной связи). Его смысл в том, что модель обучают подстраиваться под человеческие предпочтения.

Сначала собирают примеры «хороших ответов». Потом обучают модель вознаграждения, которая умеет ранжировать ответы. Затем оптимизируют основную модель так, чтобы она максимизировала оценку этой моделью вознаграждения.

Проблема в том, что модель вознаграждения это приближение, а не истина. Она может порождать поверхностные, чрезмерно осторожные ответы. Иногда модели начинают избегать вопросов, которые кажутся им рискованными.

RLHF улучшает поведение, но требует аккуратного контроля, так как легко может ввести перекосы.

Квантование как способ сделать модель дешевле

Современные модели огромны. Полная точность FP16 или FP32 слишком дорога. Квантование позволяет представлять веса в более компактной форме, например в INT8 или INT4.

Наивное квантование работает плохо: распределение активаций содержит выбросы, которые растягивают диапазон и ухудшают точность. Современные методы анализируют каждый канал отдельно, оставляют чувствительные части в высокой точности и квантуют остальные.

Это дает двукратное сокращение памяти при минимальной потере качества.

PEFT как механизм тонкой настройки

Полное переобучение модели недоступно большинству компаний. PEFT (методы эффективной тонкой настройки) позволяет обучать маленькие адаптеры, которые затем вставляются в замороженную модель. LoRA стал стандартом в индустрии. QLoRA добавляет к этому четырехбитное квантование для еще большей эффективности.

Эти методы позволяют адаптировать модели под узкие отрасли, не тратя гигантские вычислительные ресурсы. Фактически PEFT сделал обучение LLM демократичным.

Часто спрашивают, почему 70B работает лучше 7B, если оба видели одно и то же. Большая модель может «разместить» в параметрах больше факторов: редких выражений, логических паттернов, длинных зависимостей. Малая модель вынуждена агрессивно сглаживать статистику и теряет детали. Это называется capacity limit. Но достаточная тонкая настройка или хорошая архитектура адаптеров может поднять маленькую модель до уровня средней.

Продакшн метрики как настоящая оценка качества

LMM нельзя оценивать только по бенчмаркам. Важны фактичность, задержка, стабильность, способность к цитированию, уровень галлюцинаций, стоимость на тысячу токенов, поведение при нагрузках и способность к регрессии.

В продакшене модели перепроверяются собственными верификаторами, ответы анализируются дополнительными системами, ведется мониторинг эффектов отклонения и непредвиденных отклонений.

Понимание структуры LLM путь к тому, чтобы использовать модели не как загадочный инструмент, а как инженерный механизм, который можно настраивать, оптимизировать и развивать.

  • Токенизация сжимает текст.
  • Внимание перестраивает контекст.
  • Авторегрессия предсказывает продолжения.
  • Выборка управляет стилем.
  • Контекст задает пределы. RAG добавляет факты. Гибридный поиск улучшает точность.
  • RLHF задает нормы поведения.
  • Квантование делает модель доступной.
  • PEFT позволяет её адаптировать.

Термины и определения

LLM: Large Language Model, большая языковая модель.

Transformer: архитектура нейросетей, использующая механизм внимания для обработки последовательностей.

Token: минимальная единица текста, с которой работает модель, подслово, кусок слова или байт.

Tokenization: процесс преобразования текста в токены.

BPE: Byte Pair Encoding, один из алгоритмов подсловной токенизации.

Byte BPE: BPE на уровне байтов, современный стандарт в GPT моделях.

Attention: механизм внимания, вычисляющий релевантность между токенами.

Self Attention: внимание внутри одной последовательности.

Multi Head Attention: многоголовое внимание, несколько параллельных матриц внимания.

Embedding: встраивание, числовой вектор, представляющий смысл слова, токена или документа.

Context Window: максимальная длина последовательности, которую модель может обработать.

Context Overflow: переполнение контекстного окна.

RAG: Retrieval Augmented Generation, извлечение текста из базы и его подача модели как контекст.

Vector Embedding: векторное представление фрагмента текста.

Vector Database: векторная база данных, поддерживающая ближайших соседей.

ANN: Approximate Nearest Neighbor Search, аппроксимационный поиск ближайших соседей.

BM25: классический алгоритм поиска по ключевым словам.

TF IDF: статистическое взвешивание слов для точного поиска.

Hybrid Search: комбинированный поиск, объединяющий BM25 и векторный поиск.

Zero Shot: выполнение задачи без примеров.

Few Shot: выполнение задачи с несколькими примерами.

Chain of Thought: цепочка рассуждений, когда модель проговаривает шаги решения.

Sampling: выбор следующего токена из вероятностного распределения.

Temperature: коэффициент, смягчающий или усиливающий вероятность токенов.

RLHF: Reinforcement Learning from Human Feedback, обучение с усилением по человеческой обратной связи.

SFT: Supervised Fine Tuning, контролируемая начальная тонкая настройка по примерам человека.

RM: Reward Model, модель вознаграждения, ранжирующая ответы.

PPO: Proximal Policy Optimization, алгоритм обучения с подкреплением для моделей.

Hallucination: галлюцинация, правдоподобный, но ложный ответ модели.

Drift: дрейф модели, изменение поведения с течением времени.

Monitoring: система наблюдения за метриками модели в продакшене.

PEFT: Parameter Efficient Fine Tuning, методы эффективной тонкой настройки.

LoRA: Low Rank Adaptation, тонкая настройка с маленькими матрицами низкого ранга.

QLoRA: Quantized LoRA, LoRA поверх четырехбитной квантованной модели.

Prefix Tuning: метод тонкой настройки, добавляющий обучаемые префиксы к входу.

Adapter Tuning: внедрение маленьких обучаемых модулей в слои модели.

Quantization: квантование, преобразование весов модели в низкую разрядность.

Если вам близка тема AI, технологий и будущего - добро пожаловать в мой канал обсудить и поделиться апдейтами.

11