Как устроен трансформер — архитектура, на которой работает весь современный ИИ

Сегодня практически все крупнейшие языковые модели — GPT, Claude, Gemini и Llama — построены на одной архитектуре. Она появилась в 2017 году и получила название «трансформер». Именно буква T в аббревиатуре GPT означает Transformer.

Как устроен трансформер — архитектура, на которой работает весь современный ИИ

Но почему именно эта архитектура стала основой современного искусственного интеллекта?

Почему язык оказался сложнее картинок

К началу 2010-х нейросети уже хорошо работали в нескольких больших классах задач.

Первый — компьютерное зрение: распознавание объектов на изображениях, поиск патологий на медицинских снимках, классификация фотографий.

Второй — обучение с подкреплением. В 2015 году исследователи из DeepMind показали, что одна и та же нейросетевая архитектура способна достигать уровня человека в разных играх Atari.

Но обработка естественного языка оказалась гораздо более сложной задачей.

В отличие от изображения, предложение представляет собой последовательность слов, причём слова зависят друг от друга, а длина последовательности постоянно меняется. Чтобы работать с такими данными, исследователи использовали рекуррентные нейронные сети: они хранили некоторое внутреннее состояние, то есть память о предыдущих словах.

Однако у такого подхода была фундаментальная проблема: память постепенно стиралась. Когда сеть записывала новую информацию, старая частично терялась. В результате слова из начала предложения могли «забываться» ещё до конца обработки текста.

Переводчик, который к третьему слову уже не помнит первое, — не самый надёжный переводчик.

Как возник механизм внимания

Исследователи задумались: а что если не хранить всю информацию в одной постоянно перезаписываемой памяти?

Так появилась идея сохранять отдельные состояния памяти для каждого слова и затем выбирать среди них наиболее важные в конкретный момент.

Этот механизм получил название attention — «внимание».

Во время генерации очередного слова модель оценивает, какие слова исходного текста наиболее релевантны сейчас, и назначает им разные веса. Например, одно слово может получить 90% внимания, а остальные разделят оставшиеся 10%.

Благодаря этому модель больше не обязана одинаково учитывать всю историю текста: она может сосредоточиться именно на тех частях, которые важны в данный момент.

Изначально механизм внимания появился именно в задачах машинного перевода.

Статья, которая изменила всё

К 2016–2017 году исследователи столкнулись с ещё одним ограничением рекуррентных сетей: отсутствием параллелизма.

Чтобы вычислить представление следующего слова, сначала нужно было вычислить представление предыдущего. Это делало обучение медленным и плохо масштабируемым.

Группа исследователей из Google предложила радикальное решение: полностью отказаться от рекуррентности.

Вместо последовательной обработки слов они сделали так, чтобы каждое слово могло одновременно «смотреть» на другие слова через механизм внимания.

Так появился self-attention — внимание к самому контексту.

Чтобы правильно понять слово, важно учитывать окружающие его слова. Self-attention позволяет каждому токену анализировать весь контекст сразу и строить более богатое представление текста.

В 2017 году вышла статья Attention Is All You Need — «Внимание — это всё, что нам нужно». Название было отсылкой к песне The Beatles.

Архитектуру, описанную в этой работе, назвали трансформером.

Именно она лежит в основе современных больших языковых моделей.

Почему трансформер победил

Трансформер оказался одновременно более точным и более вычислительно эффективным.

Он позволил:

— обрабатывать текст параллельно;— учитывать контекст целиком;— обучать модели на огромных объёмах данных;— масштабировать системы до размеров, которые раньше были невозможны.

В результате именно трансформеры стали основой GPT, Claude, Gemini и большинства современных ИИ-систем.

По словам Михаила Бурцева, победа трансформера сегодня зафиксирована и масштабом инвестиций, и тем фактом, что все крупнейшие коммерческие модели построены именно на этой архитектуре.

Но победа не означает отсутствие ограничений: механизм внимания, сделавший трансформер успешным, одновременно является и его главной слабостью. Именно из-за него современные модели испытывают трудности с очень длинными контекстами.

Что дальше?

Трансформер уже изменил обработку текста, изображений и биологических данных. Команда Михаила Бурцева работает над рекуррентными трансформерами, которые способны обрабатывать последовательности длиной в десятки миллионов токенов — например, геном человека.

Возможно, история этой архитектуры только начинается.

Полную версию разговора с исследователем ИИ Михаилом Бурцевым о трансформерах, памяти нейросетей и будущем искусственного интеллекта можно послушать в подкасте «Мыслить как учёный».