Как устроен трансформер — архитектура, на которой работает весь современный ИИ
Сегодня практически все крупнейшие языковые модели — GPT, Claude, Gemini и Llama — построены на одной архитектуре. Она появилась в 2017 году и получила название «трансформер». Именно буква T в аббревиатуре GPT означает Transformer.
Но почему именно эта архитектура стала основой современного искусственного интеллекта?
Об этом мы поговорили с исследователем ИИ Михаилом Бурцевым в подкасте «Мыслить как учёный». Ниже — ключевые идеи нашего разговора.
Почему язык оказался сложнее картинок
К началу 2010-х нейросети уже хорошо работали в нескольких больших классах задач.
Первый — компьютерное зрение: распознавание объектов на изображениях, поиск патологий на медицинских снимках, классификация фотографий.
Второй — обучение с подкреплением. В 2015 году исследователи из DeepMind показали, что одна и та же нейросетевая архитектура способна достигать уровня человека в разных играх Atari.
Но обработка естественного языка оказалась гораздо более сложной задачей.
В отличие от изображения, предложение представляет собой последовательность слов, причём слова зависят друг от друга, а длина последовательности постоянно меняется. Чтобы работать с такими данными, исследователи использовали рекуррентные нейронные сети: они хранили некоторое внутреннее состояние, то есть память о предыдущих словах.
Однако у такого подхода была фундаментальная проблема: память постепенно стиралась. Когда сеть записывала новую информацию, старая частично терялась. В результате слова из начала предложения могли «забываться» ещё до конца обработки текста.
Переводчик, который к третьему слову уже не помнит первое, — не самый надёжный переводчик.
Как возник механизм внимания
Исследователи задумались: а что если не хранить всю информацию в одной постоянно перезаписываемой памяти?
Так появилась идея сохранять отдельные состояния памяти для каждого слова и затем выбирать среди них наиболее важные в конкретный момент.
Этот механизм получил название attention — «внимание».
Во время генерации очередного слова модель оценивает, какие слова исходного текста наиболее релевантны сейчас, и назначает им разные веса. Например, одно слово может получить 90% внимания, а остальные разделят оставшиеся 10%.
Благодаря этому модель больше не обязана одинаково учитывать всю историю текста: она может сосредоточиться именно на тех частях, которые важны в данный момент.
Изначально механизм внимания появился именно в задачах машинного перевода.
Статья, которая изменила всё
К 2016–2017 году исследователи столкнулись с ещё одним ограничением рекуррентных сетей: отсутствием параллелизма.
Чтобы вычислить представление следующего слова, сначала нужно было вычислить представление предыдущего. Это делало обучение медленным и плохо масштабируемым.
Группа исследователей из Google предложила радикальное решение: полностью отказаться от рекуррентности.
Вместо последовательной обработки слов они сделали так, чтобы каждое слово могло одновременно «смотреть» на другие слова через механизм внимания.
Так появился self-attention — внимание к самому контексту.
Чтобы правильно понять слово, важно учитывать окружающие его слова. Self-attention позволяет каждому токену анализировать весь контекст сразу и строить более богатое представление текста.
В 2017 году вышла статья Attention Is All You Need — «Внимание — это всё, что нам нужно». Название было отсылкой к песне The Beatles.
Архитектуру, описанную в этой работе, назвали трансформером.
Именно она лежит в основе современных больших языковых моделей.
Почему трансформер победил
Трансформер оказался одновременно более точным и более вычислительно эффективным.
Он позволил:
— обрабатывать текст параллельно;— учитывать контекст целиком;— обучать модели на огромных объёмах данных;— масштабировать системы до размеров, которые раньше были невозможны.
В результате именно трансформеры стали основой GPT, Claude, Gemini и большинства современных ИИ-систем.
По словам Михаила Бурцева, победа трансформера сегодня зафиксирована и масштабом инвестиций, и тем фактом, что все крупнейшие коммерческие модели построены именно на этой архитектуре.
Но победа не означает отсутствие ограничений: механизм внимания, сделавший трансформер успешным, одновременно является и его главной слабостью. Именно из-за него современные модели испытывают трудности с очень длинными контекстами.
Что дальше?
Трансформер уже изменил обработку текста, изображений и биологических данных. Команда Михаила Бурцева работает над рекуррентными трансформерами, которые способны обрабатывать последовательности длиной в десятки миллионов токенов — например, геном человека.
Возможно, история этой архитектуры только начинается.
Полную версию разговора с исследователем ИИ Михаилом Бурцевым о трансформерах, памяти нейросетей и будущем искусственного интеллекта можно послушать в подкасте «Мыслить как учёный».