«bert нейросеть» жива: ModernBERT проиграл старому BERT-base в sparse-ретривале

«bert нейросеть» жива: ModernBERT проиграл старому BERT-base в sparse-ретривале

В июне 2026 года вышла работа «Rescaling MLM-Head for Neural Sparse Retrieval» (arXiv:2606.18811, 17.06.2026) с неудобным для прогресса результатом. Авторы обучили sparse-ретриверы SPLADE по одному рецепту на разных бэкбонах - и свежий энкодер ModernBERT схлопнулся до 0.127 mean nDCG@10 на бенчмарке BEIR-13. Старый BERT-base, которому этой осенью исполняется восемь лет, на том же рецепте держит 0.361-0.403.

Вторая статья, принятая на SIGIR 2026 («Why Advanced Encoders Lag on Sparse Retrieval?», arXiv:2607.00004), называет причину - Vocabulary Gap, разрыв словарей. И предлагает лекарство, после которого тот же ModernBERT ставит рекорд на BEIR: 52.4 nDCG, прирост +4.7 к прошлому SOTA.

Если ты строишь поиск, RAG или классификацию и выбираешь энкодер-фундамент, этот разбор про твою задачу. Проверить спор на своих документах можно без зоопарка аккаунтов у провайдеров: provod.ai (российский OpenRouter) даёт единый API к современным моделям, включая embedding-модели для поиска, с оплатой в рублях по официальным тарифам.

Что такое нейросеть BERT и почему о ней снова спорят в 2026 году?

Коротко: BERT - энкодерная нейросеть Google 2018 года, которая читает текст сразу в две стороны и превращает слова в векторы. Спор разгорелся снова, потому что две свежие работы показали: в sparse-поиске старичок обходит своего преемника.

BERT (Bidirectional Encoder Representations from Transformers) опубликовали Devlin, Chang, Lee и Toutanova из Google 11 октября 2018 года (arXiv:1810.04805). BERT-base - 110 млн параметров, 12 слоёв, 12 голов внимания, обучение на 3.3 млрд слов: BooksCorpus и английская Википедия. Предобучение - Masked LM: модель видит фразу с прорехами (маскируют 15% токенов) и угадывает пропавшие слова, глядя на контекст с двух сторон сразу.

На пенсию модель так и не ушла. 25 октября 2019 года Google встроил BERT в ранжирование поиска и featured snippets: по данным официального блога компании, она помогала понимать каждый десятый запрос на английском в США; Google назвал это крупнейшим скачком в понимании запросов за пять лет. На декабрь 2024 года BERT оставался второй по скачиваниям моделью Hugging Face Hub - больше 68 млн в месяц, по данным Answer.AI (свежей статистики за июль 2026 у хаба публично нет).

Чем архитектура BERT отличается от GPT?

Коротко: BERT - энкодер, GPT - декодер. Первый читает фразу целиком и строит её сжатое представление для понимания. Второй предсказывает следующий токен и потому умеет генерировать текст. Разные органы, разные работы.

Запрос «чем отличаться архитектура bert от gpt» - один из самых частых рядом с этой темой. Разница в направлении чтения: обе модели - трансформеры, но BERT смотрит на предложение сразу с двух сторон, поэтому его векторы ложатся на классификацию, извлечение сущностей и эмбеддинги для поиска. GPT обучен авторегрессионно: токен за токеном, слева направо, и его сила - продолжать текст.

Отсюда разделение труда и цен. Энкодер - орган восприятия: дёшево превращает горы документов в числа. Декодер - орган речи: дорого сочиняет ответ. Кейс из блога Answer.AI (19.12.2024): фильтрация 15 триллионов токенов файнтюненной BERT-моделью заняла 6000 H100-часов, около $60 000 по $10 за час. Те же 15 триллионов через дешёвый декодер Gemini Flash по $0.075 за миллион токенов обошлись бы дороже миллиона долларов.

Почему ModernBERT проиграл BERT-base в sparse-ретривале?

Коротко: виноват Vocabulary Gap. Словарь BERT - 30 522 нормализованных WordPiece-токена без учёта регистра. Словарь ModernBERT - 50 368 регистрозависимых BPE-токенов. Одно слово рассыпается на веер поверхностных форм, и лексическое совпадение страдает.

ModernBERT вышел 19 декабря 2024 года (Answer.AI совместно с LightOn) как slot-in replacement для BERT-подобных моделей: контекст 8192 токена против 512, обучение на 2 триллионах токенов с большой долей кода в данных. В dense-ретривале и классификации он действительно сильнее старичков. Но авторы статьи для SIGIR 2026, Zhichao Geng и Yang Yang, зафиксировали обратное для learned sparse retrieval: при стандартном fine tune продвинутые энкодеры отстают от стареющего BERT-base.

Механика такая. Токенизатор BERT приводит слово к нижнему регистру: search, Search и SEARCH станут одним токеном и одной строкой в индексе. Регистрозависимый словарь ModernBERT хранит все три формы раздельно - для точной реконструкции текста это плюс, а для sparse-поиска минус: емкость модели уходит на морфологический шум, вес термина размазывается по избыточным формам. Размеры словарей - из официальных конфигов Hugging Face на 19 июля 2026 года.

Как эксперимент с MLM-головой подтвердил диагноз независимо?

Коротко: июньская работа замерила L2-норму матрицы MLM-головы у разных бэкбонов. У моделей с нормой ниже 2 (BERT, DistilBERT, ALBERT, GTE-MLM) sparse-ретриверы получаются сильными. У ModernBERT норма большая - и качество рушится до 0.127.

MLM-голова - последний слой энкодера, превращающий скрытое состояние в распределение по словарю. SPLADE строит sparse-вектор документа именно через эту голову, поэтому её масштаб критичен. Итоги прогона на BEIR-13 (mean nDCG@10, по данным arXiv:2606.18811 от 17.06.2026):

  • BERT, DistilBERT, ALBERT, GTE-MLM: 0.361-0.403
  • RoBERTa: 0.331
  • Ettin: 0.221
  • ModernBERT: 0.127

Разрыв между семейством BERT и ModernBERT - почти тройной, и он воспроизводится на сводке из тринадцати датасетов: версия «просто не повезло на одном корпусе» отпадает.

«bert нейросеть» жива: ModernBERT проиграл старому BERT-base в sparse-ретривале

Что такое sparse-ретривал и причём тут словарь?

Коротко: sparse-ретривер хранит документ как разреженный вектор размером со словарь: каждому терму - неотрицательный вес важности. Такой вектор ложится на классический инвертированный индекс, как BM25, только веса расставляет нейросеть.

SPLADE (Sparse Lexical and Expansion Model for First Stage Ranking) предложили Formal, Piwowarski и Clinchant на SIGIR 2021 (arXiv:2107.05720). Идея: прогнать документ через MLM-голову энкодера и получить веса сразу для десятков тысяч термов - включая синонимы, которых в тексте нет. Получается нейросетевое расширение термов плюс скорость BM25-подобного поиска. Обзор «A Unified Framework for Learned Sparse Retrieval» (arXiv:2303.13416, март 2023) добавляет ограничение: веса обязаны быть неотрицательными - таково требование стека инвертированных индексов, поэтому вектор живёт в координатах словаря.

Меряется всё это на BEIR (Thakur et al., NeurIPS 2021) - zero-shot бенчмарке из 18 датасетов, де-факто стандарте оценки ретриверов; обе работы 2026 года использовали именно его.

Как починили ModernBERT: пересадка словаря и одна константа

Коротко: два независимых фикса. Vocabulary Transfer пересаживает энкодер на нормализованный словарь и ставит SOTA на BEIR: 52.4 nDCG, прирост +4.7. Rescaling умножает матрицу MLM-головы на константу k=16 и поднимает ModernBERT с 0.127 до 0.405 - без новых параметров и без смены архитектуры.

Первый путь - из статьи SIGIR 2026. Фреймворк Vocabulary Transfer мигрирует продвинутые энкодеры на sparse-friendly словари: Semantic Initialization по топологии векторного пространства плюс Activation Potential Calibration, предотвращающая мёртвые нейроны и dense collapse. Тот же приём реанимирует просевший RoBERTa-large; код и модели авторы выложили в открытый доступ.

Второй путь - из июньской работы: перескейлить веса MLM-головы константой k до обучения SPLADE. При k=16 ModernBERT растёт с 0.127 до 0.405 на BEIR-13 (плюс 215% относительного прироста), MS MARCO MRR@10 - с 0.045 до 0.250, TREC-DL 2019 nDCG@10 - с 0.266 до 0.609; Ettin - с 0.221 до 0.391. Подвох: оптимум зависит от бэкбона. RoBERTa пикает при k=2, а при k=16 рушится. Константу подбирают, а не копируют.

Какой бэкбон взять под поиск: план на неделю

Коротко: нужен sparse-ретривер по стандартному рецепту - бери BERT-family. Нужен длинный контекст или dense-поиск - ModernBERT. В любом случае прогони оба варианта на своих данных: спор решается замером, а не датой релиза.

Сводка по официальным конфигам Hugging Face (проверены 19 июля 2026 года) и материалам Answer.AI:

  • BERT-base: Год релиза • ModernBERT-base: 2018
  • BERT-base: Параметры • ModernBERT-base: 110M
  • BERT-base: Словарь • ModernBERT-base: 30 522, WordPiece, без учёта регистра
  • BERT-base: Контекст • ModernBERT-base: 512 токенов
  • BERT-base: Позиции • ModernBERT-base: абсолютные эмбеддинги
  • BERT-base: Внимание • ModernBERT-base: полное
  • BERT-base: Слои • ModernBERT-base: 12
  • BERT-base: Где сильнее • ModernBERT-base: sparse-файнтюнинг «из коробки»

Практический порядок действий:

  1. Собери 200-500 реальных запросов и релевантных им документов из своей базы - это твой мини-BEIR.
  2. Обучи SPLADE по стандартному рецепту на BERT-base и на ModernBERT, замерь nDCG@10 на своей разметке.
  3. Если ModernBERT просел - посмотри L2-норму его MLM-головы; при норме выше 2 пробуй rescaling с сеткой k = 2, 4, 8, 16.
  4. Есть ресурс на серьёзный эксперимент - ставь Vocabulary Transfer, код открыт.
  5. Сравни оба варианта с готовыми embedding-моделями через API: иногда файнтюн вообще не нужен.

Пятый шаг заводится из России сменой двух строк: ключ и base_url единого API provod.ai. Он совместим с OpenAI SDK, поэтому скрипт сравнения не переписываешь под каждого провайдера, а переключаешь модель одной строкой. Один ключ вместо пяти, один баланс на эксперименты и прод, виден расход по каждой модели.

Что это НЕ решает?

Коротко: проигрыш ModernBERT - нишевый кейс одного рецепта. Из него следует узкий вывод про sparse-файнтюнинг; приговаривать новую архитектуру по нему нельзя.

  • В dense-ретривале, классификации и на длинном контексте ModernBERT сильнее: по заявлениям Answer.AI, это первый base-размерный энкодер, обыгравший DeBERTaV3 на GLUE, при менее чем пятой части её памяти и вдвое большей скорости.
  • Оба эксперимента - на английских данных (MS MARCO, BEIR). Для русского языка берут мультиязычные энкодеры, и переносить цифры без проверки нельзя.
  • VT и rescaling - препринты июня-июля 2026 года, а не production-стандарт: у рецептов просто не было времени набрать отрицательные отзывы из практики.

Когда provod.ai не подходит

Коротко: если ты обучаешь собственный энкодер на своём железе, агрегатор на этом этапе ни при чём.

По теме статьи честно так: provod.ai - про доступ к готовым моделям по API из России, с рублёвым балансом и документами для юрлиц. Файнтюн SPLADE на своих GPU, пересадку словаря и self-hosted инвертированный индекс он не заменяет - это работа твоей команды на твоём железе. Не подойдёт он и там, где нужен on-prem контур без внешних вызовов. А вот этап «быстро сравнить готовые embedding-модели на своих текстах до того, как платить за обучение» - как раз его территория.

Словарик запросов кластера

Коротко: вокруг запроса «bert нейросеть» поиск собрал хвост из сотни соседних формулировок. Размечаем, что люди на самом деле искали, чтобы ты не перепутал.

Техника рядом, которую путают с BERT

  • «tree» - tree of thoughts, техника промптинга LLM, к BERT отношения нет.
  • «gptq» - формат квантования весов: ужимает LLM под домашнюю видеокарту.
  • «gptzero.me» - детектор ИИ-текста, запрос пишут как «gptzero me».
  • «gym» - OpenAI Gym, тренажёр для обучения агентов с подкреплением.
  • «worm» - WormGPT, вредоносная LLM для фишинга; ищут «worm gpt github».
  • «cursorrules» - файл правил для AI-редактора Cursor.
  • «regional» и «material» - Regional Prompter у Stable Diffusion и ошибка Suno про авторские права на тексты песен.
  • «method», «extractor», «i2v» - обрывки про сэмплеры Stable Diffusion, извлечение звука и генерацию видео из картинки.
  • «try-on» - Kolors Virtual Try-On, виртуальная примерка одежды.
  • «daw», «xln», «lhy», «ztx» - звуковые станции и аудио-плагины; Suno стыкуют с DAW.
  • «salutespeech» - SaluteSpeech, голосовой стек Сбера.
  • «20studio» и «animan» - студийные сервисы из соседних выдач про Qwen и Udio.
  • «master» - «promt master»: уроки промптинга, не про энкодеры.
  • «table» - «gpt table»: генерация таблиц в ChatGPT.

Опечатки и склейки брендов

  • «gptcom», «gptchatcom» - так ошибочно набирают адрес ChatGPT.
  • «gptrus», «gptrussia» - поиск «ChatGPT в России».
  • «chatgptappcom», «chatgptappgpt», «chatgptchatappcom», «chatpgptapp», «chatbotappgpt» - попытки набрать адрес приложения ChatGPT по памяти.
  • «chatgpttestbot», «chatgpttools» - тестовые боты и подборки инструментов вокруг ChatGPT.
  • «dgpt», «gptcat», «gpttea», «lein» - мемные и обрывочные склейки с GPT.
  • «gptinnel», «gpttonel», «gpttonnel» - искажённый «GPT tunnel»: пути обхода блокировок.
  • «gptroom», «yard» - room gpt: дизайн комнат и двора по фото.
  • «gpt4tbot», «gpt5tbot», «gpt4agentsbot», «aigptbot» - телеграм-боты с доступом к GPT.
  • «chatdeepseek», «deepseekchat» - навигация к DeepSeek.
  • «diplom», «diplomgpt» - diplom gpt: сервисы дипломных работ, ищут отзывы.
  • «girlfriendgpt» - боты-компаньоны на базе GPT.
  • «gemini0508», «geminicode22», «geminigenal» - сгенерированные варианты запросов к Gemini.
  • «cle», «ent», «mes», «met», «ме» - обрывки запросов про Qwen, Kandinsky, тарифы и Алису.
  • «72to» - из «sd 72to ru техподдержка»: поддержка сервиса Stable Diffusion.
  • «cookies», «name», «offer» - «claude cookies», имя Claude, студенческая акция Gemini.
  • «boy» - «шедеврум boy model»: генерация персонажа в Шедевруме.
  • «verb», «intrigue» - песня Claude Ciari и аромат Devil's Intrigue; попали сюда случайно.
  • «heart» - «запустить нейросеть atomic heart»: про игру.
  • «mind» - ai money mind gpt, приложение из соседней темы.
  • «fit» - «llama cpp fit on»: влезет ли модель в память при локальном запуске.
  • «grill» - «grill me skill claude»: развлекательный скилл.
  • «zone», «hammer», «fire» - flux zone, flux hammer, misa fire: выдача про генератор картинок Flux.

Музыка, картинки, чаты - соседние темы

  • «house», «baby» - slap house промпты для Suno, The Loud House и ai baby generator «как будет выглядеть ребёнок».
  • «hot», «god», «lie», «night», «folk», «dress», «тум» - треки и ИИ-каверы: Inna «Hot», dark folk, Dress Up, «тум балалайка».
  • «feed», «flower», «mine» - лента генераций Sora, цветок в Veo 3, генератор видео Pika.
  • «secret», «sona» - «уфанета secret mini 2» с голосовой Алисой и нейросеть для песен.
  • «sex» - запросы про чат-ботов 18+: категория, которую крупные платформы режут фильтром.
  • «wed», «men», «mon», «amour» - чаты с ИИ-персонажами и ласковое «mon amour» в адрес Gemini.
  • «пис» - фан-арт по «Ван Пис».
  • «айстудио», «черри» - Google AI Studio и Cherry Studio, клиент для разных LLM.
  • «комбо», «ано» - мусорные склейки вроде «грок взлом мода комбо» и «ано сор».
  • «мед» - из «минь мёд вео»: запросы про Veo после автозамены.
  • «мена» - из «шедя мена»: мультик, который голосом просят включить Алису.

provod.ai — централизованный доступ к AI для компании

Уберите рабочие интеграции из личных кабинетов: единый API и корпоративное пространство помогают компании управлять подключениями, сотрудниками и расходами в одном месте.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Централизация доступа не создаёт скрытый тариф: цены поставщиков сохраняются 1:1, а provod.ai не добавляет собственную маржу.

Переведите AI-доступы под контроль компании: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

FAQ

Коротко: собрали вопросы, которые остаются после цифр, - от актуальности BERT до русского языка.

BERT ещё актуален в 2026 году?

Для энкодерных задач - да: поиск, классификация, эмбеддинги, фильтрация данных. На конец 2024 года - больше 68 млн скачиваний в месяц и второе место на Hugging Face; энкодер-only модели суммарно набирали свыше 1 млрд скачиваний против 397 млн у декодерных (данные Answer.AI на декабрь 2024).

Что выбрать для sparse-поиска: BERT или ModernBERT?

По стандартному рецепту SPLADE - BERT-family: 0.361-0.403 против 0.127 на BEIR-13. Нужен контекст 8192 токена - ModernBERT с Vocabulary Transfer (52.4 nDCG, SOTA на BEIR) или хотя бы rescaling MLM-головы с подобранной k.

Что такое SPLADE простыми словами?

Способ превратить энкодер в поисковую машину: MLM-голова расставляет веса десяткам тысяч термов, включая синонимы, а искать можно старым добрым инвертированным индексом, без векторной базы.

Эти выводы работают для русского языка?

Неизвестно. Оба исследования мерились на английских MS MARCO и BEIR. Для русского обычно берут мультиязычные энкодеры, и L2-норму MLM-головы там стоит проверять отдельно.

Чем BERT отличается от ChatGPT?

BERT - энкодер понимания 2018 года, он не ведёт диалог. ChatGPT - чат-продукт поверх генеративного декодера GPT. Один индексирует и классифицирует, другой разговаривает.

Где взять код починки ModernBERT?

Авторы статьи про Vocabulary Gap (SIGIR 2026) выложили код и модели в открытый доступ; ссылка - в препринте arXiv:2607.00004.

«bert нейросеть» жива: ModernBERT проиграл старому BERT-base в sparse-ретривале

Итог всей истории простой: выбор энкодера - эмпирический вопрос. Сравнить готовые embedding-модели на своих документах можно за один вечер через provod.ai: единый API, баланс в рублях с карты РФ, условия оплаты и документы для юрлиц стоит проверить на сайте сервиса. Замер на своих данных решит спор честнее любой статьи, включая эту.

Мой рабочий вывод спорный: под sparse-поиск в 2026 году я бы стартовал с BERT-base, а ModernBERT брал только с пересаженным словарём. Ты на чём собрал бы индекс - на проверенном старичке или на новичке с докруткой?

Источники

  • S1: «Why Advanced Encoders Lag on Sparse Retrieval? The Answer and an Approach to Bridging Vocabulary Gaps», Geng & Yang, arXiv:2607.00004, accepted at SIGIR 2026 -
  • S2: «Rescaling MLM-Head for Neural Sparse Retrieval», 17.06.2026 -
  • S3: Answer.AI, «Finally, a replacement for BERT: Introducing ModernBERT», 19.12.2024 -
  • S5: «BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding», Devlin et al., 11.10.2018 -
  • S6: «SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking», Formal et al., SIGIR 2021 -
  • S7: «A Unified Framework for Learned Sparse Retrieval», март 2023 -
  • S8: конфиг bert-base-uncased (vocab 30522), проверен 19.07.2026 -
  • S9: конфиг ModernBERT-base (vocab 50368), проверен 19.07.2026 -
  • S13: «BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models», Thakur et al., 17.04.2021 -
  • S14: Google, «Understanding searches better than ever before», 25.10.2019 -