OpenAI впервые за 6 лет открыла свои локальные модели

OpenAI выпустила gpt-oss-120b и gpt-oss-20b — две модели, которые любой разработчик может скачать, поставить на свой сервер и запустить без интернета. И главное даже не в технических характеристиках, а в самом факте: компания, которая шесть лет назад превратилась из «открытого AI-исследования» в самую закрытую лабораторию индустрии, развернулась обратно. Разберём, что именно произошло и что это меняет.

Что выпустили

Технически — две модели семейства gpt-oss, обе под лицензией Apache 2.0 (то есть бесплатное коммерческое и исследовательское использование без ограничений).

gpt-oss-120b — 117 миллиардов параметров. По бенчмаркам на ключевых задачах рассуждения почти не уступает закрытой o4-mini от той же OpenAI. На некоторых задачах (математика соревнований, медицинский Q&A) — даже превосходит её. Запускается на одном GPU NVIDIA H100 с 80 ГБ памяти.

gpt-oss-20b — 21 миллиард параметров. Уровень o3-mini, но шесть раз меньше. Реальный размер на диске — 12.8 ГБ. Это значит, что её можно запустить на MacBook с 16 ГБ памяти и получить десятки токенов в секунду на вывод.

Цифры впечатляющие, но не сами по себе. Похожие или лучшие результаты показывают открытые модели от Meta, Qwen, Mistral. Уникальность не в качестве, а в том, кто выпустил.

Почему это шаг назад в открытость, а не вперёд

Тут стоит вспомнить историю.

В 2019 году OpenAI выпустила GPT-2 — последнюю на тот момент открытую модель компании. Сначала её не выложили целиком, объясняя «слишком высоким риском злоупотреблений». Потом всё-таки выложили. И с тех пор — тишина: GPT-3 закрыт, GPT-4 закрыт, все o-серии закрыты, никаких весов. Компания, чьё название содержит слово «open», стала символом закрытости. И на этом фоне поднимался движение за открытые модели — Llama от Meta, DeepSeek из Китая, серия Qwen от Alibaba — которые, к моменту 2025 года, начали догонять и местами обгонять закрытые модели по бенчмаркам.

Релиз gpt-oss — это возврат к открытости впервые за 6 лет. И важно понимать: это не «небольшая модель в подарок». Это фронтирные модели, обученные на тех же техниках, что и o3 и o4-mini (через комбинацию reinforcement learning и других методов alignment). По сути OpenAI отдала разработчикам часть своего внутреннего стэка.

Зачем? Тут несколько версий, и они дополняют друг друга.

Версия первая — конкурентная. Llama и Qwen стали серьёзными конкурентами в нише корпоративного и оборонного AI: компании, которые не могут отправлять данные в OpenAI API (банки, правительства, медицина), уходят на открытые модели. Если эта ниша полностью отойдёт Meta и Alibaba, OpenAI потеряет огромный кусок рынка. Логичный ответ — выпустить свои open-weight модели, занять место.

Версия вторая — стратегическая. Чем больше людей разрабатывают на gpt-oss и привыкают к экосистеме OpenAI (тот же harmony response format, те же tool-use конвенции), тем выше шанс, что эти разработчики позже перейдут на платный API для больших задач. Это funnel-стратегия: бесплатно начать, потом докупить мощность.

Версия третья — политическая. В США и Европе всё громче обсуждается регулирование AI, и одна из тем — «слишком сильная концентрация в руках нескольких лабораторий». Выпустив открытые модели, OpenAI частично снимает этот аргумент.

Все три версии разумны, и, скорее всего, действуют одновременно. Чистого альтруизма тут нет — это бизнес-ход, но умный бизнес-ход.

Технические детали, которые стоит знать разработчикам

Для тех, кто думает прикрутить это к своему продукту, несколько важных моментов.

Архитектура — Mixture-of-Experts. 117 миллиардов параметров — это общее число, но на каждый токен активируется только примерно 5.1 миллиарда (в маленькой модели — 3.6 миллиарда). Это и объясняет, как такая модель помещается на одном GPU: считается только активная часть. У 128 «экспертов» в модели, на токен выбирается 4. Та же архитектура, что у DeepSeek-R1 и Mixtral.

Контекст — 128 тысяч токенов нативно. Достаточно для большинства практических задач: длинные документы, кодовые базы, многооборотные диалоги.

Тренировались на английском. Это важное ограничение. Для русскоязычных задач модель будет работать хуже, чем для англоязычных — STEM-направление в датасете подчёркивает это смещение. Если планируется RU-применение, потребуется fine-tuning.

Безопасность. OpenAI провела внутренний red teaming с бюджетом $500,000, опубликовала model card с подробным описанием тестирования. Но: с открытыми весами любые safety-настройки можно снять fine-tuning'ом. Это OpenAI явно признаёт в model card, и они специально тестировали, что произойдёт после злонамеренного дообучения. Результат — «harmful capabilities не достигают наших порогов даже после adversarial fine-tuning», но всё равно держите этот факт в голове: вы получаете не «безопасную модель», а «модель, которая по умолчанию ведёт себя безопасно».

Что это меняет на практике

Для конкретных сценариев применения сдвиг получается ощутимым.

On-premise AI стал реалистичен. Раньше для серьёзных задач нужно было либо платить за API (с отправкой данных вовне), либо мириться со средними по качеству открытыми моделями. Теперь можно ставить фронтирную модель на свой сервер и работать с чувствительными данными локально. Это меняет правила игры для регулируемых отраслей.

Себестоимость inference падает. Кто платил $10–20 за миллион токенов через закрытые API, теперь может перейти на собственный инференс с электричеством плюс амортизация железа. На больших объёмах это снижение в разы. С другой стороны — нужно админство, нужно держать GPU, нужно мониторить. Не для всех экономика сходится.

Появляется новый слой посредников. Сервисы вроде LM Studio, Ollama, Together AI начнут предлагать «gpt-oss как сервис», конкурируя ценой и удобством. OpenAI как бы создала рынок против себя — и это тоже сознательно.

Маленькая модель в кармане. 20b на MacBook — это серьёзный сдвиг для тех, кто думает об оффлайн-AI: помощник для разработчика без интернета, локальные интервью с расшифровкой, что-то для путешествий, где нет связи. Раньше это был мир маленьких 7B моделей с заметно слабым качеством. Теперь — реальный o3-mini уровень в кармане.

Что забрать себе

Если вы строите продукт на AI, два вывода стоит сделать.

Во-первых, рассмотрите open-weight как опцию заново. Месяц назад большой open-weight модели у OpenAI просто не было; теперь есть, и она в верхнем эшелоне открытых. Стоит пересчитать экономику ваших inference-расходов с новой опорой.

Во-вторых, тренд на «открытость как стратегия» только усиливается. После gpt-oss следующим релиз-кандидатом могут быть аналогичные шаги от Anthropic, Google. Закрытые лаборатории постепенно отказываются от полной закрытости — потому что вокруг растёт экосистема, и оставаться вне неё опаснее, чем потерять часть конкурентного преимущества.

И последнее. Сам факт, что компания с самыми сильными моделями в мире решает поделиться частью своей технологической базы — это сигнал, по которому видно зрелость индустрии. AI перестаёт быть «приватным ноу-хау нескольких лабораторий» и становится инфраструктурой, как стал базой данных, веб-сервер или операционная система. На этот сдвиг разработчику стоит обратить внимание — не потому что что-то изменится завтра, а потому что через 2-3 года точка отсчёта будет другой.

Свежие новости из мира AI — в моём Telegram-канале «AI за 5 минут»: t.me/ai_digest_5min. Короткие посты на русском, релизы моделей и исследования в реальном времени. Канал собирается автоматически из англоязычных источников — без необходимости самому читать Twitter каждый день.

1