Чип OpenAI — Jalapeño

Эпоха, когда Nvidia драла три шкуры за свои видеокарты, официально подходит к концу. OpenAI показала свой собственный процессор с острым названием Jalapeño. И вокруг этой железки уже куча восторгов, но большинство новостей забыли объяснить самое главное: что с этого нам с вами. Так и что?

Смотрите, чип собрали всего за девять месяцев вместо обычных трех лет. По меркам микроэлектроники — это как построить небоскреб за выходные, просто потому что инженеры додумались запрячь сам искусственный интеллект проектировать дорожки на микросхеме. Не сказать что ИИ делал это целиком и полностью, но уж точно помогал.

Но в заголовках уже все орут: «OpenAI уничтожит Nvidia!». НО - это чип не для обучения новых моделей. Тренировать свои будущие модели они продолжат на фермах Nvidia — потому что без их дури пока что никуда не деться.

Jalapeño (халапеньо - типо перчик, поняли да?) нужен для момента, когда вы вбиваете запрос в ChatGPT и ждете, пока он родит ответ в уже обученной модели. В новом чипе они выбросили к все лишние «мускулы», которые нужны видеокартам для графики или тяжелых расчетов, и влили все ресурсы в пропускную способность памяти.

Чтобы рассчитать, какое слово нужно вам выдать, например, на 51 место, сначала нейросети нужно было заново прочитать 50 предыдущих слов, вспомнить контекст и уже потом выдать наиболее вероятностное слово по контексту. И она каждый раз бегала туда сюда, за новым и новым контекстом. И вот именно эта беготня и отнимала время, а не сама генерация этого слова. Потому с генерацией у Nvidia проблем то и не было, потому что тут дело касалось правильно вычислить веса. Дурь есть — ума не надо.

Представьте себе мишленовского повара, который шинкует продукты со скоростью пулемета. И получается что гениальный повар стоит и ждет, пока ленивый стажер притащит ему со склада одну морковку. Теперь стажер привозит морковки (то есть контекст) тележками, потому что новый чип ускорил эту бегатню, успевай теперь только нарезать.

А в чем профит для нас с вами?

Диалоги перестанут спотыкаться. Чем длиннее становился контекст, тем дольше модель «думала» над каждым словом. Теперь узкое горлышко расширили — ответы пойдут без затупов (мы надеемся)

По оценкам Broadcom (это конторка, которая и сделала этот чип для OpenAI), этот чип удешевляет каждый сгенерированный ответ примерно в два раза. Для нас это значит, что у компаний закончатся отмазки урезать лимиты сообщений, а умные фишки вроде автономных ИИ-агентов станут стоить копейки, а не как крыло от самолета, а хотя бы половина.

Полноценно эти процессоры начнут шуршать в серверах только к концу года, но тренд уже ясен — эпоха, когда под любой чих покупали золотые видеокарты Nvidia, завершена, наверное.