Инференс трансформеров на чистой Java без Python и JNI: миф или реальность?

Запуск нейросетей на Java часто воспринимается как компромисс: либо JNI-обвязки, либо Python-стек, либо готовые рантаймы. Но современные JDK уже позволяют строить полноценный пайплайн инференса внутри JVM — без Python, без JNI-слоя и без лишней магии.

Хочу провести технический вебинар и показать, как на чистой Java реализовать инференс трансформеров и оптимизировать его под CPU, используя:

  • Foreign Function & Memory API (FFM) — для безопасной работы с нативной памятью и маппинга весов моделей без лишнего оверхеда и давления на GC.
  • Vector API — для SIMD-ускорения матричных операций на CPU.

И это не только про LLM.

На вебинаре разберём, как на Java можно запускать и оптимизировать разные классы трансформеров (encoder-only, encoder-decoder, decoder-only):

  • RoBERTa — для классификации и NLP-задач.
  • MiniLM — для эмбеддингов и семантического поиска.
  • T5 — для seq2seq-сценариев и генерации.
  • Qwen — для современных LLM-сценариев и практического инференса.

То есть цель вебинара — не показать ещё один способ вызвать llama.cpp по API, а разобраться, как устроен сам Java-слой инференса для трансформеров и где он реально полезен.

Если тема вам интересна — оставьте контакты по ссылке.

Если наберём 20+ заинтересованных, я подготовлю программу и разошлю приглашения с датой.

Инференс трансформеров на чистой Java без Python и JNI: миф или реальность?