Инференс трансформеров на чистой Java без Python и JNI: миф или реальность?
Запуск нейросетей на Java часто воспринимается как компромисс: либо JNI-обвязки, либо Python-стек, либо готовые рантаймы. Но современные JDK уже позволяют строить полноценный пайплайн инференса внутри JVM — без Python, без JNI-слоя и без лишней магии.
Хочу провести технический вебинар и показать, как на чистой Java реализовать инференс трансформеров и оптимизировать его под CPU, используя:
- Foreign Function & Memory API (FFM) — для безопасной работы с нативной памятью и маппинга весов моделей без лишнего оверхеда и давления на GC.
- Vector API — для SIMD-ускорения матричных операций на CPU.
И это не только про LLM.
На вебинаре разберём, как на Java можно запускать и оптимизировать разные классы трансформеров (encoder-only, encoder-decoder, decoder-only):
- RoBERTa — для классификации и NLP-задач.
- MiniLM — для эмбеддингов и семантического поиска.
- T5 — для seq2seq-сценариев и генерации.
- Qwen — для современных LLM-сценариев и практического инференса.
То есть цель вебинара — не показать ещё один способ вызвать llama.cpp по API, а разобраться, как устроен сам Java-слой инференса для трансформеров и где он реально полезен.
Если тема вам интересна — оставьте контакты по ссылке.
Если наберём 20+ заинтересованных, я подготовлю программу и разошлю приглашения с датой.