Один парень, один weekend project: как llama.cpp стала важнее половины AI-корпораций
Тысячи разработчиков поблагодарили человека, который сделал локальный ИИ возможным. История одной библиотеки
На этой неделе в Reddit случился тред, который меня зацепил. Не релиз очередной модели, не очередное «AI уволит всех». Просто пост с благодарностью: «Давайте поблагодарим Георгия Георганова, который дал нам llama.cpp». Почти 1200 апвоутов, сотни комментариев. Я понял, что на самом деле это была не благодарность проекту. Это была благодарность человеку, изменившему индустрию одной библиотекой.
Георгий Георганов — болгарский физик и программист из Софии. До 2023 года он работал над МРТ-оборудованием в американской компании и в свободное время пилил наушниковые хобби-проекты. Потом случился февраль 2023-го: Meta выпустила LLaMA, и через несколько дней веса модели утекли в сеть через торрент на 4chan. Запустить их почти никто не мог: официальный код требовал PyTorch, CUDA и дорогих NVIDIA-видеокарт. Для людей с обычными ноутбуками модель существовала, но была недоступна.
Георганов посмотрел на это и написал llama.cpp с нуля — чистый C/C++, без зависимостей, работающий на обычном процессоре. Первый коммит — 10 марта 2023 года. По его словам, это был «weekend project». Через неделю у репозитория были тысячи звёзд, а через пару месяцев — де-факто стандарт локального инференса.
Что важно — llama.cpp не просто запускал модель. Он изменил культуру. Ты скачиваешь один файл в формате GGUF — и модель работает на твоём железе. Квантование сжимает её так, что она влезает в обычную память. Нет облака, нет API, нет подписки — твои данные никуда не уходят. Именно на этом фундаменте выросли все инструменты, которыми мы пользуемся: Ollama, LM Studio, GPT4All — всё построено поверх его кода.
Дальше была история про то, как один человек перерос в компанию. В 2023-м он основал ggml.ai в Софии — его поддержали Нат Фридман, бывший CEO GitHub, и Дэниел Гросс. А в феврале 2026 года команда llama.cpp влилась в Hugging Face — не как поглощение, а как передача под долгосрочную опеку: Георганов сохранил полную техническую автономию, и проект остался open-source на 100%.
Цифры, которые я перепроверил. В марте 2026 llama.cpp пересёк 100 000 звёзд на GitHub — и сделал это быстрее, чем PyTorch и TensorFlow. Сейчас репозиторий поддерживают больше 700 разработчиков со всего мира, а локальные модели уже гоняют 13-миллиардные параметры на обычных процессорах — 15 токенов в секунду, с оверхедом меньше 100 мегабайт. То, что три года назад казалось невозможным, теперь работает на обычном ноутбуке.
Почему эта история про большее, чем код? Каждый день мы читаем про миллиардные инвестиции, датацентры размером с города и супер-модели, которые никто никогда не видел. А тем временем один парень из Софии, написавший библиотеку в выходные, оказался важнее половины этих корпораций для реальных разработчиков. Локальный ИИ — это не игрушка энтузиастов. Это фундамент приватности: пока модель можно запустить без облака, у тебя есть право на собственный ИИ. И это опция, которую стоит держать в голове — особенно когда «дешёвые» API внезапно дорожают.
Я не знаю, что дальше — в 2026-м локальные модели уже почти догнали облачные по качеству, и разрыв сокращается быстрее, чем кто-либо ожидал. Но кое-что я знаю точно: если копнуть любой инструмент, на котором держится локальный ИИ, ты упрёшься в одного человека.
P.S. Мы в Paladin Engineering наблюдаем за локальным ИИ с 2023 года. Если у вас есть боль, которая может решиться локальной моделью — и вы не хотите зависеть от облачных провайдеров — напишите, обсудим. Большие вещи начинаются с маленького weekend project.