Дмитрий Коваль

+9
с 26.08.2026

Архитектор бэкенда, помогаю малым и средним командам строить интеграции с внешними API и нейросетями.Мой канал@api_integrate_notes

4 подписчика
12 подписок

Вчера под статьёй о таймаутах и ретраях мне справедливо возразили: если лимит провайдера просел надолго, одна дополнительная попытка просто переносит сбой на пару секунд позже.

Согласен. Retry помогает пережить короткий сетевой сбой. Но если провайдер деградировал на десять минут, продолжать стучаться в него каждым запросом — значит увеличива…

Большинство разработчиков оборачивают вызов LLM в три ретрая и считают задачу решённой.

В продакшене такая схема превращает один медленный запрос в минуту ожидания, умножает расходы и иногда повторно запускает действия агента.

Многие воспринимают LLM-gateway только как слой для фильтрации запросов и защиты данных. Но у него есть куда более практическая функция для агентов.

Каждый вызов модели, параметры и ответы проходят через шлюз. Все логи сохраняются.

Введение OpenAI только что представила GPT-6.1 Sol — обновление линейки Sol. По заявлениям компании, модель показывает результат, близкий к флагману GPT-6 Astra, но токены стоят всего 1/5 от цены Astra.

Главная фишка — оптимизация под агентные сценарии, автоматизацию рабочих процессов и сложное программирование. Контекстное окно до 1,05 млн т…

Подключить LLM к рабочему процессу сегодня несложно. Дать модели системный промпт, добавить несколько инструментов, передать API-ключи — и агент уже умеет читать документы, обновлять CRM, отправлять письма и создавать задачи.

Проблема в том, что вместе с полезными возможностями мы даём недетерминированной системе право менять реальный мир.

22

От оплаты за каждый запрос к оплате за результат — коммерциализация ИИ переходит на новый этап

Почему AI-бизнес переходит от моделей к рабочим процессам

11

Все уверены: запустил LLM сам — сэкономил на API. Я работал с обеими схемами: облачные провайдеры и локальные инстансы 7B/14B. И готов сказать прямо: в 80% случаев самостоятельное развертывание выходит дороже. Люди считают только токены, но не считают скрытые расходы.

Скрытые расходы локального LLM, которые никто не считает

22

Недавно я тестировал два подхода для рабочих задач: развертывание LLM на собственном сервере и использование облачного API. Многие сразу думают, что собственный инстанс всегда выгоднее и безопаснее. Но это не всегда так.

Вот ситуации, когда самостоятельный запуск модели не имеет смысла.

Заголовок 5 частых ошибок при самостоятельном развертывании LLM на сервере

Текст статьи Многие разработчики решают развернуть большую языковую модель самостоятельно, чтобы не зависеть от внешних провайдеров и снизить расходы. Но часто на этапе запуска возникают проблемы, которые легко предотвратить.

Всем привет. Многие разработчики запускают LLM локально через Ollama, получают стабильный результат на домашнем ПК, но при переносе на сервер и в продакшен начинаются постоянные сбои, тормоза и вылеты. На практике 90% проблем возникает из-за пяти типовых ошибок, которые не видны на этапе разработки. Разберу их по порядку.

1. Игнорирование ква…

Сейчас почти каждый разработчик старается подключить в проект сразу несколько LLM-моделей. Причина очевидна: сэкономить на токенах, повысить качество сложных запросов и подстраиваться под нестабильность провайдеров. Но на практике многомодельная интеграция часто становится источником скрытых проблем, которые проявляются только на продакшене. Разбер…

На прошлой неделе я написал, что не стоит бежать переводить всю продукцию на DeepSeek — мол, привязываться к одному вендору опасно. А на этой неделе DeepSeek сделал то, чего не ожидал никто: поднял цены примерно втрое и ввёл пиковый тариф. Признаю, мой прошлый пост устарел ровно через пять дней. Давайте разберём, что произошло и что теперь делать с…