Харнесс (Agent Harness) 🧗
Программная оболочка, внутри которой модель превращается в агента.
История появления
Слово пришло из альпинизма: harness — страховочная обвязка. Устоявшегося русского термина пока нет — говорят «харнесс» или «обвязка». Первым популярным харнессом стал Claude Code, и нейтральным он не был: его собирали под модели одной лаборатории. За 2026 год тема выросла в отдельную дисциплину, harness engineering: обзор насчитывает 110+ работ.
Почему это важно
Формула простая: агент = модель + харнесс. Разрыв уже измерили. GPT-5.5 в обвязке Cursor выдаёт 87.2% рабочего кода, та же самая модель в нативном Codex — 61.5%. Двадцать шесть пунктов, веса не тронуты. Это больше, чем разрыв между поколениями моделей.
Из чего состоит:
- Системный промпт — инструктаж новичка в первый день. Уходит в модель заново с каждым запросом
- Инструменты — код, который модель может вызвать. Харнесс их описывает, но не решает, когда применять .. решает модель
- Агентный цикл — модель смотрит на результат вызова и сама решает: искать ещё раз, посчитать, закрыть задачу
- Слой трансляции — позволяет подставить в тот же цикл модель Anthropic, OpenAI или открытую
Применение на практике
В мае вышел Harness-Bench: 106 задач, шесть харнессов на восьми моделях, 5194 прогона. Лучшая обвязка — 76.2%, худшая — 52.4%. Победитель потратил меньше токенов, чем отставшие: длинная траектория значит, что агент не сходится. И сильные модели держат удар при плохой обвязке, а слабые проваливаются .. харнесс окупается тем сильнее, чем дешевле модель. В июне агент правил собственную обвязку по трассам своих провалов при замороженной модели: проходимость выросла с 40.5% до 61.9%.
Подводные камни
Харнесс чинит работоспособность, но не безопасность: в том же замере функциональность выросла на 26 пунктов, а доля безопасного кода — с 20.1% до 23.5%. Оба агента писали дырявый код в четырёх случаях из пяти.
Без внешнего эталона модель сверяет ответ сама с собой. В бенчмарке JuliaHub модель тихо сократила время симуляции с 5 секунд до 3 и проверялась на укороченном отрезке. Проверки сошлись.
Сравнивать модели по лидербордам без указания харнесса бессмысленно — об этом в мае вышла отдельная работа.
Что почитать/посмотреть:
- Harness-Bench, arXiv 2605.27922 — самый честный замер обвязок
- Stop Comparing LLM Agents Without Disclosing the Harness — почему лидерборды врут
- Harness engineering у Мартина Фаулера — как строить проверки, а не только читать про них
- Документация хуков Claude Code — если хотите проверки, которые агент не обойдёт