Бесплатный курс по созданию правильного harness вокруг Codex и Claude Code
На рынке ИИ-инструментов наступил момент, когда модель перестала быть главным вопросом. GPT-6 Astra, Claude Code, Codex — все они проходят бенчмарки, но на реальных задачах половина ответов всё ещё летит в мусорку. Почему? Курс Learn Harness Engineering даёт прямой ответ: проблема не в модели, а в обвязке (harness) вокруг неё.
Курс - здесь
Что такое harness и почему без него ничего не работает
Harness — это всё, что окружает модель: инструкции, инструменты, окружение, управление состоянием, обратная связь по верификации. Модель не становится умнее — она получает замкнутую систему, в которой ошибки диагностируются и исправляются, а не просто воспроизводятся.
Anthropic ставила эксперимент: один и тот же запрос («собрать 2D-редактор игр») на одной и той же модели Opus 4.5. В первом запуске — без обвязки — игра не работала. Во втором — с полноценным harness из трёх агентов (планировщик, генератор, оценщик) — игра стала полностью играбельной. Модель не меняли.
OpenAI в своей статье 2025 года сказала ещё жёстче: Codex в репозитории с хорошим harness переходит из состояния «ненадёжный» в «надёжный».
Где агенты реально спотыкаются
Курс - здесь
Курс выделяет пять типовых сценариев отказа:
· Размытые требования. «Добавить поиск» — агент гадает, что искать и как выводить.
· Неявные конвенции. Вся команда пишет на SQLAlchemy 2.0, а агент по умолчанию выдаёт 1.x.
· Неполное окружение. Агент тратит контекстное окно на pip install и конфликты версий вместо работы.
· Нет верификации. Агент решает, что всё готово, когда ему кажется.
· Потеря состояния между сессиями. Каждая новая сессия начинается с нуля, и агент переоткрывает структуру проекта.
Что даёт курс
13 лекций, практические проекты и библиотека готовых шаблонов. Структура:
Лекции — с первой же начинают с главного: сильные модели не гарантируют надёжного исполнения. Дальше — диагностические циклы, пять слоёв защиты, управление состоянием.
Практический проект — собрать Electron-приложение дважды: сначала без обвязки (только промпт), потом с минимальным harness. Сравнить результат. Шаблоны уже есть в репозитории.
Библиотека шаблонов — готовые файлы, которые копируются в проект:
· AGENTS.md / CLAUDE.md — корневая инструкция, первое, что читает агент
· init.sh — скрипт, который ставит зависимости, проверяет сборку и выводит команду запуска
· feature_list.json — машиночитаемый список фич с приоритетами, статусами и шагами верификации
· claude-progress.md — лог сессий, который читает каждый новый запуск
Ключевой принцип курса
Когда что-то ломается — проверяй harness, а не модель.
Каждый сбой — сигнал о структурном дефекте в одном из пяти слоёв. Задача — найти слой, починить и больше не ошибаться там.
В курсе приводят пример: команда дала Claude Sonnet задачу добавить API-эндпоинты в FastAPI-приложение. С одним предложением в промпте агент потратил 40% контекста на изучение структуры, написал код с ошибками и объявил о завершении. После добавления AGENTS.md, команд верификации и архитектурных решений та же модель успешно выполнила задачу три раза подряд с эффективностью использования контекста на 60% лучше.
Один AGENTS.md может оказаться эффективнее, чем апгрейд на более дорогую модель.
Эксперимент OpenAI
В 2025 году три инженера OpenAI запустили эксперимент: никакого ручного кода — только Codex. Через пять месяцев в репозитории был ~1 млн строк кода. 1500 PR за это время. Сначала прогресс шёл медленно — не хватало структур. Инженеры нашли паттерн: разбивать большие цели на мелкие блоки (дизайн → код → ревью → тест), собирать их по одному, а затем комбинировать в сложные задачи. Когда что-то шло не так, проблема почти никогда не была в том, что модель «недостаточно старалась». Вопрос всегда был: «чего агенту не хватает, и можно ли это добавить в понятной и исполняемой форме?»
Если вкратце: курс не про модели. Он про то, как перестать гадать, почему умный ИИ делает глупости, и начать системно строить среду, в которой он просто не может ошибиться.
Курс - здесь