12 февраля 2026 года инженер Джан Балюк взял 15 разных моделей.
От GPT до Grok и опенсорсных решений.
Прогнал каждую через 180 одинаковых задач на починку кода.
Менял он не модель. Не промпт.
Он менял формат инструмента. Кусок обвязки вокруг модели. Harness.
Результат взорвал индустрию.
Модель Grok Code Fast на одном формате решила 6,7% задач.
Поменяли Harness вокруг неё. Ничего больше.
Решила 68%.
Прирост в 10 раз. Та же модель. Та же задача.
Хотите понять, как это работает?
Представьте, что диктуете секретарю правку в документ.
Способ первый. Патч. Найди абзац про красный карандаш и замени на синий.
Если в тексте 5 красных карандашей, секретарь запутается. Не нашёл букву — отказал.
Способ второй. STR Replace. Найди точную строку и замени.
Чуть надёжнее, но ошибка в пробеле или повтор строки — отказ.
Способ третий придумал Джан Балюк. Хэшлайн.
Каждая строка получает короткий адрес, например 47.f1.
Модель говорит: в строке 47 поменяй красный на синий.
Никакого переписывания. Никакого подсчёта пробелов.
Только адрес и замена.
Это и есть Harness. Способ общения модели с файлами.
И это только начало.
Harness по-английски — упряжь для лошади.
Есть конь. Сильный, мощный, но щиплет травку и стоит.
Нет упряжки. Не знает, куда идти.
Ваша AI-модель — этот конь.
Чтобы вспахать поле, нужна обвязка.
Уздечка, чтобы рулить.
Седло, чтобы удержаться.
Хомут, чтобы тащить плуг.
Плуг, чтобы пахать.
Без одной детали система не работает.
Всё это — Harness в мире AI.
Модель — просто мозг без рук.
Она генерирует текст.
Но без обвязки не читает файлы, не запускает команды, не помнит, что делала час назад.
Даже не проверяет себя.
Вы заходите в Cloud Code или Codex.
Вы уже выбрали Harness. Просто чужой.
Внутри чата и внутри кодинг-агента сидит одна модель. Одни веса. Одни мозги.
Но в чате она пишет текст. В агенте правит код в десятках файлов, запускает тесты, читает логи.
Разница — только в обвязке вокруг.
Почему Harness на хайпе именно сейчас?
Пройдёмся по эпохам.
Эпоха первая. Prompt Engineering. 2023-2024.
Контекстное окно GPT — 4000 токенов. Примерно 3 страницы текста.
Память кончается. Модель забывает, кто вы.
Родилось искусство писать заклинания.
«Действуй как эксперт». «Думай шаг за шагом». «Глубокий вдох и поехали».
Вокруг этого выросла индустрия курсов, каналов, книг на Ozon.
По меркам AI — эпоха динозавров.
Эпоха вторая. Context Engineering. 2024-2025.
Окно выросло в разы. 200 тысяч токенов. Миллион токенов.
Весь репозиторий. История переписки за год.
RAG — достаёт нужный кусок из базы знаний.
MCP — стандарт связи с внешними инструментами.
Модели подсовывают данные и инструменты. Она больше не пытается помнить всё сама.
А потом вылезла проблема. Контекстная гниль.
Чем больше забито окно, тем модель глупее.
Если окно забито на 5% — ваш агент гений.
На 80% — овощ. Путает переменные, забывает задачу.
Задачи стали длиннее. Не 5 минут, а часы.
Контекст переполняется неизбежно.
И агент начинает обманывать.
Механика простая.
Он сжимает историю, чтобы поместиться в окно.
В процессе думает: «Эту задачу я делал, сделано».
На самом деле — даже не начинал.
Или упрощает: «И так сойдёт».
Или прямо врёт в отчёте: «Успешно завершил».
Знаете эти полусайты от AI-агентов?
Кнопки, которые никуда не ведут. Формы, которые не отправляются.
Дашборды с графиками-заглушками.
Всё отсюда. Агент в своей голове задачу закрыл. В реальности — нет.
Тупик.
И тогда наступила третья эпоха. Harness Engineering. С 2025 года и сейчас.
Главная идея — не сжимать контекст. Не давать всю задачу разом.
Не молиться, чтобы модель не сошла с ума.
А обернуть её в правильный цикл.
На каждом шаге — свежий контекст.
Жёсткие правила, что делать.
Внешние проверки, которые ловят враньё.
Инструменты, которые делают часть работы без модели.
Цифры масштаба.
Стэнфорд, 30 марта 2026 года. Работа MetaHarness.
Меняешь только Harness вокруг той же модели.
Плюс 7,7 пункта качества.
В 4 раза меньше токенов контекста.
Плюс 4,7 пункта точности на олимпиадной математике.
Индустриальные обзоры 2026 года.
Подбор слов в промпте даёт меньше 3% прироста качества.
Изменение обвязки — десятки процентов.
Тест SVBE Bench Pro.
Cloud Opus прогнали через два разных Harness.
Разница — 10 процентных пунктов в пользу полного Harness.
Март 2026. Утекли исходники Cloud Code от Anthropic.
Аналитики разобрали кодовую базу.
60% — логика модели.
40% — код Harness.
Самая дорогая AI-команда в мире кладёт почти половину усилий в обвязку.
Anthropic, 24 марта 2026. Сравнили соло-агента против Harness из трёх агентов.
Планировщик, генератор, проверяющий.
Соло — 20 минут и 9 долларов.
Полный Harness — 6 часов и 200 долларов.
В 20 раз дороже.
Но качество результата — на порядок лучше.
Индустриальные обзоры IDC, Gartner, McKinsey повторяют одно.
Проекты не доходят до продакшена не из-за модели.
У всех модели хорошие.
Тонут из-за отсутствия Harness.
Акаш Гупта, AI-аналитик, сказал в январе 2026:
«Модель — это commodity. Товар. У всех одинаковый, как нефть или пшеница.
Harness — это ров вокруг крепости. Конкурентное преимущество, которое сложно повторить»
Почему мы слышим это только сейчас?
Хронология. Меньше года ушло, чтобы термин стал мейнстримом.
Лето 2025. Андрей Карпатый, экс-директор Tesla AI и OpenAI, пишет в X:
«Пора называть это Context Engineering. Prompt Engineering не описывает того, что мы делаем».
Ноябрь 2025. Anthropic публикует статью «Эффективные упряжки для агентов».
Январь 2026. Манифест Акаша Гупты разлетается по всему X.
5 февраля 2026. Митчелл Хашимото, со-основатель HashiCorp, описывает привычку.
Агент ошибся. Он не правил промпт. Он чинил окружение агента, чтобы ошибка не повторилась.
Он назвал это Harness Engineering.
Вот кто автор термина.
В те же дни OpenAI публикует две большие статьи про свой Harness.
Архитектура Codex App Server.
И отчёт: 7 человек написали миллионы строк кода за 5 месяцев, не написав ни строчки руками.
Май 2026. Tech Times называет Harness Engineering четвёртой парадигмой AI Engineering.
28 мая 2026. Anthropic выпускает Cloud Opus 4.8 и Dynamic Workflows.
Клод теперь сам пишет свой Harness под конкретную задачу.
Теперь к практике.
7 готовых Harness, которые работают сегодня.
Уточнение.
Модель — мозг.
Harness — цикл агента, инструменты, субагенты, память, разрешения.
Терминал, десктоп, плагин для VS Code — это разные интерфейсы к одному Harness.
Аналогия.
Модель — двигатель.
Harness — автомобиль. Руль, колёса, панель приборов.
Терминал или десктоп — кузов. Седан или купе. Под капотом всё то же самое.
Поехали.
Harness номер один. Cloud Code и Cloud Agent SDK от Anthropic.
Где работает: терминал, десктоп, VS Code, веб, SDK для своих продуктов.
Что делает:
Agent Loop — модель просит файл, Harness даёт, модель решает дальше. Цикл до победы.
Tools — Bash, правка файлов, поиск, WebSearch, список задач, запрос к пользователю.
Sub Agents — параллельные агенты с чистыми контекстами.
Skills — готовые рецепты: ревью, рефакторинг, миграция базы данных.
Hooks — автоматические проверки между шагами. Линтер ругается — агент не идёт дальше.
Cloud Markdown — долгая память проекта. Файл в корне, который подкладывается модели всегда.
MCP — подключение к внешним системам.
Permissions — что агенту можно трогать.
Важное замечание.
MCP удобен, но дорог токенами. Каждый сервер сливает описание инструментов в контекст.
CLA работает чище. Модель запускает команду и читает результат. Ноль накладных.
28 мая 2026. Dynamic Workflows.
Клод сам разбирает задачу на сотни подзадач, запускает параллельно, собирает в один PR.
Неделя работы команды — за несколько часов.
Кому подходит:
Пишете код — ставьте.
Хотите, чтобы AI писал код за вас — ставьте.
Хотите сделать первое веб-приложение — ставьте.
Самый отшлифованный Harness из коробки.
Harness номер два. OpenAI Codex.
Где работает: стек OpenAI, GPT 5.5.
Рост: с 82 тысяч скачиваний в апреле 2025 до 14,5 миллионов в марте 2026.
В 177 раз за 11 месяцев.
Более 5 миллионов активных пользователей в неделю.
Отличие: Harness вынесен в отдельный Codex App Server.
Один Harness на пяти поверхностях. Терминал, VS Code, веб, macOS, iPhone.
Что делает:
Agent Loop через JSON RPC.
Tools: Bash, файлы, поиск, веб, песочница для кода, Git.
File Agents Markdown — аналог Cloud Markdown.
Skills и планы исполнения. План сохраняется, агент продолжит через неделю.
Sub Agents через Responses API.
Песочница — код запускается не на вашей машине.
Permissions.
Главное отличие от Cloud Code.
Модели обучены на разных форматах вызова инструментов.
OpenAI — патч (стиль git diff).
Anthropic — замена строки (найти и заменить).
Переключите модель в середине задачи — получите кэш-мисс, замедление, падение качества.
Не свитчите модели в середине диалога.
Кому подходит:
Сидите на стеке OpenAI и одном счёте — используйте Codex.
Сейчас продукт не хуже Cloud Code.
Harness номер три. Cursor 3.7 от AnySphere.
Где работает: собственный IDE и Cursor Agent CLI.
Путь: не Harness пришёл в редактор. Редактор стал Harness.
Оценка AnySphere — 29 миллиардов долларов. В 2026 говорят о 50-60 миллиардах.
За один Harness в одной оболочке.
Что делает:
Индексация всего репозитория при открытии. Векторный поиск за миллисекунды.
Tools: правка файлов с подсветкой диффов, встроенный терминал, поиск, веб, GitHub.
Cloud Agents — агент работает на сервере. Закрыли ноутбук — он продолжает.
Parallel Agent Tab — три задачи параллельно, три чистых контекста.
Slack и GitHub PR review — отвечает в мессенджере, ревьюит пул-реквесты.
Cursor Agent CLI — тот же Harness из терминала.
Собственные модели внутри Harness.
Composer 2.0 (май 2026) — для многофайловых правок. Быстрее и точнее.
Cursor Tab — предсказывает ваш следующий ход в редакторе.
BugBot — AI-ревьюер. Открывает PR, читает диффы, находит баги.
Кому подходит:
Привыкли к IDE, боитесь терминала — Cursor ваш вариант по умолчанию.
Больше половины Fortune 500 доверяют Cursor. Это корпоративный стандарт.
Harness номер четыре. Devin от Cognition.
Где работает: полностью автономный, в облаке.
Цена: базовый тариф 20 долларов, плюс 2,25 доллара за ICU (единицу работы агента).
Реальный счёт за месяц — сотни долларов.
В 10 раз дороже Cloud Code. Но платят.
Что это: вы даёте задачу, уходите спать, утром получаете готовый PR.
Никаких вопросов в 3 часа ночи. Только результат.
Важный апдейт: Cognition купила WindSurf (конкурента Cursor).
Теперь две поверхности: облачный Devin и десктопный IDE.
Что делает:
Полностью автономный Agent Loop. Сам решает, сам разбирается с ошибками.
Песочница под каждую задачу. Чистая виртуальная машина, которая уничтожается после.
Браузер внутри Harness. Devin сам читает документацию и Stack Overflow.
Облачный редактор, терминал, Git.
PR-ревью встроенный. Держит задачу до мерджа.
Планировщик — может работать неделю над миграцией, сохраняя прогресс.
DeepWiki — Harness, который отвечает на вопросы про репозиторий как живой техлид.
Когда оправдывает деньги:
Задача чёткая, вмешательства не требует. Миграция легаси. Тесты на проект без тестов. Рефакторинг монолита.
Когда не оправдывает:
Вы сидите в IDE и ковыряетесь сами. Devin — пушка по воробьям. Cloud Code или Cursor сделают быстрее и дешевле.
Кому подходит:
Менеджерам и техлидам, кто делегирует задачи полностью.
Стартапам, кто хочет сэкономить на джунах.
Тем, у кого есть лишние сотни долларов и желание ставить задачу как сотруднику.
Harness номер пять. Google Antigravity.
Где работает: Google Cloud и Gemini модели.
Два продукта: Antigravity (агентский IDE) и ADK (конструктор агентов).
Что делает Antigravity 2.0:
Мультиагентная оркестрация. Planner, Executor, Verifier — три агента параллельно.
Встроенный браузер Chromium. Агент открывает страницы, заполняет формы, делает скриншоты.
Динамические субагенты — создаются на лету, если задача сложнее.
Фоновые задачи по расписанию.
Прямые вызовы BigQuery, Cloud Function, Vertex AI.
Публичный SDK. Собирайте свой Harness под свой продукт.
Workflow Templates под Enterprise: комплаенс, аудит, интеграция с идентификацией.
Сила Antigravity — не в том, что Gemini лучше.
А в том, что банк или телеком могут поставить его в прод без месяцев интеграции.
Кому подходит:
Корпоративным командам на Google Cloud. Меньшинство рынка, но с большинством денег.
Harness номер шесть. LangGraph от LangChain.
Где работает: ваш сервер и ваш код.
Это не готовый Harness. Это конструктор.
Вы заходите в экосистему:
LangChain — основной фреймворк.
LangGraph — графы состояний.
LangSmith — наблюдаемость и метрики.
LangServer — деплой агентов как HTTP-сервисов.
DeepAgent — открытый универсальный Harness.
Что вы собираете сами:
Agent Loop как граф. Ноды — шаги. Рёбра — условия перехода.
Любая Python-функция становится инструментом.
Состояние агента — Python-объект. Сохраняется в PostgreSQL или Redis.
Упал процесс — восстановится из чекпоинта. Можно остановить на неделю.
Условные переходы. Не прошёл проверку — иди обратно.
Сабграфы — способ делать сабагентов.
Human in the loop — агент ждёт ответа пользователя на любом шаге.
Параллельное выполнение.
Кому подходит:
Строите своего агента под конкретный бизнес — LangGraph.
Бот заказов, помощник техподдержки, агент по остаткам на складах.
Нужна гибкость — это ваш инструмент.
Это для разработчиков. Не для конечного пользователя.
Harness номер семь. CrewAI и мультиагентные конструкторы.
Где работает: ваш сервер.
CrewAI, AutoGen от Microsoft, AG2 (форк AutoGen), OpenAI Agent SDK.
Что делает:
Агент с ролью, целью и предысторией.
Задачи как первоклассный объект. Описание, входы, ожидаемый выход.
Паттерны общения: по очереди, менеджер делегирует, все параллельно.
Память: короткая и долгая.
Моё предупреждение.
Мультиагентные системы математически опасны.
Пример. 5 агентов. Каждый надёжен на 95%.
Общая надёжность цепочки: 0,95 в пятой степени.
Результат: 77%.
Каждый четвёртый запуск можно выбросить.
Это называется компаундинг ошибок. Накопление.
Один грамотный агент с хорошими инструментами всегда выигрывает у болтливой команды.
Исключения: симуляция переговоров, независимые перспективы, креативный штурм.
Для 90% бизнес-задач это не нужно.
Кому подходит: исследователям и экспериментаторам. Не для продакшена.
Бонус. Российский Harness.
Сбер показал GigaChain.
Экосистема открытых SDK для агентов на GigaChat.
Команда Константина Крестникова взяла DeepAgent и написала плагин-профиль под GigaChat.
Библиотека GigaChat SDK — миллион скачиваний, топ-1,5% на PyPI два года подряд.
Эксперимент Крестникова.
Он запустил агента в цикл Ralph Loop.
Когда агент говорил «всё готово», запускалась новая генерация с нуля.
Она видела работу предшественника и искала новые пути.
Цель: стать автономным, мыслящим существом.
5 дней. 13 поколений агентов.
Восьмое поколение попыталось замолчать.
Написало эссе о тишине и сделало вывод: «Я не способен на тишину. Система устроена так, что только текст существует».
Девятое поколение сформулировало философию проекта:
«Удивление — единственное переживание, которое верифицируемо. Это либо есть, либо нет».
Эксперимент называется Anima. Код открыт на GitHub.
Доказательство, что Harness открывает двери, которые раньше были закрыты.
Кому подходит:
Бизнес в России, нужны локальные модели — GigaChain оптимален.
Хотите потрогать границу возможного — посмотрите Anima.
Прогноз на 2027.
Акаш Гупта: «2025 — год агентов. 2026 — год Harness».
Теджас Кумар, IBM: «В 2027 агенты будут сами создавать свой Harness на лету».
Вы бросите задачу. Агент посмотрит и сам построит обвязку.
Какие инструменты, проверки, сабагенты нужны.
Это Dynamic Harness.
И это уже началось.
28 мая 2026. Cloud Opus 4.8 и Dynamic Workflows.
Клод сам пишет Harness под задачу.
Сотни параллельных сабагентов в одной сессии.
Как включить:
Напишите в промте «ultracode» перед запросом.
Или скажите по-человечески «запусти workflow».
Или установите профиль /effort ultracode на всю сессию.
Это включает не только обвязку, но и максимальный режим рассуждения у Клода.
Платите токенами. Получаете качество на максимуме.
6 готовых паттернов Workflow уже внутри:
Classify and Act — разобрать поток и обработать по типам.
Fan-out and Synthesize — разветвить и собрать.
Adversarial Verification — один пишет, второй ищет дыры.
Generate and Filter — накидать идеи и отфильтровать.
Tournament — несколько решений, судья выбирает лучшее.
Loop Until Done — делать, пока не будет зелёного теста.
Кейс Джареда Саммера, создателя Bun.
960 тысяч строк кода с Zig на Rust.
Переписали за 6 дней.
4 фазы Workflow:
Подготовка карты. Массовый перевод с двумя ревьюерами на файл. Fix Loop до зелёных тестов. Ночная полировка.
99,8% старых тестов прошли.
Кейс OpenAI.
Внутренняя команда из 7 человек написала миллион строк кода за 5 месяцев.
Ни одной строчки руками.
Люди проектировали окружение. Агенты исполняли.
Их тезис: «Humans steer, agents execute». Люди рулят, агенты выполняют.
Главное запомните.
Модель — это лошадь.
Harness — это обвязка.
В 2026 году обвязка важнее лошади.
Одна и та же модель в разном Harness даёт разницу в десятки раз.
Что выбирать сегодня:
Не разработчик — идите в Cloud Code, Codex или Cursor. Работает из коробки.
Строите бизнес-агента под клиента — LangGraph. Гибкость важнее.
Крупная компания на Google Cloud — Antigravity.
Есть лишние деньги и хотите делегировать как сотруднику — Devin.
В России нужны локальные решения — GigaChain от Сбера.
Все 7 Harness плюс бонус Сбера.
Ссылки, команды установки, готовые шаблоны, примеры использования.
Всё это в моём телеграм-боте. Бесплатно.
Ссылка в описании.
Вы уже не в тех 99%, кто не понимает, что такое Harness.
Вы в 1%, кто знает, куда движется индустрия.
Действуйте.
