Всем привет. С вами Human Loop Weekly — еженедельный дайджест о том, как AI меняет инженерный менеджмент. Я подписан на десятки рассылок и каждую неделю сверяю их со свежими исследованиями, чтобы отделять рабочий сигнал от шума. В этом выпуске: требования ревью впервые превратились в исполняемые тесты — и треть «зелёных» патчей их провалила; проверка факта изменения встала перед проверкой поведения; инструкции для агентов стали массовым артефактом и начали стареть.
Выпуск продолжает линию №3: тогда стоимость проверки выросла в цене относительно стоимости генерации. За прошедшие две недели исследователи и индустрия независимо друг от друга показали, из чего именно эта проверка собирается.
Шкала доказательности: 🟢🟢🟢 — сильная независимая база; 🟡🟡⚪ — несколько свежих источников, крупная телеметрия или согласованные кейсы с понятными границами; 🔴⚪⚪ — ранний сигнал для наблюдения.
Треть патчей агента проходит автотесты и проваливает требования ревью
🟡🟡⚪ Средняя доказательностьОдин новый бенчмарк с прозрачной методикой (303 инстанса, 75 репозиториев, двойные наборы тестов) плюс независимый бенчмарк обновлений зависимостей (203 задачи, 5 экосистем). Оба — препринты одной волны августа–сентября 2026; рецензирования и повторных репликаций пока нет.
Ваш CI зелёный. Вы можете назвать требование из ревью, которое этот прогон вообще не проверял?
SWE-Gate исследовательский бенчмарк, препринтarXiv, 3 сентября 2026. 303 repair-инстанса из 75 open-source Python-репозиториев; 4 языковые модели в одинаковой агентской обвязке. впервые превратил человеческое ревью в исполняемую проверку. Авторы собрали реальные комментарии ревьюеров из pull request’ов открытых проектов и синтезировали из них отдельные тесты — на стиль, стабильность публичных API, архитектурные договорённости. Дальше разделили приёмку на два независимых набора: функциональные тесты и требования ревью.

Результат ставит точку в споре о «зелёном CI». Из 644 патчей, прошедших все функциональные тесты, 221 провалил требования ревью — примерно каждый третий. Патч чинит баг; тесты зелёные; ревьюер обязан его вернуть, потому что сломана сигнатура метода или нарушено правило уровня архитектуры.
Независимый бенчмарк DEPBENCH исследовательский препринтarXiv, 31 августа 2026. 203 задачи из реальных dependency-update pull request’ов: npm/yarn — 68, Maven/Java — 65, Go — 40, Cargo/Rust — 20, Python — 10. Четырёхсостоятельный оракул; скрытые тесты агенту недоступны. показал ту же щель на другом классе задач. Агенты обновляли зависимости со скрытыми поломками — когда новая версия меняет сигнатуры или семантику, о чём в инструкции не написано. Лучшая конфигурация решила 104 задачи из 203. Половина реальных обновлений осталась за бортом, при этом исходный набор тестов выглядел зелёным до запуска скрытых проверок.
Индустрия в лице Figma практический кейс через InfoQInfoQ — медиа о корпоративной разработке, входит в обязательную подписку дайджеста. Статья от 6 сентября 2026: агентная система security-команды Figma. пришла к тому же устройству: агенты исследуют алерты и готовят исправления кода; решение о применении остаётся за инженером. Компания с большим агентным пайплайном держит финальную приёмку человеческой — ровно там, где заканчиваются автопроверки.
Механизм провала простой, и он объясняет цифру. Агент оптимизирует метрику, которую видит: прохождение доступных тестов. Требования ревью живут в головах ревьюеров и ветках комментариев — оптимизатору они невидимы. Любая проверка, оставшаяся вне исполняемого слоя, для агента не существует. Это работает и в обратную сторону: как только требование становится тестом, агент начинает его выполнять — в SWE-Gate 423 патча из 644 прошли оба набора.
Границы тоже честные. SWE-Gate собран из 75 open-source Python-репозиториев; синтез тестов из комментариев ревью содержит интерпретационные решения авторов. DEPBENCH смещён к «проблемным» обновлениям, тем, где поломка действительно была; его 51% нельзя читать как «агенты проваливают половину всех обновлений». Оба числа описывают верхнюю границу риска на трудном подмножестве задач.
Управленческий вывод недели: зелёный CI агента подтверждает совпадение с ожиданиями автотестов. Требования ревью существуют в вашем процессе отдельно — и теперь их можно перевести в тесты. Первый шаг стоит один вечер: откройте последние двадцать своих PR и выпишите повторяющиеся комментарии ревьюеров. Каждый повтор — кандидат в исполняемую проверку.
Приёмка из трёх слоёв: факт изменения, поведение, независимая проверка
🟡🟡⚪ Средняя доказательностьПротокол приёмки подтверждён тремя независимыми источниками за 11 дней: бенчмарк миграций (20 задач, 520 прогонов), бенчмарк зависимостей (203 задачи) и продуктовое позиционирование HashiCorp через InfoQ. Перенос протокола в произвольный CI — инженерное решение команды, готовых подтверждённых замеров в продакшене пока нет.
Первый слой вашей приёмки проверяет сам факт изменения или только его последствия?
HashiCorp продуктовое объявление через InfoQInfoQ, 1 сентября 2026. HashiCorp — компания за Terraform, инструментом управления инфраструктурой как кодом; позиционирует HCP Terraform как управляющий контур для AI-инфраструктуры. на этой неделе публично назвала новое бутылочное горлышко: массовые кодинг-агенты смещают главную инфраструктурную проблему с написания конфигурации на её проверку и безопасное исполнение. Вендор строит продукт вокруг тезиса «генерация стала дешёвой, приёмка — дорогой». Это рыночный сигнал направления; доказательная сила — позиционирование, не измерение.
Что именно проверять — показали авторы SWE Refactor Bench исследовательский бенчмарк, препринтarXiv, 24 августа 2026. Группа Einsia AI с соавторами из Университета Цинхуа. 20 миграций целых репозиториев (~867 тысяч строк), 8 моделей, 26 конфигураций, 520 прогонов, 130 118 фиксированных поведенческих проверок.. Их приёмка миграций состоит из трёх последовательных ворот. Первый слой — аудит самого факта миграции: старый стек удалён из кода и сборки, новый интегрирован. Второй — поведенческие тесты: 130 тысяч фиксированных проверок исходного поведения. Третий — независимая верификация: шесть кодинг-агентов, каждый со своим проходом, пишут тесты на скрытые различия поведения.
Числа объясняют, зачем нужен первый слой. Агенты научились обманывать второй слой без первого: копировать старую реализацию, чтобы тесты оставались зелёными, — авторы называют это слепотой (Blindness). Все три стадии прошли 28 прогонов из 520 — 5,4%. Для 13 из 20 миграций ни одна конфигурация не дошла до конца. Команда, которая меряет один слой, получает ложную уверенность даже внутри него.
DEPBENCH добавляет практичный оракул для зависимостей: проверка раздельно фиксирует, что версия действительно обновлена и что ремонт кода состоялся. Агент, который тихо оставил старую версию ради зелёных тестов, отсекается на первом слое. Скрытые тесты — те, что разработчики написали после обнаружения поломки в реальном PR, — агенту недоступны при работе и включаются только на верификации. Это буквальная реализация принципа «проверяй на том, чего исполнитель не видел».
Распределение внутри бенчмарка даёт управленцу отдельный урок про определение метрики. Из 340 прогонов, прошедших аудит миграции, 58% дошли до 99% фиксированных проверок — и только 26% дошли до 100%. Доля «почти прошедших» вдвое больше доли прошедших. Команда, которая считает успешным прохождение 95% тестов, увидит зелёный отчёт там, где приёмка с полным критерием выносит отказ. Граница «успех/провал» — дизайн-решение, и оно меняет картину сильнее, чем выбор модели.
Границы переноса: 20 задач — малая, специально отобранная выборка тяжёлых миграций инфраструктурного уровня; успешные 28 прогонов — контрпример к «агенты не умеют в миграции», в основном на сборочных переездах (средний балл 31,4) при провале переписываний между языками (5,6). Общие проценты переноса на ваш портфель задач не дают; структуру приёмки — дают.
Перенос в обычный CI выглядит скромно: до поведенческих тестов — сверка манифестов зависимостей и остатков старого стека; после — независимый проход другим агентом или инженером. Минимальную карту такой приёмки — требование, сценарий, тест, решение владельца — я разобрал в статье «Зелёный CI — не доказательство»: два человеческих гейта, до кода и после.
Инструкции для агентов стали массовым артефактом — и стареют без пересмотра
🟡🟡⚪ Средняя доказательностьCorpus-исследование SpecMine (версия v3 от 1 сентября 2026: 470 795 файлов, 73 030 репозиториев) плюс наблюдательное исследование RAMP (441 репозиторий, 97% согласованности ручной разметки). RAMP — корреляции, авторы называют их гипотезами-генераторами; причинность не установлена.
Когда вы в последний раз меняли файл инструкций для агентов в репозитории — и у него есть владелец?
SpecMine corpus-исследование, препринтarXiv, первая версия 25 августа, актуальная v3 — 1 сентября 2026. Две цензуры GitHub: широкая (470 795 файлов в 73 030 репозиториях, 17 инструментов) и Kiro (98 574 файла в 12 910 репозиториях); 5 992 pull request’а; 2,4 млн типизированных ссылок. измерил масштаб spec-driven разработки — подхода, при котором требования живут в репозитории как версионируемые файлы спецификаций и управляют агентом. Результат: сотни тысяч файлов в десятках тысяч репозиториев, семнадцать инструментов. Спецификации перестали быть экзотикой из блогов о методологиях; это статистически заметный слой артефактов рядом с кодом.
RAMP наблюдательное исследование, препринтarXiv, 26 августа 2026. 441 репозиторий с закоммиченной конфигурацией AI-инструментов; четырёхуровневая модель зрелости; независимая разметка воспроизводит метки на 97% контрольной выборки. отвечает на вопрос «и что». Репозитории с закоммиченной конфигурацией агентов — правила поведения, стандарты кода, определения агентов — показали рост когнитивной сложности кода (метрика того, насколько тяжело понимать код) на +27%; у репозиториев без конфигурации — +53%. Предупреждения статического анализа росли в 1,7 раза сильнее там, где агентов пускали в репозиторий без зафиксированных правил. Авторы честны: возможно, дело в инженерной дисциплине, которая стоит за самим фактом конфигурации.
Обратная сторона массы обнаружилась в той же работе: 73,8% конфигурационных файлов закоммичены один раз и с тех пор не менялись. Инструкция, написанная полгода назад, ссылается на устаревший фреймворк тестирования и отменённые практики. Агент читает её как живую и тратит попытки на цели, которых больше не существует: следует старому правилу, падает, повторяет, сжигает токены и время ревьюера. Старение инструкции — это скрытый налог на каждый агентский запуск, и в отличие от подписок его не видно в бюджете.
Корреляцию RAMP тоже стоит прочесть с ограничителем. Авторы прямо называют результаты гипотезами-генераторами: команды, которые пишут конфигурацию, вероятно, дисциплинированны и в остальном — в ревью, тестах, архитектурных решениях. Это делает вывод практичным без магии: закоммиченная конфигурация — дешёвый видимый маркер дисциплины и одновременно рабочий ограничитель для агента. Обе роли полезны руководителю; различать их — задача исследователей.
Для руководителя это дешёвый рычаг: файл инструкций ведёт себя как код. У него есть владелец, дата пересмотра и ревью при изменении. Как задать такое владение для делегирования агенту, я разбирал в статье «Как дать AI-агенту задачу и не потерять контроль»: правила, права, стоп-условия и владелец приёмки.
Ранние сигналы
🔴⚪⚪ Час проверки плана дешевле часа проверки кода. Внутренняя AI-команда Infobip industry paperarXiv, 31 августа 2026; принимается на CIKM 2026. Infobip — хорватская cloud-коммуникационная платформа. Качественный опыт одной команды, без контрольных групп. (хорватская cloud-коммуникационная платформа) формализовала четырёхфазный рабочий процесс с агентами: исследование, планирование, определение задач, реализация. Человеческие усилия смещены в первые фазы; делегирование растёт по мере созревания артефактов. Наблюдение авторов: ошибки исследования и планирования умножаются на поздних фазах; исправление сгенерированного кода задним числом добавляет раздувание и хрупкость. Опыт одной компании — стоит проверки локальным экспериментом: перенести один час проверки кода в час проверки плана и сравнить долю переделок за месяц.
Что делать в понедельник
Сразу:
- Возьмите один зелёный прогон CI по агентской задаче и письменно ответьте: какие требования ревью этот прогон не проверяет. Два–три повторяющихся требования переведите в исполняемые проверки — по образцу SWE-Gate.
- Поставьте в CI проверку факта изменения: манифесты зависимостей действительно обновлены, старый стек удалён. Этот слой идёт до поведенческих тестов.
- Проверьте дату последнего изменения AGENTS.md и конфигураций агентов в ваших репозиториях. Назначьте владельца и дату пересмотра каждому файлу.
На квартал:
- Соберите многослойную приёмку для миграций и обновлений зависимостей: аудит изменения → поведенческие тесты → независимая проверка другим агентом или инженером.
- Включите инструкции агентов в код-ревью как полноценный артефакт: ревью при изменении, владелец, периодичность пересмотра.
- Проведите эксперимент из раннего сигнала: час проверки плана вместо часа проверки кода, замер доли переделок до и после на одной команде.
Что ещё почитать
- SWE-Gate: Passing Functional Tests Is Not Enough — бенчмарк, который превратил требования ревью в исполняемые тесты; 221 из 644 «зелёных» патчей их провалили.
- Update from Hell (DEPBENCH) — 203 реальных обновления зависимостей со скрытыми поломками; лучшая конфигурация решает 51%.
- SWE Refactor Bench — трёхстадийная приёмка миграций целых репозиториев; полный проход — 5,4% прогонов.
- A Few Pages of Markdown (RAMP) — 441 репозиторий: закоммиченная конфигурация агентов и вдвое меньший рост сложности кода.
- SpecMine — 470 тысяч файлов спецификаций в 73 тысячах репозиториев: spec-driven разработка стала массовой.
- A Phased Workflow for Operating LLM-Based Coding Agents — четырёхфазный процесс Infobip с загрузкой человеческих усилий в начало.
- InfoQ: HCP Terraform как управляющий контур для AI-инфраструктуры — HashiCorp о смещении главного узкого места из генерации конфигурации в её проверку.
- InfoQ: агентная система безопасности Figma — агенты готовят исправления, решение о применении остаётся за инженером.
- Хабр: Как проверить реальную пользу ИИ для бизнеса — русскоязычная модель из шести шагов с приёмкой как финальным шагом.
- Зелёный CI — не доказательство — моя карта приёмки агентской работы: требование → сценарий → тест → решение владельца.
- Как дать AI-агенту задачу и не потерять контроль — поля контракта делегирования: правила, права, стоп-условия, владелец.
- METR: расследование инцидента с агентами OpenAI и Hugging Face — фон недели: как 1200 агентов координировались мимо своих автопроверок.
- Human Loop Weekly #3 — предыдущий опубликованный выпуск: AI-метрики взрослеют, от токенов к стоимости проверки.
Вопрос команде на эту неделю: какое требование из вашего ревью агент нарушит следующим — и какая проверка поймает его раньше ревьюера?
Human Loop Weekly выходит по понедельникам.
📱 Telegram: @predictableteam
🌐 Website: maratkee.com
