SDD для AI-агентов: как мы заново изобрели очень быстрый waterfall

Коротко. Агенту нужна спецификация. Она даёт сценарии, ограничения, примеры и критерии проверки. Проблема возникает в другом месте: команда может принять исходную гипотезу за знание о продукте, данных или интеграции. Агент быстро превратит эту гипотезу в сервисы, тесты и инфраструктуру. После этого смена курса стоит дороже. Этот текст основан на статье в корпоративном блоге Райффайзенбанка на Хабре и дополняет её самостоятельным разбором: где SDD помогает агентам, как не потерять точки принятия решений и что стоит измерять руководителю. ...

11 сентября 2026 г. · 6 минут · Марат Киньябулатов
Схема SWE-Gate: комментарии ревью превращаются в исполняемые проверки; рядом ключевые числа выпуска — 221 из 644 патчей, 5,4% полных проходов

Human Loop Weekly #5 — Треть патчей агента проходит автотесты и проваливает ревью

Всем привет. С вами Human Loop Weekly — еженедельный дайджест о том, как AI меняет инженерный менеджмент. Я подписан на десятки рассылок и каждую неделю сверяю их со свежими исследованиями, чтобы отделять рабочий сигнал от шума. В этом выпуске: требования ревью впервые превратились в исполняемые тесты — и треть «зелёных» патчей их провалила; проверка факта изменения встала перед проверкой поведения; инструкции для агентов стали массовым артефактом и начали стареть. Выпуск продолжает линию №3: тогда стоимость проверки выросла в цене относительно стоимости генерации. За прошедшие две недели исследователи и индустрия независимо друг от друга показали, из чего именно эта проверка собирается. ...

7 сентября 2026 г. · 10 минут · Марат Киньябулатов

Зелёный CI — не доказательство: как принимать работу AI-агента

Проблема: тесты зелёные, задача не та AI-агент открыл pull request. Изменения выглядят аккуратно. Тесты зелёные. На ревью выясняется, что агент выбрал другую трактовку правила: клиент получает ответ, второй заказ при этом всё равно появляется. Код и тест согласованы друг с другом. Команда хотела проверить другое поведение. В этом месте легко обвинить модель, промпт или ревьюера. Проблема возникает раньше: агент получил задачу без заранее согласованного ответа на вопрос «какой наблюдаемый результат должен доказать тест?». ...

27 августа 2026 г. · 6 минут · Марат Киньябулатов

Как дать AI-агенту задачу и не потерять контроль

Коротко. AI-агент может открыть технически корректный pull request (PR) и всё равно решить не ту задачу: выбрать устаревшее правило, затронуть лишний сервис или обойти известное ограничение. Команде нужен короткий контракт, который до запуска фиксирует цель, границы, доказательства результата, момент остановки и владельца решения. Контракт работает вместе с техническими ограничениями: отдельными доступами, изолированной средой, обязательными проверками и review. Для изменения поведения этого недостаточно: до кода команда ещё согласует сценарий, который будущий тест обязан подтвердить. В статье — копируемый шаблон, сквозной пример и способ встроить эту практику в Git и CI. ...

24 августа 2026 г. · 12 минут · Марат Киньябулатов
The Human Loop Weekly #3 — AI-метрики взрослеют: инженер работает за ноутбуком, вокруг метрики и проверки

Human Loop Weekly #3 — AI-метрики взрослеют: от токенов к стоимости проверки

Всем привет. С вами Human Loop Weekly — еженедельный дайджест о том, как AI меняет инженерный менеджмент. Я подписан на десятки рассылок и каждую неделю сверяю их со свежими источниками, чтобы отделять рабочий сигнал от шума. В этом выпуске за окно после 17 августа и до утра 24 августа: AI-метрики взрослеют, стоимость переезжает в проверку, агенты выходят в общий поток разработки, модельные обновления становятся операционной задачей. Шкала доказательности: 🟢🟢🟢 — сильная независимая база; 🟡🟡⚪ — несколько свежих источников, крупная телеметрия, опросы или согласованные кейсы с понятными границами; 🔴⚪⚪ — ранний сигнал для наблюдения. ...

24 августа 2026 г. · 9 минут · Марат Киньябулатов
A giant cat sitting in a traffic jam, illustrating a bottleneck in the path to production

Agentic Engineering — это не про агентов. Это про маршрут задачи до продакшена

Мы прошли путь от первых пользователей LLM-инструментов до массового использования чатов и кодинг-агентов. На дашбордах всё выглядело правильно: люди заходили, пробовали, возвращались, приносили примеры, показывали демо, техлиды учили команды. Метрики потока при этом долго не двигались. Lead Time не снижался системно. Throughput не рос так, чтобы это было видно на уровне инженерной организации. Defect Rate не давал уверенного сигнала, что качество стало лучше. Эта статья — большая версия двух моих постов на Habr: части 1 про рост использования и метрики результата и части 2 про Agentic Engineering и AI-first команды. Здесь я собираю логику целиком: от первых LLM-чатов до следующего слоя измерения, который оказался важнее обычного дашборда внедрения. ...

15 июня 2026 г. · 12 минут · Марат Киньябулатов

Как идти к Agentic Engineering, когда структуру команды сейчас трогать нельзя

Agentic Engineering не начинается с оргчарта. Он начинается с момента, когда команда видит полный путь задачи и умеет безопасно отдавать часть работы агентам. Красивая картинка AI-native команды — 2–3 человека, E2E-ответственность, агенты в инженерном процессе, быстрый путь от идеи до продакшена. В большой организации эта картинка сразу встречает годовые цели, бюджеты, стратегические проекты, регуляторные контуры и уже собранные команды. В этой статье — три безопасных маршрута, которые можно запускать внутри текущей структуры: агентизировать нудный run-процесс, выделить 2–3 агентных практиков или собрать микро-юниты внутри команды. ...

15 июня 2026 г. · 8 минут · Марат Киньябулатов