Насколько автономными уже стали ИИ-агенты?
Современный агент уже может сам пользоваться инструментами и проходить цепочку действий. Но «задача на 12 часов», «45 минут без вмешательства» и «работать самому весь день» — три разных утверждения. Разбираемся, что измеряют сегодняшние данные.
Что вообще называется ИИ-агентом
Обычный чат устроен просто: человек пишет сообщение, модель отвечает. Агент получает ещё и возможность действовать: открыть файлы, запустить код, вызвать внешний инструмент, найти информацию или изменить проект. После каждой операции ему не обязательно ждать новой команды человека.
Но автономность — не одна характеристика. Нужно отдельно спросить: насколько сложную задачу система способна решить, как далеко она идёт без подсказки, когда просит уточнение, какие действия ей разрешены и насколько надёжно она приходит к правильному результату.
Откуда берутся «часы автономной работы»
Независимая исследовательская организация METR измеряет так называемый time horizon. По смыслу это сложность задачи, выраженная через время, которое потребовалось бы человеку-эксперту.
Если 50-процентный горизонт равен примерно 12 часам, это означает: на задаче такого уровня сложности агент по статистической модели имеет около 50% шансов справиться в условиях теста. Это не означает, что сам агент работает 12 часов подряд. METR подчёркивает это отдельно.
В сводке METR за февраль—март 2026 года для публичного frontier-уровня 50-процентный горизонт оценивался примерно в 12 часов, а 80-процентный — примерно в полтора часа. Интервалы неопределённости широкие; кроме того, METR предупреждает, что нынешний набор задач ненадёжно измеряет горизонты выше 16 часов.
И сами задачи здесь особенные: в основном программирование, машинное обучение и кибербезопасность. Они хорошо сформулированы, имеют ясный критерий успеха и подходят для автоматической проверки.
А что происходит не в тесте, а у настоящих пользователей
Здесь полезны данные Anthropic о Claude Code. Компания проанализировала миллионы взаимодействий с собственным coding-агентом и через API.
Большинство эпизодов совсем не многочасовые: медианная продолжительность одного хода Claude Code была около 45 секунд. Но край распределения удлинялся: у 0,1% самых долгих ходов продолжительность выросла с менее чем 25 минут осенью 2025 года до более чем 45 минут в начале января 2026-го.
Поэтому одновременно верны две вещи: обычная работа агента пока короткая, а в реальном использовании уже существуют случаи, когда человек позволяет ему самостоятельно работать десятки минут.
Опытные пользователи дают больше свободы — и чаще вмешиваются
Новые пользователи Claude Code включали полный автоматический режим примерно в 20% сессий. У очень опытных пользователей показатель превышал 40%. Но одновременно опытные пользователи чаще прерывали агента во время работы: примерно 9% ходов против около 5% у новичков.
Похоже, меняется форма контроля. Вместо подтверждения каждого шага человек чаще говорит «работай», следит за процессом и вмешивается, когда агент идёт не туда.
Иногда агент сам возвращает человека в цикл
Чем сложнее задача, тем чаще Claude Code сам останавливается и просит уточнение. Это может происходить из-за выбора между подходами, нехватки контекста, отсутствующего доступа или необходимости подтвердить важное действие.
Это полезное свойство, но его нельзя переоценивать. То, что агент иногда спрашивает вовремя, ещё не доказывает, что он всегда замечает собственную неопределённость.
Почему реальному агенту специально не дают полной свободы
Есть ещё одно различие между демонстрацией и рабочей системой: полномочия.
OpenAI описывает внутреннее использование Codex: агент может просматривать репозитории, запускать команды и работать с инструментами разработки, но действует внутри технических границ. Песочница ограничивает среду выполнения, отдельные действия требуют одобрения, сетевой доступ управляется политиками, а действия агента записываются в журналы.
Это не доказательство того, что такие ограничения решают все проблемы. Зато они показывают устройство реальной автономности: чем больше агент умеет, тем важнее становится не только интеллект модели, но и то, что ей разрешено.
Интернет создаёт отдельный риск
Агент, который читает страницы, письма и документы, может встретить чужие инструкции, пытающиеся заставить его сделать не то, чего хотел пользователь. Такое воздействие называют prompt injection — попыткой подсунуть агенту команду через данные, которые он обрабатывает.
OpenAI рассматривает prompt injection как практическую проблему агентных систем. Чем больше у системы инструментов и прав, тем выше потенциальная цена успешной манипуляции. Поэтому безопасность автономности зависит не только от самой модели, но и от архитектуры доступа и возможности ограничить последствия ошибки.
Так насколько автономны агенты сегодня?
Почти все лучшие количественные данные сегодня особенно сильны в программировании и соседних цифровых задачах. Нельзя взять результат coding agent и автоматически перенести его на врача, руководителя, юриста или исследовательскую организацию целиком.
Почему это важно для будущего ИИ
Автономность — один из переходов между «модель хорошо отвечает» и «система действительно выполняет работу».
В AI 2027 быстрые изменения зависят от того, насколько долго агенты способны самостоятельно вести сложную работу. В разборе автоматизации AI R&D важно, может ли исследовательский агент не просто предложить фрагмент кода, а провести цепочку экспериментов и скорректировать план. А для рынка труда имеет значение не только процент задач, где модель показывает хороший ответ, но и сколько реальной работы можно надёжно передать системе.
Вывод AI Futures
ИИ-агенты уже стали настоящими исполнителями, а не только чатами. Но сегодняшняя автономность остаётся ограниченной, неоднородной и тесно связанной с человеческим контролем.
Им уже можно делегировать всё более крупный кусок хорошо определённой цифровой работы — если есть понятная цель, проверяемый результат, ограниченные полномочия и возможность вовремя вернуть человека в цикл.
Поэтому следить стоит не за одной рекордной цифрой «часов автономности», а за четырьмя изменениями: растёт ли надёжность на длинных задачах, расширяются ли результаты за пределы программирования, реже ли требуется содержательное вмешательство человека и можно ли безопасно давать агентам более серьёзные полномочия.