Сначала — суть

Главный вопрос: может ли ИИ ускорить создание следующего поколения ИИ?

Короткий ответ: уже есть убедительные примеры, где ИИ помогает выполнять отдельные части исследовательской работы. Но это ещё не доказательство того, что вся разработка новых систем ИИ ускоряется в той же пропорции. Между быстрым выполнением одной задачи и быстрым движением всей лаборатории остаётся большой разрыв.

1. Что уже умеют системы

Они могут помогать с программированием, анализом, поиском решений и некоторыми экспериментальными задачами. Это реальный прогресс: часть работы, которая раньше полностью лежала на человеке, уже можно делегировать системе или выполнять вместе с ней.

2. Почему этого недостаточно для сильного вывода

Исследование — это не одна операция. Нужно выбрать хороший вопрос, поставить эксперимент, дождаться результата, понять, что он означает, заметить ошибку и решить, куда двигаться дальше. Если ИИ ускоряет только один участок, общий срок проекта может почти не измениться.

3. Что мы пытаемся установить

Нас интересует не рекорд системы в тесте, а более простой человеческий вопрос: становится ли команда способна создавать новое поколение ИИ заметно быстрее? Для такого вывода нужны данные о реальном исследовательском процессе, а не только о наборе отдельных заданий.

4. Что пока остаётся неизвестным

Мы пока не знаем, насколько быстро будут исчезать человеческие ограничения в выборе идей, проверке результатов и принятии решений. Поэтому сильное ускорение разработки ИИ остаётся возможностью, которую нужно наблюдать и проверять, а не установленным фактом.

Главная мысль: «ИИ хорошо решает исследовательские задачи» и «лаборатория создаёт новый ИИ намного быстрее» — это разные утверждения.

Почему стоит вернуться: мы перепроверяем доказательную базу при появлении важных новых данных. Если они меняют основной вывод, это отдельно появится в «Что изменилось» и на странице «Материалы».

ИИ-агенты · разбор AI Futures

Насколько автономными уже стали ИИ-агенты?

Современный агент уже может сам пользоваться инструментами и проходить цепочку действий. Но «задача на 12 часов», «45 минут без вмешательства» и «работать самому весь день» — три разных утверждения. Разбираемся, что измеряют сегодняшние данные.

Короткий ответ. ИИ уже можно делегировать заметный кусок хорошо поставленной цифровой работы. Но сегодняшняя автономность — это работа внутри заданных границ, а не универсальный цифровой сотрудник, которому можно дать широкую цель и забыть о нём.

Что вообще называется ИИ-агентом

Обычный чат устроен просто: человек пишет сообщение, модель отвечает. Агент получает ещё и возможность действовать: открыть файлы, запустить код, вызвать внешний инструмент, найти информацию или изменить проект. После каждой операции ему не обязательно ждать новой команды человека.

Но автономность — не одна характеристика. Нужно отдельно спросить: насколько сложную задачу система способна решить, как далеко она идёт без подсказки, когда просит уточнение, какие действия ей разрешены и насколько надёжно она приходит к правильному результату.

Главная граница: способность выполнить длинную задачу, фактическое время работы без человека и право совершать действия во внешнем мире — разные вещи.

Откуда берутся «часы автономной работы»

Независимая исследовательская организация METR измеряет так называемый time horizon. По смыслу это сложность задачи, выраженная через время, которое потребовалось бы человеку-эксперту.

Если 50-процентный горизонт равен примерно 12 часам, это означает: на задаче такого уровня сложности агент по статистической модели имеет около 50% шансов справиться в условиях теста. Это не означает, что сам агент работает 12 часов подряд. METR подчёркивает это отдельно.

В сводке METR за февраль—март 2026 года для публичного frontier-уровня 50-процентный горизонт оценивался примерно в 12 часов, а 80-процентный — примерно в полтора часа. Интервалы неопределённости широкие; кроме того, METR предупреждает, что нынешний набор задач ненадёжно измеряет горизонты выше 16 часов.

И сами задачи здесь особенные: в основном программирование, машинное обучение и кибербезопасность. Они хорошо сформулированы, имеют ясный критерий успеха и подходят для автоматической проверки.

Что из этого следует. Frontier-агенты уже способны самостоятельно проходить некоторые многошаговые технические задачи, которые заняли бы у специалиста часы. Чего не следует: что они могут заменить столько же часов произвольной человеческой работы.

А что происходит не в тесте, а у настоящих пользователей

Здесь полезны данные Anthropic о Claude Code. Компания проанализировала миллионы взаимодействий с собственным coding-агентом и через API.

Большинство эпизодов совсем не многочасовые: медианная продолжительность одного хода Claude Code была около 45 секунд. Но край распределения удлинялся: у 0,1% самых долгих ходов продолжительность выросла с менее чем 25 минут осенью 2025 года до более чем 45 минут в начале января 2026-го.

Поэтому одновременно верны две вещи: обычная работа агента пока короткая, а в реальном использовании уже существуют случаи, когда человек позволяет ему самостоятельно работать десятки минут.

Опытные пользователи дают больше свободы — и чаще вмешиваются

Новые пользователи Claude Code включали полный автоматический режим примерно в 20% сессий. У очень опытных пользователей показатель превышал 40%. Но одновременно опытные пользователи чаще прерывали агента во время работы: примерно 9% ходов против около 5% у новичков.

Похоже, меняется форма контроля. Вместо подтверждения каждого шага человек чаще говорит «работай», следит за процессом и вмешивается, когда агент идёт не туда.

Иногда агент сам возвращает человека в цикл

Чем сложнее задача, тем чаще Claude Code сам останавливается и просит уточнение. Это может происходить из-за выбора между подходами, нехватки контекста, отсутствующего доступа или необходимости подтвердить важное действие.

Это полезное свойство, но его нельзя переоценивать. То, что агент иногда спрашивает вовремя, ещё не доказывает, что он всегда замечает собственную неопределённость.

Почему реальному агенту специально не дают полной свободы

Есть ещё одно различие между демонстрацией и рабочей системой: полномочия.

OpenAI описывает внутреннее использование Codex: агент может просматривать репозитории, запускать команды и работать с инструментами разработки, но действует внутри технических границ. Песочница ограничивает среду выполнения, отдельные действия требуют одобрения, сетевой доступ управляется политиками, а действия агента записываются в журналы.

Это не доказательство того, что такие ограничения решают все проблемы. Зато они показывают устройство реальной автономности: чем больше агент умеет, тем важнее становится не только интеллект модели, но и то, что ей разрешено.

Интернет создаёт отдельный риск

Агент, который читает страницы, письма и документы, может встретить чужие инструкции, пытающиеся заставить его сделать не то, чего хотел пользователь. Такое воздействие называют prompt injection — попыткой подсунуть агенту команду через данные, которые он обрабатывает.

OpenAI рассматривает prompt injection как практическую проблему агентных систем. Чем больше у системы инструментов и прав, тем выше потенциальная цена успешной манипуляции. Поэтому безопасность автономности зависит не только от самой модели, но и от архитектуры доступа и возможности ограничить последствия ошибки.

Так насколько автономны агенты сегодня?

Хорошо поставленная цифровая задачаУже да. Агенты способны сами пройти заметную цепочку действий, а на части технических задач сложность измеряется человеческими часами.
Десятки минут без вмешательстваУже встречаются в реальном coding-agent использовании, но это край распределения, а не типичный эпизод.
Без подтверждения каждого шагаДа. Опытные пользователи чаще дают агенту свободу, но продолжают наблюдать, прерывать и уточнять.
Широкая цель и долгий результат без человекаПока не установлено как надёжная общая способность, особенно вне хорошо проверяемой цифровой работы.

Почти все лучшие количественные данные сегодня особенно сильны в программировании и соседних цифровых задачах. Нельзя взять результат coding agent и автоматически перенести его на врача, руководителя, юриста или исследовательскую организацию целиком.

Почему это важно для будущего ИИ

Автономность — один из переходов между «модель хорошо отвечает» и «система действительно выполняет работу».

В AI 2027 быстрые изменения зависят от того, насколько долго агенты способны самостоятельно вести сложную работу. В разборе автоматизации AI R&D важно, может ли исследовательский агент не просто предложить фрагмент кода, а провести цепочку экспериментов и скорректировать план. А для рынка труда имеет значение не только процент задач, где модель показывает хороший ответ, но и сколько реальной работы можно надёжно передать системе.

Вывод AI Futures

ИИ-агенты уже стали настоящими исполнителями, а не только чатами. Но сегодняшняя автономность остаётся ограниченной, неоднородной и тесно связанной с человеческим контролем.

Им уже можно делегировать всё более крупный кусок хорошо определённой цифровой работы — если есть понятная цель, проверяемый результат, ограниченные полномочия и возможность вовремя вернуть человека в цикл.

Поэтому следить стоит не за одной рекордной цифрой «часов автономности», а за четырьмя изменениями: растёт ли надёжность на длинных задачах, расширяются ли результаты за пределы программирования, реже ли требуется содержательное вмешательство человека и можно ли безопасно давать агентам более серьёзные полномочия.

Основные первоисточники

Living Research

Проверено 12 августа 2026

Первый исследовательский проход: METR, Anthropic и OpenAI. Основной вывод: агенты уже выполняют многошаговую цифровую работу, но единой универсальной «длительности автономности» данные не дают.

Если новые измерения заметно изменят этот вывод, мы обновим материал и отдельно покажем, что поменялось.

Следующий вопрос

Что меняется, если таких агентов использовать для создания следующего поколения ИИ?

Автономность отдельного агента ещё не равна ускорению всей лаборатории. В следующем материале разбираем, какие части AI R&D уже можно автоматизировать и где остаётся человек.

Как ИИ автоматизирует собственную разработку →Вернуться ко всем материалам