Когда ИИ сможет выполнять целую работу самостоятельно?
Сегодня ИИ уже можно попросить не просто написать письмо или исправить одну строку кода. Ему дают задачи, на которые у человека ушли бы часы: разобраться в проблеме, найти информацию, изменить несколько файлов, собрать таблицу или подготовить большой результат.
Из-за этого легко представить следующий шаг: скоро человеку останется только сказать, что нужно получить, а ИИ сам разберётся со всем остальным.
Но здесь есть важная граница.
Долго выполнять действия — ещё не значит самостоятельно выполнять работу.
Для настоящей рабочей самостоятельности мало уметь сделать много шагов подряд. Нужно понять неидеально поставленную задачу, найти недостающий контекст, заметить изменение условий, не забыть ограничения, вовремя задать вопрос, проверить собственный результат и выдать то, чему человек действительно может доверять.
Поэтому главный вопрос не в том, сколько минут или часов агент способен действовать без остановки.
Главный вопрос другой:
сколько человеческого управления, уточнений, проверки и исправлений всё ещё требуется, чтобы получить хороший конечный результат?
Именно по этой границе сегодня проходит разница между впечатляющим ИИ-агентом и самостоятельным цифровым исполнителем.
Что значит «выполнить целую работу»
Представим аналитика, которому руководитель говорит: «Разберись, почему в этом квартале упали продажи, и подготовь выводы к завтрашней встрече».
Это не одна команда.
Нужно понять, какие данные нужны. Найти их. Проверить, что периоды и показатели сопоставимы. Заметить странность в цифрах. Возможно, уточнить у коллег, не менялась ли методика учёта. Проверить несколько объяснений. Отделить совпадение от вероятной причины. Собрать выводы так, чтобы ими можно было воспользоваться на встрече.
Если ИИ умеет построить график, это ещё не вся работа аналитика. Если он умеет написать текст отчёта — тоже нет.
В этой статье под «целой работой» мы понимаем более узкую вещь, чем профессию: один законченный рабочий результат от поставленной цели до сдачи.
Система должна сама пройти большую часть пути:
цель → план → поиск нужного контекста → несколько разных действий → реакция на неожиданности → проверка → готовый результат.
Человек при этом может оставаться ответственным и делать финальную проверку. Вопрос в том, насколько большой должна быть эта проверка.
Это важно не путать с другим вопросом — заменит ли ИИ саму профессию. Даже если агент сможет самостоятельно готовить отдельные отчёты, это ещё не доказывает, что компании понадобится меньше аналитиков. Автоматизация рабочего результата и сокращение рабочих мест — разные ступени.
Почему кажется, что этот момент уже почти наступил
Одна причина — быстрый рост результатов ИИ на длинных задачах.
Исследовательская организация METR измеряет, насколько сложные задачи современные агенты способны решить с заданной вероятностью. Сложность выражается через время, которое понадобилось бы квалифицированному человеку.
Отсюда появляются формулировки вроде «агент достиг горизонта в несколько часов».
Их легко прочитать как «ИИ уже может самостоятельно работать несколько часов».
Но METR специально предупреждает: это не одно и то же.
Если задача обычно занимает у эксперта восемь часов, а агент успешно её решил, это не означает, что агент восемь часов непрерывно работал как сотрудник. Тем более это не означает, что ему можно передать произвольную восьмичасовую офисную работу.
Тесты METR в основном относятся к программированию, машинному обучению и кибербезопасности. Кроме того, результат зависит от требуемой вероятности успеха: способность иногда справиться со сложной задачей и способность надёжно выполнять её каждый рабочий день — разные требования.
Что известно: современные агенты действительно решают всё более длинные и сложные хорошо поставленные цифровые задачи.
Что из этого не следует: что существует универсальное число часов, в течение которых ИИ уже способен заменить самостоятельного работника.
Люди уже начинают отдавать ИИ задачи на часы
Бенчмарки — не единственный сигнал.
OpenAI изучила использование Codex и сообщила, что к маю 2026 года 70,2% пользователей в исследованной выборке хотя бы раз давали системе запрос, который сама модель оценивала как работу более чем на час для человека. 25,6% пользователей хотя бы раз давали запрос, оценённый более чем в восемь часов человеческой работы.
Это заметное изменение поведения. Люди уже используют ИИ не только для микрозадач.
Но здесь снова нельзя перепрыгивать через ступень доказательства.
Оценка человеческого времени сделана моделью и сама OpenAI называет её ориентировочной. Главное же — большой запрос не равен успешно выполненной работе. Эти числа не показывают, какая доля таких задач закончилась приемлемым результатом и сколько времени человек затем потратил на проверку и исправления.
Anthropic видит похожее движение в Claude Code. Опытные пользователи чаще разрешают агенту действовать без подтверждения каждого отдельного шага. На сложных внутренних задачах успешность росла, а среднее число человеческих вмешательств в одном из анализов снизилось с 5,4 до 3,3.
Однако контроль не исчезает. Медианное отдельное действие Claude Code в изученном периоде длилось около 45 секунд. На более сложных задачах система чаще просит уточнения. А опытные пользователи, хотя и дают ей больше свободы, более выборочно следят за ходом работы и вмешиваются, когда считают это необходимым.
Получается важная картина: человек постепенно перестаёт быть оператором каждой кнопки, но пока не перестаёт быть руководителем и проверяющим.
Что происходит, когда задача становится похожа на настоящую работу
Самые интересные результаты появляются не там, где агенту дают одну чистую задачу, а там, где ему приходится жить с последствиями собственных предыдущих действий.
OSWorld 2.0 проверяет агентов на 108 длинных компьютерных сценариях. Это не только программирование: системе приходится работать с обычными приложениями и проходить много этапов. У человека такой сценарий занимает в среднем около 1,6 часа.
Лучший протестированный в исследовании агент полностью выполнил только 20,6% задач.
Почему?
Система могла забыть ограничение, которое получила в начале. Не заметить, что информация на экране изменилась. Сделать предположение там, где следовало уточнить. Не восстановить скрытый контекст. Выполнить действия, но не проверить, действительно ли получился нужный результат.
Именно такие ошибки особенно важны для реальной работы. В компании редко существует идеально подготовленная инструкция, где вся нужная информация лежит перед исполнителем и каждое действие автоматически получает оценку «правильно» или «неправильно».
Другой тест, Odysseys, проверяет длинные задачи в интернете, где нужно переходить между сайтами и собирать результат через последовательность действий. Лучший опубликованный результат — 44,5%. Это уже значимая способность, но до уровня «поставил задачу и забыл» ещё далеко.
В финансах WorkstreamBench показывает ту же проблему с другой стороны. Агенты уже способны создавать сложные таблицы и финансовые модели, но по мере усложнения цепочки расчётов качество заметно падает и лучшие системы всё ещё не достигают устойчивого профессионального уровня.
То есть проблема повторяется в разных областях: отдельные сильные способности уже есть, но при сборке их в длинную рабочую цепочку надёжность проседает.
Даже в программировании целый цикл сложнее его частей
Программирование сегодня — одна из областей, где ИИ-агенты измерены лучше всего.
И именно здесь особенно хорошо видно, почему нельзя складывать результаты отдельных тестов в обещание полной автономности.
SWE-Cycle разделяет работу над программной задачей на несколько этапов: подготовить окружение, внести изменение, написать или обновить тесты — а затем проверяет полный цикл целиком.
Когда этапы объединяются, результат резко ухудшается по сравнению с отдельными фазами.
Причина понятна: ошибка в начале становится контекстом для следующего шага. Агенту приходится не только уметь каждую операцию отдельно, но и сохранять правильное состояние задачи на всём пути.
Есть и ещё более практичная проверка.
METR попросила настоящих сопровождающих open-source проектов оценить изменения кода, которые автоматический тест SWE-bench счёл успешными. В изученной выборке автоматическая оценка в среднем была на 24,2 процентного пункта выше, чем решение людей о том, готовы ли они действительно принять это изменение в основной код проекта.
Это не означает, что автоматические тесты бесполезны. Они измеряют важную часть результата.
Но для рабочего мира появляется дополнительный вопрос: не просто прошёл ли результат тест, а готов ли профессионал поставить под ним своё имя.
А если ИИ уже делает результат уровня эксперта?
Есть данные, которые выглядят намного оптимистичнее.
В GDPval OpenAI проверяет модели на рабочих результатах из разных профессий. Frontier-модели в части заданий уже приближаются к качеству, которое эксперты предпочитают работе других экспертов.
Это сильный сигнал: ИИ способен создавать не только игрушечные ответы, но и полезные профессиональные артефакты.
Однако GDPval первой версии устроен как одноразовая задача. Система получает подготовленный контекст и должна выдать результат. OpenAI прямо отмечает, что тест не измеряет полноценную интерактивную работу: поиск недостающего контекста, разговор с коллегами, последовательные уточнения, изменение требований и многократную доработку.
Поэтому хороший конечный документ ещё не доказывает, что ИИ самостоятельно прошёл весь путь, который обычно приводит к этому документу.
Это различие будет становиться всё важнее. Чем лучше модели делают отдельный результат, тем больше оставшаяся трудность смещается в постановку задачи, контекст, координацию и проверку.
Самая трудная часть может оказаться не самой «умной»
Когда говорят о будущем ИИ, легко представить, что главный барьер — способность рассуждать.
Но реальная работа часто ломается на более приземлённых вещах.
Файл лежит не там, где ожидалось. В таблице поменяли название столбца. Руководитель имел в виду другой период. Данные противоречат письму коллеги. Клиент передумал в середине задачи. Правило компании не записано в инструкции. Нельзя отправить документ без согласования. Хороший результат по метрике оказывается плохим решением для бизнеса.
Исследования уже видят этот эффект.
METR обнаруживает более слабые результаты на более «неопрятных» задачах, где меньше идеальной структуры. Anthropic видит больше запросов на уточнение по мере роста сложности целей. В OSWorld 2.0 скрытое состояние, динамическая информация и пропущенная проверка результата входят в основные причины ошибок.
Поэтому умение работать с неоднозначностью — не дополнительная приятная функция. Это часть самой способности выполнять работу.
Иногда правильное действие самостоятельного исполнителя — не продолжать любой ценой, а остановиться и спросить человека.
Значит ли человеческий вопрос, что агент не автономен?
Нет.
Сотрудник тоже уточняет требования, просит доступ или согласовывает решение. Полная изоляция от людей — плохое определение самостоятельной работы.
Гораздо полезнее спросить, какая доля человеческого внимания требуется для результата.
Есть большая разница между двумя сценариями.
В первом человек ставит задачу на два часа, а затем каждые пять минут отвечает на вопрос, подтверждает действие, исправляет ошибку и объясняет следующий шаг.
Во втором он ставит ту же задачу, один раз отвечает на содержательное уточнение и через некоторое время проверяет готовый результат за десять минут.
Формально в обоих случаях человек участвовал. Экономически и организационно это совершенно разный уровень автономности.
Поэтому для AI Futures более полезный ориентир выглядит примерно так:
ценность принятого результата относительно времени, которое человек потратил на управление, проверку и исправления.
Это не существующий универсальный научный показатель, а наша аналитическая рамка. Но она лучше отражает то, что действительно важно работодателю и работнику, чем число минут непрерывной работы агента.
В каких задачах самостоятельность придёт раньше
Данные пока не позволяют составить календарь по профессиям, но позволяют увидеть свойства задач, которые облегчают автономность.
Раньше всего end-to-end делегирование выглядит правдоподобным там, где работа:
- полностью цифровая;
- имеет достаточно ясную цель;
- получает доступный системе контекст;
- допускает автоматическую или быструю проверку;
- позволяет безопасно отменить ошибочное действие;
- не требует большого количества негласных организационных знаний;
- имеет ограниченную цену отдельной ошибки.
Именно поэтому программирование так часто оказывается впереди: код можно запускать, тестировать, сравнивать и откатывать.
Но даже внутри одной профессии две задачи могут находиться на совершенно разных уровнях. Подготовить стандартный отчёт по готовому шаблону и самостоятельно решить, почему бизнес теряет клиентов, — обе задачи аналитика, но требования к автономности у них разные.
Поэтому будущее, вероятно, придёт не в форме даты, когда «ИИ научился работать самостоятельно». Сначала будут расширяться островки работы, которые можно передавать целиком.
Когда же наступит настоящий переход?
На этот вопрос хочется ответить годом.
Пока это было бы ложной точностью.
METR действительно наблюдает быстрый исторический рост длины задач, с которыми справляются frontier-агенты. В одном сценарном упражнении исследователи METR в марте 2026 года использовали предположение, что примерно через 12–18 месяцев системы могут достичь около 200 часов по их метрике горизонта задач.
Но это прогноз исследователей для конкретной, преимущественно программной метрики и определённой вероятности успеха. Это не прогноз того, что через 12–18 месяцев большинство офисной работы станет автономным.
Чтобы изменить наш сегодняшний вывод, нужно увидеть несколько вещей одновременно.
Во-первых, высокая надёжность на реалистичных длинных workflows. Не 20%, 40% или даже случайные 50% успеха, а уровень, при котором результатом можно регулярно пользоваться.
Во-вторых, профессиональная приемка. Не только автоматический тест, но реальные специалисты должны принимать результат примерно с той надёжностью, с которой принимают работу людей соответствующего уровня.
В-третьих, малый объём человеческого контроля. Время на объяснения, разрешения, исправления и проверку должно стать небольшой долей времени, которое раньше занимала сама работа.
В-четвёртых, устойчивость к беспорядку реального мира. Система должна справляться, когда требования неполные, контекст нужно найти, а условия меняются по ходу работы.
В-пятых, широта. Такие результаты должны появиться не только в программировании, но и в других видах интеллектуального труда.
В-шестых, реальные внедрения. Компании должны регулярно передавать агентам законченные рабочие пакеты и измерять качество, стоимость и ошибки — не только показывать демонстрации.
Когда эти сигналы начнут сходиться, вопрос «может ли ИИ выполнять целую работу самостоятельно?» получит гораздо более уверенный ответ.
Сегодня они ещё не сошлись.
Что известно
- ИИ-агенты уже способны самостоятельно выполнять некоторые существенные многошаговые цифровые задачи.
- Люди всё чаще дают им задачи, оцениваемые в часы человеческой работы.
- В отдельных продуктах и внутренних системах растёт успешность при меньшем числе пошаговых вмешательств.
- На реалистичных длинных компьютерных, веб-, финансовых и программных workflows всё ещё остаются большие провалы надёжности.
- Неоднозначность, потеря контекста и необходимость профессиональной проверки остаются существенными ограничениями.
- Результаты программирования нельзя автоматически переносить на всю интеллектуальную работу.
Что пока неизвестно
- когда широкая профессиональная end-to-end автономность станет обычной;
- какой уровень человеческой проверки окажется экономически оптимальным в разных видах работы;
- насколько быстро нынешний рост capability перенесётся из хорошо измеряемых задач в неоднозначные рабочие условия;
- насколько результаты сегодняшних benchmark-подходов будут предсказывать работу будущих систем в реальных компаниях;
- в каких областях профессиональная приемка и низкая стоимость проверки появятся первыми.
Вывод AI Futures
В некоторых ограниченных видах цифровой работы ИИ уже можно передавать законченные задачи. Для широкой профессиональной интеллектуальной работы срок пока не установлен.
Главный рубеж — не количество часов, которое агент способен действовать, и не рекорд на одном тесте. Важнее другое: может ли человек поставить цель, не управлять каждым шагом и затем получить результат, который требует лишь небольшой и предсказуемой проверки.
Сегодня агенты быстро приближаются к этой границе в хорошо поставленных, цифровых и проверяемых задачах. Но реалистичные длинные workflows показывают, что потеря контекста, неоднозначность, накопление ошибок и профессиональная проверка всё ещё существенно ограничивают самостоятельность.
Поэтому наиболее точный ответ на вопрос «когда?» сейчас такой: для отдельных рабочих пакетов — уже сейчас; для широкой профессиональной работы — мы пока не знаем. Следить стоит не за одной цифрой «автономных часов», а за тем, насколько быстро уменьшается человеческое время на управление, уточнения, проверку и исправления при сохранении качества результата.
Первоисточники
- METR — Measuring AI Ability to Complete Long Tasks
- METR — Frontier AI Trends Report
- Anthropic — Measuring AI agent autonomy in practice
- OpenAI — How agents are transforming work
- OSWorld 2.0
- Odysseys
- WorkstreamBench
- SWE-Cycle
- METR — Many SWE-bench Passing PRs Would Not Be Merged Into Main
- OpenAI — GDPval
- METR — Organizational Uplift Game