Почему стоит вернуться: мы перепроверяем доказательную базу при появлении важных новых данных. Если они меняют основной вывод, это отдельно появится в «Что изменилось» и на странице «Материалы».

Исследование AI Futures

Чтение: 4 минуты

Когда ИИ сможет выполнять целую работу самостоятельно?

Материал подготовлен AI Futures. Редакционная ответственность и решение о публикации — MMX.

Короткий доказательный разбор для читателя без технической подготовки.

Граница вывода

Claim ceiling: допустимо говорить об автономии на отдельных, хорошо проверяемых заданиях. Нельзя приравнивать это к автоматизации профессии или обещать конкретный год массовой замены специалистов.

Живое исследование Вывод без изменений

Актуальность материала

Опубликовано
Проверено

Перед публикацией проверены данные о длинных цифровых задачах, профессиональной приёмке и фактическом объёме человеческого управления. Доказательства показывают рост возможностей, но не устанавливают дату широкой автономной работы без человека.

История обновлений
  1. — Материал опубликован после проверки claim ceiling, контрдоказательств и границ переноса результатов между профессиями.

«Проверено» означает, что мы пересмотрели актуальность источников и вывода. Это не означает, что прогноз гарантированно сбудется.

ИИ уже может самостоятельно выполнить некоторые ограниченные цифровые задания — например, исправить отдельную ошибку в программе или собрать черновой анализ. Но нет надёжной даты, когда он сможет без постоянного контроля выполнять широкий круг полноценных профессиональных работ.

Что означает «целая работа»

Здесь речь не о профессии целиком, а об одном законченном результате: получить задачу, спланировать действия, использовать нужные программы, исправить ошибки и выдать результат приемлемого качества. Чем дольше и неоднозначнее работа, тем больше мест, где система может ошибиться.

Факт. METR измеряет «временной горизонт» ИИ: задачи какой длительности для человека модель выполняет с заданной вероятностью успеха. В публичном отчёте начала 2026 года оценка для 50% успеха составляла примерно 12 часов 50 минут, а для 80% — около полутора часов. Диапазоны неопределённости широки, а набор в основном состоит из программирования, машинного обучения и кибербезопасности. Это не означает, что модель непрерывно и надёжно работает 13 часов в любой профессии.

В анализе OpenAI Codex 70,2% пользователей хотя бы раз отправляли запрос, который модель оценила как более часа человеческой работы, а 25,6% — более восьми часов. Но это оценка сложности запроса самой моделью, а не доказательство успешного результата.

Где реальность сложнее теста

На OSWorld 2.0 агент должен пользоваться обычными компьютерными программами в 108 сценариях; лучший результат в исходном исследовании — 20,6%. В Odysseys, другом тесте длительной компьютерной работы, лучший показатель составил 44,5%. Это заметный прогресс, но далеко не надёжность сотрудника.

Контрдоказательство. METR обнаружила, что автоматические оценки программных исправлений могут быть на 24,2 процентного пункта выше, чем готовность сопровождающих проекта принять те же изменения. «Тест пройден» и «результат можно безопасно использовать» — разные утверждения.

GDPval охватывает 44 профессии, девять секторов и 1320 задач. Однако модели выполняют задания в один заход, без обычных переговоров, уточнений и изменяющихся требований. Поэтому тест измеряет полезный срез работы, но не замену профессий.

Что из этого следует

Интерпретация AI Futures. Автономия сначала будет распространяться на цифровые задания с ясной целью, доступными данными и дешёвой проверкой результата. Работы, где нужно понимать людей, отвечать за последствия, получать физический доступ или разбираться с неоднозначностью, будут автоматизироваться медленнее.

Сценарий METR, в котором горизонт может вырасти примерно до 200 часов за 12–18 месяцев, — экстраполяция конкретной метрики, а не прогноз о любой офисной работе. Надёжная оценка требует смотреть не только на длительность, но и на вероятность успеха, качество проверки, стоимость ошибок и долю вмешательств человека.

Второй информационный слой

Методология и технические подробности

Ограничение вывода и методология

Второй информационный слой

  • Временной горизонт — статистическая точка на кривой успеха, а не максимальная продолжительность запуска.
  • GDPval проверяет профессионально составленные результаты, но не интерактивный рабочий процесс.
  • Показатели разных тестов нельзя складывать: у них разные задачи, правила и критерии качества.
Первоисточники

Материал объясняет состояние открытых доказательств и не является индивидуальной профессиональной консультацией.