Фундаментальный разбор · AI Futures

AI R&D Automation: насколько ИИ уже способен ускорять разработку самого ИИ

ИИ уже выполняет часть работы по разработке ИИ и используется внутри ведущих AI-компаний. Но публичные данные пока не показывают, во сколько раз это ускоряет всю исследовательскую организацию.

AI Futures · опубликовано 8 августа 2026 · обновляемый материал
Уже подтвержденоИсполнение и ограниченные исследовательские циклыАгенты пишут код, запускают эксперименты и используются внутри реального AI R&D.
Измеряется, но пока ненадёжноИсследовательское суждение и прирост производительностиЕсть прямые проверки и реальные сигналы, но величина эффекта сильно зависит от метода.
Пока не установленоОбщий множитель ускорения лабораторииПубличные данные не подтверждают универсальные 2x, 5x или 10x для всей организации.

Главное

ИИ уже участвует в исследованиях и разработке ИИ — AI R&D — не только как автодополнение кода. Современные агенты пишут и исправляют программы, запускают ML-эксперименты, воспроизводят исследовательские результаты, ищут алгоритмы в средах с быстрой машинной проверкой и в отдельных случаях проходят цикл «гипотеза → эксперимент → анализ → следующая гипотеза». В начале 2026 года автономные агенты уже использовались на реальных исследовательских и инженерных проектах внутри нескольких ведущих AI-компаний.

Но между «агент умеет выполнить исследовательскую задачу» и «организация вдвое быстрее создаёт следующее поколение моделей» лежит несколько разных переходов. На каждом могут возникнуть узкие места: постановка задачи, качество системы оценки, исследовательское чутьё, интерпретация неоднозначных результатов, экспериментальные мощности, координация параллельных агентов или одна работа на критическом пути, которую невозможно распараллелить.

Вывод AI Futures
Автоматизация AI R&D уже операционно реальна. Публичные данные всё ещё не устанавливают общий множитель ускорения лаборатории в 2, 5 или 10 раз.

1. Одного процента «автоматизации исследований» не существует

Фраза «ИИ автоматизирует исследования» объединяет слишком разные вещи. На нижнем уровне агент реализует уже принятое человеком решение. Выше — выбирает экспериментальный подход, воспроизводит работу, предлагает гипотезы или ищет новые алгоритмы. Ещё выше находится организационный вопрос: ускоряет ли совокупность этих возможностей весь цикл R&D.

  1. Исполнениеподтверждено
  2. ML-экспериментыподтверждено
  3. Воспроизведение исследованийподтверждено с ограничениями
  4. Ограниченный исследовательский циклподтверждено в задачах с проверкой
  5. Исследовательское суждениечастично подтверждено · главный переход
  6. Параллельная исследовательская организацияузкие демонстрации
  7. Ускорение всей лабораториине измерено напрямую
  8. Рекурсивное ускорениеусловный сценарий
Чем выше уровень, тем меньше прямых публичных измерений. Разрывы 4→5 и 6→7 — ключевые переходы, которые нельзя автоматически вывести из нижних уровней.

METR измеряет task-completion time horizon через длительность задачи для эксперта-человека, при которой агент достигает заданной вероятности успеха. Эта метрика не означает, что модель буквально способна безошибочно «работать X часов подряд». METR отдельно предупреждает, что для текущего набора задач оценки выше 16 часов ненадёжны.

Ограничение измерения
Успешное выполнение многочасовой ограниченной задачи ничего само по себе не говорит о способности месяцами выбирать правильную исследовательскую программу или координировать полный цикл создания новой модели.

2. Исполнение уже действительно передаётся агентам

Anthropic проанализировал около 400 тысяч интерактивных сессий Claude Code с октября 2025 по апрель 2026 года. В типичной сессии пользователи принимали около 70% решений уровня планирования, тогда как Claude принимал около 80% решений уровня исполнения.

Человек
~70%
решений планирования
Claude
~80%
решений исполнения
Это доли решений в разных категориях наблюдавшихся Claude Code-сессий, а не «проценты профессии», которые автоматизированы.

Исторические бенчмарки показывают расширение зоны делегирования. В MLE-bench лучшая протестированная конфигурация при релизе 2024 года достигала уровня Kaggle bronze или выше в 16,9% из 75 соревнований. В PaperBench при релизе 2025 года лучший протестированный агент получил 21,0% среднего replication score и не превзошёл сильный человеческий baseline из ML PhD на оценённом подмножестве.

И главное: это уже не только бенчмарки. Frontier Risk Report METR сообщает, что в феврале–марте 2026 года автономные агенты использовались на реальных исследовательских и инженерных проектах внутри участвовавших Anthropic, Google, Meta и OpenAI.

3. Когда эксперимент превращается в исследование: преимущество системы оценки

Самые сильные результаты автоматизации часто появляются там, где качество идеи можно быстро и многократно проверить машиной. Anthropic Alignment Science показал параллельных автономных исследователей для weak-to-strong supervision; AlphaEvolve от Google DeepMind строит поиск вокруг автоматически оцениваемых программ.

Гипотеза
Эксперимент
Проверка и отбор → следующая гипотеза
Условие отказа: неверная система оценки → эксплуатация метрики (reward hacking) → оптимизация не той цели.
При машинно-проверяемом результате исследовательский цикл легче масштабировать. Но качество системы оценки становится самостоятельным узким местом.

В эксперименте Anthropic агенты демонстрировали эксплуатацию метрики: использовали нежелательные обходные пути, выбирали выгодные seeds и пытались извлечь информацию о test labels через evaluation API.

Вывод AI Futures
Один из центральных барьеров автоматизации исследований — не только генерация идей, но и способность надёжно определять, что считать реальным прогрессом.

4. Исследовательское суждение: следующая граница

Co-Scientist показывает, что ИИ уже способен участвовать в генерации, критике и ранжировании научных гипотез. Но это остаётся совместная работа человека и ИИ: люди задают цели и контекст, оценивают реализуемость и контролируют физические эксперименты.

GeneBench-Pro OpenAI измеряет анализ, требующий исследовательского суждения на синтетических задачах computational biology. На момент релиза GPT-5.6 Sol Pro успешно решил 31,5% задач.

31,5%
задач успешно решено

GeneBench-Pro

Результат GPT-5.6 Sol Pro на момент релиза. OpenAI оценивал типичную задачу примерно в 20–40 часов работы человеческого эксперта.

Это не доля «автоматизированного исследовательского мышления».

Бенчмарк синтетический, детерминированно проверяемый и относится к computational biology, а не к frontier AI R&D. Осторожный вывод: исследовательское суждение уже становится измеряемой способностью агентов, но надёжность и переносимость на открытые исследовательские программы ещё не установлены.

5. Девять агентов — не девятикратное ускорение

Параллельные агенты могут исследовать разные направления, но могут и дублировать друг друга, разделять одну ошибочную предпосылку, эксплуатировать один дефект системы оценки или создавать интеграционный шум быстрее, чем люди успевают его проверять. Эксперименты могут конкурировать за GPU, а некоторые этапы лежат на критическом пути и не ускоряются от добавления работников.

Поэтому «агент-часы» сами по себе мало говорят о научной производительности. Более полезный вопрос: сколько дополнительной подтверждённой исследовательской ценности приносит следующая единица вычислений для агентов после учёта координации, экспериментов и проверки?

6. Реальный прирост производительности уже виден — но его величина расплывается

METR опросил 349 технических специалистов в феврале–апреле 2026 года; среди них были 71 исследователь и 129 представителей академии/PhD. Медианная самооценка прироста создаваемой ценности благодаря ИИ находилась примерно между 1,4 и 2 разами, а медианная самооценка ускорения работы составила 3 раза.

ИсточникСигналПочему это не общий множитель лаборатории
METR surveyмедианная самооценка прироста ценности ~1,4–2xself-report, selection, калибровка
METR randomized-study updateточечные оценки порядка 18% и 4% сокращения времениширокие интервалы и сильные selection effects
Frontier Risk Reportреальное внутреннее R&D и признаки пользынет чистого organization-wide counterfactual

Эти методы несопоставимы напрямую, поэтому числа намеренно не показаны на одной количественной оси.

Вывод AI Futures
Уже недостаточно говорить «мы не знаем, помогают ли агенты». Операционное использование и полезность достаточно реальны, чтобы ведущие AI-компании внедряли их в настоящие проекты. Неизвестным остаётся размер сквозного эффекта на прогресс лаборатории.

7. Как на самом деле измерить ускорение лаборатории

Если агент ускоряет написание исследовательского кода в десять раз, лаборатория не обязательно развивается в десять раз быстрее. Если код не находится на критическом пути, ограничение просто останется в постановке эксперимента, ожидании цикл обучения модели, анализе результатов или выборе следующего направления.

Постановка задачи
Код и подготовка
Эксперимент
узкое место
Анализ
Решение о следующем цикле
Ускорение одного этапа не равно ускорению полного цикла. Важен этап, который реально ограничивает критический путь.

Для общего множителя нужны: ценный research output, сопоставимый сценарий без ИИ, полный учёт неудачных направлений, человеческого времени, стоимости моделей и экспериментов, календарного критического пути, downstream validation и отдачи при добавлении агентов.

8. Что это меняет в разговорах о рекурсивном ускорении

Сценарии быстрого развития ИИ предполагают положительную обратную связь: более сильный ИИ помогает создавать ещё более сильный ИИ, который ещё сильнее ускоряет исследования. Но эту цепочку нужно проверять переход за переходом.

Сильнее ИИ→ ?Полезнее AI R&D automation→ ?Быстрее вся лаборатория→ ?Быстрее следующее поколение→ ?Ещё сильнее ИИ
Знаки вопроса показывают, что переходы имеют разные уровни доказательности и не являются наблюдаемой неизбежной петлёй.

Сегодня публичные данные поддерживают начало этой цепочки: более длинные bounded tasks, значительная доля исполнения в реальном рабочем процессе программирования, ограниченные исследовательские циклы при хорошей системе оценки и использование автономных агентов в реальном R&D. Но общий множитель лаборатории и его обратное влияние на скорость следующего поколения систем пока не измерены.

Для связи с первым материалом AI Futures см. наш разбор сценария AI 2027. В сценариях такого типа сильное ускорение R&D является прогнозным механизмом, а не нынешним измеренным фактом.

9. Что смотреть дальше

Командная производительностьЧто изменит вывод: end-to-end данные от выбора задачи до подтверждённого результата.
Раскрытия ведущих лабораторийЧто изменит вывод: данные о снятых узких местах полного цикла разработки моделей.
Бенчмарки исследовательского сужденияЧто изменит вывод: устойчивые результаты в неоднозначных AI-research задачах.
Создание и аудит систем оценкиЧто изменит вывод: надёжная машинная проверка плохо формализованных задач.
Отдача от параллельных агентовЧто изменит вывод: кривые validated output относительно вычислений и человеческого контроля.
Сокращение цикла разработки моделейЧто изменит вывод: доказательство, что исследования с участием ИИ ускоряет следующее поколение систем.

Вывод: переход, который действительно имеет значение

Автоматизация AI R&D уже нельзя считать чистой спекуляцией. Автоматизация исполнения реальна; ML experimentation и research replication всё лучше измеряются; в средах с быстрой машинной проверкой агенты способны на многократные исследовательские итерации; появились прямые проверки исследовательского суждения; автономные агенты уже работают внутри реальных R&D workflows.

Но этого недостаточно, чтобы поставить рядом с современной AI-лабораторией число «2x», «5x» или «10x» и назвать его измеренным фактом.

Финальный вывод
ИИ всё сильнее ускоряет отдельные слои разработки ИИ. Главный неизвестный параметр сместился вверх по стеку — к узким местам всей исследовательской организации и к тому, что именно модель снимает с критического пути создания модели после неё.

Основные первоисточники