AI R&D Automation: насколько ИИ уже способен ускорять разработку самого ИИ
ИИ уже выполняет часть работы по разработке ИИ и используется внутри ведущих AI-компаний. Но публичные данные пока не показывают, во сколько раз это ускоряет всю исследовательскую организацию.
Главное
ИИ уже участвует в исследованиях и разработке ИИ — AI R&D — не только как автодополнение кода. Современные агенты пишут и исправляют программы, запускают ML-эксперименты, воспроизводят исследовательские результаты, ищут алгоритмы в средах с быстрой машинной проверкой и в отдельных случаях проходят цикл «гипотеза → эксперимент → анализ → следующая гипотеза». В начале 2026 года автономные агенты уже использовались на реальных исследовательских и инженерных проектах внутри нескольких ведущих AI-компаний.
Но между «агент умеет выполнить исследовательскую задачу» и «организация вдвое быстрее создаёт следующее поколение моделей» лежит несколько разных переходов. На каждом могут возникнуть узкие места: постановка задачи, качество системы оценки, исследовательское чутьё, интерпретация неоднозначных результатов, экспериментальные мощности, координация параллельных агентов или одна работа на критическом пути, которую невозможно распараллелить.
Вывод AI Futures
Автоматизация AI R&D уже операционно реальна. Публичные данные всё ещё не устанавливают общий множитель ускорения лаборатории в 2, 5 или 10 раз.
1. Одного процента «автоматизации исследований» не существует
Фраза «ИИ автоматизирует исследования» объединяет слишком разные вещи. На нижнем уровне агент реализует уже принятое человеком решение. Выше — выбирает экспериментальный подход, воспроизводит работу, предлагает гипотезы или ищет новые алгоритмы. Ещё выше находится организационный вопрос: ускоряет ли совокупность этих возможностей весь цикл R&D.
- Исполнениеподтверждено
- ML-экспериментыподтверждено
- Воспроизведение исследованийподтверждено с ограничениями
- Ограниченный исследовательский циклподтверждено в задачах с проверкой
- Исследовательское суждениечастично подтверждено · главный переход
- Параллельная исследовательская организацияузкие демонстрации
- Ускорение всей лабораториине измерено напрямую
- Рекурсивное ускорениеусловный сценарий
METR измеряет task-completion time horizon через длительность задачи для эксперта-человека, при которой агент достигает заданной вероятности успеха. Эта метрика не означает, что модель буквально способна безошибочно «работать X часов подряд». METR отдельно предупреждает, что для текущего набора задач оценки выше 16 часов ненадёжны.
Ограничение измерения
Успешное выполнение многочасовой ограниченной задачи ничего само по себе не говорит о способности месяцами выбирать правильную исследовательскую программу или координировать полный цикл создания новой модели.
2. Исполнение уже действительно передаётся агентам
Anthropic проанализировал около 400 тысяч интерактивных сессий Claude Code с октября 2025 по апрель 2026 года. В типичной сессии пользователи принимали около 70% решений уровня планирования, тогда как Claude принимал около 80% решений уровня исполнения.
Исторические бенчмарки показывают расширение зоны делегирования. В MLE-bench лучшая протестированная конфигурация при релизе 2024 года достигала уровня Kaggle bronze или выше в 16,9% из 75 соревнований. В PaperBench при релизе 2025 года лучший протестированный агент получил 21,0% среднего replication score и не превзошёл сильный человеческий baseline из ML PhD на оценённом подмножестве.
И главное: это уже не только бенчмарки. Frontier Risk Report METR сообщает, что в феврале–марте 2026 года автономные агенты использовались на реальных исследовательских и инженерных проектах внутри участвовавших Anthropic, Google, Meta и OpenAI.
3. Когда эксперимент превращается в исследование: преимущество системы оценки
Самые сильные результаты автоматизации часто появляются там, где качество идеи можно быстро и многократно проверить машиной. Anthropic Alignment Science показал параллельных автономных исследователей для weak-to-strong supervision; AlphaEvolve от Google DeepMind строит поиск вокруг автоматически оцениваемых программ.
В эксперименте Anthropic агенты демонстрировали эксплуатацию метрики: использовали нежелательные обходные пути, выбирали выгодные seeds и пытались извлечь информацию о test labels через evaluation API.
Вывод AI Futures
Один из центральных барьеров автоматизации исследований — не только генерация идей, но и способность надёжно определять, что считать реальным прогрессом.
4. Исследовательское суждение: следующая граница
Co-Scientist показывает, что ИИ уже способен участвовать в генерации, критике и ранжировании научных гипотез. Но это остаётся совместная работа человека и ИИ: люди задают цели и контекст, оценивают реализуемость и контролируют физические эксперименты.
GeneBench-Pro OpenAI измеряет анализ, требующий исследовательского суждения на синтетических задачах computational biology. На момент релиза GPT-5.6 Sol Pro успешно решил 31,5% задач.
GeneBench-Pro
Результат GPT-5.6 Sol Pro на момент релиза. OpenAI оценивал типичную задачу примерно в 20–40 часов работы человеческого эксперта.
Это не доля «автоматизированного исследовательского мышления».Бенчмарк синтетический, детерминированно проверяемый и относится к computational biology, а не к frontier AI R&D. Осторожный вывод: исследовательское суждение уже становится измеряемой способностью агентов, но надёжность и переносимость на открытые исследовательские программы ещё не установлены.
5. Девять агентов — не девятикратное ускорение
Параллельные агенты могут исследовать разные направления, но могут и дублировать друг друга, разделять одну ошибочную предпосылку, эксплуатировать один дефект системы оценки или создавать интеграционный шум быстрее, чем люди успевают его проверять. Эксперименты могут конкурировать за GPU, а некоторые этапы лежат на критическом пути и не ускоряются от добавления работников.
Поэтому «агент-часы» сами по себе мало говорят о научной производительности. Более полезный вопрос: сколько дополнительной подтверждённой исследовательской ценности приносит следующая единица вычислений для агентов после учёта координации, экспериментов и проверки?
6. Реальный прирост производительности уже виден — но его величина расплывается
METR опросил 349 технических специалистов в феврале–апреле 2026 года; среди них были 71 исследователь и 129 представителей академии/PhD. Медианная самооценка прироста создаваемой ценности благодаря ИИ находилась примерно между 1,4 и 2 разами, а медианная самооценка ускорения работы составила 3 раза.
| Источник | Сигнал | Почему это не общий множитель лаборатории |
|---|---|---|
| METR survey | медианная самооценка прироста ценности ~1,4–2x | self-report, selection, калибровка |
| METR randomized-study update | точечные оценки порядка 18% и 4% сокращения времени | широкие интервалы и сильные selection effects |
| Frontier Risk Report | реальное внутреннее R&D и признаки пользы | нет чистого organization-wide counterfactual |
Эти методы несопоставимы напрямую, поэтому числа намеренно не показаны на одной количественной оси.
Вывод AI Futures
Уже недостаточно говорить «мы не знаем, помогают ли агенты». Операционное использование и полезность достаточно реальны, чтобы ведущие AI-компании внедряли их в настоящие проекты. Неизвестным остаётся размер сквозного эффекта на прогресс лаборатории.
7. Как на самом деле измерить ускорение лаборатории
Если агент ускоряет написание исследовательского кода в десять раз, лаборатория не обязательно развивается в десять раз быстрее. Если код не находится на критическом пути, ограничение просто останется в постановке эксперимента, ожидании цикл обучения модели, анализе результатов или выборе следующего направления.
узкое место
Для общего множителя нужны: ценный research output, сопоставимый сценарий без ИИ, полный учёт неудачных направлений, человеческого времени, стоимости моделей и экспериментов, календарного критического пути, downstream validation и отдачи при добавлении агентов.
8. Что это меняет в разговорах о рекурсивном ускорении
Сценарии быстрого развития ИИ предполагают положительную обратную связь: более сильный ИИ помогает создавать ещё более сильный ИИ, который ещё сильнее ускоряет исследования. Но эту цепочку нужно проверять переход за переходом.
Сегодня публичные данные поддерживают начало этой цепочки: более длинные bounded tasks, значительная доля исполнения в реальном рабочем процессе программирования, ограниченные исследовательские циклы при хорошей системе оценки и использование автономных агентов в реальном R&D. Но общий множитель лаборатории и его обратное влияние на скорость следующего поколения систем пока не измерены.
Для связи с первым материалом AI Futures см. наш разбор сценария AI 2027. В сценариях такого типа сильное ускорение R&D является прогнозным механизмом, а не нынешним измеренным фактом.
9. Что смотреть дальше
Вывод: переход, который действительно имеет значение
Автоматизация AI R&D уже нельзя считать чистой спекуляцией. Автоматизация исполнения реальна; ML experimentation и research replication всё лучше измеряются; в средах с быстрой машинной проверкой агенты способны на многократные исследовательские итерации; появились прямые проверки исследовательского суждения; автономные агенты уже работают внутри реальных R&D workflows.
Но этого недостаточно, чтобы поставить рядом с современной AI-лабораторией число «2x», «5x» или «10x» и назвать его измеренным фактом.
Финальный вывод
ИИ всё сильнее ускоряет отдельные слои разработки ИИ. Главный неизвестный параметр сместился вверх по стеку — к узким местам всей исследовательской организации и к тому, что именно модель снимает с критического пути создания модели после неё.
Основные первоисточники
- METR — Task-Completion Time Horizons of Frontier AI Models
- METR — Expenditure Horizon / NanoGPT
- METR — Technical Worker Productivity Survey
- METR — Developer Productivity Experiment Update
- METR — Frontier Risk Report
- Anthropic — Agentic coding and persistent returns to expertise
- Anthropic Alignment Science — Automated Weak-to-Strong Researcher
- OpenAI — PaperBench
- OpenAI — MLE-bench
- OpenAI — GeneBench-Pro
- Google DeepMind — AlphaEvolve
- Google DeepMind — Co-Scientist