Исследование AI Futures
Чтение: 4 минуты
ИИ уже помогает создавать следующий ИИ. Может ли из-за этого прогресс резко ускориться?
Материал подготовлен AI Futures. Редакционная ответственность и решение о публикации — MMX.
Короткий доказательный разбор для читателя без технической подготовки.
Граница вывода
Claim ceiling: можно говорить об автоматизации отдельных, хорошо описанных этапов. Нельзя утверждать, что ИИ уже заменяет исследовательские команды или неизбежно запускает самоускоряющийся прогресс.
Актуальность материала
Проверены новые результаты по агентному программированию, научным задачам и оценкам METR. Они показывают рост возможностей, но не устанавливают общий множитель ускорения целой исследовательской организации.
История обновлений
- — Перепроверены новые результаты по автоматизации исследований и контрдоказательства; основной вывод без изменений.
- — Reader Comprehension v2 одобрен как новый content baseline; доказательная база, границы утверждений и основной вывод не расширены.
- — Проверена актуальность материала; основной вывод без изменений.
- — Материал опубликован.
«Проверено» означает, что мы пересмотрели актуальность источников и вывода. Это не означает, что прогноз гарантированно сбудется.
ИИ уже выполняет отдельные части исследований: пишет код, предлагает гипотезы, запускает заранее определённые эксперименты и анализирует результаты. Но открытые данные пока не показывают, что он автономно ведёт весь исследовательский цикл или уже ускорил работу лабораторий в несколько раз.
Что уже умеют системы
Факт. В исследовании Anthropic о Claude Code люди принимали около 70% решений о том, *что* делать, а модель — около 80% решений о том, *как* выполнить выбранный шаг. Это показывает разделение труда: человек чаще задаёт направление, ИИ чаще занимается исполнением.
В эксперименте Automated Weak-to-Strong Researcher девять ИИ-агентов получали заранее сформулированную исследовательскую задачу, предлагали гипотезы, запускали вычислительные эксперименты и сопоставляли результаты. Авторы сообщили о сильной связи между оценками системы и экспертными оценками — 0,97. Однако это коэффициент согласованности, а не «97% исследований выполнено без человека». Эксперимент потребовал примерно 800 агент-часов и около $18 000 вычислительных расходов.
На специализированных тестах возможности остаются неровными. В GeneBench-Pro лучшие указанные модели решили около 29–32% задач. В тестах PaperBench и MLE-bench системы демонстрируют полезные исследовательские навыки, но не надёжное выполнение всей работы учёного.
Почему это ещё не автономная лаборатория
Исследовательская работа — это не только запуск кода. Нужно выбрать важный вопрос, заметить ошибочное допущение, изменить план, получить доступ к данным или оборудованию, оценить безопасность и решить, достаточно ли доказательств для вывода.
Ограничение. Большинство публичных тестов дают системе чёткую цель, подготовленную среду и измеримый результат. Реальная наука содержит неоднозначные задачи, неудачные измерения и организационные задержки. Успех внутри теста нельзя автоматически переносить на работу всей лаборатории.
Контрдоказательство. Низкие результаты на GeneBench-Pro и необходимость человеческого выбора направления показывают, что современные агенты часто не справляются даже с ограниченными профессиональными задачами. Публичных данных о двукратном, пятикратном или десятикратном ускорении полноценной лаборатории пока нет.
Что из этого следует
Интерпретация AI Futures. Наиболее вероятный ближайший эффект — не «ИИ сам создаёт следующий ИИ», а сокращение времени на некоторые повторяемые этапы: поиск вариантов, написание исследовательского кода, перебор гипотез и подготовку первичного анализа. Это может ускорить отдельные проекты, но величина общего эффекта зависит от того, где находится настоящее узкое место: в вычислениях, данных, оборудовании, идеях, проверке безопасности или принятии решений людьми.
Резкое самоускорение остаётся сценарием, а не установленным фактом. Чтобы говорить о нём увереннее, нужны повторяемые результаты на открытых задачах, измерение полного времени работы команды и доказательство, что качество и безопасность не ухудшаются.
Второй информационный слой
Методология и технические подробности
Ограничение вывода и методология
Второй информационный слой: как читать доказательства
- Решения «что делать» и «как делать» кодировались исследователями по рабочим сессиям; это не измерение всех профессий и всех видов науки.
- Коэффициент 0,97 в Automated Weak-to-Strong Researcher относится к согласованности конкретной оценки, а не к доле автономной работы.
- Бенчмарк — стандартизированный набор задач. Он полезен для сравнения систем, но не воспроизводит все условия реальной лаборатории.
Первоисточники
Материал объясняет состояние открытых доказательств и не является индивидуальной профессиональной консультацией.