Сначала — суть

Главный вопрос: может ли ИИ ускорить создание следующего поколения ИИ?

Короткий ответ: уже есть убедительные примеры, где ИИ помогает выполнять отдельные части исследовательской работы. Но это ещё не доказательство того, что вся разработка новых систем ИИ ускоряется в той же пропорции. Между быстрым выполнением одной задачи и быстрым движением всей лаборатории остаётся большой разрыв.

1. Что уже умеют системы

Они могут помогать с программированием, анализом, поиском решений и некоторыми экспериментальными задачами. Это реальный прогресс: часть работы, которая раньше полностью лежала на человеке, уже можно делегировать системе или выполнять вместе с ней.

2. Почему этого недостаточно для сильного вывода

Исследование — это не одна операция. Нужно выбрать хороший вопрос, поставить эксперимент, дождаться результата, понять, что он означает, заметить ошибку и решить, куда двигаться дальше. Если ИИ ускоряет только один участок, общий срок проекта может почти не измениться.

3. Что мы пытаемся установить

Нас интересует не рекорд системы в тесте, а более простой человеческий вопрос: становится ли команда способна создавать новое поколение ИИ заметно быстрее? Для такого вывода нужны данные о реальном исследовательском процессе, а не только о наборе отдельных заданий.

4. Что пока остаётся неизвестным

Мы пока не знаем, насколько быстро будут исчезать человеческие ограничения в выборе идей, проверке результатов и принятии решений. Поэтому сильное ускорение разработки ИИ остаётся возможностью, которую нужно наблюдать и проверять, а не установленным фактом.

Главная мысль: «ИИ хорошо решает исследовательские задачи» и «лаборатория создаёт новый ИИ намного быстрее» — это разные утверждения.

Почему стоит вернуться: мы перепроверяем доказательную базу при появлении важных новых данных. Если они меняют основной вывод, это отдельно появится в «Что изменилось» и на странице «Материалы».

AGI · фундаментальный разбор

Что такое AGI — и как мы поймём, что он появился?

Одного общепринятого экзамена на AGI сегодня нет. Разбираемся с нуля: что именно пытаются измерять исследователи, почему одного рекорда недостаточно и какие вопросы стоит задать, когда кто-то говорит «AGI уже здесь».

Представьте две системы искусственного интеллекта.

Первая программирует лучше почти любого человека. Дайте ей сложную задачу по коду — и она справится. Но попросите разобраться в договоре, спланировать исследование или понять незнакомую бытовую проблему — и её преимущество исчезнет.

Вторая программирует хуже первой. Зато она умеет писать, считать, работать с таблицами, разбираться в документах, планировать, искать ошибки и осваивать новые типы задач.

Какая из них умнее?

А теперь добавим третью систему. По отдельности она не всегда лучшая, зато вы можете дать ей цель — и она сама выполняет длинную последовательность действий, использует инструменты, исправляет ошибки и возвращается с результатом.

Она ближе к тому, что называют AGI?

Вот здесь и начинается проблема со словом AGI — искусственный общий интеллект.

В разговорах о будущем ИИ оно часто звучит как название конкретной финишной черты: сегодня AGI ещё нет, завтра система проходит решающий экзамен — и с этого момента AGI существует.

Но общепринятого экзамена сегодня нет.

Не потому, что исследователи совсем не умеют измерять способности машин. Наоборот, измерять уже можно многое. Проблема в другом: «быть очень сильным», «уметь делать очень разные вещи» и «уметь действовать самостоятельно» — не одно и то же.

Поэтому прежде чем спрашивать, появился ли AGI, нужно понять, что именно мы собираемся считать его появлением.

Что вообще означает «общий» интеллект

Калькулятор считает быстрее человека. Шахматная программа может играть лучше гроссмейстера. Узкая система может великолепно выполнять одну специальную задачу.

Мы не называем их общим интеллектом. Почему? Потому что выдающееся умение в одной области ещё ничего не говорит о способности справляться с другими областями.

Хороший инженер может никогда не изучать налоговое право, но способен прочитать объяснение, задать вопросы и постепенно разобраться в новой теме. Мы ценим не только набор уже известных ему задач, но и способность переносить знания, учиться и действовать в разных ситуациях.

Именно эта широта — одна из центральных идей в разговоре об AGI.

Но одной широты мало. Система может понемногу уметь всё и при этом делать всё плохо. Поэтому появляется второй вопрос: насколько хорошо она справляется?

А затем третий: нужно ли человеку вести её за руку или она способна сама пройти длинный путь от цели до результата?

Уже получается не одна шкала, а несколько. И разные исследовательские организации проводят границу AGI по-разному.

OpenAI связывает AGI с человеческой работой

У OpenAI есть довольно понятное определение. В её Charter AGI описывается как высокоавтономные системы, которые превосходят людей в большинстве экономически ценных видов работы.

Переведём это на обычный язык.

Представьте не один экзамен, а всю экономику: программистов, бухгалтеров, инженеров, юристов, аналитиков, дизайнеров, менеджеров и множество других профессий.

Если ИИ великолепно программирует, этого недостаточно. По этому определению речь идёт о большинстве ценной работы. Если ИИ выдаёт прекрасный результат только после постоянных уточнений человека, возникает второй вопрос: насколько он действительно автономен?

Определение OpenAI конкретнее, чем просто «ИИ станет очень умным». Но оно всё равно не даёт готовой кнопки проверки.

Что считать большинством экономически ценной работы? С каким человеком сравнивать систему? Насколько самостоятельной она должна быть? Должна ли она только выдавать хороший конечный результат или уметь сама собирать контекст, задавать вопросы и исправлять ошибки?

Charter не устанавливает для всего этого единого численного порога.

Главное различие: определение AGI можно сформулировать, но из определения ещё не возникает универсальный тест.

Источник: OpenAI Charter.

А если один ИИ гениален в узкой области, а другой хорош во многих?

Вернёмся к двум системам из начала статьи. Первая — почти гениальный программист, но слабая во всём остальном. Вторая — хороший универсал: программирует, пишет, анализирует документы, решает математические задачи, планирует и осваивает незнакомые задания, хотя не всегда превосходит первую.

Одним числом сравнить их трудно, потому что мы одновременно спрашиваем о двух вещах: насколько хорошо система решает задачи? И насколько разные задачи она вообще способна решать?

Исследователи Google DeepMind предложили разделять эти вопросы. В работе Levels of AGI первую ось они называют уровнем результата — performance, вторую — широтой способностей, generality.

Название здесь менее важно, чем сама идея. Можно стать намного сильнее в математике и почти не измениться в других областях. Можно научиться решать множество новых типов задач, оставаясь на среднем уровне. А можно улучшаться сразу в обоих направлениях.

Поэтому авторы предлагают думать об AGI не только как о переключателе «нет / есть», а как об уровнях развития способностей.

Автономность они рассматривают отдельно. Очень сильная система может работать только под постоянным контролем человека, а узкоспециализированный агент — самостоятельно выполнять длинную последовательность действий. Самостоятельность и широта интеллекта — разные свойства.

Но схема DeepMind — исследовательское предложение, а не международный стандарт.

Источник: Google DeepMind — Levels of AGI.

Возможно, одного «балла интеллекта» вообще недостаточно

Представьте школьника, который получает одну итоговую оценку — 4,5. Из неё невозможно понять, что у него пятёрка по математике, тройка по литературе и большие трудности с иностранным языком.

Среднее число что-то сообщает, но скрывает форму способностей. С искусственным интеллектом может происходить похожее.

В 2026 году исследователи DeepMind и соавторы предложили более подробную систему измерения прогресса к AGI. Вместо одного магического числа они раскладывают интеллект на десять когнитивных способностей и предлагают строить профиль системы: где она сильна, где слаба и как переносит умения на новые задачи.

Для нас сейчас важнее не список категорий, а принцип: даже попытка сделать AGI более измеримым не обязательно приводит к одному «IQ для искусственного интеллекта».

Авторы не объявляют свою систему окончательным ответом. Это предложение о том, как сделать измерение более содержательным.

Источник: Measuring Progress Toward AGI: A Cognitive Framework.

Можно ли просто проверить ИИ на настоящей работе?

Определение OpenAI говорит об экономически ценной работе. Значит, возникает естественный вопрос: почему бы не дать ИИ настоящую профессиональную задачу и не посмотреть, справится ли он?

OpenAI создала GDPval. Вместо экзаменационных вопросов система получает задания, похожие на результаты реальной профессиональной работы: подготовить документ, таблицу, презентацию, инженерный материал и другие рабочие продукты.

Первая версия охватывает 44 профессии в девяти крупных секторах экономики США и содержит 1320 специализированных задач.

Это важный шаг. Мы уже спрашиваем не только «хорошо ли модель сдаёт тесты?», а «может ли она делать полезную человеческую работу?».

Но реальная профессия — не только готовый файл в конце рабочего дня. Юрист выясняет обстоятельства. Аналитик замечает, что ему не хватает данных. Дизайнер получает противоречивую обратную связь. Инженер обсуждает ограничения с коллегами. Работа может продолжаться недели и состоять из множества промежуточных решений.

GDPval первой версии в основном проверяет хорошо поставленную задачу, которую нужно выполнить за один заход. Сама OpenAI отмечает, что такая оценка не воспроизводит полностью процессы, где нужно долго накапливать контекст и улучшать результат через несколько итераций.

Поэтому высокий результат на GDPval — свидетельство о способности выполнять часть реальной профессиональной работы. Но он не доказывает автоматически, что система уже превосходит людей в большинстве экономически ценной работы. И сам по себе не отвечает на вопрос, сможет ли система работать самостоятельно.

Источник: OpenAI GDPval.

А что значит «работать самостоятельно»?

В одной ситуации вы просите ChatGPT написать письмо. Через несколько секунд получаете текст, читаете его и решаете, что делать дальше.

В другой вы говорите системе: «Найди ошибку в этом программном проекте, изучи код, исправь проблему, запусти тесты и сообщи мне результат».

После этого система сама открывает файлы, выполняет команды, проверяет результат и пробует снова, если что-то не получилось.

Вторая ситуация ближе к тому, что обычно называют автономностью: способности двигаться к цели без постоянной команды человека на каждом шаге.

Но как измерить, насколько далеко эта самостоятельность зашла?

Исследовательская организация METR берёт задачи разной сложности и смотрит, с какой вероятностью ИИ-агент способен довести их до конца. Сложность выражается через то, сколько времени такая же задача обычно занимает у человека-эксперта.

Эта величина называется task-completion time horizon — временной горизонт выполнения задач.

Важно: если в результате написано «несколько часов», это не означает, что ИИ несколько часов непрерывно работал сам. Речь о сложности задачи, выраженной через время человека-эксперта.

METR специально предупреждает об этой разнице. Есть и ещё одно ограничение: нынешний набор задач в основном связан с программированием, машинным обучением и кибербезопасностью. Текущая версия методики также плохо измеряет область выше 16 человеческих часов.

Поэтому METR помогает ответить на вопрос: насколько сложные многошаговые задачи агент способен надёжно завершать? Но из этого нельзя сделать вывод, что он настолько же хорош в юриспруденции, управлении компанией или медицине.

Источники: METR Task-Completion Time Horizons; Measuring AI Ability to Complete Long Tasks.

Теперь видно, почему один рекорд ничего не решает

Можно измерять, сколько разных вещей умеет система. Можно измерять, насколько хорошо она их делает. Можно проверять её на задачах, похожих на реальную профессиональную работу. Можно измерять, насколько сложные многошаговые задачи она способна доводить до конца.

Но сильный результат по одному пункту не переносится автоматически на остальные.

Если модель превосходит эксперта на выбранном наборе профессиональных заданий, это ещё не значит, что она превосходит людей вообще. Если агент завершает задачи, которые человеку занимают много часов, это ещё не значит, что ему можно отдать любую многодневную работу и вернуться через неделю за идеальным результатом. Если система великолепна в математике и программировании, это ещё не доказывает, что её способности действительно общие.

Самый полезный способ думать об AGI: не как об одном числе, а как о наборе требований.

Какие требования войдут в набор — зависит от определения. Но серьёзное заявление должно показать, что система удовлетворяет не одному удобному показателю, а тем свойствам, которые выбранное определение действительно требует.

А если система всё это умеет — можно просто выпустить её в мир?

Не обязательно. Способности системы и полномочия, которые ей безопасно дать, — разные вопросы.

Очень способный ИИ можно запустить в изолированной среде без доступа к деньгам, важной инфраструктуре или внешним системам. Той же модели можно дать гораздо больше инструментов и прав — и последствия ошибки изменятся, хотя сама модель умнее от этого не стала.

Поэтому современные организации отдельно оценивают не только способности передовых моделей, но и риски и защитные меры. Например, OpenAI в Preparedness / Frontier Governance материалах рассматривает несколько разных категорий серьёзного риска, а не один показатель «AGI — да/нет».

Это не ещё одно определение AGI и не доказательство того, что AGI опасен по определению.

Это напоминание: «на что система способна?» и «что ей можно позволить делать?» — разные вопросы.

Значит ли это, что слово AGI бессмысленно?

Нет.

У разных определений есть общая идея: речь идёт уже не об узком инструменте, великолепном в одной заранее выбранной задаче, а о системе с очень широкими и сильными способностями.

Разногласия начинаются там, где нужно провести точную границу. Насколько широкой должна быть система? Насколько сильной? Сколько самостоятельности требуется? Какие реальные задачи считать достаточным доказательством? С кем сравнивать — со средним человеком или специалистом?

На эти вопросы пока нет одного набора ответов, принятого всеми.

Но измерения становятся всё практичнее. Вместо разговоров только о впечатляющих демонстрациях исследователи проверяют профессиональные задания, многошаговую работу, перенос способностей и отдельные когнитивные функции.

Спор постепенно можно переводить из области ярлыков в область проверяемых утверждений.

Как тогда читать новость «AGI уже здесь»?

Допустим, завтра выходит новая модель, а заголовки говорят: «Компания X достигла AGI».

Не нужно сразу верить. Но и автоматически отвергать заявление тоже не нужно.

Есть пять вопросов, которые превращают громкий заголовок в содержательный разговор.

  1. Что именно здесь называют AGI? Без определения слово почти невозможно проверить.
  2. Насколько широки способности системы? Это выдающийся специалист в нескольких областях или система действительно справляется с очень разными задачами?
  3. Насколько хорошо она справляется? Её сравнивают со средним человеком, квалифицированным специалистом или лучшими экспертами?
  4. Насколько она самостоятельна и надёжна? Может ли система сама пройти длинный путь до результата или человек постоянно исправляет и направляет её?
  5. Чем всё это проверили? Короткими искусственными тестами? Ре
    Living Research

    Проверено 12 августа 2026

    Определения и измерения AGI быстро меняются. В этом проходе сверены OpenAI Charter и GDPval, исследовательские рамки Google DeepMind 2024/2026 и методология METR.

    Если появится широко признанный критерий AGI или существенно изменятся используемые здесь методы измерения, мы обновим материал и покажем, что поменялось.

    Следующий вопрос

    Если общего теста на AGI нет, как вообще рассуждать о том, когда он может появиться?

    Один из способов — не угадывать дату напрямую, а построить подробный сценарий и проверить его ключевые допущения. Именно так устроен AI 2027.

    Разобрать сценарий AI 2027 →Вернуться ко всем материалам