Исследование AI Futures
Чтение: 4 минуты
Что такое AGI — и как мы поймём, что он появился?
Материал подготовлен AI Futures. Редакционная ответственность и решение о публикации — MMX.
Короткий доказательный разбор для читателя без технической подготовки.
Граница вывода
Claim ceiling: можно сравнивать системы по заранее определённым способностям. Нельзя объявлять AGI без ясного определения, независимых проверок широты, надёжности и автономности.
Актуальность материала
Проверены определения и измерения AGI, GDPval и методология METR. Официальная таблица результатов GDPval больше не поддерживается, но сам тест и границы вывода статьи остаются актуальными.
История обновлений
- — Уточнён текущий статус GDPval leaderboard; основной вывод о невозможности установить AGI одним тестом не изменился.
- — Материал опубликован после первичного evidence, Reader Comprehension и release-readiness прохода.
«Проверено» означает, что мы пересмотрели актуальность источников и вывода. Это не означает, что прогноз гарантированно сбудется.
AGI — сокращение от «искусственный общий интеллект». Обычно так называют систему, способную успешно выполнять широкий круг интеллектуальных задач, а не одну специальную функцию. Но общепринятого экзамена и единой границы AGI нет. Поэтому рекорд на одном тесте сам по себе не доказывает его появление.
Почему определения различаются
Факт. OpenAI определяет AGI как высокоавтономные системы, превосходящие людей в большинстве экономически ценных видов работы. Google DeepMind предлагает отдельно оценивать широту задач и уровень выполнения. В других подходах автономность — способность действовать длительно без помощи — рассматривают как дополнительное измерение.
Эти определения похожи, но отвечают на разные вопросы. Система может превосходно решать сложные задачи в одной области и оставаться узкой. Она может знать многое, но часто ошибаться при длительном выполнении. Или хорошо пройти тест, потому что условия заранее известны.
Что показывают современные проверки
GDPval включает 1320 заданий из 44 профессий в девяти секторах. Это попытка измерять экономически полезную работу, а не только головоломки. Но задания выполняются в один заход и не воспроизводят переговоры с заказчиком, меняющиеся требования, ответственность и работу в команде.
METR оценивает длительность задач, которые агент решает с определённой вероятностью успеха. Набор в основном относится к программированию, машинному обучению и кибербезопасности; результаты плохо определены для задач длиннее 16 часов. Поэтому показатель нельзя переносить на медицину, управление или физический труд.
Исследователи также предлагают «когнитивные профили»: отдельно измерять память, рассуждение, обучение, планирование и другие способности. Это полезная идея, но предложенный набор из десяти способностей пока не стал общим стандартом.
Почему одного числа недостаточно
Ограничение. Высокий средний балл может скрывать редкие, но серьёзные ошибки. Для реальной работы важны стабильность, способность заметить собственную ошибку, корректно попросить помощь и не выходить за разрешённые границы.
Контрдоказательство. Современные агенты показывают сильные результаты на отдельных тестах, но на длительных и компьютерных задачах их надёжность резко ниже. Это совместимо с большим прогрессом и одновременно не подтверждает универсальную компетентность.
Практический критерий AI Futures
Интерпретация AI Futures. Вместо вопроса «AGI уже здесь?» полезнее задать пять уточнений:
- Как именно определён AGI?
- Насколько широк набор задач?
- С каким уровнем человека сравнивают систему?
- Насколько надёжно и автономно она работает?
- Проверен ли результат независимо и вне подготовленного теста?
Если на эти вопросы нет ответов, слово AGI выражает ожидание или маркетинговую позицию, а не установленный научный результат. Появление более сильных систем может изменить общество и без формального «момента AGI», поэтому измерять конкретные способности полезнее, чем спорить только о названии.
Второй информационный слой
Методология и технические подробности
Ограничение вывода и методология
Второй информационный слой
- «Общий» не означает «безошибочный» или «сознательный».
- Экономически ценная работа зависит от страны, правил и времени; это не неизменный перечень.
- Независимая проверка должна исключать утечку задач, подгонку и выбор только удобных примеров.
Первоисточники
Материал объясняет состояние открытых доказательств и не является индивидуальной профессиональной консультацией.