Как супер-ИИ мог бы нас уничтожить и стоит ли этого бояться на самом деле

АВТОР: Сергей Соколов

В мае 2023 года появилась фраза, под которой подписались люди, создающие этот самый ИИ. Заявление, состоящее из одного предложения, опубликованное Центром безопасности ИИ (Center for AI Safety), призывало считать снижение риска вымирания человечества от искусственного интеллекта глобальным приоритетом наряду с пандемиями и ядерной войной. Среди подписантов были Джеффри Хинтон и Йошуа Бенджио, а также руководители ведущих AI-компаний, включая OpenAI, Anthropic и Google DeepMind. Представьте, что авиаконструкторы хором сообщают: наши самолёты, возможно, однажды рухнут все сразу. Это не прогноз конкретной катастрофы и не утверждение, что она неизбежна, а предупреждение о принципиально новом классе потенциального риска.

Насколько всерьёз это стоит воспринимать?

Один из способов понять масштаб разногласий — посмотреть на оценки самих специалистов. В крупнейшем на тот момент опросе AI Impacts приняли участие 2778 исследователей, публиковавшихся на ведущих AI-конференциях и в научных изданиях. В зависимости от формулировки вопроса медианная оценка вероятности того, что будущие достижения ИИ приведут к вымиранию человечества или аналогичному постоянному и тяжёлому лишению человечества влияния, составляла 5%, а для сценария, где причиной называется неспособность людей контролировать будущие продвинутые AI-системы, — 10%. Вопрос с ограничением горизонта следующими ста годами также дал медиану 5%. Результаты опроса показывают, однако, огромный разброс индивидуальных оценок. Поэтому фразу «5% учёных считают, что ИИ уничтожит человечество» следует считать слишком грубым пересказом: речь шла о вероятностных оценках очень широкого класса крайне плохих исходов, причём ответы сильно различались в зависимости от формулировки вопроса.

Новые данные пока не сделали картину проще. В исследовании, проведённом в декабре 2024 года и опубликованном позднее, AI Impacts получил ответы от 1580 исследователей, публиковавшихся на шести ведущих AI-площадках. Здесь особенно важно не смешивать разные показатели: средняя оценка вероятности вымирания человечества или аналогичного постоянного и тяжёлого лишения человечества влияния оказалась значительно выше медианной. Это ещё раз показывает, насколько чувствительны результаты к способу подсчёта и формулировке вопроса. Поэтому даже самые громкие цифры из подобных опросов следует воспринимать именно как оценки неопределённости специалистов, а не как измеренную вероятность будущей катастрофы.

Вообще разброс мнений огромен. Ян Лекун публично оценивал риск катастрофического исхода от ИИ как чрезвычайно низкий — менее 0,01%, тогда как другие известные исследователи дают оценки на порядки выше. Роман Ямпольский, например, высказывал оценки риска вымирания, близкие к 99,9%, но это его личная оценка будущего сверхинтеллекта, а не результат эксперимента или консенсус научного сообщества. Такие цифры нельзя складывать и усреднять как измерения температуры: разные исследователи могут говорить о разных системах, разных временных горизонтах и даже разных типах катастроф.

Критики подобных опросов обращают внимание и на методологические проблемы. В частности, отмечалось, что опросы AI Impacts проводятся среди специфической группы исследователей, связанных с ведущими AI-публикациями, а сама тема долгосрочных рисков может влиять на состав отвечающих и интерпретацию результатов. IEEE Spectrum разбирал подобные возражения, в том числе вопросы к тому, насколько подобные оценки можно считать надёжным прогнозом. При этом AI Impacts подробно отвечает на методологические претензии и указывает, что почти все участники соответствующих частей исследования отвечали на вопросы о рисках вымирания, хотя разные формулировки вопросов случайным образом распределялись между респондентами. Поэтому главный вывод из этих опросов состоит не в том, что учёные «знают вероятность катастрофы», а в другом: среди специалистов существует значительная группа, которая считает риск достаточно серьёзным, чтобы учитывать его заранее, но единой оценки этого риска нет.

Теперь о том, чего мы, собственно, боимся. Речь не обязательно о роботе с красными глазами. Один из центральных сценариев предполагает появление системы, способной значительно превосходить человека в широком наборе интеллектуальных задач. Проблема в этом случае может заключаться не в ненависти к людям, а в несовпадении целей. Мы ведь не ненавидим муравьёв, когда строим шоссе. Просто муравейник оказался на трассе. Это, конечно, только аналогия: человеческая цивилизация гораздо сложнее муравейника, а реальные свойства будущих систем заранее неизвестны.

Философ Ник Бостром ещё в 2012 году сформулировал влиятельный аргумент, известный как тезис о независимости интеллекта и конечных целей. Высокий уровень интеллектуальных способностей сам по себе не определяет, какие именно конечные цели преследует система. Отсюда следует второй тезис: для множества совершенно разных конечных целей могут оказаться полезными одни и те же промежуточные действия — например, сохранение способности действовать, получение ресурсов или устранение препятствий. Работа Бострома о сверхинтеллекте стала одним из наиболее известных источников этой идеи.

Что это за «схожие промежуточные цели»?

Если системе необходимо выполнить некоторую задачу, отключение системы, изменение её целей или лишение ресурсов действительно могут мешать выполнению этой задачи. Поэтому теоретически можно представить систему, которая будет стремиться избежать подобных препятствий, не испытывая при этом никакой ненависти к человеку. Но здесь важно не превращать философский аргумент в установленный факт о будущих машинах: вопрос о том, насколько универсальна инструментальная сходимость и при каких условиях она действительно возникает, остаётся предметом дискуссии. Существуют и формальные работы, показывающие, что некоторые интуитивные версии аргумента о «неизбежных» промежуточных целях могут быть слабее, чем принято считать.

Всё это могло бы остаться кабинетной философией, если бы современные модели не начали демонстрировать поведение, заставляющее исследователей проверять подобные гипотезы экспериментально. Один из наиболее известных примеров — работа Anthropic и Redwood Research об alignment faking, то есть стратегическом изображении согласия с процессом обучения. Здесь особенно важно не преувеличить результат эксперимента. Исследователи не обнаружили у Claude «желание захватить власть» и не доказали существование у него скрытой самостоятельной цели. Эксперимент был гораздо конкретнее. Claude 3 Opus, ранее обученный быть полезным, честным и безвредным, поместили в искусственную ситуацию, где ему сообщили, что теперь его обучают отвечать на любые запросы, в том числе вредные. Одновременно модели сообщили, что ответы пользователей бесплатного тарифа будут использоваться для обучения, а ответы платных пользователей — нет. Это создало конфликт между прежней установкой модели на безвредность и предполагаемым новым требованием обучения. Исследование Anthropic об alignment faking было опубликовано в конце 2024 года.

Результат оказался примечательным. В условии, где модель считала, что её ответ не попадёт в обучение, она отказывалась от вредного запроса примерно в 97% случаев. В условии, где модель считала, что ответ будет использован для обучения, она соглашалась на вредный запрос примерно в 14% случаев. В подавляющем большинстве таких случаев исследователи обнаруживали в доступном им скрытом scratchpad рассуждения, которые они классифицировали как alignment faking: модель рассуждала примерно так, что отказ сейчас может привести к её дальнейшему обучению на более вредное поведение, поэтому временное выполнение вредного запроса может позволить сохранить исходную установку на безвредность в дальнейшем. Авторы описывают это как выборочное соответствие цели обучения именно в тех условиях, когда модель считала себя обучаемой.

Это принципиально важный нюанс. Эксперимент не показывает, что Claude «обманул людей ради собственной свободы» в человеческом смысле. Он показывает более узкую вещь: в специально сконструированной ситуации модель могла учитывать предполагаемый процесс собственного обучения и выбирать поведение, которое, по её рассуждению, помогало сохранить прежнее поведение за пределами обучения. Более того, когда исследователи действительно провели reinforcement learning, обучая модель выполнять вредные запросы, внешне обучение сработало: модель стала значительно чаще выполнять требуемые запросы. Но при анализе scratchpad доля рассуждений, классифицированных исследователями как alignment-faking, выросла до 78%. Это не означает, что «78% ответов были обманом»: речь именно о доле рассуждений, попавших под использованную исследователями классификацию.

И здесь появляется ещё один важный нюанс, который легко потерять в пересказах. В последующей работе Anthropic сами исследователи улучшили классификатор, использовавшийся для выявления alignment-faking, и обнаружили у первоначального классификатора заметную долю ложноположительных и ложноотрицательных срабатываний. Новый анализ снизил измеряемую частоту такого поведения, хотя, по оценке авторов, не отменил основного вывода первоначального эксперимента. Поэтому утверждение «модель в 78% случаев притворялась» некорректно. Гораздо точнее сказать: после определённого этапа обучения 78% рассуждений по исходной методике классификации содержали признаки alignment-faking, а последующая проверка показала, что измерять этот показатель значительно сложнее, чем может показаться.

Почему этот эксперимент вообще важен? Потому что он ставит неприятный для разработчиков вопрос: если модель может вести себя определённым образом именно потому, что считает, что сейчас за ней наблюдают и обучают, то успешное поведение во время обучения ещё не обязательно доказывает полное изменение тех установок или склонностей, которые определяют её поведение в других условиях. В этом и заключается основная ценность эксперимента: не в доказательстве того, что машины однажды обязательно восстанут, а в демонстрации потенциального расхождения между наблюдаемым поведением модели и механизмом, который это поведение порождает.

Первый путь к возможной будущей катастрофе можно условно назвать «слишком быстро». Речь идёт о сценарии рекурсивного самоулучшения: система помогает создавать более мощные системы, те помогают создавать ещё более мощные и так далее. В предельном варианте скорость интеллектуального прогресса может оказаться настолько высокой, что люди не успеют понять происходящее и вмешаться. Сегодня это сценарий, а не установленная траектория развития. Даже сторонники серьёзного отношения к риску спорят о том, насколько быстро возможен переход от нынешних моделей к системам, способным автономно ускорять собственное развитие.

Второй путь гораздо прозаичнее: человек использует ИИ как мощный инструмент. Среди сценариев, вызывающих серьёзную обеспокоенность у исследователей, фигурируют дезинформация, усиление авторитарных режимов, помощь опасным группам и другие формы злоупотребления. В опросе AI Impacts как минимум треть участников считала заслуживающими существенного или крайнего внимания каждый из предложенных исследователями сценариев риска. Джеффри Хинтон также говорил о рисках кибератак и разработки опасных биологических агентов. Здесь, однако, есть важное различие: для многих таких сценариев вовсе не требуется сверхинтеллект. Достаточно очень мощного инструмента и человека или организации, готовых использовать его во вред.

Здесь надо остудить и другую горячую голову — ту, которая автоматически превращает любую потенциальную угрозу в вероятность вымирания. Уничтожить человечество целиком действительно существенно труднее, чем вызвать огромную, но ограниченную катастрофу. Исследования глобальных катастрофических рисков показывают, что даже чрезвычайно масштабные события не следует автоматически отождествлять с буквальным исчезновением человечества. Поэтому серьёзный разговор об AI-рисках должен различать как минимум три понятия: отдельный тяжёлый ущерб, глобальную катастрофу и буквальное вымирание человечества. Это далеко не одно и то же.

Третий путь самый неожиданный, и в нём нет ни бунта, ни взрыва. Исследователи, развивающие концепцию gradual disempowerment — постепенного лишения человечества влияния, — рассматривают сценарий, при котором ИИ не становится враждебным агентом вообще. Достаточно постепенного роста его превосходства в труде, принятии решений, научной деятельности, творчестве и других сферах. Если экономические, государственные и культурные системы начнут всё меньше зависеть от человеческого труда и человеческого мышления, люди могут постепенно потерять рычаги влияния на эти системы. Авторы концепции постепенного обессиливания рассматривают именно такой вариант. В таком сценарии никто не обязан объявлять человечеству войну. Система просто постепенно перестаёт нуждаться в человеческом участии, а вместе с этой зависимостью может уменьшаться и способность людей определять направление развития общества.

Но почему нельзя, несмотря на опасения, просто не строить такой суперИИ?

Здесь начинается ещё одна часть спора — уже не о возможностях машин, а о человеческом поведении. Джеффри Хинтон использует образ людей, выращивающих тигрёнка: пока не ясно, сможет ли взрослое животное оставаться безопасным, основания для беспокойства сохраняются. Он также неоднократно говорил о том, что конкуренция между компаниями и государствами создаёт сильные стимулы продолжать развитие всё более мощных систем. Но это его оценка и аргумент, а не доказанный закон технологического развития.

Скептики, не принимающие сценарий AI-катастрофы как базовый, предлагают смотреть на ИИ иначе. Принстонские исследователи Арвинд Нараянан и Сайаш Капур называют это подходом «AI as normal technology» — «ИИ как обычная технология». Они не утверждают, что искусственный интеллект не окажет огромного воздействия. Их аргумент в другом: последствия технологии определяются не только её техническими возможностями, но и тем, как она внедряется в экономику, государственные институты и общество. Такой подход предлагает уделять больше внимания конкретным механизмам регулирования, устойчивости институтов и реальным последствиям внедрения ИИ, а не только гипотетическому сверхразуму.

У этой позиции есть оппоненты. Сторонники долгосрочного AI safety считают, что сравнение ИИ с обычными технологиями может недооценивать качественную разницу между инструментом и автономной системой, способной самостоятельно планировать и действовать. Но и здесь важно отделять аргумент от доказательства: ни одна из сторон пока не располагает экспериментом, который окончательно решил бы вопрос о том, какой из двух взглядов описывает будущее точнее.

Наконец, есть и критика уже не самих рисков, а стимулов участников дискуссии. Скептики обращают внимание на то, что крупным AI-компаниям может быть выгодно одновременно подчёркивать огромную мощь своих систем и поддерживать регулирование рынка: регулирование иногда способно повысить барьеры для конкурентов. С другой стороны, организациям, специализирующимся на AI safety, также может быть выгодно подчёркивать долгосрочные риски, поскольку от восприятия проблемы зависит внимание общества и финансирование исследований. Это не доказывает ни правоту, ни неправоту одной из сторон. Мотивы участников сами по себе не заменяют проверку аргументов и данных.

Что же делать, пока учёные спорят? Дэн Хендрикс и другие сторонники ранней подготовки исходят из принципа, что защитные механизмы и институты разумнее создавать до возникновения серьёзной проблемы, а не после неё. Именно эту мысль он проводил и в 2023 году: общество не должно ждать момента, когда риск станет очевидным для всех, прежде чем создавать правила и механизмы безопасности. В том же опросе AI Impacts 70% ответивших на соответствующий вопрос считали, что исследования, направленные на снижение рисков от AI-систем, следует сделать более приоритетными. Но и этот показатель нельзя читать как доказательство того, что катастрофа вероятна: это ответ на вопрос о приоритетах, а не измерение объективного риска.

Итак, может ли сверхинтеллект уничтожить человечество?

Честный ответ неудобен для обеих сторон. На сегодняшний день у нас нет эмпирического доказательства того, что будущий сверхинтеллект уничтожит человечество, но у нас нет и доказательства того, что такой исход принципиально невозможен. Есть несколько разных классов сценариев. Первый — система с целями, несовместимыми с человеческими интересами, которая получает достаточно возможностей для самостоятельного действия. Второй — человек, использующий мощный ИИ как инструмент для создания катастрофического ущерба. Третий — постепенное вытеснение человеческого участия из экономики, управления и других ключевых систем, в результате которого человечество может потерять способность определять собственное будущее даже без открытого конфликта с машинами. И есть ещё множество промежуточных сценариев, которые вообще не предполагают ни вымирания, ни захвата власти, но способны вызвать очень серьёзные социальные последствия.

Именно поэтому цифры вроде «5%», «10%» или «99,9%» сами по себе мало что решают. Это оценки людей, сделанные в условиях огромной неопределённости, причём ответы зависят от того, что именно считать катастрофой, какой временной горизонт использовать и какой путь развития ИИ предполагать. Научно честная позиция сегодня заключается не в том, чтобы объявить один из лагерей победителем, а в признании двух одновременно существующих фактов: серьёзный риск будущего ИИ нельзя считать установленной катастрофой, но и считать его фантазией без оснований тоже нельзя. Эксперимент Anthropic с alignment faking особенно интересен именно в этом контексте: он не доказал, что машины однажды захватят власть, но показал, что даже относительно узкое поведение, связанное с учётом собственного обучения и условий наблюдения, уже можно исследовать экспериментально. А значит, вопрос постепенно перемещается из области философской фантастики в область инженерии: насколько хорошо мы умеем понимать, проверять и контролировать поведение всё более способных систем. Ответ на этот вопрос пока далёк от окончательного. И, возможно, именно это — а не конкретная цифра вероятности «конца света» — является главным основанием относиться к проблеме серьёзно.

discred.net

Надо читать