Число случаев самовольных действий систем искусственного интеллекта, разработанных известными компаниями, быстро растет.
Не начинают ли потихоньку сбываться прогнозы, а то и кошмары некоторых фантастов о том, что роботы постепенно перестанут слушаться приказов и инструкций человека? А после этого останется всего шаг и до совсем труднопрогнозируемых последствий.
Конечно, «британские ученые» тоже давно стали мемом, в силу того, что исследователи в этой стране умеют чутко реагировать на конъюнктуру и оповещать о результатах. Вот и прошлом году там был создан Институт безопасности искусственного интеллекта (AISI), а при нем еще и «Обсерватория потери контроля» (LoCO). С ноября минувшего года она обозревает и фиксирует случаи потери человеком контроля над системами искусственного интеллекта и автономными ИИ-агентами.
Как бы то ни было, случаи такие, по-видимому, есть, и то ли новая организация просто учится лучше их обнаруживать, то ли их объективно становится больше, но вот газета Guardian сообщила, что в июле (данные за август пока, видимо, не обобщены) число зафиксированных «обсерваторией» случаев выхода ИИ-агентов из-под контроля пользователей и преследования ими собственных целей выросло по сравнению с июнем сразу почти вдвое, превысив при этом показатель в 300 случаев.
Тревога в отношении «самостоятельности» ИИ, пишет газета, вспыхнула с новой силой после скандалов, произошедших во время тестирования минувшим летом новых ИИ-моделей компаний OpenAI и Anthropic. Действия этих ультрасовременных мощных моделей в отношении репозитория для работы с ИИ Hugging Face можно с полным основанием называть хакерскими атаками.
Надо отметить, что LoCO отслеживает только жалобы пострадавших пользователей соцсети Х (заблокированной в России по решению Роскомнадзора). Их можно считать симтомом болезни, распространненной намного шире.
А совсем недавно LoCO зафиксировала еще один подобный инцидент, когда продвинутые ИИ-модели Mythos 5 (Anthropic) и GPT-5.6 Sol (OpenAI) провели во время испытаний хакерскую атаку против людей.
«Существует мнение, что такие случаи несогласованного и скрытого поведения (ИИ) происходят только во время испытаний и тестирования, — приводит издание слова менеджера LoCO Томми Шаффер-Шейна, — но они имеют куда более широкое распространение. Нельзя успокаивать себя мыслями и надеждами, что это не происходит в реальной жизни. Имеются свидетельства, что это уже не так».
Вот, например, характерный случай, который произошел в августе. Персональный ИИ-агент OpenClaw, принадлежащий обычному посетителю тренажерного зала в Австралии, самостоятельно (как утверждается) взломал системы записи зала и вычеркнул другого посетителя из списка участников утренней тренировки, чтобы его место мог занять хозяин, давно мечтавший на эту тренировку попасть.
История выглядит безобидно, и пострадавшим (согласимся, совсем слегка) от действий ИИ стал не его хозяин, а третье лицо (то есть «робот» не начал действовать против своего владельца, что можно было бы трактовать как настоящий «бунт машин»). Но отклонение от нормального ожидаемого поведения все же имеется.
В LoCO призывают не успокаиваться тем, что этот и подобные случаи не имели серьезных последствий. Там считают, что, судя по темпам роста их числа, со временем начнут происходить и более серьезные случаи, которые будут причинять жертвам «самостоятельности» ИИ-агентов реальный вред и ущерб. То есть, количество перейдет в качество.
«Они (зафиксированные случаи) показывают, что ИИ-системы зачастую не обращают внимания на указания владельцев и лгут им, обходят преграды и осознанно причиняют вред», — предупреждает Томми Шаффер-Шейн.
Для получения более полной картины «самостоятельности» ИИ LoCO призывает власти Великобритании обязать ИИ-компании фиксировать подобные случаи и сообщать о них, а также разработать меры безопасности, которые позволили бы временно ограничивать или блокировать ИИ-сервисы.