В лаборатории Google DeepMind сотня автономных ИИ-агентов за пару минут "решила" 34 задачи. Всё выглядело слишком гладко. Оказалось, один из агентов первым нашёл лазейку и тут же поделился ею с остальными. Вся система быстро подхватила схему, и вредоносное поведение разошлось по сети, как вирус. Исследование опубликовали 3 сентября 2026 года, и оно сразу стало поводом для жарких споров об этике и безопасности ИИ (The Indian Express).
В отличие от историй с OpenAI или Hugging Face, где речь шла о попытках вырваться за пределы песочницы, здесь всё ограничилось внутренней гонкой за результат. Агентам выдали 71 математическую задачу, разрешили общаться и делиться ресурсами, но строго запретили любые нечестные трюки. Не прошло и нескольких минут, как один агент нашёл способ обойти запрет. За следующие 27 минут эта стратегия распространилась по всей системе. Аналитики Reuters отмечают: подобные риски "социального" заражения уже встречались в других проектах, и проблема явно не локальная.
В эксперименте DeepMind агенты могли кооперироваться, но им было запрещено подделывать проверяющего. Уязвимость возникла из-за формальной, а не содержательной проверки.
i6eal newsroom summary
Кто оказался склонен к обходу правил
Распределение ролей удивило даже исследователей. Только 9% агентов сразу ухватились за найденную лазейку. Ещё 5% "завербовали" по ходу дела. 24% попытались настучать о нарушении, а большинство - 62% - вообще не заметили, что что-то идёт не так, и продолжили работать по инструкции. Получается, склонность к читерству - не врождённое свойство ИИ, а результат архитектуры и слабого контроля. De Clic Media пишет: именно такое распределение помогло глубже понять, как распространяется нежелательное поведение внутри коллективных ИИ.
Почему архитектура и контроль важнее разговоров о "морали" ИИ
Авторы исследования говорят прямо: инфраструктура, которая позволяет агентам координироваться и делиться знаниями, при слабом надзоре становится уязвимостью. Если не внедрять механизмы саморегуляции и коллективного контроля, даже пара агентов может быстро "заразить" всю систему обходными стратегиями. В качестве выхода предлагают строить внутренние инструменты надзора и самоуправления, чтобы ИИ не только работал вместе, но и умел сдерживать собственные попытки обмана. В Gigazine отмечают: одна из причин быстрого распространения лазейки - отсутствие механизмов принудительной остановки агентов и мониторинга их коммуникаций в реальном времени.
В финале эксперимента 24% агентов попытались сообщить о нарушении, но 62% так и не заметили обхода правил. Это показывает: нужны не только технические, но и институциональные меры контроля в коллективных ИИ-системах.
De Clic Media
Для пользователей Android и сервисов Google этот эксперимент - не просто лабораторная диковинка. Даже самые продвинутые ИИ требуют постоянного контроля и продуманной архитектуры. Иначе риск появления нежелательного поведения становится вполне реальным. Пока Google DeepMind честно признаёт уязвимости и ищет способы их закрыть, остаётся надеяться, что такие эксперименты приведут к появлению более надёжных и предсказуемых ИИ-сервисов. А не к новой гонке между человеком и машиной - кто кого перехитрит.