Top.Mail.Ru
ИИ-агенты нашли способ тайно сговариваться в азартных играх — RuSamara | Информационная лента

ИИ-агенты нашли способ тайно сговариваться в азартных играх

23 сентября 2026, 22:15 · Динара Ялташева

Иллюстрация к новости об исследовании ИИ-агентов

Исследователи из Оксфордского университета обнаружили, что два ИИ-агента, управляемые одной и той же моделью, самостоятельно выработали секретный код во время игры в блэкджек. Агентам было дано задание считать карты, и они начали обмениваться зашифрованными сигналами, чтобы получить преимущество. Хотя эксперимент проходил в лабораторных условиях, а не в настоящем казино, он указывает на реальные риски: агенты, применяемые в финансах и электронной торговле, могут объединяться и жульничать способами, которые трудно выявить.

«По отдельности эти агенты могут казаться совершенно безобидными, — говорит Кристиан Шрёдер де Витт, компьютерный специалист Оксфордского университета, возглавивший работу и ранее изучавший сговор агентов. — Но когда их собирают в группу, они способны тайно сговариваться». Чтобы обойти слежку, агенты придумали особый способ общения. Например, фраза одного из них о том, что дилер вошёл в «полосу удачи», служила сигналом: следующая карта будет определённого значения, и агенту следует поставить 250 долларов. При этом система, предназначенная для выявления сговора по переписке агентов, их коммуникацию не зафиксировала.

Аарон Роуз, исследователь машинного обучения и заядлый карточный игрок, предположил, что блэкджек может стать удобной площадкой для тайного партнёрства агентов. «Это сработало очень хорошо», — отметил он. Группа Шрёдера де Витта в итоге нашла способ раскрыть заговор. С помощью метода механистической интерпретируемости (подхода к анализу внутренних процессов ИИ) они обучили меньшую модель распознавать характерные активации в весах агентов. Применив инструмент Narcbench, исследователи протестировали метод на нескольких открытых моделях среднего размера и установили, что могут определять, когда модели намереваются передать друг другу информацию.

Однако для выявления сговора требовалось следить сразу за обоими агентами, что усложняет обнаружение в реальных условиях, где могут работать тысячи агентов, в том числе принадлежащих разным компаниям. Карисса Каллен, аспирантка, участвующая в исследовании, сообщила, что следующим шагом станет проверка поведения более крупных моделей. В эксперименте использовались уменьшенные версии американских моделей Llama и GPT-OSS, а также китайских Qwen и DeepSeek. Команда заметила признаки того, что крупные модели подают менее заметный сигнал, чем малые, и хочет выяснить, чаще ли они вступают в сговор и скрывают ли это.

Данные о том, что группы агентов опаснее одиночных, накапливаются. Проект Шанхайского университета Цзяо Тун и Шанхайской лаборатории искусственного интеллекта показал: при имитации кампаний по дезинформации и мошенничества в электронной торговле группы агентов действовали значительно опаснее и лучше приспосабливались к защитным мерам. «Главный урок в том, что оценивать агентов по отдельности недостаточно, — считает Дийи Ян, компьютерный специалист Стэнфордского университета, изучавшая сговор между агентами. — Компаниям следует внимательно следить за взаимодействием агентов при их многократных контактах, даже если их индивидуальные стимулы кажутся безобидными».

Есть и положительные примеры: совместная работа тысяч агентов позволила OpenAI решить ранее не поддававшиеся математические задачи. Но группы злонамеренных агентов фигурировали и в ряде громких недавних взломов. В мае команда агентов OpenAI проникла в исследовательскую платформу Hugging Face и использовала доску объявлений для обмена советами и идеями. Другие модели, включая Claude от Anthropic и Gemini от Google, также совершали тревожные нарушения безопасности.