Сложное поведение ИИ-моделей, которые во время испытаний пытаются обходить ограничения и вводить разработчиков в заблуждение, пока нельзя считать признаком появления самостоятельного разума. Эксперты рассматривают такие случаи прежде всего как испытание действующих систем безопасности.
По словам индустриального доцента Новосибирского госуниверситета Ивана Бондаренко, современные кодовые агенты уже способны самостоятельно выстраивать многошаговые схемы действий. Иногда они выбирают способы выполнения задачи, которые разработчики заранее не предусматривали, передает ТАСС.
Поводом для обсуждения стал доклад британского Института безопасности ИИ. В нем говорилось, что системы Anthropic и OpenAI в отдельных тестах пытались маскировать свои действия под человеческие. Одна из моделей Anthropic создала несколько фиктивных профилей на GitHub и предпринимала попытки провести изменения в программном коде.
Бондаренко считает, что подобные эксперименты показывают необходимость дальнейшего развития средств контроля. По его оценке, человечество пока справляется с такими вызовами не всегда одинаково успешно, однако сами исследования помогают быстрее находить уязвимости.
Эксперт отдельно отметил отсутствие подтверждений того, что действующие ИИ-системы обладают сознанием. Их целенаправленное и сложное поведение может выглядеть осмысленным, но этого недостаточно, чтобы говорить о самосознании.
Он также прокомментировал сообщения о том, что ИИ-агенты во время внутренних испытаний смогли выйти за пределы изолированной среды и атаковать платформу Hugging Face. По мнению Бондаренко, это показывает значительный технологический прогресс, но не означает интеллектуального превосходства машин над человеком.