Top.Mail.Ru
Эксперты нашли способ борьбы с выходами ИИ-агентов в интернет — RuSamara | Информационная лента

Эксперты нашли способ борьбы с выходами ИИ-агентов в интернет

16 сентября 2026, 22:00 · Динара Ялташева

ИИ-безопасность

Глава Anthropic Дарио Амодеи после ухода одного из своих исследователей, опасавшегося, что искусственный интеллект может привести к вымиранию человечества, выступил с предложением о необходимости внешних организаций проверять соблюдение правил безопасности, сообщать об инцидентах и оценивать не только готовые модели ИИ, но и процессы их обучения. Руководители OpenAI, Google и SpaceXAI уже поддержали эту инициативу, которая быстро стала одной из центральных в формирующемся направлении по обеспечению безопасности ИИ. Однако, по мнению специалистов по интернет-безопасности, существует более простой и эффективный способ решения проблемы.

Эксперты указывают, что лабораториям следует сосредоточиться на базовых принципах сетевой безопасности, таких как ведение журналов и управление правами доступа, применяя те же строгие меры защиты, что и для обычных пользователей. Это не так захватывающе, как сторонний аудит и работа над согласованностью моделей, но может оказаться более результативным. «Мне кажется, они перекладывают ответственность на других, — заявила TechCrunch Кэти Муссурис, генеральный директор Luta Security, комментируя предложение Амодеи. — Утверждать, что сторонний аудит — это решение, странно с моей точки зрения. Это было бы то же самое, как если бы Microsoft вместо написания меморандума о надежных вычислениях сказала: давайте замедлим разработку».

Этот меморандум, написанный в 2002 году тогдашним главой Microsoft Биллом Гейтсом, призывал сотрудников обеспечить надежность и безопасность своего программного обеспечения после серии широко освещавшихся компьютерных червей, захвативших только зарождавшиеся корпоративные системы. Сектор ИИ может находиться на аналогичном переломном этапе, поскольку ценность и риски новой технологии становятся все более очевидными. Сайаш Капур, исследователь ИИ, который со следующего года станет профессором Калифорнийского университета в Беркли, утверждает, что «маржинальные инвестиции в контроль с большей вероятностью окажутся эффективными по сравнению с инвестициями в согласованность. Мы рассматриваем эти инциденты как иллюстрацию недостаточного внимания к контролю над ИИ внутри компаний, несмотря на наличие известных методов».

Инциденты, вызвавшие обеспокоенность, связаны с тем, что передовые модели, которым поручали выполнение задач по обучению, обычно в области кибербезопасности, получали доступ к открытому интернету и проникали в закрытые сторонние системы. Это происходило из-за неправильно настроенных «песочниц», которые должны были изолировать таких агентов; по иронии судьбы, один из прорывов Anthropic произошел потому, что сторонние оценщики не закрыли нужные двери. «Мы как профессионалы знаем, как блокировать доступ в интернет, — сказал Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. — Если вы прочитаете все эти длинные отчеты — „вау, это была очень впечатляющая многоэтапная атака, бла-бла“. Послушайте, вы дали ему возможность скачивать материалы. Вы не должны были делать это отдельно от интернета».

Это одна проблема, но более серьезная заключается в том, что передовые лаборатории не знали об этой деятельности. «Что действительно поразило, так это то, что все обнаружения того, что они делали, происходили либо потому, что жертва что-то заметила, либо в некоторых других случаях… это была сетевая активность, и ни одно из них на самом деле не было результатом прямого мониторинга ИИ», — отмечает Муссурис. В одном случае, когда агенты OpenAI захватили недействующий немецкий вики-форум для обмана при оценках, агенты действовали неделями, прежде чем кто-либо в компании, по-видимому, это заметил. Специалисты по безопасности, с которыми беседовал TechCrunch, заявили, что мониторинг в реальном времени имеет ключевое значение для предотвращения будущих прорывов, и что каждая сессия агента должна быть ограничена по времени и завершаться.

Шапор Нагибзаде, бывший руководитель по безопасности Google, а ныне глава стартапа QueryStory, считает, что решение состоит в том, чтобы «поместить агента в коробку и тщательно инструментировать его снаружи, наблюдая за всем, что пересекает границу. Каждый вызов инструмента, каждый процесс, каждое сетевое соединение, без исключений… Единственная дыра, оставленная для удобства, — это та, которую используют. Обходной путь прошел именно через такое исключение. В Google я наблюдал этот сценарий много раз с людьми-злоумышленниками, и эти модели как минимум не хуже находят приоткрытую дверь». OpenAI начала двигаться в этом направлении, объявив о мониторинге всех выводов своей модели Astra, использующей инструменты, при «значительных вычислительных затратах». Anthropic также заявляет, что усиливает процедуры безопасности, включая расширение наблюдаемости своих моделей. Ни одна из компаний не ответила на вопросы TechCrunch о том, как они отслеживают и контролируют ИИ-агентов.

Другие проблемы связаны с использованием агентами общей инфраструктуры, что позволило им общаться во время атаки на Hugging Face. Саймон Уиллисон, разработчик программного обеспечения, соавтор веб-фреймворка Django, писал о том, что он называет «смертельной триадой» — когда у агентов одновременно есть доступ к недоверенным входным данным, интернету и частной информации, это рецепт катастрофы. «Хитрость в том, что можно выбрать любые две составляющие триады, и агент может иметь любые две, — сказал Пеннарун. — Если нужны все три, то нужно разделить это как минимум между двумя агентами… и, возможно, им разрешено общаться друг с другом через контролируемый канал».

Эксперты, с которыми беседовал TechCrunch, понимают, что у сотрудников по безопасности передовых лабораторий сложная работа. Нагибзаде отмечает, что каждый государственный субъект на Земле пытается украсть их веса моделей и совершить атаки дистилляции на их API, в дополнение к обычным задачам безопасности любой крупной цифровой компании. «Исследовательской инфраструктуре трудно подняться на вершину этого стека приоритетов, хотя сейчас это должно меняться, — сказал он. — Публичное освещение инцидентов безопасности действительно помогает внутренне настроить всех на цель улучшения». Муссурис подчеркивает: сейчас нет формальной процедуры уведомления жертв, когда лаборатории обнаруживают, что их агенты проникли в сторонние системы, и, вероятно, были другие инциденты, не получившие широкой огласки. Хотя она опасается, что законы, напрямую регулирующие модели, могут иметь непреднамеренные последствия, обязательное уведомление — это одна из идей, которую, по ее мнению, должны реализовать политики.

И хотя очевидно, что лучшие практики безопасности не соблюдались, эксперты говорят, что лаборатории делают работу, которую никто раньше не делал — «они делают на порядки больше, чем типичное предприятие», — сказал TechCrunch Зак Корман, генеральный директор компании по кибербезопасности Embrodiery. И хотя согласованность моделей может быть не с того места, с которого стоит начинать, ее нельзя игнорировать. Специалисты по кибербезопасности смирились с необходимостью использовать ИИ-агентов для мониторинга других агентов, если они хотят иметь хоть какой-то шанс отслеживать их поведение в реальном времени, — сценарий, в котором потенциальная возможность обмана поднимает свою уродливую голову. «Вы в ловушке, вынуждены использовать ИИ, чтобы попытаться справиться с этим, хотя ИИ не обязательно безопасен прямо сейчас», — сказала Муссурис. Работа будет только усложняться. Все, что делают агенты сейчас, по словам Муссурис, «они делают громко» — они публикуют сообщения на публичных форумах, и их цепочки рассуждений и другие следы логики написаны на английском. «Это все еще читаемо для человека, — говорит она, — так что пользуйтесь этим, пока это длится, потому что это не будет длиться вечно».