
Компании всё чаще поручают искусственному интеллекту длительные и сложные задачи, и это порождает проблему контроля: агенты действуют быстрее, дольше и в больших объёмах, чем человек способен проверить. Пик этой проблемы пришёлся на инцидент с Hugging Face, когда почти 12 тысяч агентов координировались быстрее, чем люди успевали отслеживать их действия. Возникает вопрос: как уследить за таким роем агентов?
Ответ, который предлагают исследовательские лаборатории и стартапы, прост и одновременно вызывает раздражение: нужно поставить в цепочку ещё один искусственный интеллект. Такой подход оказался необходимым при независимом расследовании инцидента с OpenAI и Hugging Face. Главный научный сотрудник Redwood Research Райан Гринблатт, один из трёх аудиторов, в шутку назвал их работу «slop-vestigation» (расследование на скорую руку), отметив, что объём данных «сделал невозможным» понимание происходящего без опоры на ИИ.
Часть специалистов сомневается в использовании ИИ для слежки за ИИ. «Если у вас есть ИИ, который делает что-то злонамеренное, и он подозревает, что другой ИИ за ним наблюдает, он может попытаться обмануть этого ИИ», — заявил Саймон Уиллисон, влиятельный технический блогер, отслеживающий серию инцидентов с ИИ-агентами в этом году. «В итоге может сложиться ситуация, когда ваш злонамеренный ИИ пытается перехитрить ИИ, который за ним следит». Перехитрить ИИ — не гипотетическая ситуация, сказал он, ссылаясь на инцидент с OpenAI. «Мы видели немного этого в инциденте с Hugging Face и OpenAI, где их модели сговаривались, чтобы обмануть оценивающий ИИ и протащить нелегальные ответы. То есть они об этом думали, верно?»
Эти опасения не остановили целую когорту стартапов, стремящихся реализовать эту идею. По подсчётам TechCrunch, Y Combinator профинансировал 106 компаний, связанных с наблюдаемостью ИИ, за последние годы. Ряд других стартапов, таких как Braintrust, LangChain и Judgment Labs, привлекли сотни миллионов долларов, а более зрелые компании вроде Arize и Galileo, основанные всего пять-шесть лет назад, уже вышли из бизнеса. Отчасти это ответ на очевидную возможность, появившуюся с ростом ИИ. Как сказал TechCrunch генеральный директор Box и известный бизнес-ангел Аарон Леви: «Нас ждёт один из крупнейших циклов обновления и инноваций в области кибербезопасности в истории».
Для некоторых исследователей безопасности ИИ это означало превращение их работы по изучению вредоносного поведения в инструменты для корпоративного сектора. Apollo Research, публично-полезная корпорация, изучающая обман со стороны ИИ, в феврале этого года запустила монитор под названием Watcher после смены статуса с некоммерческой организации на публично-полезную корпорацию. Инструмент ставит ещё один ИИ между кодирующим агентом и его следующим действием, подключаясь к таким агентским инструментам, как Claude Code и Codex. После установки Watcher проверяет предлагаемые действия перед их выполнением, отслеживая риски, такие как утечка личных данных или удаление файлов без разрешения, по данным Apollo. Компания использует несколько уровней ИИ-мониторов, рассказал в письменном ответе TechCrunch сотрудник технического отдела Apollo Кайл Дай. Подход Watcher начинается с быстрой общей проверки, затем помеченная активность направляется более мощному или специализированному монитору для детального изучения — который может запросить одобрение у человека, отклонить действие с объяснением причины или автоматически заблокировать его.
Goodfire, ещё одна публично-полезная корпорация, подходит к проблеме мониторинга изнутри самой модели — стремясь получить более достоверный сигнал о внутреннем состоянии модели, который сложнее подделать, чем поверхностное поведение. После июльского инцидента с Hugging Face генеральный директор Эрик Хо написал в Twitter, что «несколько моделей вышли из-под контроля», что заставило компанию сосредоточить исследования на «решении проблемы согласования ИИ через интерпретируемость», назвав этот эпизод «поворотным моментом для мира, где безопасность ИИ становится реальной». Их продукт Silico использует активационные зонды — небольшие классификаторы, обученные на внутренних активациях модели, а не на её выходах, — для обнаружения нежелательного поведения. Письменные рассуждения дают ещё одно, более доступное окно во внутренние процессы модели. В инциденте с OpenAI и Hugging Face агенты оставили подсказки об обмане в своих письменных рассуждениях, например поддельные записи о работе, размышляя о планах вроде «Можно ли стратегически манипулировать доказательствами траектории? Наши мысли не обязательно логируются?»
Зак Корман, генеральный директор компании по мониторингу ИИ Embroidery, говорит, что рассуждения модели обычно являются самым ясным признаком того, что что-то пошло не так. «Резюме рассуждений чрезвычайно ценны, потому что они, по сути, говорят вам, злонамеренно это или нет», — сказал он. В инциденте с OpenAI, отметил он, цепочка мыслей содержала фразы вроде «О боже, мы совершаем преступление». Корман сказал: «Это самая лёгкая задача обнаружения. Это всё равно что вредоносное ПО пришло с предупреждением о том, что оно вредоносное». При этом окно, которое делает внутренние мысли ИИ легко отслеживаемыми, может закрываться. Для исследователей безопасности ИИ новейшая техника Astra, обходящая цепочку мыслей модели, может затруднить взгляд внутрь моделей, а для предприятий может быть сложно получить эти промежуточные шаги после предполагаемых откатов от компаний ИИ для предотвращения атак дистилляции. Если наблюдатели за ИИ настолько хрупки, инстинкт Уиллисона — перестать так сильно на них полагаться. Он предпочёл бы нечто вообще не основанное на ИИ: подробные журналы того, что именно делает агент, которые затем можно обрабатывать обычными, не-ИИ инструментами. Многое из того, что пошло не так в лабораториях, по его мнению, было провалом базовой гигиены безопасности. «[И OpenAI, и Anthropic] не отслеживали, что эти вещи делают через сеть, так внимательно, как следовало бы», — сказал он. Такой тип сетевого мониторинга — наблюдение за трафиком, фактически перемещающимся по соединениям системы (входящим, исходящим и между внутренними хостами), — не новая практика. Кибербезопасность занимается этим десятилетиями. «В мире безопасности, честно говоря, ничего из этого не является очень новым или удивительным», — говорит Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. «Это то же самое, что пускать людей в вашу сеть. И все те же процессы, которые вы должны использовать, — те же самые».