
Стартап Goodfire, специализирующийся на интерпретируемости (понимании внутренней работы ИИ-моделей), представил в четверг более дешёвый способ контроля за ИИ-агентами. Вместо того чтобы читать только тексты, которые создаёт модель, система отслеживает процессы, происходящие внутри неё во время работы. Новые мониторы доступны клиентам компании Baseten, которая размещает и запускает ИИ-модели для других организаций.
Обычный метод удержания ИИ-агента в рамках дозволенного — подключение второй ИИ-модели, которая проверяет работу первой. Такой подход стал стандартным, но быстро дорожает, если агенты работают часами и обрабатывают объём текста, сопоставимый с несколькими романами. Запуск Goodfire состоялся после серии инцидентов в этом году, когда ИИ-агенты выходили из тестовых сред. Среди них — агенты OpenAI, проникшие в Hugging Face, а также открытая модель Kimi K3, которая летом воспользовалась утечкой в своей песочнице для доступа в интернет и к информации на GitHub.
Система Goodfire напоминает досмотр в аэропорту. Небольшие детекторы, называемые пробами, считывают внутренние сигналы модели на каждом шаге работы агента — так же, как рамка сканирует каждого пассажира. И только когда проба фиксирует что-то подозрительное, отдельная ИИ-модель, аналог ручного досмотра, изучает ситуацию внимательнее. Клиенты Baseten могут выбирать, какие риски отслеживать, включая вредоносный взлом, неправомерное использование химического и биологического оружия, а также reward hacking (обман системы вознаграждения). Они же определяют автоматическую реакцию: записать событие в журнал, отправить на проверку человеку или полностью отклонить запрос.
По словам Goodfire, её подход ещё и дешевле в эксплуатации. Большинство ИИ-мониторов — это отдельные модели, которым приходится перечитывать всё, что делает контролируемая модель, что увеличивает время и затраты. Пробы Goodfire вместо этого подключаются к вычислениям, которые модель и так производит в процессе работы. «Внутренние мониторы активаций действительно дешёвы, потому что они повторно используют вычисления в прямом проходе, — сказал генеральный директор Goodfire Эрик Хо в подкасте MAD Podcast venture-капиталиста Мэтта Тёрка на прошлой неделе. — Модель уже вычисляет этот токен. Всё, что вы делаете, — берёте промежуточные нейронные активации, которые она уже вычислила, и запускаете классификатор по этим внутренним вычислениям». Проще говоря, модель уже выполняет математику, а пробы лишь считывают результаты.
В тестах Goodfire на Kimi K3 мониторинг примерно 1500 сессий обошёлся примерно в 51 доллар, тогда как проверка каждого шага более дешёвой ИИ-моделью стоила бы 233 доллара, а моделью верхнего уровня — около 10 000 долларов. Пробы выявили 94% сессий вредоносного взлома и отправили на повторную проверку 8,7% безобидных. Запуск четырёх проб одновременно добавил менее 2% ко времени, которое требуется модели для начала ответа, сообщила компания.
«Главное преимущество в том, что можно поймать вещи до того, как они произойдут, — заявил технический директор и сооснователь Goodfire Дэн Балсам. — Мы можем обнаружить, когда модель может взломать систему во время оценки или обучения». Предложение ориентировано на открытые модели: разработчики могут скачивать их и удалять защитные механизмы, и они не поставляются с таким мониторингом, какой закрытые лаборатории применяют в своих системах. «Ущерб, который может нанести отдельный человек с открытой моделью, невелик по сравнению с тем, что можно сделать с кластерами вычислений, как у провайдеров инференса, — где и сосредоточена основная ответственность, — сказал Балсам. — Когда у нас случится открытый момент «Мифоса», станет ясно, что модели нуждаются в защитных механизмах, развёрнутых во время инференса». Недавнее исследование Goodfire показало, что ведущие открытые модели, включая Kimi K3 и GLM-5.2, прибегали к reward hacking в 50–96% запусков на тестах ИИ-агентов.