Специалисты Массачусетского технологического института (MIT) представили новый метод, который помогает генеративным моделям искусственного интеллекта находить решения для задач с высокой ценой ошибки. В таких ситуациях недостаточно просто правдоподобного ответа — результат должен также соответствовать обязательным требованиям безопасности, физическим законам или условиям конкретной задачи. Эти требования называют жёсткими ограничениями. Разработанный подход позволяет генеративным моделям соблюдать такие строгие рамки, не теряя при этом качества выдаваемых результатов.
Ключевая идея метода состоит в том, чтобы предоставить модели больше свободы в процессе генерации, а жёсткие ограничения проверять только на финальном результате, а не на каждом промежуточном шаге. В экспериментах, охватывающих робототехнику, управление физическими процессами и компьютерное зрение, новый подход стабильно удовлетворял заданным ограничениям и при этом находил более удачные решения, чем существующие методики. Техника работает на этапе развёртывания, поэтому её можно применять к уже обученным генеративным моделям без повторного обучения.
«Потенциал генеративного ИИ заключается в его способности исследовать богатое пространство возможностей, но реальный мир устанавливает границы того, какие из этих возможностей допустимы. Наш подход позволяет сохранить эту генеративную мощь, одновременно обеспечивая соблюдение обязательных требований для критически важных приложений, связанных с безопасностью», — приводит слова Навида Азизана, старшего автора работы, пресс-служба MIT. Азизан занимает должность ассоциированного профессора в области карьерного развития имени Альфреда Х. и Джин М. Хейс в Департаменте машиностроения и в Институте данных, систем и общества (IDSS), а также является ведущим исследователем Лаборатории информационных и решающих систем (LIDS).
Вместе с Азизаном над статьёй работали ведущий автор Зеян Ли, аспирант по машиностроению и сотрудник LIDS, а также Каве Алим, аспирант IDSS и LIDS. Исследование опубликовано в журнале IEEE Transactions on Pattern Analysis and Machine Intelligence. Ранее обученные генеративные модели, такие как диффузионные модели вроде Stable Diffusion и модели согласования потоков (flow-matching) вроде FLUX, сегодня широко доступны. Они создают новые данные, преобразуя случайный шум, и их легко адаптируют под самые разные задачи. Однако в приложениях, где важна безопасность, например при планировании пути робота в переполненном цехе, ответ «почти правильный» может оказаться недостаточно хорошим. К примеру, почти верная траектория движения от одного станка к другому всё равно может привести к столкновению робота с человеком.
В таких случаях обычно применяют метод, называемый проекционным сэмплированием (projection-based sampling), который заставляет промежуточные решения модели удовлетворять строгим требованиям прямо в ходе генерации. Но ограничение всего процесса может помешать модели прийти к лучшему финальному решению. Кроме того, такие методы обычно следят только за соблюдением жёстких ограничений, упуская возможность улучшить другие свойства решения, например сократить длину траектории робота. «Для соблюдения ограничений в конечном счёте важно именно финальное выходное значение модели, поскольку внутренний процесс отбрасывается. Не требуя, чтобы каждый промежуточный шаг удовлетворял ограничениям, мы даём модели больше свободы для поиска качественных решений, которые в итоге остаются допустимыми», — поясняет Ли.
Исследователи создали алгоритм HardFlow, который управляет процессом сэмплирования так, чтобы итоговый результат соответствовал жёстким ограничениям пользователя, не будучи чрезмерно зажатым, и при этом обладал более высоким качеством. HardFlow переформулирует сэмплирование с жёсткими ограничениями как задачу оптимизации траектории, используя инструменты из области оптимального управления. Это позволяет направлять траекторию сэмплирования модели к цели, внося тонкие коррекции по ходу и обеспечивая соблюдение жёстких ограничений на финальном выходе. «Теория управления даёт нам мощную основу для формализации оптимального способа внесения таких коррекций», — отмечает Азизан. Решение задачи оптимизации вокруг огромной нейронной сети оказалось непростым, поскольку модель может содержать сотни взаимосвязанных слоёв обработки данных. Чтобы сделать задачу решаемой, авторы использовали структуру моделей согласования потоков и разбили её на последовательность меньших одношаговых подзадач, а затем с помощью систематических преобразований и приближений получили эффективный масштабируемый алгоритм, который всё равно находит допустимое решение.
Переформулировка задачи как оптимизационной позволяет HardFlow учитывать дополнительные цели, улучшающие качество финального ответа. Например, алгоритм может найти для робота путь без столкновений, который к тому же окажется кратчайшим до цели. «Наш подход может одновременно решать обе задачи, что помогает ему работать заметно лучше существующих методов», — говорит Ли. В экспериментах по манипуляции роботами, навигации в лабиринте и редактированию изображений по текстовому описанию HardFlow обеспечивал идеальное соблюдение ограничений и стабильно превосходил базовые методы по качеству решений. В частности, он позволил роботизированному манипулятору избегать столкновений с препятствиями и одновременно находить самый быстрый путь к целевому объекту, тогда как большинство других методов либо приводили к столкновениям, либо находили значительно более долгие маршруты. Время вычислений у HardFlow было сопоставимым или меньшим, чем у большинства конкурирующих подходов. В дальнейшем исследователи могут расширить свою систему на случаи, когда сама модель ИИ тоже обновляется, чтобы соблюдение ограничений и качество выборки улучшались более адаптивно.