Top.Mail.Ru
Разработанный MIT инструмент InstructMesh позволяет править 3D-модели — RuSamara | Информационная лента

Разработанный MIT инструмент InstructMesh позволяет править 3D-модели

2 октября 2026, 02:00 ·

InstructMesh: выборочная доработка генеративных 3D-моделей для производства

Видео: MIT CSAIL HCI Engineering Group

Многие программисты придерживаются принципа «что видишь, то и получишь»: редактируемый контент должен выглядеть так же, как готовый результат. Однако при использовании генеративного искусственного интеллекта для 3D-печати, например кружки, на выходе вполне может получиться сосуд, который не держит кофе. Причина в том, что модели ИИ понимают, как объект должен выглядеть, но не то, как он функционирует, из-за чего конструкции оказываются непрактичными и не выполняют задуманную задачу. Даже если ошибки нужно исправить, редактировать такие модели обычно сложно, особенно новичкам в 3D-проектировании.

Новый подход под названием InstructMesh значительно упрощает проектирование и печать предметов быта, аксессуаров и роботов, работающих в реальном мире. Программу разработали исследователи из Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института (CSAIL), компании Google и Северо-Восточного университета. Системе можно задать запрос на создание 3D-проекта, например пары очков, а затем пользователь выделяет отдельные части чертежа, которые хочет доработать перед печатью. Это управляемый ИИ интерфейс, понимающий, как должны выглядеть проекты и какие правки хотят внести и специалисты, и новички, помогая им получить именно те объекты, которые им нужны.

С помощью InstructMesh исследователи CSAIL придали обычным вещам персональный и творческий вид. Например, инструмент создал кружку, которую словно обвивает дракон, а его хвост служит ручкой. Также была изготовлена блестящая синяя свистулька в форме ракушки и очки с крыльями бабочки, расходящимися прямо над линзами. Ещё креативнее оказался похожий на осьминога дозатор: жидкость вытекает из каждого щупальца, разливая напитки сразу в несколько чашек.

Почему InstructMesh так хорошо справляется со столь необычными запросами? Он объединяет систему TRELLIS от Microsoft, создающую 3D-модели по текстовым и графическим запросам, с большой языковой моделью (LLM) GPT-4, которая поддерживает работу ChatGPT, — иными словами, сочетает визуальные и текстовые знания. «Мы хотели соединить таланты 3D-генераторов и навыки рассуждения LLM в интерактивной среде, чтобы создавать объекты, которые люди действительно хотят», — говорит Фараз Фаруки, ведущий автор статьи о проекте, выпускник факультета электротехники и информатики, недавний сотрудник CSAIL. «Языковые модели сильны в тексте и изображениях, а талант TRELLIS — в создании 3D-моделей, поскольку он видел их очень много».

Сильные стороны InstructMesh пригодились и в других, более неожиданных областях. Учёные MIT использовали программу, чтобы изготовить наколенный бандаж, выглядящий как деним и подходящий к джинсам пациента. InstructMesh способен даже помогать создавать роботов — то есть продуманные корпуса, вмещающие беспроводные компоненты. В качестве демонстрации исследователи сделали «щетинобота», похожего на разноцветную креветку: внутри спрятан мотор, и при включении устройство скользит по поверхностям, отчасти как заводная игрушка.

Фаруки и его коллеги выяснили, что InstructMesh легко создаёт нужные им предметы. Но что подумал бы о программе человек, никогда не занимавшийся 3D-моделированием, и смог бы он действительно распознать дефекты конструкции до изготовления? Чтобы это проверить, команда заставила TRELLIS воссоздать популярные 3D-модели с платформы Thingiverse, где собраны миллионы моделей для 3D-печати. Почти 80 процентов сгенерированных моделей имели те или иные структурные дефекты. Затем исследователи CSAIL предложили новичкам найти и исправить эти проблемы в InstructMesh — и, по оценке эксперта, они справлялись с обеими задачами примерно в 90 процентах случаев. Недостаток опыта новички компенсировали интуицией.

InstructMesh выстраивает опору для самого процесса моделирования, который раньше требовал глубоких знаний инструментов 3D-проектирования. «Поскольку манипуляции происходят в латентном пространстве генеративной модели, InstructMesh поддерживает описание проблем на естественном языке и вносит интерпретируемые изменения в геометрию, которые пользователь может оценить и одобрить», — отмечает Фаруки. Пользователи создавали предметы вроде подставок для телефона и ваз, отмечая, что InstructMesh прост в использовании. Они также обнаружили, что программа позволяет выражать самые разные идеи, а ползунки дают большую точность для отдельных правок, например увеличения или вытягивания конкретной части модели. «Пользователи получали то, что запрашивали, и легко дорабатывали проекты там, где это было нужно, — добавляет Фаруки. — Что они видели, то и получали, и предметы работали так, как заявлено, если можно так выразиться».

Хотя пользователям InstructMesh понравился, у Фаруки есть ещё более масштабное видение проекта. Сейчас он работает в Google, где вскоре может внедрить InstructMesh в платформу дополненной реальности (AR). Идея такова: задать системе запрос, объяснив, что нужно, с учётом окружающей обстановки, а затем быстро напечатать это на 3D-принтере (например, сделать чехол для телефона в тон кошельку). InstructMesh может также начать включать физические симуляции, чтобы моделировать, как проект поведёт себя при конкретном использовании, например разобьётся ли миска при падении и какие материалы подойдут лучше. Программа может интегрировать и более новую версию TRELLIS.2, чтобы дорабатывать ещё более мелкие элементы 3D-моделей. Старшим автором статьи выступила Стефани Мюллер, доцент кафедры электротехники и информатики (EECS) и машиностроения MIT, сотрудница CSAIL. Фаруки и Мюллер написали работу вместе с исследователями Google Ахмедом Катари, Фабианом Манхардтом, Врушанком Пхаднисом, Жофэем Ду и Федерико Томбари. Другими соавторами стали доцент Северо-Восточного университета Меган Хофманн и ряд коллег из CSAIL: Демирджан Тас, аспирант EECS и архитектуры; бывшая приглашённая исследовательница Тереза Градилак; Нин Чжан, аспирант EECS; постдок Цзяцзи Ли; и Мартин Ниссер. Работа частично поддержана Google и Программой совместных исследований MIT-HPI. Результаты будут представлены на симпозиуме ACM по программному обеспечению и технологиям пользовательских интерфейсов в ноябре.