Генерация 3D из текста перестала быть демо-фокусом где-то между 2024 и 2026 годом. Сейчас почти любой человек без существенного опыта в Blender может написать «деревянный сундук с металлическими уголками» и через минуту получить файл, который откроется в Unity или в любом другом приложении. То есть тут вопрос уже не о том, можно ли сделать, а о том, какое будет качество, как правильно сгенерировать модель и что делать с ней дальше.
Есть два типа источника: фото и текст. Из одного снимка нейросеть способна построить геометрию лучше, чем из текста, если ракурс и освещение позволяют восстановить глубину. Текст выигрывает в контроле над деталями, по типу материалов, пропорций, вещей которые необычны для данного объекта. На практике оба подхода дают модель, которую иногда приходится дорабатывать руками, если хочется красивый результат.
В этой статье мы разберем, как устроен пайплайн генерации от промпта или снимка до экспорта, какие сервисы закрывают отдельные этапы и где результат все еще требует вмешательства человека.
Трехмерные модели — весьма узкое место в игровой разработке, AR, электронной коммерции и 3D-печати. Художник тратит от нескольких часов до нескольких дней на создание и рендер одной модели. А нейросети же обещают сократить это до несколько минут. Какая-то часть обещаний может и будет выполнена, но часть, безусловно, маркетинг.
Беда даже не в том, что инструментов нет. Они как раз-то и есть, но, увы, выполняют разные задачи и выдают разный по пригодности результат. Одни делают ставку на скорость и стилизацию, другие на топологию и экспорт в различные форматы, а кто-то — на интеграцию с движками.
Через наш сервис BotHub вы можете выбрать любую модель ИИ и работать с ними на любые темы — без VPN и с оплатой российскими картами.
Как текст и фото превращаются в геометрию?
Давайте попробуем разобраться в механике генерации. Нейросеть восстанавливает трехмерную структуру из данных, которые сама же и интерпретирует, а не рисует модель полностью.
Диффузионные модели и NeRF
Самое понятное — это генеративные диффузионные модели, на подобие нейросетей для изображений, только для прямой работы с 3D (воксели, SDF-поля или прочее). Модель учится размывать и восстанавливать геометрию, только в объеме. Так работают Meshy, Tripo и прочие генераторы.
Tripo P2.0, например, на Gamescom 2026 показал генерацию нативных quad-мешей — то есть сразу пригодной для редактирования топологии, а не хаотичного набора треугольников.

NeRF и его вариации, включая 3D Gaussian Splatting, — это реконструкция изображения, то есть на подаются фотографии объекта с разных ракурсов; алгоритм вычисляет положение точек в пространстве и строит трёхмерную модель.

3D Gaussian Splatting представляет объект как облако трёхмерных гауссовых распределений — эллипсоидов с параметрами положения, масштаба, поворота, прозрачности и цвета. При рендеринге они проецируются на экран и смешиваются, давая изображение. Это быстрее NeRF и лучше работает с деталями, но требует тех же качественных исходников. Если говорить проще, то нужна качественная съемка, с равномерным освещением, четкими границами. Для товаров и сканирования реальных объектов подходит отлично, но если ваш запрос абстрактный — увы, нет.
Почему из текста — форма, а из фото — глубина
Текстовая генерация идет от абстракции к конкретике. Модель знает, что условный «сундук» — это ящик с крышкой, а «металлические уголки» — это накладки-наклепки на ребрах. Она собирает приблизительную форму из выученных паттернов. Но она не знает, какой именно сундук вы имеете в виду. Пропорции, толщина досок, форма замка — всё это будет усреднённым по датасету.
С фото всё наоборот — если снимок позволяет восстановить глубину, нейросеть получает реальную геометрию конкретного объекта. Тут не нужно угадывать — данные уже есть. Но увы, есть беда, в том, что фото даёт только то, что видно. Задняя стенка, внутренние полости, детали под другим углом — всё это домысливается по симметрии или просто остаётся дырой. Мультиракурсная съёмка (Tripo и другие сервисы поддерживают ввод с фронта, тыла и боков) частично решает проблему, но всё равно не даёт полной картины.
Форматы экспорта
Тут всё проще, чем кажется, ибо формат выбирается по конечной точке маршрута.

GLB — бинарный glTF, один файл, внутри меш, текстуры, материалы. Стандарт для веба, Three.js, онлайн-превью, Android AR. Если не знаете, куда пойдёт модель, берите GLB: откроется почти везде, весит мало, грузится быстро.
FBX — формат Autodesk для обмена между Maya, Blender, Unity, Unreal. Единственный из списка, который нормально тащит скелетную анимацию и риггинг. Если модель — персонаж или объект с анимацией, альтернатив нет.
OBJ — старый текстовый формат. Тащит только геометрию и UV. Ни PBR-материалов, ни анимации. Зато открывается буквально всем, что моложе 30 лет. Для быстрой передачи статичного меша или зачистки в Blender — нормально.
USDZ — формат Apple для AR Quick Look. Один файл-архив, работает в Safari, Messages, Vision Pro без установки приложений. Для iOS-AR альтернатив нет, но за пределами экосистемы Apple практически бесполезен.
PBR-материалы: почему без карт модель мертва
PBR — это когда поверхность взаимодействует со светом по формулам. Поэтому без roughness и metallic модель выглядит как пластилиновая болванка, сколько бы полигонов в неё ни залили.
Normal map хранит микрорельеф, но полигон плоский, свет спотыкается о царапины и поры, которых геометрически нет. Миллионы полигонов для этого не нужны. Roughness же задаёт резкость отражения. Ноль — зеркало, единица — матовый камень. Без этой карты все поверхности одинаково глянцево-пластиковые. Параметр Metallic делит материалы на металлы и диэлектрики. У металла отражение окрашено в цвет основы, у диэлектрика остаётся белым. Не задать карту — и металлические части станут крашеным пластиком.
Сервисы: кто что делает
Инструментов развелось много, но пайплайны у них похожие друг на друга, даёшь запрос — получаешь меш с текстурами. Многое зависит от того, что именно вы получаете на выходе и сколько времени тратите на доводку.
Meshy

Meshy эволюционировал из генератора картинок в полноценный конвейер. Начиная с шестой версии они сделали ставку на геометрию: более гладкие органические формы, чистые рёбра на твёрдых поверхностях. Появился Low Poly режим для игр, который сразу даёт оптимизированный wireframe без ручной ретопологии.
Отдельная история — автоматический риггинг, то бишь загружаешь персонажа, через полминуты получаешь скелет, а еще можешь накинуть из библиотеки в 600+ анимаций (ходьба, бег, атаки, idle) и выгрузить в FBX или GLB. Если нужен персонаж «под ключ» для прототипа или инди-проекта — это самый прямой путь. Если нужна одна пропс-модель для сцены, весь этот комбайн избыточен.

Tripo AI

Tripo агрессивно стартовал, но к P2.0 подтянул качество топологии.

Ключевая фишка — нативные quad-меши. То есть, представьте себе, после генерации не нужно гнать модель в Blender на ретопологию: сетка уже разбита на четырёхугольники с правильным flow, пригодная для риггинга и анимации. Smart Mesh режим выдаёт от 500 до 50,000 треугольников, HD Model — до 2 миллионов для рендера или печати. Мультиракурсный ввод до 10 углов — если есть возможность сделать несколько снимков объекта, геометрия получится заметно точнее. Для мультяшных персонажей и стилизованных пропсов Tripo часто даёт лучший результат, чем более «серьёзные» инструменты.
Rodin (Hyper3D)

Rodin изначально целился в твёрдые поверхности — оружие, технику, механизмы. В Gen-2.5 заявляется нативный 3D с PBR-текстурами, генерация до 10 миллионов полигонов, адаптивные режимы от 4 секунд (черновик) до 80 секунд (максимальная деталь).

Промпты для твёрдых поверхностей у них отработаны: «болтовые соединения, сколы краски, масляные пятна» — и модель получает эти детали не только в текстуре, но и в геометрии. Для мотоциклов, винтовок, промышленного оборудования, sci-fi пропсов Rodin остаётся одним из немногих, кто не превращает металл в пластилин.
Sloyd
Sloyd — стартап из Норвегии, и он пошёл другим путём.

Вместо чисто генеративного подхода у них есть Parametric AI — библиотека шаблонов с редактируемыми параметрами. Выбираешь базовую форму (здание, мебель, оружие), крутишь ползунки, меняешь пропорции и материалы. Топология при этом остаётся чистой и предсказуемой, строится по шаблону. Для архитектуры, интерьеров, конфигураторов товаров это работает точнее, чем «нарисуй мне стул». Генеративный режим тоже есть — Image-to-3D с контролем полигонажа и разрешения текстур.

Autodesk Wonder 3D

Autodesk подошёл к задаче со стороны профессионального пайплайна. Wonder 3D ориентирован на экспорт в OBJ с сохранением редактируемой геометрии, то бишь меш, с которым можно работать в Maya или 3ds Max. Для студий, где модель уходит в существующий конвейер, это может быть вполне полезно. Пока продукт в раннем доступе.

Кстати, часть Autodesk Flow Studio.
Промпты и фото: что реально влияет на результат
Предлагаю перейти непосредственно к практике, и изучить, как строить промпты так, чтобы результат понравился вам.
Структура промпта
Промпты для 3D-генераторов работают иначе, нежели для картинки. Если в условном Nano Banana можно написать абстрактное «киберпанк-город, неон, дождь», и получить что-то, то здесь атмосфера не поможет. Модель должна понимать, что именно строить, и именно поэтому структура такая: сначала объект, потом материал, потом масштаб, потом стиль, и только в конце детали. Прилагательные в этом списке весят больше существительных, потому что существительное задаёт класс объекта, а прилагательное — его конкретную форму. «Меч» даст усреднённый клинок из датасета. «Полуторный меч из дамасской стали с кожаной оплёткой рукояти, следы заточки на лезвии, гарда из тёмной стали» — уже конкретная вещь, которую можно узнать.
Порядок слов тоже имеет значение. Meshy и Tripo лучше понимают промпты, где объект стоит в начале, а модификаторы идут после. Если написать «с деревянными уголками сундук», модель может запутаться в том, что здесь главное. Поэтому сначала «сундук», потом «деревянный, с металлическими уголками, потемневшая древесина, кованые накладки». Длина промпта — вопрос компромисса. Слишком короткий даёт обобщённую форму, слишком длинный размывает приоритеты, и модель начинает цепляться за второстепенные детали. Оптимально — от пятнадцати до сорока слов.
Фото: требования к ракурсу, фону и освещению
Фото даёт геометрию точнее текста, когда снимок позволяет восстановить глубину. Для этого нужен ракурс, на котором видны все три плоскости объекта. Снимок строго спереди даст плоскую маску без объёма. Снимок под углом в три четверти — уже рабочий вариант. Фон должен быть однородным и контрастным по отношению к объекту, иначе алгоритм цепляется за текстуру стола или стены и тащит её в модель. Освещение — равномерное, без жёстких бликов и глубоких теней, потому что блик воспринимается как часть геометрии, а тень — как впадина.
А еще стоит учесть ракурс и постановку. Один снимок даёт только то, что видно, но нам же нужна также задняя стенка, внутренние полости, детали с обратной стороны — всё это домысливается по симметрии или остаётся дырой. Мультиракурсный ввод решает проблему частично. Tripo принимает до десяти углов, и на практике хватает четырёх-шести: фронт, тыл, два бока, верх и низ. Если объект симметричный, можно обойтись тремя. Главное — снимать с одинакового расстояния и при одинаковом свете, иначе алгоритм не сможет сопоставить ракурсы между собой и геометрия поедет.
Если вы видите размытые текстуры, то скорее всего это следствие низкого разрешения исходника или агрессивного сжатия. Если на фото текстура смазана, в модели она тоже будет смазанной. Дыры в мешах появляются на стыках между ракурсами и в местах, где объект перекрывает сам себя. Автоматически они не заделываются, нужен Blender и инструмент вроде Fill Holes. Лишние полигоны — обратная сторона высокой детализации: модель на десять миллионов треугольников не загрузится в мобильное приложение и не распечатается на бытовом 3D-принтере без предварительного упрощения. Всё это чистится руками, и на это уходит времени больше, чем на саму генерацию.
Постобработка
А вот без постобработки вряд ли вы сможете воспользоваться моделью сразу, если у вас есть специальные требования.
Ретопология в Blender
Автоматическая топология годится, увы, не всегда. Генераторы выдают треугольную сетку, которая нормально для рендера, но для анимации — так себе. Персонаж с треугольной топологией при деформации скелетом мнётся и рвётся в местах сгибов. Поэтому после генерации модель гонят в Blender и делают ретопологию: либо вручную, либо через аддоны вроде Quad Remesher, либо через встроенный Remesh с настройкой Quad. Tripo P2.0 и Meshy 6 уже отдают quad-меши, и для них этот этап можно пропустить.
UV-развертка и запекание текстур
UV-развертка после генерации часто кривая: швы проходят через видимые части модели, масштаб текстурных островков неравномерный, на стыках видны разрывы. Blender с аддоном UV Packmaster или встроенным Smart UV Project решает это за пару минут. Запекание текстур нужно, когда вы меняете геометрию после генерации: ретопология сдвигает вершины, и старые текстуры перестают совпадать с новой сеткой. Тогда старые материалы запекаются на новую развертку через Cycles или Bake Wrangler.
Оптимизация под игровые движки
LOD — уровни детализации. Для игр модель нужна в нескольких версиях: высокополигональная для крупного плана, среднеполигональная для обычного рендера, низкополигональная для дальнего плана. Генераторы выдают одну версию, чаще всего слишком тяжёлую, так что полигонаж режется через Decimate в Blender (но с осторожностью, если резать агрессивно, геометрия ломается и появляются артефакты на рёбрах). Атласы текстур собираются, когда нужно уменьшить количество draw calls в движке.
Подготовка к 3D-печати
Перед печатью модель проверяется на non-manifold — это рёбра, которые соединены с более чем двумя полигонами, и дыры, через которые видно внутреннюю полость. В Blender это делается через Select Non-Manifold в режиме редактирования. Толщина стенок должна быть не меньше одного миллиметра для FDM-печати и полмиллиметра для SLA, иначе модель развалится при снятии со стола. Масштаб задаётся в миллиметрах, иначе при экспорте в STL модель уедет в слайсер с неправильными размерами. Всё это проверяется до генерации G-кода.
Привет. Понял задачу. Пишу оставшиеся блоки в твоём стиле: разговорная подача, пояснения на пальцах, заголовки через markdown, без «не X, а Y», без рубленых предложений, без повторения одних и тех же мыслей. Про лицензии, датасеты и стоимость пишу конкретно, с фактами, которые можно проверить.
Где нейросети стабильно проваливаются
Не так все идеально, как кажется на первый взгляд. Помимо требованиям к качеству промпта или фото и постобработки, стоит понимать, что, например, архитектурные сцены генераторы до сих пор собирают плохо. Отдельное здание или мост получается нормально, а вот целый квартал с несколькими корпусами, переходами и двором — уже каша. Модель не понимает планировку, стыки между корпусами и общую композицию, поэтому на выходе появляется набор несвязанных геометрических блоков, которые потом приходится выравнивать вручную. Еще сложные механизмы с подвижными частями тоже провал. Шестерёнки, поршни, шарниры генератор изобразит похоже, но не факт, что они будут совпадать по зубьям и осям, а еще не факт что они будут выглядеть как реально работающие механизмы, а не просто стимпанк-монстр. Для реального механизма всё равно нужен CAD и инженер, а нейросеть годится только для визуальной болванки.
Персонажи с риггом — отдельная боль. Meshy риггит автоматически, Tripo тоже заявляет поддержку, но качество скелета зависит от позы. Если персонаж в T-позе, всё нормально. Если в динамичной позе, веса распределяются криво, и при анимации колено выворачивается наружу. Для серьёзного проекта скелет всё равно переделывают в Blender или Maya, а генератор используют только для меша.
Лицензии
Тут нужно смотреть на каждый сервис отдельно, потому что условия различаются. Meshy даёт коммерческую лицензию на платных тарифах, а на бесплатном модели идут под CC BY 4.0 с указанием авторства. Tripo на бесплатном тарифе разрешает коммерческое использование, но с ограничением по количеству генераций в месяц. Rodin даёт полные права на платных планах, а на бесплатном модели под CC BY-NC, то есть только для некоммерческих проектов. Sloyd разрешает коммерческое использование на всех тарифах, включая бесплатный, но с лимитом по количеству экспортов.
Autodesk Wonder 3D пока в раннем доступе, и условия лицензии там ещё формируются, но я думаю что такая компания как Autodesk постоит за свои права.
Если проект коммерческий, читайте лицензию перед генерацией, ибо тут ситуация с правами нейроконтента обстоит дело по другому, нежели с другими.
Практические сценарии
Тут все просто, использовать можно много где, но стоит учесть что много будет работы после, и есть ограничения в некоторых сферах, где без нормальных моделей или проверки не обойтись. Конечно, сценариев множество, но тут расположены самые популярные.
Инди-разработка
Для инди-команды из двух-трёх человек генератор закрывает пропсы, окружение и черновых персонажей. Сундуки, бочки, ящики, фонари, деревья, да хоть камни — всё это генерируется за минуты и не требует художника на старте. Meshy с автоматическим риггингом и библиотекой анимаций позволяет быстро собрать прототип персонажа, проверить геймплей и уже потом заказать нормальную модель у художника. Tripo с quad-мешами даёт топологию, которую можно сразу анимировать без ретопологии.
Конечно, не стоит уходить совсем в ИИ-контент, но это поможет вам протестировать идею и стиль заранее.
Электронная коммерция
3D-превью товаров из фото — это то, где фото-подход даёт максимальную точность. Магазин получает несколько снимков товара с разных ракурсов, загружает их в Tripo или Rodin, получает модель с PBR-текстурами и встраивает её в карточку через GLB и Three.js. Покупатель крутит товар на сайте, смотрит со всех сторон, примеряет в AR.
Для простых предметов работает, но вот для одежды вряд-ли, потому что ткань мнётся и модель не передаёт драпировку. Стоимость такой генерации ниже, чем заказ 3D-модели у студии, а срок — минуты вместо дней.
3D-печать
Для печати генератор годится, если модель декоративная: статуэтка, ваза, брелок, элемент или деталь, с понятным чертежом. Технические запчасти лучше не генерировать, ибо нейросеть не всегда может соблюдать четкие требования. Перед печатью модель обязательно проверяется на non-manifold и толщину стенок, потому что генераторы часто выдают тонкие перемычки, которые часто ломаются. Масштаб задаётся в миллиметрах до экспорта в STL, иначе слайсер получит модель не того размера. Для FDM минимальная толщина стенки — один миллиметр, для SLA — полмиллиметра.
AR/VR
Для AR и VR генератор закрывает быстрые ассеты: предметы интерьера, инструменты, еда, декор. Формат GLB или USDZ в зависимости от платформы. Главное ограничение — полигонаж. Модель на миллион треугольников не потянет мобильный AR, поэтому после генерации её режут через Decimate до 50-100 тысяч. Текстуры сжимаются до 2K, чтобы не грузить память устройства. Для сцен в VR, где нужно много объектов, генератор экономит дни работы, но каждый объект всё равно проходит через оптимизацию.
Заключение
Если вы делаете прототипы, или вам нужны декоративные модели или 3D-превью, простые объекты и вся прочая — нейросети могут помочь. А если у вас есть уже существующий пайплайн или строгие требования, то это может создать вам проблем.
А воспользоваться нейросетями можете на нашем сервисе BotHub, который имеет как и приятный интерфейс чат-бота, так и OpenAI-совместимый API. Без VPN и с оплатой через российские банковские карты.
А на ближайшие года, скорее всего, риггинг станет точнее, и автоматические скелеты будут пригодны для анимации без ручной правки. Генерация сцен выйдет за пределы одного объекта: уже сейчас есть эксперименты с генерацией интерьеров и небольших локаций целиком. Анимация тоже подтянется: Meshy и Tripo уже дают библиотеки движений, а в следующем году можно ожидать генерацию анимации по текстовому описанию. Архитектура и механизмы останутся слабым местом дольше, ибо тут уже нужна точность и проработанность.
TheRaven
Нейронка, скажи своему митпрокси чтобы аккуратнее в хабр копипастил.
fire64
Omg...
Читал по диагонали, не заметил в статье этот абзац))
Особо эпично это на фоне предыдущей статьи автора:
Как проверить текст на следы ИИ: маркеры и артефакты, которые выдают нейрослоп