Диффузионная модель

Архитектура генеративного ИИ, которая создает изображения, обучаясь обращать вспять процесс постепенного добавления шума.

Что такое диффузионная модель?

Диффузионная модель — это архитектура генеративного ИИ, создающая изображения за счет обучения обратному процессу зашумления. Во время обучения изображения постепенно разрушаются случайным шумом, а модель учится отменять каждый шаг. При генерации она начинает с чистого шума и шаг за шагом удаляет его, формируя новое изображение под управлением текстовой подсказки, референсной картинки или того и другого.

Диффузионные модели лежат в основе большинства современных генераторов изображений, включая системы переноса одежды, которые используются в виртуальных примерочных на базе фото.

Диффузионная модель удаляет шум, превращая случайные пиксели в готовое изображение
Диффузионная модель удаляет шум, превращая случайные пиксели в готовое изображение

Как это работает

  1. Прямой процесс (обучение): к реальному изображению небольшими шагами добавляется шум, пока не останется только «белый шум».
  2. Обучение обратному процессу: модель учится предсказывать предыдущее, менее зашумленное состояние на каждом шаге.
  3. Генерация: начиная со случайного шума, многократно применяется изученное удаление шума (обычно от 20 до 50 шагов), пока не появится четкое изображение.
  4. Обусловливание (управление): на каждом этапе модель можно направлять с помощью входных данных, таких как фотография одежды, поза человека или маска области для перерисовки.

Роль в виртуальной примерке

Именно обусловливание превращает обычный генератор изображений в движок для примерки: получив фото человека, фото одежды и маску, модель перерисовывает только выделенную область (см. инпеинтинг), сохраняя текстуру ткани, складки и освещение в соответствии с оригинальным фото.

Компромиссом здесь является скорость: генерация занимает несколько секунд и требует вычислений на GPU, поэтому примерочные на базе диффузии выдают статичные изображения, а не накладывают одежду на живое видео.

FAQ

Ответы на вопросы.

Почему диффузионные модели заменили GAN в виртуальных примерочных?

В ранних разработках для примерки использовались генеративно-состязательные сети (GAN), но диффузионные модели оказались более стабильными в обучении, более управляемыми благодаря обусловливанию и лучше воспроизводящими мелкие текстуры. Все это критично при работе с одеждой.

Связанные термины

Инпейтинг изображений
Регенерация замаскированной области изображения без изменения остальных деталей.
Перенос одежды
Процесс использования ИИ для наложения одежды с товарной фотографии на изображение человека.

Посмотрите на своих товарах.

Установите Genlook на Shopify за минуты и позвольте покупателям примерять товары до покупки.