Диффузионная модель — генерация изображений
Модель, которая создаёт изображение, постепенно убирая шум по текстовому описанию. Технология за большинством генераторов картинок и видео.
Также встречается как: diffusion model, генерация изображений
Коротко. Диффузионная модель учится восстанавливать изображение из шума. При генерации она начинает со случайного шума и шаг за шагом «проявляет» картинку, ориентируясь на текстовое описание.
Что важно для продукта
Управляемость. Кроме текста, генерацию направляют другими способами: исходным изображением, маской области, картой глубины или позой. Для прикладных задач это важнее качества модели: точное попадание в макет ценнее красоты.
Скорость и стоимость. Генерация состоит из множества шагов, поэтому она дороже и медленнее текстовой. Существуют ускоренные варианты с меньшим числом шагов.
Права на результат. Вопрос лицензий на обучающие данные и на сгенерированное — открытый и различается по юрисдикциям. Для коммерческого использования условия конкретного сервиса нужно читать.
Где это применимо в бизнесе
Визуализация товара в интерьере, варианты дизайна, карточки для маркетплейсов, превью и иллюстрации, замена фона в фотографиях каталога. Общее у этих задач одно: результат проверяет человек, а ошибка стоит недорого.
Где ошибаются
Ставят генерацию туда, где нужна точность. Схемы, чертежи, тексты на изображении и точные пропорции товара — слабое место технологии.
Не считают стоимость на объём. Каталог из десяти тысяч карточек — совсем другая экономика, чем десять картинок для лендинга.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.