- Stable Cascade — недавно опубликованная некоммерческая модель генерации изображений по текстовому описанию, основанная на архитектуре Würstchen. Она использует подход из трёх этапов и легко обучается и донастраивается на массовом оборудовании.
- Stable Cascade — инновационная модель синтеза «текст-изображение», построенная на архитектуре Würstchen. Благодаря уникальному трёхэтапному подходу она упрощает обучение и донастройку на массовом оборудовании и достигает высокого качества результатов за счёт иерархического сжатия.
- Stable Cascade расширяет свои возможности за пределы стандартной генерации «текст-изображение»: она поддерживает вариации изображений, генерацию «изображение-изображение» и полные скрипты обучения для ControlNet и LoRA, что подтверждает её гибкость и универсальность.
Stable Cascade — инновационная модель генерации изображений по текстовому описанию, которая благодаря уникальной трёхэтапной архитектуре выдаёт результат высокого качества в сжатом пространстве изображений и при этом снижает требования к оборудованию. Модель и сопутствующие скрипты обучения доступны на странице Stability в GitHub и позволяют проводить дальнейшую настройку и эксперименты.
Новая эра генерации «текст-изображение»
Stable Cascade, построенная на архитектуреWürstchen, — инновационная модель синтеза «текст-изображение», опубликованная в качестве исследовательской превью-версии на некоммерческой лицензии. Её особенность — уникальный трёхэтапный подход, который упрощает процесс обучения и донастройки на массовом оборудовании. В публикацию входят контрольные точки, скрипты инференса, а также дополнительные скрипты обучения дляControlNetиLoRA— всё это доступно на странице Stability в GitHub. Модель также доступна для инференса через библиотеку diffusers. Благодаря иерархическому сжатию изображений Stable Cascade достигает высокого качества результатов при сильно сжатом латентном пространстве, задавая новые ориентиры качества и эффективности для генерации «текст-изображение».
Читайте также:Stability AI улучшает генерацию изображений с помощью новой базовой модели Stable Diffusion
Читайте также:Генеральный директор Stability AI Эмад Мостак уходит в отставку, чтобы заняться децентрализованным ИИ
Технические детали
Архитектура Stable Cascade состоит из трёх этапов, каждый из которых играет ключевую роль в генерации изображений высокого качества. Этап C — фаза латентного генератора — преобразует пользовательский ввод в компактные латентные представления размером 24×24. Они передаются на этапы A и B — фазы латентного декодера, — которые дополнительно сжимают изображения, аналогично роли VAE в Stable Diffusion, но со значительно более высоким сжатием. Такое разделение позволяет обучать или донастраивать — в том числе ControlNets и LoRA — только на этапе C, снижая затраты в 16 раз по сравнению с моделями Stable Diffusion аналогичного размера.
Модульный подход обеспечивает эффективное обучение и инференс, что делает модель значительным шагом вперёд в этой области.
За пределами генерации «текст-изображение»
Stable Cascade расширяет свои возможности за пределы стандартной генерации «текст-изображение», предлагая вариации изображений и генерацию «изображение-изображение». Извлекая эмбеддинги изображения из заданного изображения с помощью CLIP, модель может генерировать несколько вариаций исходного изображения. Эта функция демонстрирует гибкость и универсальность модели. Кроме того, в публикацию включены скрипты обучения и донастройки для ControlNet и LoRA, что позволяет пользователям проводить дальнейшие эксперименты с архитектурой.
Также предоставляются специальные ControlNets для инпейнтинга и аутпейнтинга, что подчёркивает потенциал модели для творческих и практических применений.
Сообщество и некоммерческое использование
Сейчас Stable Cascade доступна только для некоммерческого использования. Однако Stability AI предлагает другие модели изображений для коммерческих целей через страницу членства или платформу разработчика. Публикация поощряет вовлечение сообщества и эксперименты: весь код обучения и инференса доступен на странице Stability в GitHub. Stability AI приглашает пользователей следить за новостями в социальных сетях — Twitter, Instagram, LinkedIn — и в сообществе Discord. Такой подход формирует среду сотрудничества, которая помогает развивать область генерации «текст-изображение», сохраняя доступность и инновационность.

