• Stable Cascade é um modelo de geração de imagens a partir de texto, não comercial, recentemente publicado, baseado na arquitetura Würstchen. Ele adota uma abordagem em três etapas e é fácil de treinar e ajustar em hardware de consumo.
  • Stable Cascade, um modelo inovador de síntese de texto para imagem construído na arquitetura Würstchen, utiliza uma abordagem única em três etapas para simplificar o treinamento e o ajuste em hardware de consumo, obtendo resultados de alta qualidade por meio de compressão hierárquica.
  • Stable Cascade estende suas capacidades além da geração texto-imagem padrão ao oferecer variações de imagem, gerações imagem para imagem e scripts de treinamento completos para ControlNet e LoRA, demonstrando sua flexibilidade e versatilidade.

Stable Cascade é um modelo inovador de geração de imagens a partir de texto que atinge saída de alta qualidade em um espaço de imagem compactado graças a uma arquitetura única em três etapas, ao mesmo tempo que reduz os requisitos de hardware. O modelo e os scripts de treinamento associados estão disponíveis na página GitHub da Stability e permitem personalização e experimentação adicionais.

Uma nova era na geração de texto para imagem

Stable Cascade, construído na arquiteturaWürstchen, é um modelo inovador de síntese de texto para imagem publicado como prévia de pesquisa com licença não comercial. Este modelo se caracteriza por uma abordagem única em três etapas, simplificando o processo de treinamento e ajuste em hardware de consumo. A publicação inclui checkpoints, scripts de inferência e scripts de treinamento adicionais paraControlNeteLoRA, todos disponíveis na página GitHub da Stability. Este modelo também pode ser acessado para inferência por meio da biblioteca diffusers. Ao focar em compressão hierárquica de imagens, o Stable Cascade obtém resultados de alta qualidade com um espaço latente altamente compactado, estabelecendo novos referenciais em qualidade e eficiência para geração de texto para imagem.

Leia também:Stability AI melhora a geração de imagens com novo modelo base Stable Diffusion

Leia também:CEO da Stability AI, Emad Mostaque, renuncia para buscar IA descentralizada

Revelação de detalhes técnicos

A arquitetura do Stable Cascade compreende três etapas, cada uma desempenhando um papel crucial na geração de imagens de alta qualidade. A etapa C, a fase do gerador latente, transforma as entradas do usuário em latentes compactos de 24×24. Estes são transmitidos para as etapas A e B, as fases do decodificador latente, que comprimem ainda mais as imagens, de forma semelhante ao papel do VAE no Stable Diffusion, mas com compressão muito maior.

Esse desacoplamento permite treinamento ou ajuste adicional, incluindo ControlNets e LoRAs, apenas na etapa C, reduzindo custos por um fator de 16 em comparação com modelos Stable Diffusion de tamanho similar. A abordagem modular garante treinamento e inferência eficientes, tornando-o um avanço significativo na área.

Além da geração de texto para imagem

O Stable Cascade estende suas capacidades além da geração texto-imagem padrão ao oferecer variações de imagem e gerações imagem para imagem. Ao extrair embeddings de imagem de uma imagem fornecida usando CLIP, o modelo pode gerar múltiplas variações da imagem original. Essa funcionalidade destaca a flexibilidade e versatilidade do modelo. Além disso, a publicação inclui scripts de treinamento e ajuste para ControlNet e LoRA, permitindo que os usuários experimentem mais com a arquitetura. ControlNets específicos para inpainting e outpainting também são fornecidos, enfatizando o potencial do modelo para aplicações criativas e práticas.

Foco comunitário e não comercial

O Stable Cascade está atualmente disponível apenas para uso não comercial. No entanto, a Stability AI oferece outros modelos de imagem para fins comerciais por meio de sua página de assinatura ou plataforma de desenvolvimento. A publicação incentiva o engajamento da comunidade e a experimentação, com todo o código de treinamento e inferência disponível na página GitHub da Stability. A Stability AI convida os usuários a se manterem atualizados sobre seus progressos por meio de plataformas de mídia social como Twitter, Instagram, LinkedIn e sua comunidade Discord.

Essa abordagem promove um ambiente colaborativo, visando avançar o campo da geração de texto para imagem enquanto mantém acessibilidade e inovação.