1001Ferramentas
🎨Geradores

Gerador de Prompt Stable Diffusion

Monta prompts estruturados para Stable Diffusion / Midjourney com sujeito, estilo, qualidade, iluminação e câmera. Suporta negative prompt.


  

Engenharia de prompts para Stable Diffusion

O Stable Diffusion é um modelo open-source de difusão texto-para-imagem lançado em agosto de 2022 pela Stability AI em parceria com Robin Rombach, Andreas Blattmann e o grupo CompVis (LMU Munique). Ele combina um autoencoder variacional que comprime imagens em um espaço latente, uma U-Net que faz o denoising desse latente passo a passo e um text encoder (CLIP nas versões 1.x, OpenCLIP em 2.x, T5 no SD3) que transforma o prompt em vetor de condicionamento. Como pesos e código são públicos, surgiu em torno dele um ecossistema de fine-tunes, LoRAs, ControlNets e front-ends que nenhum modelo fechado conseguiu replicar.

Versões principais: o SD 1.5 é o checkpoint legado mais popular, com a maior biblioteca de LoRAs; o SD 2.x migrou para OpenCLIP e 768×768; o SDXL (julho de 2023) introduziu refiner em dois estágios e saída nativa 1024×1024 com anatomia e texto bem melhores; o SD3 (2024) substituiu a U-Net por um Multimodal Diffusion Transformer; e o Flux.1 (Black Forest Labs, agosto de 2024) é o sucessor espiritual feito pelos autores originais do SD, com fotografia mais nítida e renderização de texto confiável.

Estrutura do prompt

Uma fórmula confiável é sujeito + descritores + estilo + qualidade + composição + iluminação + lente + paleta de cores. Exemplo: a small dog wearing a top hat, oil painting, Studio Ghibli style, masterpiece, 4k, ultra detailed, rule of thirds, golden hour lighting, 50mm bokeh, warm pastel palette. Modificadores comuns de qualidade incluem masterpiece, best quality, ultra detailed, 4k, 8k, photorealistic, cinematic, dramatic lighting, by Greg Rutkowski. O negative prompt (low quality, blurry, bad anatomy, deformed, extra fingers, watermark, text) diz ao sampler o que evitar e costuma ser tão impactante quanto o positivo.

Pesos, tokens e samplers

Na sintaxe AUTOMATIC1111, (palavra:1.3) aumenta a atenção naquele token e [palavra] reduz. O SD 1.5 limita 75 tokens por chunk CLIP; prompts maiores são divididos e re-embutidos automaticamente pelo WebUI. O CFG scale (7-12 típico) controla quão estritamente o sampler obedece ao prompt — valores altos demais produzem imagens queimadas e saturadas. O sampler também importa: Euler a é rápido e criativo; DPM++ 2M Karras com 20-30 steps é o padrão moderno para fotografia limpa.

Ecossistema: ControlNet, LoRA, inpainting

Img2Img parte de uma imagem existente com denoising strength 0.3-0.7. ControlNet (fev/2023, Lvmin Zhang) condiciona com esqueletos de pose, mapas de profundidade, bordas Canny ou rabiscos — tornando a composição previsível. LoRA (Low-Rank Adaptation) treina um delta de 10-100 MB que injeta um personagem ou estilo específico com apenas 10-100 imagens de referência. Inpainting edita uma região mascarada preservando o resto. Front-ends: AUTOMATIC1111, ComfyUI (grafo de nós), Forge, InvokeAI e Fooocus. Para hospedar, opções vão de GPU NVIDIA local 8 GB+ até RunPod, Replicate e galerias de prompts como lexica.art.

Perguntas frequentes

Posso usar as saídas do Stable Diffusion comercialmente? Os checkpoints principais (1.5, SDXL base, SD3) são liberados sob licenças open-source permissivas / próximas de CC0 e as imagens geradas são suas, mas confira sempre a licença específica de cada fine-tune, LoRA ou ControlNet que você carregar — alguns impõem cláusulas não-comerciais.

ControlNet vs LoRA — qual a diferença? ControlNet impõe estrutura (pose, profundidade, bordas, segmentação). LoRA impõe estilo ou identidade (um artista, personagem ou figurino específico). Eles se combinam: ControlNet de pose mais LoRA de personagem é a receita padrão para quadros de quadrinhos consistentes.

Que sampler e quantos steps usar? DPM++ 2M Karras com 25 steps e CFG 7 é um padrão sólido para SDXL. Para explorar rápido, caia para Euler a em 15 steps; para renders finais, teste DPM++ 3M SDE Karras em 30-40 steps.

Há preocupação ética com o dataset de treino? Sim — o LAION-5B usado nas versões iniciais raspou obras de artistas sem consentimento explícito, gerando processos (Andersen v. Stability AI). O SD3 introduziu um registro de opt-out para artistas, e o uso para deepfakes continua sendo um problema de política não resolvido que todo operador deve considerar antes de subir em produção.

Ferramentas Relacionadas