Zum Inhalt springen
AI & Machine Learning

ControlNet

Eine neuronale Netzwerkarchitektur, die Diffusionsmodellen räumliche Konditionierung hinzufügt und dadurch eine präzise Kontrolle der generierten Bildstruktur ermöglicht.

ControlNet ermöglicht es, die KI-Bilderzeugung mit strukturellen Referenzen wie Kantenkarten, Tiefenkarten, Posenskeletten oder Segmentierungsmasken zu steuern. Statt die Komposition nur einem Textprompt zu überlassen, nutzt ControlNet ein Konditionierungsbild, das das räumliche Layout festlegt, während der Textprompt Stil und Inhalt steuert. Ein Posenskelett sorgt dafür, dass eine generierte Figur einer bestimmten Körperhaltung entspricht. Eine Tiefenkarte bewahrt die dreidimensionale Anordnung einer Szene. Eine Kantenkarte erhält bestimmte strukturelle Details. Diese Kombination aus struktureller Präzision und generativer Flexibilität ermöglicht professionelle Ergebnisse, die konkrete kompositorische Anforderungen erfüllen, statt zufällige Kompositionen nur aus Text zu erzeugen.