GLM-Image-Modellgewichte sind auf Hugging Face verfügbar. Herunterladen

Was ist GLM-Image? Das Open-Source-Modell, das bilingualen Text rendert

Sep 5, 2026

GLM-Image ist ein Open-Source-Bildgenerierungsmodell, das von Z.ai entwickelt und unter der MIT-Lizenz veröffentlicht wurde und rund 16 Milliarden Parameter umfasst. Was es auszeichnet, ist eine konkrete, messbare Stärke: Es rendert lesbaren Text in Bildern sowohl auf Chinesisch als auch auf Englisch und erzielt 91,16 % auf dem CVTG-2K-Benchmark für chinesisches Text-Rendering. Es unterstützt sowohl Text-zu-Bild- als auch Bild-zu-Bild-Generierung.

Diese Kombination – öffentliche Gewichte, eine permissive Lizenz und zweisprachiger Text, der die Generierung übersteht – ist ungewöhnlich, und genau deshalb taucht GLM-Image immer wieder in Gesprächen auf, die früher von geschlossenen, nur im Abo verfügbaren Tools dominiert wurden. Dieser Leitfaden erklärt, was GLM-Image ist, wie seine hybride Architektur in einfachen Worten funktioniert, für wen es am besten geeignet ist und wo es ehrlich gesagt Schwächen hat.

<!--IMG: A bilingual café storefront sign generated by GLM-Image, showing crisp Chinese and English text side by side-->

Was ist GLM-Image genau?

Was ist GLM-Image genau?

GLM-Image ist das Bildgenerierungsmodell von Z.ai, veröffentlicht als Open Weights auf Hugging Face unter der Organisation zai-org. „Open Weights unter MIT“ hat eine präzise Bedeutung: Sie können das Modell herunterladen, auf eigener Hardware betreiben, es anpassen, in ein Produkt integrieren und die Ausgaben kommerziell nutzen — ohne um Erlaubnis zu fragen oder eine Lizenz auszuhandeln. Das ist ein anderes Angebot als „kostenlos ausprobieren“, und genau deshalb richten Entwickler und kleine Studios ihre Aufmerksamkeit auf diese Modellfamilie.

Die rund 16 Milliarden Parameter machen zwei praktische Dinge deutlich. Erstens ist das Modell groß genug, um komplexe Szenen zu planen und Text im Bild als Sprache zu behandeln statt als Textur — genau dort, wo kleinere Generatoren beginnen, Wörter zu verstümmeln. Zweitens ist es so anspruchsvoll, dass Self-Hosting realistisch eine GPU mit rund 12 GB VRAM voraussetzt. Auf Consumer-Hardware ist GLM-Image ein „möglich, aber planen Sie dafür“-Vorhaben, kein Laptop-Nebenbei.

Die meisten Menschen werden die Weights allerdings nie anfassen. Auf glmimage.app ist GLM-Image die Engine hinter dem gehosteten Generator: Sie beschreiben ein Bild, das Modell erzeugt es, und lokale Hardware kommt nicht ins Spiel. Alles in diesem Artikel gilt für das Modell, unabhängig davon, ob Sie ihm über die Website oder über Ihren eigenen Inference-Stack begegnen.

Wie funktioniert GLMImage?

Wie funktioniert GLMImage?

GLMImage ist architektonisch hybrid, und das hybride Design ist die ganze Geschichte. Ein nützliches mentales Modell ist ein Planer und ein Maler, die eine Leinwand teilen.

Die Planungsphase ist autoregressiv. Wie ein Sprachmodell liest es deinen Prompt Token für Token und entscheidet, was das Bild enthalten soll: die Subjekte, die Anordnung und — kritisch — was jeder Text im Bild sagen soll. Da der Text zuerst als Sprache geplant wird, wird ein Satz wie "精品咖啡" als tatsächliche Zeichen festgelegt, bevor ein einziger Pixel gezeichnet wird.

Die Malphase ist ein Diffusions-Decoder. Er nimmt den Plan und rendert ihn in Pixel mit feinen Details, realistischer Textur und kontrolliertem Licht. Ein dedizierter Glyph Encoder behandelt Zeichensätze speziell, weshalb Striche als echte Buchstaben und echte Hanzi erscheinen statt dekorativer Kritzeleien, die nur das Schreiben andeuten.

Warum ist das wichtig? Reine Diffusions-Pipelines generieren Wörter auf die gleiche Weise wie Wolken — als visuelle Textur in einer Region. Das funktioniert für ein zweibuchstabiges Logo und bricht für alles Längere zusammen, insbesondere für Chinesisch, wo ein einziger falscher Strich die Bedeutung verändert. Das Aufteilen der Aufgabe — entscheide den Text als Sprache, dann zeichne ihn als Glyphen — ist es, was GLMImage ermöglicht, ein lesbares Schild in einer lesbaren Szene zu platzieren. Die Analogie ist eine Vereinfachung einer tiefen technischen Pipeline, aber sie prognostiziert das Verhalten des Modells gut: stark, wo die Planung zählt, zuverlässig bei Text, den andere Modelle verderben.

Warum ist die Darstellung bilingualer Texte so wichtig?

Warum ist die Darstellung bilingualer Texte so wichtig?

Chinesische Schriftzeichen sind gnadenlos. Jeder Hanzi ist eine dichte Struktur aus Strichen, und kleine Fehler machen den Text nicht schlampig — sie machen ihn falsch. Die meisten Bildgeneratoren bewältigen kurze englische Wörter akzeptabel, geraten bei längeren Phrasen ins Trudeln und lösen Chinesisch in überzeugend aussehenden Unsinn auf. Wer versucht hat, ein bilinguales Menü, eine Verpackungsmockup oder ein Konferenzbanner mit einem generischen Generator zu produzieren, kennt den Workflow: Generiere die Kunst, dann setze jeden einzelnen Text in einem Design-Tool neu.

GLM-Image's 91,16% Score auf CVTG-2K — einem chinesischen Benchmark für die visuelle Texterzeugung — ist die eine harte Zahl, auf die man sich stützen kann, weil es ein veröffentlichtes Benchmark-Ergebnis ist und nicht nur so ein Gefühl. Lies es richtig: Etwa neun von zehn chinesischen Text-Rendern sind korrekt, was kurze Phrasen, Titel und Beschilderung zuverlässig macht auf eine Weise, die selten ist. Es ist keine Erlaubnis, Absätze von Fließtext in einem Bild zu setzen; langer Text ist heute bei jedem Modell riskant, und dichter Text gehört sowieso in ein Layout-Tool.

Die Superkraft liegt speziell im Pairing: Chinesisch und Englisch sauber in demselben Bild, in einem einzigen Generierungsdurchlauf. Das deckt bilinguale Poster, Produktetiketten für den grenzüberschreitenden E-Commerce, Event-Beschilderung, App-Store-Screenshots für zwei Märkte, Lehrmaterialien und überall dort ab, wo ein einzelnes Asset beide Sprachen sprechen muss.

<!--IMG: Comparison of a generated product poster with clean bilingual labeling versus typical garbled text output-->

Was kann GLM-Image?

GLM-Image unterstützt zwei Generierungsmodi – und professionelle Workflows nutzen beide.

Text-zu-Bild ist der bekannte Weg: Sie schreiben einen Prompt, das Modell erzeugt ein Bild von Grund auf. Hier entwickeln Sie Ideen, geben den Look vor und erstellen erste Entwürfe.

Bild-zu-Bild startet von einem Referenzbild plus Prompt. Das Modell behält, was die Referenz bereits richtig gemacht hat – Komposition, Motiv, Gesamtstruktur – und ändert, was Sie ändern möchten: den Hintergrund, den Stil, das Licht, die Jahreszeit. Der praktische Ablauf sieht so aus: ein Basisbild per Text-zu-Bild erzeugen, den besten Kandidaten behalten und ihn dann über Bild-zu-Bild-Durchgänge verfeinern, statt von vorne neu zu generieren und zu verlieren, was bereits funktioniert hat.

Weil das Modell von Haus aus zweisprachig ist, können Sie auf Englisch, auf Chinesisch oder gemischt prompten – etwa wenn das Ergebnis selbst zweisprachig sein soll. Speziell bei Text im Bild gelten dieselben Faustregeln wie bei jedem Generator – den Schriftzug kurz halten, angeben, wo er sitzen soll, und die gewünschte Typografie beschreiben –, nur dass sie hier deutlich häufiger zum Erfolg führen.

Für wen ist GLM-Image?

Marketer und E-Commerce-Teams, die chinesisch-englische Assets produzieren. Ein einziger Generierungslauf statt erst generieren und dann neu setzen ist eine echte Produktionsersparnis, wenn das auf Dutzende SKUs oder Kampagnen zutrifft.

Entwickler und kleine Unternehmen, die Generierung in ihrem eigenen Stack wollen. Die MIT-Lizenz erlaubt Self-Hosting für ein kommerzielles Produkt, und rund 12 GB VRAM sind für eine Workstation-Grafikkarte ein erreichbares Ziel.

Designer, die schnell konzipieren wollen – mit brauchbarer Platzhalter-Typografie. Ein Mockup, dessen Headline bereits ungefähr im richtigen Stil gesetzt ist, ist ein besserer Gesprächseinstieg als eine Box voller lorem-ipsum-förmiger Kritzeleien.

Solo-Creator und kleine Teams, die aufs Budget achten. Der gehostete Zugang beginnt mit begrenzten kostenlosen täglichen Generierungen, und bezahlte Pläne liegen bei 9,90 $/Monat für 500 Credits (etwa 50 Bilder) bis 79,90 $/Monat für 6.000 Credits (etwa 600 Bilder).

Lehrende und Verlage, die beschriftete Diagramme und Illustrationen brauchen, bei denen kurze Beschriftungen im Bild tatsächlich lesbar sein müssen – ein enger Verwandter des Problems zweisprachiger Beschilderung. Der Generator für wissenschaftliche Illustrationen ist genau auf diese Aufgabe zugeschnitten.

Wo hat GLM-Image Schwächen?

Ein ehrliches Datenblatt führt auch die Schwächen auf:

  • Fotorealistische Porträts sind nicht seine Spezialität. GLM-Image kann Personen erzeugen, aber wenn Sie fotorealistische Headshots in großer Stückzahl brauchen, die von echter Fotografie nicht zu unterscheiden sind, sollten Sie es vor einer Entscheidung gegen die Alternativen testen. Seine Stärke liegt in Text- und Layout-Intelligenz, nicht im Porträt-Realismus.
  • Langer Text im Bild bleibt riskant. Der Benchmark deckt den Bereich von Phrasen und Beschilderung ab. Fließtext in Absatzlänge innerhalb eines Bildes ist bei jedem aktuellen Modell – diesem eingeschlossen – eine Aufgabe für Layout-Tools.
  • Self-Hosting verlangt echte Hardware und etwas Vertrautheit mit Python. Rund 12 GB VRAM, eine funktionierende CUDA-Umgebung und die Bereitschaft, eine Inferenzumgebung zu pflegen. Es ist keine One-Click-Installation und nicht CPU-freundlich.
  • Geschwindigkeit bei hoher Auflösung ist nicht seine Glanznummer. Die hybride Pipeline leistet mehr Planungsarbeit pro Bild; rechnen Sie auf Consumer-GPUs eher mit Geduld als mit sofortigen Ergebnissen, und planen Sie Batch-Jobs entsprechend.
  • Das Ökosystem ist jung. Tooling, LoRAs und Community-Workflows sind spärlicher als bei älteren Open-Modellen wie Stable Diffusion.

Nichts davon ist ein Ausschlusskriterium; es sind Grenzen des Einsatzbereichs. Innerhalb dieser Grenzen ist das Modell bemerkenswert zuverlässig.

Wie kannst du GLM-Image ausprobieren?

Am schnellsten geht es über die gehostete Version: Öffne den Bildgenerator und gib einen Prompt ein. Es ist keine Einrichtung nötig, und täglich steht eine begrenzte Anzahl kostenloser Generierungen zur Verfügung. Die kostenpflichtigen Tarife sind Credit-basiert: Basic für 9,90 $/Monat umfasst 500 Credits (etwa 50 Bilder), Pro für 29,90 $ umfasst 2.000 (etwa 200) und Max für 79,90 $ umfasst 6.000 (etwa 600); eine Generierung kostet rund 10 Credits. Die aktuellen Details findest du auf der Preisseite, und unser Artikel Preise erklärt führt dich durch die Credit-Berechnung.

Wenn du tiefer einsteigen möchtest, gibt es zwei nächste Schritte: Der Leitfaden zum Prompt-Schreiben erklärt, wie du Bilder so beschreibst, dass das Modell etwas Konkretes zum Umsetzen hat, und der GLMImage-Walkthrough deckt den gesamten gehosteten Workflow ab. Wenn du das Modell selbst betreiben möchtest, ist die GLM-Image-Modellkarte auf Hugging Face die maßgebliche Quelle für Download und Anforderungen.

Häufig gestellte Fragen

Ist GLM-Image kostenlos nutzbar?
Zwei Fragen in einer. Die Gewichte sind unter der MIT-Lizenz kostenlos, für den Eigenbetrieb benötigen Sie jedoch geeignete GPU-Hardware. Der gehostete Dienst auf glmimage.app bietet eine begrenzte Anzahl kostenloser Generierungen pro Tag, kostenpflichtige Pläne beginnen bei 9,90 $/Monat.

Was erlaubt die MIT-Lizenz konkret?
Kommerzielle Nutzung, Modifikation und Weiterverbreitung des Modells und seiner Ausgaben, mit den üblichen Pflichten zur Namensnennung und zur Weitergabe der Lizenz. In der Praxis: Sie können ein Produkt auf selbst gehostetem GLM-Image aufbauen, ohne eine separate kommerzielle Vereinbarung.

Kann GLM-Image vorhandene Bilder bearbeiten oder nur neue erzeugen?
Beides. Text-to-Image erzeugt aus einem Prompt; Image-to-Image nimmt ein Referenzbild plus Prompt und zeichnet es mit den gewünschten Änderungen neu, wobei die Komposition erhalten bleibt.

Wie genau ist der chinesische Text wirklich?
91,16 % im CVTG-2K-Benchmark für chinesisches Text-Rendering — das stärkste veröffentlichte Ergebnis, das wir als verifiziert betrachten. In der Praxis werden kurze Phrasen und Beschilderungen zuverlässig dargestellt; halten Sie den Text im Bild kurz und geben Sie Platzierung und Typografie an, um die besten Ergebnisse zu erzielen.

Überzeugen Sie sich selbst von der Textdarstellung: Bild mit GLM-Image erzeugen →

Emily Reid

Emily Reid

Was ist GLM-Image? Das Open-Source-Modell, das bilingualen Text rendert | Blog