
Jede wissenschaftliche Illustration steht und fällt mit ihren Beschriftungen — und Beschriftungstext ist genau das, worin Bildmodelle historisch am schwächsten waren. Deshalb haben wir die Prüfung selbst durchgeführt: 20 beschriftete Tafeln, generiert auf glmimage.app (Modell: grok-imagine-image-2.0), jede geprüft auf Schreibung, Platzierung und Anzahl der Beschriftungen. Diese Seite zeigt die Tafeln, das Protokoll und das, was wir tatsächlich gefunden haben — einschließlich der Fehlermodi, für die Sie planen sollten.
Beschriftete Tafel generieren · Die Regel zur Beschriftungsanzahl · Alle 30 Beispiele
Hinweis zur Sprache: Die Prompts und Regelbeispiele bleiben auf Englisch, weil die auf den Tafeln gerenderten Beschriftungen englisch erscheinen und kurze Großbuchstaben-Labels am zuverlässigsten gerendert werden.
Der Testaufbau
Jede Tafel dieses Tests entstand aus einem strukturierten Prompt — Thema, benannte Panels, dann eine zitierte Beschriftungsliste in Versalien (dieselbe Grammatik wie in unserer Arbeitsablauf-Anleitung). Bevor eine Tafel auf dieser Seite erscheint, durchläuft sie eine menschliche Prüfung von Beschriftungsschreibung und Anatomie; dieser Artikel liest eine Stichprobe von 20 Tafeln aus neun Disziplinen mit drei Fragen pro Tafel neu:
- Schreibung — ist jede Beschriftung exakt wie angefordert geschrieben?
- Platzierung — zeigt jede Beschriftung auf die richtige Struktur?
- Anzahl — haben alle angeforderten Beschriftungen den Weg auf die Tafel gefunden?
Wir drucken bewusst keine aggregierte Genauigkeitsprozentzahl. Zwanzig Tafeln sind eine kleine Stichprobe, und die Prompts stammen von Menschen, die die Konventionen des Systems kennen — ein naiver Prompt würde schlechter abschneiden. Betrachten Sie dies als strukturierten Blick darauf, wie sich das Format verhält und welche Fehlermodi zählen, nicht als Kennzahl.
Die Tafeln
Medizin

Ziel-Beschriftungen: ANTIBODY, TAU, ASO, REDUCED TANGLES. Die Unterscheidung von innen und außen (Antikörper außerhalb des Neurons, ASO innerhalb) ist genau die Art semantischer Platzierung, die das Format beherrscht, wenn der Prompt sie benennt.

Ziel-Beschriftungen: CORTEX, DEPOSIT, DARK CORE, HALO.

Ziel-Beschriftungen: LEUKAPHERESIS, GENE TRANSFER, EXPANSION, INFUSION — beachten Sie die Länge: „LEUKAPHERESIS" hat 13 Zeichen, das längste Einzelwort dieses Tests.

Ziel-Beschriftungen: CD3 ARM, TUMOR ANTIGEN ARM, T CELL, TUMOR CELL, PERFORIN.
Biologie und Biotechnologie

Ziel-Beschriftungen: APP, ALPHA, BETA, GAMMA, AMYLOID-BETA. Die Sekretasen wurden als ausgeschriebene Wörter statt griechischer Buchstaben gerendert — eine Entscheidung des Prompts, da modellgezeichnete griechische Buchstaben eine bekannte Schwachstelle sind.

Ziel-Beschriftungen: PRINTHEAD, BIOINK, CELLS, SCAFFOLD, CONSTRUCT.
Astronomie und Physik

Ziel-Beschriftungen: EVENT HORIZON, ACCRETION DISK, JET, PHOTON RING.
Materialwissenschaft und Geowissenschaften

Ziel-Beschriftungen: PLY, WEAVE, MATRIX, INTERFACE.

Ziel-Beschriftungen: ROLL ANGLE, METALLIC, SEMICONDUCTING, BUNDLE.

Ziel-Beschriftungen: CUBIC, HEXAGONAL, MONOCLINIC, TRICLINIC.
Die übrigen zehn Tafeln des Testsatzes (verlinkt, je eine Zeile): Anti-Tau-Strategien, Plaque-Last, CAR-T-Herstellung, CAR-T im Körper, Antigen-Flucht, APP-Verarbeitung, Bioprinting, Laminatlagen, Nanoröhrchen-Chiralität, Kristallsysteme.
Was das Format richtig macht
Kurze zitierte Beschriftungen in Versalien rendern zuverlässig. Über den Testsatz hinweg kommen Beschriftungen aus 1–2 Wörtern in Versalien — JET, PLY, HALO, CD3 ARM — in der großen Mehrzahl der Fälle korrekt geschrieben heraus, sofern sie im Prompt in Anführungszeichen stehen. Das entspricht dem, wofür textorientierte Bildmodelle inzwischen gebaut sind: Die Zeichenkette in Anführungszeichen wirkt als Bedingung, nicht als Vorschlag.
Die Beschriftungsanzahl überlebt, solange sie klein ist. Vier bis fünf Beschriftungen landen als vollständiger Satz. Die Regel zur Beschriftungsanzahl, die wir beim Bau dieser Tafeln abgeleitet haben: Oberhalb von sechs Beschriftungen sinkt die Zuverlässigkeit pro Beschriftung, und die Bezugslinien beginnen zu kollidieren — begrenzen Sie Tafeln auf sechs und teilen Sie das Thema stattdessen.
Zusammengesetzte Begriffe funktionieren besser mit Bindestrich oder ausgeschrieben. „AMYLOID-BETA" und „RADIATIVE ZONE" verhalten sich unauffällig; griechische Buchstaben und chemische Tiefstellungen (α, β, CO₂) sind der Ort, an dem die Schreibung bricht — schreiben Sie sie aus (ALPHA, BETA, CO2), und die Zuverlässigkeit kehrt zurück.
Wo es weiterhin scheitert
- Platzierung gegen Zeigen. Eine Beschriftung kann fehlerfrei geschrieben sein und trotzdem auf die Nachbarstruktur zeigen. Die Schreibung sagt nichts über die Anatomie aus — diese Prüfung bleibt manuell, und unser Überprüfungsprotokoll existiert genau für diese Lücke.
- Lange Beschriftungen schrumpfen. „TUMOR ANTIGEN ARM" kann auf Tafelgröße kleiner als lesbar ausfallen. Korrektur im Prompt: die Beschriftung kürzen oder das zugehörige Panel benennen.
- Gespiegelte Layouts vertauschen Beschriftungen. In der Anatomie können rechts/links-Beschriftungen vertauscht sein, während die Zeichnung sonst korrekt wirkt. Die Korrektur ist eine benannte Randbedingung: "right side of the image", "left lung on the viewer's left".
- Erneuerungen gehören zu den Kosten. Jeder ehrliche Arbeitsablauf veranschlagt eine oder zwei erneute Generierungen pro Tafel. Ein Modell, dessen Beschriftungen öfter schon beim ersten Versuch stimmen, ist günstiger, als sein Angebotspreis vermuten lässt — derselbe Punkt, den unser Vergleich zum Textrendering allgemein macht.
Die Prompt-Regeln aus dem Test
1. Quote every label, in capitals: Label "JET", "PHOTON RING".
2. Keep labels to 1–2 words; spell out symbols (ALPHA not α, CO2 not CO₂).
3. Cap the set at six labels per plate.
4. Name the panel each label lives in when placement matters.
5. Fix errors by naming them: "the sill is horizontal, between two strata".
Prüfliste für wissenschaftliche Abbildungen
- [ ] Sind alle Beschriftungen korrekt geschrieben?
- [ ] Zeigt jede Beschriftung auf die richtige Struktur (liest sich nicht nur korrekt)?
- [ ] Ist die Beschriftungsanzahl vollständig?
- [ ] Sind Positionen und Proportionen gegenüber der Referenz plausibel?
- [ ] Zeigen die Pfeile in die richtige Richtung?
- [ ] Wurde das Ergebnis mit einer verlässlichen Quelle abgeglichen?
Fazit
Kann KI wissenschaftliche Beschriftungen korrekt rendern? Für das Format, das diese Seite vermittelt — kurze, zitierte Beschriftungen in Versalien auf strukturierten Tafeln — lautet die Antwort aus diesen zwanzig Tafeln: zuverlässig genug, um darauf aufzubauen; nicht zuverlässig genug, um die Prüfung auszulassen. Die Schreibung ist bei dieser Beschriftungslänge fast ein gelöstes Problem; das Zeigen und die Anzahl sind bei kleinen Sätzen gut; und der Prüfschritt bleibt menschlich. Diese Kombination macht das KI-Drafting lohnend: Der teure Teil (korrekte, lesbare, publizierbare Abbildungen) läuft weiterhin über Ihre Augen, aber der billige Teil ist nicht mehr langsam.
Häufige Fragen
Welches Modell hat die Testtafeln gerendert?
grok-imagine-image-2.0, über das Modul für wissenschaftliche Illustration von glmimage.app — dieselbe Pipeline wie hinter jeder Tafel dieser Seite. Wir nennen es, weil Modellnennung Teil ehrlichen Testens ist; ein Beschriftungstest ohne Modellangabe ist Marketing, keine Messung.
Unterscheidet sich die Beschriftungsgenauigkeit nach Disziplin?
In unseren Tafeln clustering die Fehler nach Beschriftungstyp, nicht nach Disziplin: lange Wörter, Symbole und Tiefstellungen scheitern überall; kurze Versalien-Begriffe gelingen überall. Eine Tafel, die „JET" und „TUMOR ANTIGEN ARM" mischt, erbt das Risiko des zweiten Labels.
Was gilt für nicht-englische Beschriftungen?
Behandeln Sie sie als eigenen Test. Zweisprachiges Rendering ist eine spezifische Fähigkeit — sie ist die Kernstärke der GLM-Bildmodelle und der Grund, warum diese Seite existiert —, aber jedes Modell, das Sie verwenden, verdient einen kleinen Pilotversuch: zehn Beschriftungen in Ihrer Sprache, bevor Sie einen Abbildungssatz damit festlegen.
Wenn die Schreibung besteht, ist die Abbildung dann publikationsbereit?
Nein — korrekte Schreibung ist notwendig, nicht hinreichend. Eine Beschriftung kann fehlerfrei geschrieben sein und auf die falsche Struktur zeigen. Publikationsreife durchläuft das vollständige Überprüfungsprotokoll, dessen einer Baustein dieser Test ist.
Den Test auf dem eigenen Stack reproduzieren
Der Test ist absichtlich reproduzierbar: zwanzig Prompts aus einer einzigen Grammatik (unserer Vorlage), Beschriftungen auf sechs begrenzt, ein bis zwei Wörter, durchgehend groß, in Anführungszeichen; dann eine Lektüre pro Tafel auf Schreibung, Platzierung und Anzahl; dann die Auszählung nach Beschriftungstyp — kurze Wörter, lange Wörter, Symbole, Tiefstellungen. Führen Sie ihn mit dem Modell und Werkzeug aus, das Sie tatsächlich verwenden, denn das Beschriftungsverhalten ist modelspezifisch, und Ihr Stack ist der einzige, der für Ihre Abbildungen zählt. Stimmt Ihre Auszählung mit dem Muster oben überein (kurze zitierte Beschriftungen zuverlässig, Länge und Symbole nachlassend), übertragen sich die Regeln dieses Artikels unmittelbar; stimmt sie nicht, ist Ihre Auszählung das Regelwerk — schreiben Sie die Prompts, die Ihre Zahlen stützen, und halten Sie den Test im Abbildungsprotokoll fest (die Gewohnheit der Artefakte).





