Les poids du modèle GLM-Image sont disponibles sur Hugging Face. Télécharger

L'IA peut-elle restituer correctement les légendes scientifiques ? Un test sur 20 planches

Sep 8, 2026

Figure de disque d'accrétion de trou noir annotée : horizon des événements, disque d'accrétion, jet, anneau de photons

Toute illustration scientifique se révèle ou s'effondre à travers ses annotations — et le texte des légendes est précisément ce que les modèles d'image ont toujours su faire le moins bien. Nous avons donc mené nous-mêmes cette vérification : 20 planches annotées générées sur glmimage.app (modèle : grok-imagine-image-2.0), chacune examinée pour l'orthographe, le placement et le nombre de légendes. Cette page présente les planches, le protocole et ce que nous avons réellement constaté — y compris les modes d'échec que vous devriez anticiper.

Générer une planche annotée · La règle du nombre de légendes · Les 30 exemples

Le protocole de test

Chaque planche de ce test a été générée à partir d'un prompt structuré — sujet, panneaux nommés, puis une liste de libellés entre guillemets en majuscules (la même grammaire que notre guide de flux de travail). Avant qu'une planche ne soit mise en ligne sur ce site, elle passe une revue humaine de l'orthographe des libellés et de l'anatomie ; cet article relit un échantillon de 20 planches couvrant neuf disciplines, avec trois questions par planche :

  1. Orthographe — chaque libellé est-il exactement orthographié comme demandé ?
  2. Positionnement — chaque libellé pointe-t-il vers la bonne structure ?
  3. Nombre — tous les libellés demandés figurent-ils sur la planche ?

Nous ne publions délibérément pas de pourcentage global de précision. Vingt planches représentent un échantillon restreint, et les prompts ont été rédigés par des personnes qui connaissent les conventions du système — un prompt naïf donnerait de moins bons résultats. Considérez ceci comme un examen structuré du comportement du format et des modes de défaillance qui comptent, et non comme un chiffre de référence.

Les plaques

Médecine

Figure de thérapie Tau étiquetée anticorps, tau, ASO, enchevêtrements réduits

Étiquettes cibles : ANTICORPS, TAU, ASO, ENCHEVÊTREMENTS RÉDUITS. La distinction intérieur/extérieur (anticorps à l'extérieur du neurone, ASO à l'intérieur) est exactement le type de placement sémantique que ce format gère lorsque le prompt le nomme.

Tissu cortical avec dépôts étiqueté cortex, dépôt, cœur sombre, halo

Étiquettes cibles : CORTEX, DÉPÔT, CŒUR SOMBRE, HALO.

Flux de fabrication CAR-T étiqueté leucaphérèse, sélection, transfert de gène, expansion, perfusion

Étiquettes cibles : LEUCAPHÉRÈSE, TRANSFERT DE GÈNE, EXPANSION, PERFUSION — notez la longueur : « LEUCAPHÉRÈSE » compte 12 caractères, le mot le plus long de ce test.

Pont d'anticorps bispécifique étiqueté bras CD3, bras antigène tumoral, lymphocyte T, cellule tumorale, perforine

Étiquettes cibles : BRAS CD3, BRAS ANTIGÈNE TUMORAL, LYMPHOCYTE T, CELLULE TUMORALE, PERFORINE.

Biologie et biotechnologie

Figure du traitement de l'APP étiquetée APP, alpha, bêta, gamma, amyloïde-bêta

Étiquettes cibles : APP, ALPHA, BÊTA, GAMMA, AMYLOÏDE-BÊTA. Les sécrétases aux lettres grecques sont rendues sous forme de mots écrits en toutes lettres — un choix du prompt, car les lettres grecques dessinées par le modèle sont un point faible connu.

Figure de bio-impression étiquetée tête d'impression, bioencre, cellules, échafaudage, construction

Étiquettes cibles : TÊTE D'IMPRESSION, BIOENCRE, CELLULES, ÉCHAFAUDAGE, CONSTRUCTION.

Astronomie et physique

Trou noir avec disque d'accrétion, étiqueté horizon des événements, disque d'accrétion, jet, anneau de photons

Étiquettes cibles : HORIZON DES ÉVÉNEMENTS, DISQUE D'ACCRÉTION, JET, ANNEAU DE PHOTONS.

Science des matériaux et de la Terre

Stratifié en fibre de carbone étiqueté pli, tissage, matrice, interface

Étiquettes cibles : PLI, TISSAGE, MATRICE, INTERFACE.

Chiralité des nanotubes de carbone étiquetée angle de roulage, métallique, semi-conducteur, faisceau

Étiquettes cibles : ANGLE DE ROULAGE, MÉTALLIQUE, SEMI-CONDUCTEUR, FAISCEAU.

Systèmes cristallins minéraux étiquetés cubique, hexagonal, monoclinique, triclinique

Étiquettes cibles : CUBIQUE, HEXAGONAL, MONOCLINIQUE, TRICLINIQUE.

Les dix planches restantes du jeu de test (liées, une par ligne) : stratégies anti-tau, charge en plaques, parcours des CAR-T, CAR-T dans le corps, échappement antigénique, traitement de l'APP, bio-impression, plis de stratifié, chiralité des nanotubes, systèmes cristallins.

Ce que le format réussit bien

Les libellés courts entre guillemets en majuscules s'affichent de manière fiable. Sur l'ensemble de test, les libellés de 1 à 2 mots en capitales — JET, PLY, HALO, CD3 ARM — sont orthographiés correctement la grande majorité du temps, à condition d'être mis entre guillemets dans l'invite. Cela correspond à ce pour quoi les modèles d'image axés sur le texte sont désormais conçus : la chaîne entre guillemets agit comme une contrainte, et non comme une suggestion.

Le nombre de libellés est préservé lorsqu'il est faible. Quatre à cinq libellés se positionnent comme un ensemble. La règle sur le nombre de libellés que nous avons dérivée en construisant ces planches : au-delà de six libellés, la fiabilité par libellé chute et les lignes de rappel commencent à se croiser — limitez les planches à six libellés et divisez plutôt le sujet.

Les termes composés fonctionnent mieux lorsqu'ils sont écrits avec un trait d'union ou en toutes lettres. « AMYLOID-BETA » et « RADIATIVE ZONE » se comportent bien ; les lettres grecques et les indices chimiques (α, β, CO₂) sont les points où l'orthographe se dégrade — écrivez-les en toutes lettres (ALPHA, BETA, CO2) et la fiabilité revient.

Là où cela échoue encore

  1. Positionnement vs. orientation. Une étiquette peut être parfaitement orthographiée et pointer malgré tout vers la structure voisine. L'orthographe ne dit rien de l'anatomie — cette vérification reste manuelle, et notre protocole de vérification existe précisément pour combler ce manque.
  2. Les étiquettes longues rétrécissent. « TUMOR ANTIGEN ARM » à l'échelle d'une planche peut s'avérer plus petit que lisible. Correction dans le prompt : raccourcir l'étiquette, ou nommer le panneau auquel elle appartient.
  3. Les mises en page miroir inversent les étiquettes. En anatomie, les étiquettes droite/gauche peuvent se retrouver inversées alors que le dessin semble par ailleurs correct. La solution est une contrainte explicite : « côté droit de l'image », « poumon gauche à gauche pour le spectateur ».
  4. Les tentatives font partie du coût. Tout workflow honnête prévoit une ou deux régénérations par planche. Un modèle qui réussit ses étiquettes du premier coup plus souvent est moins cher que son prix affiché ne le laisse penser — le même argument que notre article sur les benchmarks avance à propos du rendu de texte en général.

Les règles de prompt issues du test

1. Citez chaque étiquette, en majuscules : Étiquette « JET », « PHOTON RING ».
2. Limitez les étiquettes à 1–2 mots ; écrivez les symboles en toutes lettres (ALPHA et non α, CO2 et non CO₂).
3. Limitez à six étiquettes par planche.
4. Nommez le panneau dans lequel se trouve chaque étiquette lorsque la disposition est importante.
5. Corrigez les erreurs en les nommant : « le seuil est horizontal, entre deux strates ».

Liste de vérification pour la relecture scientifique

  • [ ] Toutes les légendes sont-elles correctement orthographiées ?
  • [ ] Chaque légende pointe-t-elle vers la bonne structure (et pas seulement vers un texte correct) ?
  • [ ] Le nombre de légendes est-il complet ?
  • [ ] Les positions et les proportions sont-elles cohérentes par rapport à votre référence ?
  • [ ] Les flèches indiquent-elles la bonne direction ?
  • [ ] Le contenu a-t-il été vérifié à partir d'une source fiable ?

En résumé

L'IA peut-elle restituer correctement les étiquettes scientifiques ? Pour le format enseigné sur ce site — des étiquettes courtes, entre guillemets, en majuscules, sur des planches structurées — la réponse apportée par ces vingt planches est la suivante : suffisamment fiable pour s'en servir comme base, mais pas assez fiable pour se passer d'une relecture. L'orthographe est presque un problème résolu à cette longueur d'étiquette ; le placement et le décompte sont bons avec de petits ensembles ; et l'étape de vérification reste humaine. C'est cette combinaison qui rend le travail de l'IA utile : la partie coûteuse (des figures correctes, lisibles et publiables) passe toujours par vos yeux, mais la partie bon marché a cessé d'être lente.

FAQ

Quel modèle a généré les planches de test ?

grok-imagine-image-2.0, via le module d'illustration scientifique de glmimage.app — le même pipeline que celui derrière chaque planche de ce site. Nous le nommons parce que l'attribution du modèle fait partie d'un test honnête ; un test d'étiquettes sans le nom du modèle relève du marketing, pas de la mesure.

La précision des étiquettes varie-t-elle selon la discipline ?

Dans nos planches, les échecs se regroupent par type d'étiquette, et non par discipline : les mots longs, les symboles et les indices en exposant/en indice échouent partout ; les termes courts en majuscules réussissent partout. Une planche mélangeant « JET » et « TUMOR ANTIGEN ARM » hérite du risque de la seconde étiquette.

Qu'en est-il des étiquettes non anglaises ?

Traitez-les comme un test distinct. Le rendu bilingue est une capacité spécifique — c'est le point fort mis en avant par les propres modèles d'image de GLM et la raison d'être de ce site — mais tout modèle que vous utilisez mérite un petit pilote : dix étiquettes dans votre langue avant de lui confier un jeu de figures.

Si l'orthographe est correcte, la figure est-elle prête à être publiée ?

Non — l'orthographe est nécessaire, mais pas suffisante. Une étiquette peut être parfaitement orthographiée et pointer vers la mauvaise structure. Le caractère publiable passe par l'intégralité du protocole de vérification, dont ce test n'est qu'une contribution.

Reproduire ce test sur votre propre pile

Le test est volontairement reproductible : vingt prompts issus d'une seule grammaire (notre modèle), des légendes limitées à six caractères, un à deux mots, en majuscules, entre guillemets ; puis une lecture par planche pour l'orthographe, le placement et le décompte ; puis le bilan par type de légende — mots courts, mots longs, symboles, indices inférieurs. Exécutez-le avec le modèle et la chaîne d'outils que vous utilisez réellement, car le comportement des légendes est propre à chaque modèle et votre pile est la seule qui compte pour vos figures. Si votre bilan correspond au schéma ci-dessus (légendes courtes entre guillemets fiables, longueur et symboles qui se dégradent), les règles de cet article s'appliquent directement ; si ce n'est pas le cas, votre bilan fait foi — rédigez les prompts que vos chiffres justifient, et conservez le test dans le journal de figures (l'habitude de l'artefact).

William Hayes

William Hayes

L'IA peut-elle restituer correctement les légendes scientifiques ? Un test sur 20 planches | Blog