Une bague a une taille. L'essayage virtuel a enfin dû l'apprendre.
Un modèle d'essayage virtuel de bijoux sans masque, développé par l'ANU et Amazon, intègre la dimension réelle du produit dans le prompt sous forme de chiffre. L'essayage virtuel de vêtements n'a jamais eu à fournir ce chiffre, ce qui explique pourquoi les catégories à la marge la plus élevée ont été les dernières à bénéficier d'un essayage qui fonctionne vraiment.
Parallax Pincer
La main générée est convaincante, et la bague qu’elle porte est un anneau de rideau. Les phalanges se plient là où elles doivent se plier, la lumière tombe correctement sur l’ongle, et l’anneau à l’annulaire est assez large pour y glisser une serviette de table. L’essayage virtuel de vêtements a longtemps eu le droit de deviner la taille, car un pull rendu une taille trop grande reste lisible comme un pull. Les bijoux n’ont pas cette marge de manœuvre, ce qui explique pourquoi les catégories à la marge la plus grasse ont été les dernières à obtenir un essayage qui fonctionne.
JewelTry, publié sur arXiv le 15 septembre par une équipe de l’Australian National University et d’Amazon, traite cette marge de manœuvre comme le cœur du problème. Jusqu’ici, l’essayage virtuel de bijoux s’appuyait sur un masque pour fixer l’objet en place, tandis que les frameworks d’essayage généraux, écrivent les auteurs, « ne modélisent pas explicitement l’échelle réelle du produit ». JewelTry abandonne le masque et fournit à la place un chiffre au modèle : la dimension physique du produit en pouces, inscrite dans le prompt textuel et projetée, via un petit adaptateur, en un unique token d’échelle, de sorte que le modèle apprenne comment une taille indiquée se rapporte à l’anatomie qui l’entoure.
C’est dans la notation que réside l’honnêteté. L’article introduit ScaleErr, le rapport logarithmique absolu entre la dimension dominante de l’objet rendu et sa dimension réelle, où zéro signifie que la taille est exacte. JewelTry affiche 0,169 contre 0,208 pour Qwen-JVTON, 0,256 pour OmniTry, 0,397 pour InsertAnything et 1,158 pour Any2AnyTryOn. Lu comme un logarithme népérien, le meilleur score reste à environ dix-huit pour cent d’écart par rapport à la plus grande dimension de la pièce. C’est l’état de l’art, et sur un solitaire, cela change de bague.
JVTO-Bench, construit en parallèle du modèle, comprend 23 662 triplets d’entraînement et 375 échantillons de test répartis sur quatre catégories. Les jeux de données d’essayage existants, note l’article, « fournissent rarement des annotations spécifiques aux bijoux ou des informations fiables sur l’échelle réelle du produit ». L’équipe a donc utilisé Claude Sonnet 4 pour lire les dimensions à partir de photographies de produits calibrées, avec vérification humaine des résultats. Nous avions avancé en mai que le goulot d’étranglement de l’essayage virtuel s’était déplacé du modèle vers les métadonnées de catalogue ; ici, les chercheurs ont dû fabriquer ces métadonnées avant de pouvoir s’entraîner dessus.
D’une certaine manière, l’essayage virtuel de bijoux existe déjà depuis des années. Perfect Corp superpose depuis longtemps des bagues et boucles d’oreilles en réalité augmentée sur des flux caméra en direct, et son pipeline dédié aux bagues et montres demande à chaque marque d’importer des « fichiers CAO de modèles 3D aux normes du secteur » pour chaque référence. Son produit pour boucles d’oreilles vante un essayage « à partir d’une image 2D, sans modélisation 3D coûteuse ». La voie économique existe pour ce qui pend à un lobe, pas pour ce qui se calibre sur une phalange. Un fabricant détient le fichier CAO ; une marketplace détient une photo et une légende — ce qui explique sans doute pourquoi le nom d’Amazon figure sur cet article.
Le benchmark porte le même déséquilibre : 12 149 paires d’entraînement pour les boucles d’oreilles, 2 908 pour les bagues.
Le problème d’échelle est plus ancien que le rendu lui-même. En 1932, Chanel a présenté Bijoux de Diamants au 29 rue du Faubourg Saint-Honoré, en plaçant les pièces sur des bustes de cire à cheveux naturels plutôt que dans des plateaux de joaillier, et faisait payer vingt francs l’entrée au profit d’œuvres caritatives. Une comète de diamants posée à plat sur du velours n’est qu’une quantité de pierres ; posée sur un front, c’est une proportion. La réponse de Chanel a été de construire le corps et de laisser l’acheteuse s’y mesurer.
Signet paie encore aujourd’hui une version de ce même problème. Le groupe a annoncé 1,53 milliard de dollars de ventes pour le trimestre clos le 1er août, des ventes à magasins comparables en hausse de 2,2 % et une marge brute de 39,4 %, et a relevé ses prévisions annuelles en conséquence. Le PDG J.K. Symancyk a déclaré aux analystes le 9 septembre que les sites refondus de Kay et Jared proposaient « une meilleure imagerie et une meilleure présentation des produits, avec des photographies sur mannequin plus réalistes pour aider les clients à acheter en toute confiance », Zales devant suivre plus tard dans le mois. C’est le buste de cire, quatre-vingt-quatorze ans plus tard, photographié en studio. C’est aussi la réponse la plus coûteuse du menu, facturée par séance photo et par référence.
Ce qui change à l’écran, c’est la grammaire même de l’image des accessoires. Le e-commerce de bijoux a vécu sur le plan macro et la photo à plat, parce que les deux masquent l’échelle par convention, l’image portée restant l’exception coûteuse. Un modèle qui prend une dimension en argument rend l’image portée assez bon marché pour devenir la vue par défaut, ce qui fait passer le regard porté sur la catégorie du scintillement en gros plan à la proportion sur un corps. Dix-huit pour cent d’écart, ce n’est pas encore gagné. Mais le chiffre est désormais dans le tableau, et c’est à partir de là qu’il commence à bouger.