The Verge: pourquoi les plats générés par IA restent immangeables
TL;DR
- Selon Chris Russell (Oxford), les modèles de diffusion posent d'abord la structure d'une image; les erreurs de forme survivent ensuite aux textures fines ajoutées.
- Giovanbattista Califano (Naples Federico II) souligne la faiblesse des modèles sur les structures fines et continues, expliquant nouilles, fils et tentacules déformés.
- Roland Meyer (Zurich) et Michael Cook (King's College) alertent: les modèles copient les looks sans comprendre le monde, avec un début de model collapse.
Les modèles de diffusion fixent d'abord la structure globale d'une image avant d'y plaquer les textures fines, et c'est cette hiérarchie qui explique la vague de photos de plats générés par IA aussi laquées que dérangeantes. Dans un explainer publié par The Verge, plusieurs chercheurs pointent la même mécanique: quand la silhouette est ratée, le vernis photoréaliste ne fait qu'amplifier l'erreur. Notre tracker en a répertorié 18 signalements AI Photo sur les trois derniers mois.
Chris Russell, professeur d'IA à l'Université d'Oxford, résume l'ordre des opérations: «This means that initially coarse structures are recovered first with fine texture details», la précision n'arrivant qu'à la fin. Les fautes de forme héritées de la première étape restent alors visibles sous des textures très soignées, cousines des mains à six doigts qui hantent encore la génération humaine.
Un type d'objet concentre les dégâts. Giovanbattista Califano, chercheur en science comportementale à l'Université de Naples Federico II, note que «Diffusion models are notoriously weak at generating thin, continuous, terminating structures», d'où les nouilles qui s'échappent d'un bol ou les spaghettis qui ressemblent à de la pelote.
La deuxième couche du problème est conceptuelle. Roland Meyer, professeur des cultures numériques à l'Université de Zurich, tranche que «AI image generation reproduces looks without proper knowledge about the world». Michael Cook, senior lecturer en informatique à King's College London, ajoute que les modèles copient la grammaire de la photo culinaire (contrastes durs, couleurs saturées, lumière laquée) sans en comprendre la fonction, et prévient qu'un début de model collapse pointe à mesure que les jeux d'entraînement se remplissent d'images synthétiques.
Shared on Bluesky by 1 AI expert
Article original publié par theverge.com
Lire l'article original →Titre original : The Verge décortique pourquoi les photos de plats générées par IA restent visuellement inmangeables