Puffin-World unifie physique, géométrie et image dans un seul modèle 3D
TL;DR
- Puffin-World intègre trois états natifs du monde (gravité et latitude, profondeur, apparence) dans une architecture multimodale unifiée sans modules externes hors ligne.
- Sur Puffin-Cam-Bench, l'erreur de vecteur up tombe à 0,96° contre 3,86° pour Puffin et 13,37° pour la meilleure baseline généraliste.
- Le dataset Puffin-16M cumule 15 millions de triplets vision-langage-caméra et 1 million de trajectoires; code, modèles et données sont publiés.
Puffin-World, dévoilé par une équipe menée par S-Lab (Nanyang Technological University) avec University of Michigan, Beijing Jiaotong University et ACE Robotics, propose une architecture multimodale unifiée qui modélise conjointement trois états natifs du monde: la physique (champ gravitationnel et latitude), la géométrie (profondeur) et l'apparence (image). Le papier mis en ligne sur Hugging Face revendique une génération 3D physiquement cohérente sans recours à des modules externes hors ligne.
Le pivot technique tient à une représentation « Omni-Camera » qui combine un vecteur up aligné sur la gravité, un angle de latitude et une carte de rayons. Les auteurs écrivent que le système « jointly models three native world states: physics (gravity field and latitude), geometry (depth), and appearance (image) ». Un mécanisme de propagation physique reporte l'orientation gravitationnelle de l'image de référence aux vues suivantes via des rotations relatives.
Côté chiffres, sur Puffin-Cam-Bench (600 paires texte-caméra), l'erreur médiane de vecteur up descend à 0,96° contre 3,86° pour la version antérieure Puffin et 13,37° pour la meilleure baseline généraliste, soit un facteur quatre revendiqué face à l'ancien Puffin. Sur RealEstate10K, le PSNR atteint 17,22 face à 17,11 pour MVGenMaster. Sur Puffin-Traj-Bench, dédié aux trajectoires rotationnelles difficiles, l'erreur de roll tombe à 0,80° contre 1,35° pour SEVA et 9,24° pour MVGenMaster.
Le jeu de données Puffin-16M accompagne le modèle: 15 millions de triplets vision-langage-caméra et 1 million de trajectoires, avec des annotations de caméra absolue étendues à 44,5 millions d'images sur 28 datasets publics dont ImageNet, Objects365 et ScanNet. Deux variantes coexistent, la Pro assemblant Qwen2.5-1.5B-Instruct et SD3.5-Large-8.1B. Le sujet est visiblement chaud: c'est la 18ème alerte que nous suivons sur le fil recherche des trois derniers mois.
Les auteurs indiquent avoir « released the code, models, and datasets ».
Article original publié par huggingface.co
Lire l'article original →Titre original : Puffin-World unifie multimodal et états 3D natifs pour un modèle du monde de grande échelle