Marigold V2 améliore AbsRel de 16-26% sur KITTI et ETH3D
TL;DR
- Marigold V2 revendique 16 à 26 % de gain AbsRel sur KITTI et ETH3D en profondeur monoculaire, à paraître à SIGGRAPH Asia 2026.
- L'inférence tient en une seule étape sur un DiT Qwen-Image-Edit-2509 quantifié 4-bit, fine-tuné par QLoRA rang 128 sur un GPU 32 Go.
- Le même pipeline atteint l'état de l'art sur NYUv2, KITTI, ETH3D, ScanNet, DIODE, et sert aussi normales, décomposition intrinsèque et complétion.
À paraître à SIGGRAPH Asia 2026, Marigold V2 revendique 16 à 26 % d'amélioration en AbsRel sur KITTI et ETH3D face aux meilleurs modèles précédents en estimation de profondeur monoculaire, selon la fiche du papier sur Hugging Face.
Le papier "repurposes diffusion transformers for monocular depth estimation via single-step flow-matching inference", écrivent Igor Pavlovic, Anton Obukhov, Fabio Tosi, Matteo Poggi, Sabine Süsstrunk, Dengxin Dai et leurs coauteurs. Le modèle part du DiT pré-entraîné Qwen-Image-Edit-2509, quantifié en 4-bit, puis fine-tuné par QLoRA de rang 128 sur un unique GPU 32 Go. L'inférence tient en une seule étape, sans boucle de diffusion.
Deux ingrédients portent les gains. L'alignement sémantique iREPA-depth cale les représentations internes sur les features DINOv3 extraites de la profondeur vérité-terrain. Une perte Sinkhorn en deux étapes, décrite comme un "5×5 block tiling with soft matching", tolère le bruit d'annotation. Le modèle atteint l'état de l'art sur NYUv2, KITTI, ETH3D, ScanNet et DIODE.
Le même pipeline sert aussi l'estimation de normales de surface, la décomposition d'image intrinsèque et la complétion de profondeur. Poids, code et démo sont publiés en ouvert, dans un trimestre déjà chargé côté vision 3D pour notre tracker AI Weekly, après Scal3R et l'Atlas de World Labs.
Article original publié par huggingface.co
Lire l'article original →Titre original : Marigold V2 rouvre les diffusion transformers pour l'estimation de profondeur monoculaire, +16-26 % AbsRel