Accéder au contenu principal

SAM 2 : bien démarrer avec le Segment Anything Model 2 de Meta

SAM 2 (Segment Anything Model 2) de Meta AI est le premier modèle unifié capable de segmenter n'importe quel objet dans les images et les vidéos en temps réel.
Actualisé 18 sept. 2026  · 10 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Meta a récemment présenté une avancée enthousiasmante en IA : Segment Anything Model 2 (SAM 2).

Cet outil supprime la complexité de la sélection d'objets en retouche photo et vidéo : en quelques clics ou coups de pinceau, le tour est joué. SAM 2 isole et suit les objets avec une précision remarquable.

Mais SAM 2 ne se limite pas aux besoins des designers. Développé par Meta AI, ce modèle avancé promet d'avoir un impact dans de nombreux secteurs, de l'imagerie médicale à la montée en performances des véhicules autonomes. 

Dans cet article, nous verrons ce qu'est SAM 2, en quoi il se distingue de son prédécesseur (le premier Segment Anything Model, SAM) et les fonctionnalités clés qui font la différence. Nous aborderons également ses usages possibles dans différents domaines et comment vous pouvez commencer à l'utiliser.

Cette vidéo illustre l'application de SAM 2 à la segmentation vidéo et montre sa capacité à suivre et segmenter avec exactitude des objets sur plusieurs images. SAM 2 maintient la cohérence de la segmentation, même en cas d'occlusions ou de mouvements rapides.

Voyons comment SAM 2 repousse les limites de la vision par ordinateur et fixe de nouveaux standards.

Qu'est-ce que SAM 2 ?

SAM 2 (Segment Anything Model 2) est la dernière avancée de Meta AI en vision par ordinateur. Il s'appuie sur les bases du SAM original et offre des capacités accrues pour la segmentation d'images et de vidéos.

Concrètement, SAM 2 génère des masques de segmentation précis afin d'identifier et de séparer les objets au sein d'une image ou d'une vidéo.

Imaginez une image complexe contenant de multiples objets, et vous devez en sélectionner un pour une retouche. Classiquement, il faut délimiter minutieusement son contour, pixel par pixel : une tâche longue et fastidieuse. SAM 2 simplifie tout cela en générant automatiquement des masques de segmentation précis, même dans des scènes chargées.

Vous souhaitez éditer une vidéo où un personnage se déplace et le garder net tout au long de la scène ? Avec SAM 2, vous pouvez suivre ses mouvements sans effort, même s'il disparaît temporairement ou change de forme.

Autre exemple de la capacité de SAM 2 à garder le bon objet au point et à suivre avec précision les déplacements d'un personnage, même lorsqu'il disparaît ou change de forme : le modèle demeure robuste dans des cas de montage vidéo complexes.

SAM 2 vs SAM

Si le SAM d'origine était déjà impressionnant, SAM 2 franchit un cap avec plusieurs améliorations clés.

Fonctionnalité

SAM

SAM2

Capacité de segmentation

Images uniquement

Images et vidéos

Segmentation vidéo

Non prise en charge

Segmentation vidéo en temps réel avec mémoire

Précision et vitesse

Référence de base

Précision accrue et jusqu'à 6× plus rapide pour la segmentation d'images

Architecture

Modèles séparés selon les tâches

Modèle unifié pour la segmentation d'images et de vidéos

Open source

Oui

Oui

Segmentation vidéo

SAM 2 introduit la segmentation d'objets dans les vidéos, une avancée majeure par rapport à son aîné.

Cette capacité s'appuie sur un module de mémoire par session, qui suit l'objet ciblé d'une image à l'autre. La mémoire est stockée dans une "banque de mémoire" conservant des cartes de caractéristiques spatiales et des informations sémantiques sur l'objet.

Ces cartes et informations sont exploitées par les mécanismes d'attention du modèle — en particulier la self-attention et la cross-attention — pour comparer les caractéristiques de l'image courante à celles des images précédentes.

Performances améliorées

SAM 2 traite les images vidéo en temps réel, à environ 44 images par seconde, ce qui le rend adapté aux vidéos en direct et à l'édition interactive. Les gains de vitesse et de précision sont considérables, permettant à SAM 2 de réussir des tâches complexes avec une grande exactitude.

Guidage par prompts affiné

SAM 2 gère des techniques de prompting plus avancées, y compris l'utilisation de masques comme prompts d'entrée. Cette richesse fonctionnelle délimite avec plus de finesse les zones d'intérêt et améliore la gestion de scènes complexes aux objets qui se chevauchent.

Segmentation interactive

Avec SAM 2, vous pouvez ajuster les résultats de segmentation en temps réel en fournissant des prompts sur n'importe quelle image. Cette interactivité permet un affinage itératif, idéal dans des flux de post-production où la précision est essentielle.

L'amélioration de l'IA pour les débutants

Apprenez les bases de l'IA et du ChatGPT en partant de zéro.
Apprendre l'IA Gratuitement

Applications de SAM 2

SAM 2 ne sert pas qu'à des retouches photo ou vidéo basiques : ses fonctionnalités puissantes s'appliquent à de nombreux domaines, de la création numérique à la santé, en passant par les véhicules autonomes.

Industries créatives

SAM 2 transforme l'édition d'images et de vidéos en simplifiant des tâches comme la suppression d'objets, le remplacement d'arrière-plan et le compositing avancé.

Par exemple, composer un paysage surréaliste à partir d'éléments variés devient un jeu d'enfant avec SAM 2, rendant des montages complexes presque sans effort.

Au-delà de l'édition classique, SAM 2 excelle aussi en IA générative, en offrant un contrôle précis sur les éléments d'images et de vidéos générées. De quoi démultiplier les idées et produire des contenus uniques et personnalisés.

De plus, l'intégration de SAM 2 à des plateformes sociales comme Instagram pourrait donner naissance à de nouveaux filtres et effets s'adaptant en temps réel aux objets et aux scènes, stimulant l'engagement et la créativité.

Science et recherche

En imagerie médicale, SAM 2 peut s'avérer crucial pour identifier et délimiter avec précision des structures anatomiques dans les examens.

Les scientifiques peuvent aussi s'en servir pour suivre finement l'évolution de la taille d'une tumeur lors de tests de nouveaux traitements, améliorant la fiabilité des résultats et la compréhension de leur efficacité.

Et SAM 2 ne se limite pas à la médecine : il aide aussi en sciences de l'environnement. Par exemple, il analyse avec précision des images satellites pour suivre la déforestation, la fonte des glaciers ou l'évolution urbaine. Un atout pour les chercheurs qui ont besoin de données visuelles très précises.

Systèmes autonomes

Le secteur automobile peut beaucoup gagner de la segmentation d'objets en temps réel et précise de SAM 2. En améliorant les systèmes de perception des véhicules autonomes, SAM 2 favorise l'identification et le suivi exacts des piétons, autres véhicules et obstacles — essentiels pour une navigation sûre dans des environnements complexes.

Imaginez une voiture autonome dans une ville animée. La segmentation avancée de SAM 2 lui permet de détecter et d'anticiper les dangers avec fiabilité, améliorant nettement la sécurité routière. Cette capacité renforce la fiabilité globale des véhicules autonomes et soutient leur adoption.

Réalité augmentée

SAM 2 présente un fort potentiel en réalité augmentée (AR). Grâce au suivi précis des objets en temps réel, les éléments virtuels se fondent harmonieusement dans le monde réel pour des expériences plus immersives. Jeux vidéo, éducation ou travail à distance : les applications AR gagnent en interactivité et en réactivité.

Annotation de données et entraînement de modèles d'IA

Autre usage clé : la création de jeux de données annotés (images et vidéos). SAM 2 automatise la segmentation à grande échelle, réduisant le temps et l'effort de l'annotation manuelle. Résultat : un développement d'IA accéléré et des données d'entraînement de meilleure qualité, pour des modèles plus robustes et plus justes.

SAM2 : comment ça marche ?

Plongeons dans les coulisses de SAM 2. 

SAM 2 repose sur une architecture sophistiquée articulée autour de trois composants : un encodeur d'image, un encodeur de prompts flexible et un décodeur de masques ultrarapide. Ensemble, ils traitent efficacement images et vidéos.

  1. Encodeur d'image : son architecture hiérarchique capture des caractéristiques multi-échelles des images vidéo, des grands motifs aux détails fins.
  2. Encodeur de prompts : combine self-attention et cross-attention pour affiner la segmentation à partir des entrées utilisateur (clics, masques, etc.).
  3. Décodeur de masques : traite rapidement les informations issues des encodeurs pour produire, en temps réel, des masques de segmentation de haute qualité, y compris sur des scènes complexes.

Attention mémoire et compréhension spatio-temporelle

Une particularité marquante de SAM 2 est son module d'attention mémoire, crucial pour la segmentation vidéo. Il permet au modèle de mémoriser et réutiliser des informations provenant des images précédentes, afin de suivre les objets de manière cohérente.

Pour mieux comprendre, examinons d'abord l'architecture du SAM original :

SAM architecture

SAM 2 étend cette architecture des images vers les vidéos pour segmenter des objets au fil des images. Il utilise divers prompts (clics, boîtes englobantes, etc.) pour définir l'étendue de l'objet dans une image. Un décodeur de masques léger traite ces prompts et les plongements d'images pour créer un masque, ensuite propagé à toutes les images de la vidéo pour former un "masklet".

SAM 2 architecture

Le système intègre un mécanisme mémoire avec encodeur, banque et module d'attention, pour stocker et exploiter des informations sur les objets et les interactions utilisateur, et ainsi améliorer les masques aux images suivantes.

L'encodeur mémoire met à jour la banque à chaque prédiction de masque, ce qui permet à SAM 2 d'affiner ses résultats au fur et à mesure. L'architecture est conçue pour un traitement efficace de flux vidéo en temps réel, idéal pour la robotique et l'annotation de jeux de données.

SAM 2 fonctionne également sur des images en les traitant comme une vidéo d'une seule image. Dans ce mode, le mécanisme mémoire est désactivé : le modèle génère des masques sans recours aux composants mémoire, en ne considérant que l'image courante.

Performance en temps réel

Grâce à son architecture optimisée et à des traitements efficaces, SAM 2 opère à environ 44 images par seconde. Cette capacité temps réel le rend pertinent pour de nombreux cas : édition live, systèmes d'IA interactifs, etc.

Données d'entraînement

SAM 2 a été entraîné sur un jeu de données vaste et diversifié, incluant le nouveau jeu SA-V, avec plus de 600 000 annotations de masklets sur 51 000 vidéos. Cette variété lui permet de généraliser sur des scénarios très différents, du quotidien aux domaines spécialisés.

Limites de SAM 2

SAM 2 est très avancé, mais il n'est pas exempt de limites. 

S'il excelle pour segmenter des objets dans des images et des vidéos courtes, il peut peiner dans des cas difficiles : changements drastiques de point de vue, longues occlusions, scènes surchargées ou vidéos très longues. Pour y répondre, le modèle accepte des corrections manuelles via des prompts interactifs. 

Dans des scènes denses, SAM 2 peut confondre des objets similaires, surtout si la cible n'est spécifiée que sur une seule image. Des prompts supplémentaires sur les images suivantes permettent toutefois d'y remédier.

L'efficacité diminue lorsqu'il faut segmenter plusieurs objets simultanément, car chaque objet est traité séparément, sans communication entre objets. De plus, SAM 2 peut manquer des détails fins sur des objets très rapides, et ses prédictions peuvent fluctuer d'une image à l'autre faute de lissage temporel explicitement imposé.

Malgré la génération automatique de masklets, des annotateurs humains restent nécessaires pour vérifier la qualité des masques et cibler les images à corriger. Des progrès et automatismes supplémentaires sont souhaitables, et les développeurs encouragent la communauté à s'appuyer sur SAM 2 pour faire avancer la recherche et créer de nouvelles applications.

SAM2 : où télécharger ou accéder à SAM 2 ?

Pour télécharger les poids du modèle et le code, rendez-vous sur le site de Meta AI. SAM 2 est publié sous licence Apache 2.0, en open source, accessible aux développeurs et aux chercheurs. Vous pouvez télécharger le modèle et le code ici.

Pour un essai rapide, testez la démo interactive ici.

example SAM2 demo

J'ai testé SAM 2 sur une vidéo de mes dernières vacances à Venise. Essayez avec vos propres vidéos pour sélectionner et suivre facilement des objets tout au long de vos séquences.

SAM 2 : ressources complémentaires

Pour approfondir l'architecture, l'entraînement et les usages du modèle, consultez l'article de recherche officiel, qui détaille les innovations derrière SAM 2.

Pour aller plus loin, de nombreuses ressources sont disponibles : documentation, tutoriels, etc., sur le site de Meta AI, avec des explications d'architecture et des guides pas à pas.

La communauté contribue activement aux projets open source autour de SAM 2. Suivre les évolutions et participer vous permettra d'influencer l'avenir de SAM 2 et de profiter rapidement des nouveautés.

Pour rester à jour, nous vous conseillons de suivre le blog Meta AI et de consulter régulièrement leur référentiel GitHub. Vous y trouverez des annonces de nouvelles fonctions, des cas d'usage concrets et des aperçus de la feuille de route. Être informé vous aidera à tirer le meilleur de SAM 2 et à contribuer à son évolution. 

SAM 2 : enjeux éthiques

Comme pour toute technologie puissante, il est essentiel de réfléchir à son usage. Parce qu'il repose sur de grands jeux de données, il existe un risque de biais dans les prédictions, à surveiller tout particulièrement dans des contextes sensibles comme la surveillance ou les véhicules autonomes.

Il faut également prendre en compte les enjeux de confidentialité, notamment lorsque SAM 2 est utilisé pour surveiller ou suivre des personnes. Des discussions ouvertes et des lignes directrices claires sont indispensables pour garantir un usage responsable, bénéfique et équitable.

Rappelons aussi que les modèles d'IA comme SAM 2 ne valent que par la qualité des données d'entraînement. D'où l'importance de jeux de données divers et équilibrés pour limiter les risques d'inéquité.

Des évaluations continues et une transparence sur les usages seront aussi essentielles pour maintenir la confiance du public et veiller au respect des droits et du bien-être de toutes et tous.

Conclusion

Segment Anything Model 2 (SAM 2) marque un tournant en vision par ordinateur, avec des capacités de segmentation avancées pour les images comme pour les vidéos.

Sa faculté à suivre des objets en temps réel, conjuguée à une précision accrue et à des techniques de prompting conviviales, en fait un outil précieux pour de nombreux secteurs.

Au fur et à mesure de son évolution, SAM 2 ouvre de nouvelles perspectives en création, en recherche scientifique et au-delà. Avec une démo interactive et un accès open source au modèle et à son vaste jeu de données d'entraînement, Meta AI encourage l'innovation et la collaboration au sein de la communauté IA, posant les bases des prochaines avancées en compréhension visuelle et en applications interactives.

Obtenez une certification de haut niveau en matière d'IA

Démontrez que vous pouvez utiliser l'IA de manière efficace et responsable.

FAQs

Comment SAM 2 gère-t-il les cas de segmentation ambigus où plusieurs objets partagent des frontières similaires ?

SAM 2 prédit plusieurs masques à chaque étape lorsqu'il détecte une ambiguïté, par exemple quand un objet partage des frontières avec d'autres. Si des prompts supplémentaires ne suffisent pas à lever l'ambiguïté, le modèle sélectionne le masque au plus fort IoU (Intersection over Union) prédit pour la propagation dans la vidéo, garantissant la segmentation la plus fiable tout au long de la séquence.

Quels mécanismes d'attention spécifiques SAM 2 utilise-t-il pour améliorer la précision de la segmentation en vidéo ?

SAM 2 utilise des mécanismes de self-attention et de cross-attention au sein de son module d'attention mémoire. Ils permettent au modèle de se concentrer sur les images passées pertinentes stockées dans la banque mémoire, améliorant la précision de la segmentation sur des séquences complexes, notamment lors de transformations ou d'occlusions.

Comment la banque mémoire de SAM 2 concilie-t-elle contexte temporel et efficacité de calcul ?

La banque mémoire de SAM 2 fonctionne comme une file FIFO (First In, First Out) pour conserver les souvenirs jusqu'à N images récentes. Ce choix apporte le contexte temporel nécessaire en retenant l'essentiel des dernières images tout en maintenant l'efficacité de calcul, évitant que le modèle ne soit submergé par trop de données.

Quel type de codage positionnel SAM 2 utilise-t-il pour maintenir la précision spatiale en segmentation vidéo ?

SAM 2 emploie un Rotary Positional Embedding (RoPE) 2D dans ses couches d'attention mémoire. Ce codage positionnel préserve la précision spatiale au fil des images en conservant des relations spatiales cohérentes, même lorsque les objets se déplacent ou changent de forme.

Comment SAM 2 garantit-il l'équité entre différents groupes démographiques pour des tâches de segmentation vidéo ?

SAM 2 a été évalué en matière d'équité entre différents groupes démographiques avec le jeu Ego-Exo4D, qui inclut des informations démographiques déclaratives. Le modèle montre des écarts minimaux de performance entre genres et tranches d'âge avec des prompts à 3 clics ou des masques vérité terrain, ce qui favorise une performance équitable entre populations.


Dr Ana Rojo-Echeburúa's photo
Author
Dr Ana Rojo-Echeburúa
LinkedIn
Twitter

Ana Rojo Echeburúa est une spécialiste de l'IA et des données, titulaire d'un doctorat en mathématiques appliquées. Elle aime transformer les données en informations exploitables et possède une grande expérience de la direction d'équipes techniques. Ana aime travailler en étroite collaboration avec ses clients pour résoudre leurs problèmes commerciaux et créer des solutions d'IA innovantes. Connue pour ses compétences en matière de résolution de problèmes et de communication claire, elle est passionnée par l'IA, en particulier l'IA générative. Ana se consacre à l'apprentissage continu et au développement éthique de l'IA, ainsi qu'à la simplification des problèmes complexes et à l'explication de la technologie de manière accessible.

Sujets
Intelligence artificielle
Grands modèles linguistiques

Apprenez l'IA avec ces cours !

Cours

Traitement d’images en Python

4 h
56.8K
Apprenez à traiter, transformer et manipuler les images à votre convenance.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow