Kurs
Meta hat kürzlich einen spannenden Fortschritt in der KI vorgestellt: Segment Anything Model 2 (SAM 2).
Dieses Tool nimmt dir die mühsame Objektauswahl bei der Bild- und Videobearbeitung ab und macht sie so einfach wie ein Klick oder ein paar Striche. SAM 2 isoliert und verfolgt Objekte mühelos und äußerst präzise.
Doch SAM 2 ist mehr als nur ein Werkzeug für Designer. Entwickelt von Meta AI wird dieses fortschrittliche Modell ganze Branchen prägen – von der Neugestaltung der medizinischen Bildgebung bis hin zur Verbesserung autonomer Fahrsysteme.
In diesem Artikel erfährst du, was SAM 2 ist, wie es sich vom Vorgänger, dem ursprünglichen Segment Anything Model (SAM), unterscheidet und welche Kernfunktionen es auszeichnen. Außerdem beleuchten wir mögliche Einsatzszenarien und zeigen, wie du damit starten kannst.
Dieses Video zeigt, wie SAM 2 für die Videosegmentierung eingesetzt wird und dabei Objekte über mehrere Frames hinweg präzise verfolgt und segmentiert. Selbst bei Verdeckungen oder schnellen Bewegungen bleibt die Segmentierung konsistent.
Lass uns erkunden, wie SAM 2 die Möglichkeiten des Computer Vision erweitert und neue Maßstäbe setzt.
Was ist SAM 2?
SAM 2 (Segment Anything Model 2) ist der neueste Fortschritt von Meta AI in der Computer-Vision-Technologie. Es baut auf dem Fundament des ursprünglichen SAM auf und bietet verbesserte Funktionen für Bild- und Videosegmentierung.
Im Kern erzeugt SAM 2 präzise Segmentierungsmasken, die Objekte in Bildern oder Videos identifizieren und trennen.
Stell dir ein komplexes Bild mit vielen Objekten vor, aus dem du eines für die weitere Bearbeitung auswählen musst. Traditionell würdest du die Kontur mühsam Pixel für Pixel nachzeichnen – zeitaufwendig und frustrierend. SAM 2 vereinfacht das, indem es selbst in unübersichtlichen Szenen automatisch präzise Masken erzeugt.
Willst du in einem Video eine Figur verfolgen und sie durchgehend im Fokus behalten, kann SAM 2 die Bewegung problemlos tracken – selbst wenn die Figur kurz verschwindet oder ihre Form ändert.
Ein weiteres Beispiel dafür, wie SAM 2 die Aufmerksamkeit hält und die Bewegung einer Figur präzise verfolgt – auch wenn sie aus dem Bild verschwindet oder ihre Form wechselt. Das zeigt die Robustheit des Modells in komplexen Videoschnitt-Szenarien.
SAM 2 vs. SAM
Das ursprüngliche SAM war bereits beeindruckend, doch SAM 2 legt mit mehreren zentralen Verbesserungen deutlich nach.
|
Funktion |
SAM |
SAM2 |
|
Segmentierungsfähigkeit |
Nur Bilder |
Bilder und Videos |
|
Videosegmentierung |
Nicht unterstützt |
Echtzeit-Videosegmentierung mit Speicher |
|
Genauigkeit und Geschwindigkeit |
Baseline |
Höhere Genauigkeit und 6× schneller bei Bildsegmentierung |
|
Architektur |
Getrennte Modelle für unterschiedliche Aufgaben |
Einheitliches Modell für Bild- und Videosegmentierung |
|
Open Source |
Ja |
Ja |
Videosegmentierung
SAM 2 führt die Fähigkeit ein, Objekte in Videos zu segmentieren – ein großer Schritt gegenüber dem Vorgänger.
Ermöglicht wird das durch ein Session-basiertes Speichermodul, das das Zielobjekt über die Frames hinweg verfolgt. Dieser Speicher liegt in einer „Memory Bank“, die räumliche Feature-Maps und semantische Informationen über das Objekt vorhält.
Diese Karten und Informationen nutzt der Aufmerksamkeitsmechanismus des Modells – konkret Self-Attention und Cross-Attention –, um die Features des aktuellen Frames mit denen vorheriger Frames zu vergleichen.
Verbesserte Performance
SAM 2 verarbeitet Videoframes in Echtzeit mit rund 44 Frames pro Sekunde – ideal für Live-Videoanwendungen und interaktive Bearbeitung. Das ist ein deutlicher Sprung bei Tempo und Präzision, wodurch SAM 2 komplexe Aufgaben sehr genau bewältigt.
Verfeinertes Prompting
SAM 2 unterstützt fortgeschrittene Prompting-Techniken, etwa Masken als Eingabe-Prompts. So lassen sich Interessensbereiche deutlich genauer definieren – hilfreich in komplexen Szenen mit überlappenden Objekten.
Interaktive Segmentierung
Mit SAM 2 kannst du Segmentierungsergebnisse in Echtzeit durch Prompts in beliebigen Frames nachjustieren. Diese Interaktivität erlaubt iteratives Verfeinern – besonders wertvoll in Workflows, die höchste Präzision verlangen, etwa in der Postproduktion.
KI-Upskilling für Einsteiger
Anwendungsfelder von SAM 2
SAM 2 ist nicht nur für einfache Foto- oder Videoschnitte gedacht – die starken Funktionen lassen sich breit einsetzen, etwa in der digitalen Kunst, im Gesundheitswesen oder bei autonomen Fahrzeugen.
Kreativbranchen
SAM 2 verändert Bild- und Videobearbeitung, indem Aufgaben wie Objektauswahl und -entfernung, Hintergrundtausch und fortgeschrittenes Compositing deutlich einfacher werden.
So wird zum Beispiel das Erstellen surrealer Landschaften aus Elementen verschiedener Quellen mit SAM 2 zum unkomplizierten Prozess – komplexe Edits gelingen fast mühelos.
Über klassische Bearbeitung hinaus spielt SAM 2 auch bei generativer KI seine Stärken aus, da sich Elemente in generierten Bildern und Videos präzise steuern lassen. Das beflügelt neue Ideen und macht individuelle Ergebnisse leichter möglich.
Zudem kann die Integration von SAM 2 in Social-Media-Plattformen wie Instagram neue Filter und Effekte ermöglichen, die sich in Echtzeit an Objekte und Szenen anpassen – das steigert Interaktion und Kreativität.
Wissenschaft und Forschung
In der medizinischen Bildgebung kann SAM 2 helfen, Körperstrukturen in Scans präzise zu identifizieren und zu trennen.
Auch Forschende können mit SAM 2 die Größenentwicklung eines Tumors bei der Erprobung eines neuen Medikaments genau verfolgen – das führt zu belastbareren Ergebnissen und einem besseren Verständnis der Wirksamkeit.
SAM 2 ist jedoch nicht nur in der Medizin nützlich. Auch in Umweltstudien leistet es wertvolle Dienste – etwa bei der präzisen Auswertung von Satellitenbildern, um Entwaldung, schmelzende Gletscher oder Stadtentwicklung im Zeitverlauf zu verfolgen. Damit ist SAM 2 ein starkes Werkzeug für Forschung mit hohen Anforderungen an visuelle Genauigkeit.
Autonome Systeme
Die Automobilbranche profitiert besonders von SAM 2: Die Echtzeit- und Präzisionssegmentierung verbessert die Wahrnehmungssysteme autonomer Fahrzeuge. Fußgänger, andere Fahrzeuge und Hindernisse lassen sich genauer erkennen und verfolgen – entscheidend für sicheres Navigieren in komplexen Verkehrssituationen.
Stell dir ein selbstfahrendes Auto in einer belebten Innenstadt vor. Dank der fortschrittlichen Segmentierung von SAM 2 erkennt das Fahrzeug potenzielle Gefahren zuverlässig und reagiert angemessen – das erhöht die Sicherheit und fördert die Verbreitung autonomer Technologien.
Augmented Reality
SAM 2 hat großes Potenzial für Augmented Reality (AR). Mit präzisem Objekt-Tracking in Echtzeit verschmelzen virtuelle Elemente nahtlos mit der realen Umgebung – für noch immersivere AR-Erlebnisse. Das kann Anwendungen in Gaming, Bildung und Remote-Arbeit deutlich aufwerten.
Datenannotation und Training von KI-Modellen
Ein weiterer wichtiger Einsatz ist der Aufbau annotierter Datensätze (aus Bildern und Videos). SAM 2 automatisiert die Segmentierung in großen Datenmengen, reduziert manuellen Aufwand und beschleunigt die KI-Entwicklung. Das verbessert die Trainingsdatenqualität und führt zu robusteren, genaueren Modellen.
SAM2: Wie funktioniert es?
Schauen wir hinter die Kulissen von SAM 2.
SAM 2 basiert auf einer ausgefeilten Architektur mit drei Kernkomponenten: einem Bild-Encoder, einem flexiblen Prompt-Encoder und einem schnellen Masken-Decoder. Zusammen verarbeiten sie Bilder und Videos effizient.
- Bild-Encoder: Die hierarchische Architektur erfasst Multi-Scale-Features aus Videoframes und erkennt sowohl grobe Muster als auch feine Details.
- Prompt-Encoder: Mithilfe von Self- und Cross-Attention verfeinert er die Segmentierung anhand von Nutzereingaben wie Klicks oder Masken.
- Masken-Decoder: Der schnelle Decoder verarbeitet die Encoder-Informationen in Echtzeit zu hochwertigen Masken – auch in komplexen Szenen.
Memory Attention und raum-zeitliches Verständnis
Ein herausragendes Merkmal von SAM 2 ist das Memory-Attention-Modul, entscheidend für Videosegmentierung. Es ermöglicht dem Modell, Informationen aus vorherigen Frames zu behalten und zu nutzen – für konsistentes Tracking im gesamten Video.
Zum Verständnis hilft ein Blick auf die ursprüngliche SAM-Architektur:

SAM 2 erweitert die SAM-Architektur von Bildern auf Videos und segmentiert Objekte über die Frames hinweg. Verschiedene Prompts wie Klicks oder Bounding-Boxes definieren die Ausdehnung des Objekts in einem Frame. Ein schlanker Masken-Decoder verarbeitet Prompts und Bild-Embeddings zu einer Segmentierungsmaske, die über alle Frames propagiert wird – es entsteht ein „Masklet“.

Das System nutzt einen Speichermachanismus mit Memory-Encoder, -Bank und -Attention, um Informationen zu Objekten und Interaktionen zu speichern und in späteren Frames die Maskenvorhersagen zu verbessern.
Der Memory-Encoder aktualisiert die Memory Bank mit jeder Maskenvorhersage pro Frame. So verfeinert SAM 2 seine Ergebnisse, je mehr Frames verarbeitet werden. Die Architektur ist auf Echtzeit-Streaming ausgelegt – passend für Robotik oder Datenannotation.
Bei Bildern arbeitet SAM 2, indem es sie als ein Ein-Frame-Video behandelt – der Speichermodus ist dann inaktiv. Es erzeugt Segmentierungsmasken ohne Memory-Komponenten und löst die Aufgabe als vereinfachten Sonderfall.
Echtzeit-Performance
Dank optimierter Architektur und effizienter Verarbeitung erreicht SAM 2 etwa 44 Frames pro Sekunde. Diese Echtzeitfähigkeit eignet sich für ein breites Anwendungsspektrum – von Live-Editing bis zu interaktiven KI-Systemen.
Trainingsdaten
SAM 2 wurde auf einem umfangreichen, vielfältigen Datensatz trainiert, darunter das neue SA-V-Dataset mit über 600.000 Masklet-Annotationen aus 51.000 Videos. Diese Größe und Vielfalt ermöglichen starke Generalisierung – von Alltagsobjekten bis zu spezialisierten Domänen.
Einschränkungen von SAM 2
So fortschrittlich SAM 2 ist – ganz ohne Grenzen kommt es nicht aus.
Bei schwierigen Situationen gerät SAM 2 an Grenzen: starke Blickwinkelwechsel, lange Verdeckungen, dichte Szenen oder sehr lange Videos erschweren das Tracking. Als Gegenmittel erlaubt das Modell manuelle Korrekturen über interaktive Prompts.
In gedrängten Szenen kann SAM 2 ähnliche Objekte verwechseln, vor allem wenn das Zielobjekt nur in einem Frame festgelegt wurde. Zusätzliche Prompts in späteren Frames helfen, das zu korrigieren.
Die Effizienz sinkt, wenn viele Objekte gleichzeitig segmentiert werden, da jedes Objekt separat verarbeitet wird – ohne Abstimmung zwischen den Objekten. Zudem kann SAM 2 bei sehr schnellen Bewegungen feine Details verpassen, und Vorhersagen können zwischen Frames schwanken, weil keine zeitliche Glättung erzwungen wird.
Trotz fortschrittlicher automatischer Masklet-Erzeugung braucht es weiterhin menschliche Annotatoren – etwa zur Qualitätsprüfung oder um Korrekturframes zu identifizieren. Weitere Automatisierung und Verbesserungen sind nötig, und die Entwickler laden die KI-Community ein, auf SAM 2 aufzubauen, die Forschung voranzutreiben und neue Anwendungen zu schaffen.
SAM2: Wo kann ich SAM 2 herunterladen oder nutzen?
Die Model-Gewichte und den Code findest du auf der Meta-AI-Website. SAM 2 steht unter der Apache-2.0-Lizenz – also Open Source und frei zugänglich für Entwickler und Forschende. Den Download gibt es hier.
Wenn du SAM 2 einfach ausprobieren willst, gibt es eine interaktive Demo hier.

Ich habe SAM 2 mit einem Video aus meinem letzten Urlaub in Venedig getestet. Probier es mit eigenen Aufnahmen aus, um Objekte im gesamten Clip leicht zu markieren und zu verfolgen.
SAM 2: Weiterführende Ressourcen
Für einen tieferen Einblick in Architektur, Training und Anwendungen findest du das offizielle Forschungspaper. Es liefert detaillierte Einblicke in die Innovationen hinter SAM 2.
Wenn du tiefer einsteigen willst, findest du Doku, Tutorials und mehr auf der Meta-AI-Website – von Architekturdetails bis zu Schritt-für-Schritt-Anleitungen.
Auch die Community arbeitet aktiv an der Weiterentwicklung von SAM 2 in den Open-Source-Repos mit. Wer up to date bleibt und sich einbringt, kann die Zukunft von SAM 2 mitgestalten und früh von neuen Features profitieren.
Um nichts zu verpassen, folge dem Meta-AI-Blog und schau regelmäßig ins GitHub-Repository. Dort gibt es News, Praxisbeispiele und Ausblicke. So nutzt du SAM 2 optimal – und trägst zur Weiterentwicklung bei.
SAM 2: Ethische Aspekte
Wie bei jeder starken Technologie gilt: verantwortungsvoll einsetzen. Da SAM 2 auf großen Datensätzen basiert, besteht ein Risiko für Verzerrungen in den Vorhersagen – besonders relevant in sensiblen Bereichen wie Überwachung oder autonomem Fahren.
Außerdem sind Datenschutzfragen zu bedenken – insbesondere, wenn Menschen überwacht oder getrackt werden. Offene Diskussionen und klare Leitlinien sind wichtig, damit SAM 2 fair und zum Nutzen aller eingesetzt wird.
Wichtig ist auch: KI-Modelle wie SAM 2 sind nur so gut wie ihre Trainingsdaten. Daher sind diverse, ausgewogene Datensätze entscheidend, um faire Ergebnisse zu fördern.
Laufende Evaluation und Transparenz beim Einsatz von SAM 2 sind zentral, um Vertrauen zu schaffen und die Technologie im Sinne der Gesellschaft einzusetzen.
Fazit
Segment Anything Model 2 (SAM 2) setzt in der Computer Vision neue Akzente und bringt fortschrittliche Segmentierung für Bilder und Videos.
Echtzeit-Tracking, höhere Genauigkeit und nutzerfreundliches Prompting machen das Tool in vielen Branchen wertvoll.
Mit offener Demo, Open-Source-Zugang und großem Trainingsdatensatz fördert Meta AI Innovation und Zusammenarbeit – beste Voraussetzungen für die nächste Generation visuellen Verständnisses und interaktiver Anwendungen.
Verdiene eine Top-KI-Zertifizierung
FAQs
Wie geht SAM 2 mit mehrdeutigen Segmentierungsfällen um, in denen mehrere Objekte ähnliche Grenzen haben?
Wenn SAM 2 auf Mehrdeutigkeiten stößt – etwa wenn sich Objektgrenzen überlappen –, sagt das Modell in jedem Schritt mehrere Masken voraus. Lassen sich Unklarheiten nicht durch zusätzliche Prompts beheben, wählt das Modell die Maske mit dem höchsten vorhergesagten Intersection over Union (IoU) zur Weiterführung im Video, um die bestmögliche Segmentierung zu sichern.
Welche spezifischen Attention-Mechanismen setzt SAM 2 ein, um die Segmentierungsgenauigkeit in Videos zu erhöhen?
SAM 2 nutzt im Memory-Attention-Modul sowohl Self-Attention als auch Cross-Attention. Dadurch kann das Modell relevante frühere Frames aus der Memory Bank gezielt berücksichtigen und die Segmentierung über komplexe Videosequenzen hinweg verbessern – insbesondere bei Transformationen oder Verdeckungen.
Wie balanciert die Memory Bank in SAM 2 zwischen zeitlichem Kontext und Recheneffizienz?
Die Memory Bank von SAM 2 ist als FIFO-Warteschlange (First In, First Out) gestaltet und speichert Erinnerungen bis zu N jüngster Frames. So bleibt ausreichend zeitlicher Kontext erhalten, ohne die Rechenlast unnötig zu erhöhen – das Modell wird nicht von Daten überflutet.
Welche Art von Positionskodierung nutzt SAM 2, um die räumliche Genauigkeit bei der Videosegmentierung zu sichern?
SAM 2 verwendet in den Memory-Attention-Layern 2D Rotary Positional Embedding (RoPE). Diese Positionskodierung erhält die räumliche Genauigkeit über die Frames hinweg, indem sie Positionsbeziehungen zwischen Objekten und Umgebung konsistent abbildet – auch bei Bewegung oder Formänderung.
Wie stellt SAM 2 Fairness über verschiedene demografische Gruppen hinweg bei Videosegmentierungsaufgaben sicher?
SAM 2 wurde hinsichtlich Fairness über demografische Gruppen hinweg mit dem Ego-Exo4D-Datensatz evaluiert, der selbstberichtete demografische Angaben enthält. Bei 3-Klick-Prompts oder Ground-Truth-Masken zeigt das Modell nur minimale Leistungsunterschiede zwischen Geschlechtern und Altersgruppen – es arbeitet also weitgehend gleichwertig über verschiedene Populationen hinweg.
Ana Rojo Echeburúa ist KI- und Datenspezialistin und hat einen Doktortitel in angewandter Mathematik. Sie liebt es, Daten in verwertbare Erkenntnisse umzuwandeln und hat umfangreiche Erfahrung in der Leitung technischer Teams. Ana arbeitet gerne eng mit ihren Kunden zusammen, um deren Geschäftsprobleme zu lösen und innovative KI-Lösungen zu entwickeln. Sie ist für ihre Problemlösungsfähigkeiten und ihre klare Kommunikation bekannt und hat eine Leidenschaft für KI, insbesondere für generative KI. Ana widmet sich dem kontinuierlichen Lernen und der ethischen KI-Entwicklung sowie der Vereinfachung komplexer Probleme und der Erklärung von Technologien auf verständliche Weise.
