Bilder und Videos sind allgegenwärtig. Wir Menschen verlassen uns für viele Aufgaben auf unser Sehvermögen – beim Autofahren, beim Erkennen von Freundinnen und Freunden oder bei Diagnosen. Da Computer immer tiefer in unseren Alltag vordringen, ist es umso wichtiger, dass auch sie mit Bildern umgehen können. Bildanalyse ist der Weg, wie Computer ein Bild „sehen“ und verstehen. Wird die Bildanalyse durch Machine Learning unterstützt, sprechen wir von Computer Vision.
Dieses Tutorial führt dich durch die Art und Weise, wie Computer Bilder „sehen“, erklärt die Grundlagen der Bildmanipulation und zeigt schließlich, wie sich Machine Learning und generative KI auf Bilder anwenden lassen. Legen wir los!
Wenn du mehr über Bildklassifikation lernen möchtest, schau dir unser Code-along zu Image Classification with Hugging Face an.
Was ist Computer Vision?
Computer Vision ist ein Teilgebiet der Künstlichen Intelligenz, das Computern und Systemen ermöglicht, aus digitalen Bildern, Videos und anderen visuellen Eingaben sinnvolle Informationen zu gewinnen. Es ist die Wissenschaft und Technologie von Maschinen, die sehen können. Als wissenschaftliche Disziplin wendet Computer Vision Theorien und Modelle auf den Aufbau von Systemen an, die visuelle Informationen verarbeiten.
Im Kern geht es bei Computer Vision um das Interpretieren visueller Daten. Dazu gehört das Erfassen, Verarbeiten, Analysieren und Verstehen digitaler Bilder, um hochdimensionale Informationen aus der realen Welt zu extrahieren und als numerische oder symbolische Daten für Maschinen nutzbar zu machen. Dabei kommen Methoden und Techniken aus Physik, Mathematik, Elektrotechnik und Informatik zum Einsatz.
Einführung in die Bildanalyse
Auf der untersten Ebene arbeiten Computer mit 1 und 0. Das gilt auch für Bilder. Computer können ein Bild als Matrix aus 1 und 0 darstellen. Beim Anzeigen eines Bildes blendet der Computer ein Raster von Pixeln ein, von denen jedes mit genau einer Farbe gefüllt ist. Betrachte eine sehr einfache Form, etwa das schwarze Dreieck unten.
![]()
Abbildung 1: Ein einfaches Dreieck mit niedriger Auflösung aus 28 Pixeln.
Diese Form besteht aus 28 Pixeln: 16 schwarzen und 12 weißen Pixeln. In der folgenden Abbildung siehst du die Umrandung jedes Pixels.
![]()
Abbildung 2: Schwarzes Dreieck mit umrandeten Pixeln.
Aber dieses Bild ist nur eine Darstellung der vom Computer gespeicherten Zahlenmatrix.

Abbildung 3: Veranschaulichung der 1 und 0 in der Matrix, aus der das Dreiecksbild besteht.
Das ist für Bilder mit nur zwei Farben – Schwarz und Weiß – recht einfach. Bei Graustufenbildern braucht es mehr Abstufung. In den Kästchen können dann Zahlen wie 0,015 stehen. Diese Zahl sagt dem Computer im Grunde, welche Leuchtdichte ein Pixel auf dem Bildschirm bekommen soll. Sie definiert einen Wert zwischen Schwarz (1) und Weiß (0).
Farbbilder analysieren
So eintönig sind Bilder aber selten. Wie gehen Computer mit Farbbildern um? Färben wir das Dreieck grün!
![]()
Abbildung 4: Dasselbe 28-Pixel-Dreieck wie zuvor, jetzt mit Farbe!
Hier reicht eine Zahl zwischen Null und Eins nicht aus, um diese Farbe zu beschreiben. Es gibt zu viele Farben, als dass man jeder eine einzelne, intuitiv erfassbare Zahl zuweisen könnte.
Stattdessen wurden Systeme entwickelt, die die Bestandteile einer Farbe aufschlüsseln und jedem Bestandteil eigene Zahlen zuweisen.
Du hast zum Beispiel sicher schon von RGB gehört. Dieses Farbmodell zerlegt jede Farbe in die Anteile von Rot, Grün und Blau, die zusammen die gewünschte Farbe ergeben.
Das RGB-Modell stammt von Bildschirmen wie Fernsehern, die rote, grüne und blaue Pixel verwenden. Es unterstützt die additive Farbmischung, wie sie bei solchen Lichtquellen vorkommt.
In diesem System heißen Rot, Blau und Grün „Kanäle“. Bei einem 8‑Bit‑Bild erhält jeder Kanal einen Wert zwischen 0 und 255 (das ist der Maximalwert einer achtstelligen Binärzahl).
Schauen wir uns an, was das für unser grünes Dreieck bedeutet.
Die RGB‑Werte für dieses Grün lauten 154, 205 und 50. Wäre es reines Grün, wären Rot- und Blaukanal jeweils 0. Die RGB‑Darstellung zeigt, dass diesem Grün viel Rot und etwas Blau beigemischt ist. Jedes Pixel hat drei Kanalwerte, die es beschreiben. Jedes grüne Pixel wird durch 154, 205, 50 dargestellt, jedes weiße durch 0, 0, 0.
Das bedeutet: Dieses einfache grüne 28‑Pixel‑Dreieck wird durch drei 7x4‑Matrizen repräsentiert.
Du kannst dir vorstellen, wie diese drei Matrizen übereinandergestapelt das Bild ergeben.

Abbildung 5: Für dieses grüne Dreieck enthält jeder Farbkanal im RGB‑System eine Matrix von Pixelwerten. Zusammengestapelt entstehen daraus die Bilddaten.
Du siehst, wie Bilder schnell viel Speicherplatz benötigen, wenn jedes Pixel drei Zahlen braucht. Überlege kurz, wie viele Zahlen in einem hochauflösenden Bild stecken, etwa in 4K (mit 4.000 Pixeln).
RGB ist nicht das einzige System zur Farbcodierung. Vielleicht kennst du auch CMYK, das vier Zahlen pro Farbe nutzt: Cyan, Magenta, Gelb und Schwarz. Dieses subtraktive Farbmodell ist beispielsweise beim Drucken hilfreich.
Jedes Farbsystem hat Vor- und Nachteile. Wenn du bei der Analyse auf Speicherprobleme stößt, lohnt es sich, Alternativen zu prüfen. In diesem Tutorial bleiben wir jedoch bei RGB.
Was lässt sich nun mit diesen Pixelwertmatrizen anstellen?
Manuelle Techniken der Bildanalyse
Objekte mit Thresholding isolieren
Wie erkennt ein Computer, welche Pixel ein Gesicht oder ein anderes Objekt darstellen? Heute übernehmen das oft Machine‑Learning‑Modelle. Um die zu verstehen, hilft es, zunächst zu lernen, wie man eine Figur manuell in einem Bild isoliert.
Stell dir ein Video mit zwei Eidechsen vor, aufgenommen vor hellem Hintergrund. Der Einfachheit halber wandelst du das Video in Graustufen um, damit es nur noch einen Kanal gibt. Du möchtest die Bewegung der Eidechsen im Video verfolgen.
Ein Video ist nur eine Abfolge von Fotos (Frames). Zuerst zerlegst du also den Stapel und betrachtest jedes Foto einzeln. Nun musst du dem Computer zeigen, welcher Teil des Graustufenfotos die Eidechse ist und welcher nicht.
Theoretisch könntest du mit der Maus jedes einzelne Pixel, das zur Eidechse gehört, markieren und als „Eidechse“ beschriften. Angesichts der Auflösung und der vielen Bilder deines Videos ist das aber unrealistisch.
Stattdessen definierst du eine Regel, die dem Computer sagt, was zur Eidechse gehört und was nicht. Am einfachsten geht das mit Thresholding.

Abbildung 6: Der Einfachheit halber arbeiten wir hier in Graustufen.
Was ist Thresholding?
Thresholding segmentiert ein Bild anhand des numerischen Werts jedes Pixels. Betrachte erneut das Graustufenbild der Eidechsen. Die Eidechsen erscheinen dunkler als der Hintergrund. Häufig gibt es in Bildern einen Helligkeitsunterschied zwischen dem Zielobjekt und dem Hintergrund.
Thresholding nutzt diesen Unterschied, um die Kontur des Objekts – hier der Eidechsen – zu finden. Ziel ist es, einen Schwellwert zu bestimmen, der helle und dunkle Pixel trennt.
Ein binäres Bild erzeugen
Stell dir die Zahlenmatrix dieses Graustufenbilds vor. Jedes Pixel hat einen Wert zwischen 0 und 255.
Mit Thresholding kannst du eine Regel festlegen, dass „alles ausreichend Dunkle“ Eidechse ist. Beispielsweise: Jedes Pixel mit einem Wert von 130 oder höher gehört zur Eidechse, alles darunter nicht.
Technisch setzt du dabei alles mit dem Schwellwert oder höher auf 255 und alles andere auf 0. So entsteht ein binäres Bild mit schwarzen und weißen Pixeln. Hast du einen guten Schwellwert gewählt, sind die Eidechsen schwarz vor weißem Hintergrund.

Abbildung 7: Binärbild, erzeugt mit einem Schwellwert von 130.
In diesem Beispiel haben wir 130 willkürlich gewählt. Um die Eidechsen sauber zu isolieren, solltest du einen Wert finden, der den Großteil der Eidechsen erfasst und gleichzeitig möglichst wenige Hintergrundpixel einschließt.
Dieser Ansatz, für das gesamte Bild einen einzigen Schwellwert zu wählen, heißt globales Thresholding. Es ist grob und oft ungenau. Bei einer perfekt silhouettierten Eidechse vor weißem Hintergrund funktioniert es gut. Wie du hier siehst, sind reale Bilder jedoch selten so einfach. Häufig brauchst du eine ausgefeiltere Methode.
Eine solche Methode ist lokales Thresholding. Dabei wählst du in verschiedenen Bildbereichen unterschiedliche Schwellwerte. Das ist besonders nützlich bei Helligkeitsverläufen im Hintergrund. Es gibt viele weitere Optimierungsverfahren – welches du wählst, hängt vom Anwendungsfall ab.
Auch Farbbilder lassen sich thresholden. Das ist jedoch deutlich komplizierter und sprengt den Rahmen dieses Tutorials.
Morphologische Analyse
Thresholding bringt dich bei der Isolierung der Eidechsen weit, ist aber nicht perfekt. Teile des Hintergrunds können fälschlich als Eidechse markiert werden oder Eidechsenteile fehlen. Du brauchst ein weiteres Werkzeug, um die Tiere besser abzugrenzen. Beim Thresholding hast du eine Regel auf Basis von Farbe oder Helligkeit definiert. Jetzt nutzt du Formregeln – sogenannte morphologische Operationen.
Formen mit Strukturelementen definieren
Morphologische Operationen verwenden Strukturelemente, um die Kanten von Formen zu bestimmen. Ein Strukturelement ist eine kleine Matrix mit bestimmter Form, meist Quadrat, Kreis oder Kreuz. Auch die Größe des Strukturelements lässt sich variieren.
Bei einer morphologischen Operation wird jedes Pixel mit seinen Nachbarn innerhalb dieser Form verglichen. Es gibt zwei grundlegende Operationen, um die Form des Zielobjekts zu definieren: Dilatation und Erosion.
Dilatation
Bei der Dilatation gilt: Wenn irgendein Nachbarpixel innerhalb des Strukturelements dunkel ist (hier 1), wird das Zielpixel ebenfalls auf 1 gesetzt.
Stell dir vor, du fährst mit einer quadratischen Lupe über ein Zahlenraster. Du legst eine Zahl in die Mitte und schaust dir die Zahlen im Quadrat an. Ist eine davon 1, markierst du die mittlere Zahl als 1 – unabhängig vom ursprünglichen Wert.
So kann die Dilatation Objektgrenzen ausdehnen oder Löcher füllen.
Erosion
Erosion funktioniert analog, aber mit umgekehrter Wirkung. Wenn ein Nachbarpixel 0 ist, wird das Zielpixel zu 0. Dadurch lassen sich Objekte trennen, Rauschen reduzieren und Kanten schärfen.

Abbildung 8: Visuelles Beispiel für Dilatation und Erosion mit kreuzförmigem Strukturelement. Im Beispiel wurde die Operation nur auf die zweite Zeile angewendet. In echten Bildern gilt sie für jedes Pixel. Schon hier siehst du: Erosion verschmälert die Linie, Dilatation macht sie dicker.
So wirken Dilatation und Erosion auf das binäre Eidechsenbild.

Abbildung 9: Beispiel für Erosion und Dilatation auf dem Eidechsenfoto. Das Strukturelement war ein 6x6‑Quadrat.
Dilatation und Erosion kombinieren
Dilatation und Erosion lassen sich iterativ oder nacheinander anwenden, um das Ergebnis zu beeinflussen. Üblich ist der kombinierte Einsatz beider Verfahren.
Folgt auf Erosion eine Dilatation, werden kleine Ausstülpungen und Rauschen entfernt, die verbleibende Kontur verstärkt sich. Das nennt man Opening.
Folgt auf Dilatation eine Erosion, werden kleine Löcher und Lücken gefüllt und die Kanten aufgeräumt. Das nennt man Closing.

Abbildung 10: Demonstration von Opening und Closing mit einem 6x6‑Quadrat als Strukturelement.
Du siehst: Keines der Bilder isoliert die Eidechsen perfekt. Mit jeder Anpassung kommst du der Sache aber näher.
Im nächsten Schritt könntest du dem Computer sagen, er soll alles außerhalb eines gewissen Größenbereichs ignorieren. Das entfernt die meisten Sprenkel und lässt die Eidechsen übrig. Lerne das selbst im Image Processing in Python Course auf DataCamp!
Für jedes Bild oder jede Bildserie kannst du solche Regelketten definieren, die dem Computer sagen, wie dein Ziel aussieht. Auf dieser Basis kann er Entscheidungen treffen.
Solche Entscheidungen reichen vom Erkennen von Galaxien bis zum Auffinden von krankem Gewebe. Für jedes einzelne Bild Regeln zu schreiben, ist jedoch aufwendig und mühsam. Hier kommt Machine Learning ins Spiel.
Überwachtes Machine Learning für die Bildanalyse
Ein überwachtes ML‑Modell trainieren
Wie du gesehen hast, ist manuelle Bildanalyse anspruchsvoll, weil unzählige Variablen eine Rolle spielen. Zum Glück hilft Machine Learning (ML), diesen Prozess zu automatisieren. Einen tiefen Einblick bekommst du in Machine Learning Scientist with Python oder Supervised Machine Learning. Dieses Tutorial streift ML nur so weit, wie es fürs Verständnis der Bildverarbeitung nötig ist.
Es gibt zwei große ML‑Kategorien: überwachtes ML und unüberwachtes ML.
Beim überwachten ML gibst du dem Computer viele Bilder und beschriftest sie vorab. Das ist, als würdest du einem Baby Tiere zeigen und sagen: „Das ist ein Elefant.“ Das Baby muss selbst herausfinden, was Dinge zu „Elefanten“ macht – und was zu „Fischen“.
Beim überwachten ML macht der Computer etwas ganz Ähnliches.

Abbildung 11: Von DALL·E generiertes Bild: Eine Mutter zeigt auf Spieltiere, um dem Baby Formen beizubringen. Überwachtes Lernen funktioniert ähnlich: Es werden Beispiele mit richtiger Antwort bereitgestellt.
Annotation und Merkmalsextraktion
Angenommen, du möchtest ein Modell trainieren, das Objekte in unbekannten Bildern erkennt. Der erste Schritt beim Trainieren eines überwachten Modells ist das Annotieren und Labeln einer Bildsammlung, dem Trainingsdatensatz. Annotation bedeutet, interessante Bereiche im Bild manuell zu markieren.
Wollen wir ein Modell auf verschiedene Tierarten trainieren, würden wir in jedem Bild die Tiere umreißen und ihnen die passende Klasse zuweisen, etwa „cow“, „cat“ usw. Dieser annotierte Datensatz ist die Grundlage fürs Training. Es gibt auch viele bereits gelabelte Datensätze, die öffentlich verfügbar sind.
Sobald der Trainingsdatensatz vorliegt, müssen relevante Merkmale aus den Bildern extrahiert werden. Merkmalsextraktion bedeutet, wichtige Eigenschaften oder Muster zu identifizieren, die Klassen voneinander unterscheiden.
Im Tierbeispiel könnten „vier Beine“ und „Flecken“ typische Eigenschaften von Kühen sein.
Convolutional Neural Networks
Für die Merkmalsextraktion gibt es viele Techniken – von einfachen Farb- und Texturmerkmalen bis hin zu fortgeschrittenen Ansätzen wie Convolutional Neural Networks (CNNs).
CNNs sind ein populärer überwacht lernender Algorithmus, der während des Trainings wichtige Merkmale aus gelabelten Bildern automatisch lernt. Sie bestehen aus Schichten, die jeweils bestimmte Operationen auf die Bilddaten anwenden.
Convolution‑Schichten erfassen lokale Muster mittels Filtern, Pooling‑Schichten reduzieren die räumlichen Dimensionen. Voll verbundene Schichten kombinieren die Informationen. Durch diese Abfolge extrahiert und kombiniert das Netzwerk Merkmale, um präzise Vorhersagen zum Bildinhalt zu treffen.
Eine Architektur wählen
Das Training eines überwachten Modells wie eines CNN umfasst mehrere Schritte. Zunächst werden die Daten vorverarbeitet, um Konsistenz und Qualität sicherzustellen: Bilder skalieren, Pixelwerte normalisieren und den Datensatz per Transformationen wie Drehungen oder Spiegelungen erweitern.
Als Nächstes entwirfst du die Architektur des CNN. Im Kern ist das die Anzahl und Art der Schichten und deren Konfiguration. Die Architektur sollte Komplexität und Einfachheit ausbalancieren, damit das Modell wesentliche Merkmale erfasst, ohne zu überfitten. Es kann helfen, mit einer etablierten Architektur zu starten und sie anzupassen. Eine nützliche Übersicht findest du hier.

Abbildung 12: Einfache Beispielarchitekturen für CNNs.
Overfitting
Overfitting bedeutet, dass der Computer die Bilder im Trainingsdatensatz hervorragend beschriftet, unbekannte Bilder aber schlecht erkennt.
Oft liegt das daran, dass der Computer eine Verzerrung im Trainingsset gelernt hat, die im echten Leben nicht gilt (zum Beispiel wenn die meisten Katzenbilder einen blauen Hintergrund haben). Es gibt viele Techniken, um zu verhindern, dass das Modell die Trainingsdaten auswendig lernt, statt verallgemeinerbare Muster zu lernen.
Ein überwachtes ML‑Modell trainieren
Sobald die Architektur steht, initialisierst du die Modellparameter und startest das Training.
Während des Trainings passt das Modell seine Parameter iterativ mittels Optimierungsverfahren wie Gradientenabstieg an, um den Unterschied zwischen seinen Vorhersagen und den zuvor definierten Ground‑Truth‑Labels zu minimieren.
Dazu wird die Verlustfunktion berechnet, die den Vorhersagefehler quantifiziert, und die Parameter entsprechend aktualisiert.
Das Training eines überwachten ML‑Modells für die Bildanalyse ist ein iterativer Prozess. Du trainierst mit dem gelabelten Datensatz, bewertest die Leistung auf einem Validierungssatz und nimmst Anpassungen vor, bis die Ergebnisse zufriedenstellen.
Anwendungen überwachter ML‑Modelle in der Bildanalyse
Ist das überwachte ML‑Modell auf gelabelten Bilddaten trainiert, kann es für verschiedene Aufgaben der Bildanalyse eingesetzt werden. Hier sind gängige Anwendungen, die die Leistungsfähigkeit überwachter Modelle zeigen.
Bildklassifikation
Bei der Bildklassifikation geht es darum, einem Eingabebild ein Label bzw. eine Klasse zuzuweisen.
Ein überwacht trainiertes Modell kann beispielsweise Tierbilder den Kategorien „fish“, „lizard“ oder „beetle“ zuordnen.

Abbildung 13: Beispiel für Bildklassifikation. Dieses Bild wurde als „Dinner“ klassifiziert.
Durch das Lernen an einem vielfältigen, gelabelten Datensatz kann das Modell verallgemeinern und Bilder sehr genau klassifizieren. Einsatzgebiete sind u. a. das Erkennen von Krankheiten in medizinischen Bildern, das Erkennen von Objekten in Satellitenaufnahmen oder das Klassifizieren von Emotionen aus Gesichtsausdrücken. Mehr dazu in diesem DataCamp‑Webinar.
Objekterkennung
Objekterkennung ist eine weitere wichtige Anwendung. Anders als bei der Klassifikation werden hier Objekte nicht nur identifiziert, sondern auch lokalisiert – etwa durch Begrenzungsrahmen.
So kann das Modell mehrere Objekte in einem Bild erkennen.

Abbildung 14: Beispiel für Objekterkennung. Verschiedene Objekte im Bild wurden identifiziert.
Anwendungen reichen vom autonomen Fahren – Erkennung und Verfolgung von Fußgängern, Fahrzeugen und Verkehrsschildern – bis zu Überwachungssystemen zur Identifikation und Verfolgung relevanter Personen oder Objekte. Auch Facebook und Instagram nutzen solche Methoden, wenn dein Gesicht in Fotos markiert wird.
Herausforderungen überwachter ML‑Modelle
So beeindruckend überwachte Modelle sind, es gibt Einschränkungen und Herausforderungen.
Ein zentrales Problem ist der Bedarf an großen Mengen gelabelter Trainingsdaten. Das Annotieren und Labeln ist zeit- und ressourcenintensiv.
Überwachte Modelle reagieren zudem empfindlich auf Verzerrungen in den Trainingsdaten, was zu voreingenommenen oder unfairen Vorhersagen führen kann. Für neue Domänen oder Bildkategorien ist oft zusätzliches Training oder Feintuning nötig.
Die gelernten Repräsentationen und Entscheidungswege komplexer Modelle wie CNNs zu interpretieren, ist ebenfalls schwierig – es ist nicht immer klar, warum ein Modell eine bestimmte Vorhersage getroffen hat.
Trotzdem treiben überwachte ML‑Modelle die Bildanalyse voran und ermöglichen bemerkenswerte Fortschritte in Bereichen wie Gesundheitswesen, Landwirtschaft und Sicherheit.
Mit weiterer Forschung und Entwicklung lassen sich diese Herausforderungen adressieren und die Modelle verfeinern – für noch genauere und verlässlichere Bildverarbeitungslösungen.
Unüberwachtes Machine Learning für die Bildanalyse
Unüberwachtes Lernen einsetzen
Eine Alternative zum überwachten Lernen ist unüberwachtes Machine Learning. Anders als überwachtes Lernen kommt es ohne Labels aus und sucht stattdessen nach verborgenen Mustern, Strukturen oder Beziehungen in den Daten selbst.
Ziel des unüberwachten Lernens in der Bildanalyse ist es, aus unbeschrifteten Bilddaten sinnvolle Strukturen und Erkenntnisse zu gewinnen. Mit entsprechenden Techniken kannst du wertvolle Informationen extrahieren und die zugrunde liegenden Eigenschaften von Bildern besser verstehen.
Unüberwachtes Lernen kann ähnliche Bilder clustern, charakteristische Muster oder Texturen bestimmter Klassen entdecken und Anomalien bzw. Ausreißer erkennen.
Was unüberwachtes Lernen unterscheidet
Wenn überwachtes Lernen dem „Dies ist eine Kuh, das ist ein Fisch“ entspricht, dann ist unüberwachtes Lernen, einem Baby einfach einen Haufen Tiere zu geben und es selbst sortieren zu lassen. Es könnte nach Größe, Beinzahl, Textur oder Farbe sortieren.
Das Ergebnis kann deiner Sortierung nach Arten ähneln – oder ganz anders aussehen. Die Analyse der resultierenden Kategorien liefert dennoch nützliche Informationen.

Abbildung 15: Von DALL·E generiertes Bild: Ein Baby sortiert Tierfiguren in einer unüberwachten Lernumgebung.
Bildanalyse mit unüberwachten ML‑Modellen
Unüberwachte ML‑Modelle eröffnen spannende Möglichkeiten, indem sie Bilder ohne Labels in Gruppen oder Kategorien sortieren.
Stell dir vor, du hast eine riesige Bildsammlung und möchtest sie sinnvoll ordnen. Unüberwachte Modelle analysieren visuelle Merkmale und gruppieren Bilder anhand gemeinsamer Eigenschaften wie Farbe oder Form. So erhältst du wertvolle Einblicke und vereinfachst Analyseaufgaben.
Clustering‑Algorithmen
Clustering‑Algorithmen fassen ähnliche Bilder anhand gemeinsamer Merkmale zusammen. Ein weit verbreiteter Ansatz ist k‑means‑Clustering, das die Daten in eine vorgegebene Anzahl von Clustern aufteilt, indem es iterativ die Distanz innerhalb der Gruppen minimiert.
Hierarchisches Clustering ist ein anderer Ansatz, der durch wiederholtes Zusammenführen oder Aufteilen auf Basis der Ähnlichkeit eine hierarchische Struktur von Bildmengen erzeugt. So lassen sich natürliche Gruppierungen in unbeschrifteten Datensätzen entdecken und Ähnlichkeit sowie Vielfalt besser verstehen.
Bildsegmentierung
Besonders wertvoll ist unüberwachtes Lernen für die Bildsegmentierung, also das Aufteilen eines Bildes in sinnvolle Regionen oder Objekte.
Durch Clustering oder andere unüberwachte Methoden kannst du ein Bild in Bereiche mit ähnlicher Farbe, Textur oder anderen Eigenschaften zerlegen.
Das ist nützlich in der medizinischen Bildgebung zum Auffinden von Tumoren, in Satellitenbildern für Landbedeckungsklassen oder in der Computergrafik zum Trennen von Vorder- und Hintergrund.
Mustererkennung
Auch in der Mustererkennung glänzt unüberwachtes Lernen.
Unüberwachte Algorithmen lernen Repräsentationen oder Merkmale, die zugrunde liegende Muster oder Strukturen in den Daten erfassen. Durch diese gelernten Merkmale lassen sich Bilder anhand gemeinsamer Muster oder visueller Ähnlichkeiten klassifizieren oder gruppieren. So werden etwa Bildsuche oder Bildsynthese möglich.
Anomalieerkennung
Unüberwachtes Lernen wird auch zur Anomalieerkennung eingesetzt. Indem normale Muster eines Datensatzes gelernt werden, können abweichende Bilder oder Regionen identifiziert werden. Das ist besonders in der Überwachung hilfreich, wo das Erkennen ungewöhnlicher Aktivitäten bei der Sicherheitsüberwachung unterstützt.
Herausforderungen unüberwachter ML‑Modelle
Unüberwachtes Lernen bringt eigene Herausforderungen mit sich. Eine davon ist die Interpretation der Ergebnisse, da es keine Ground‑Truth‑Labels zum Vergleich gibt.
Zurück zum Tierbeispiel: Du könntest eine Kategorie mit braunem Pferd, Käfer und Oktopus erhalten, während eine andere Kategorie ein weißes Pferd, einen Hasen und eine Blume enthält. Ohne Vorgaben zur Sortierung entstehen Gruppen, die nicht besonders aussagekräftig sind.
Entsprechend ist es schwer, die Qualität und Aussagekraft der gefundenen Cluster oder Muster zu bewerten.
Vorteile unüberwachter ML‑Modelle
Unüberwachte Modelle bieten in der Bildverarbeitung mehrere Vorteile. Vor allem entfällt der Aufwand für umfangreiches manuelles Labeln – große Bilddatensätze lassen sich so leichter und kostengünstiger nutzen.
Stell dir vor, du müsstest jedes einzelne Instagram‑Bild manuell sichten und labeln. Unüberwachtes Lernen erspart einen solchen Kraftakt.
Zudem können unüberwachte Modelle verborgene Muster und Strukturen sichtbar machen und so neue Erkenntnisse und visuelle Beziehungen aufdecken, die nicht sofort ins Auge fallen.
Diese explorative Natur eröffnet neue Wege der Bildanalyse und kann Durchbrüche in Bereichen wie Raumfahrt, Robotik und Medizin ermöglichen.
|
Überwachtes ML |
Unüberwachtes ML |
|
|
Aufgaben |
|
|
|
Vorteile |
|
|
|
Nachteile |
|
|
Abbildung 16: Vergleich von überwachtem und unüberwachtem Machine Learning in der Bildverarbeitung.
Neue Bilder mit generativer KI erzeugen
Sobald ein Modell die Merkmale verschiedener Objekte in Bildern gelernt hat, kann es diese Information nutzen, um neue Bilder zu erzeugen.
DALL·E und Midjourney sind prominente Beispiele für unüberwachte ML‑Modelle, die generative Modellierung einsetzen, um neue Bilder zu erstellen. Durch Training auf riesigen Datensätzen lernen sie die Bausteine, die für Bilder bestimmter Klassen nötig sind.
Wenn du DALL·E also bittest, ein Bild eines Roboter‑Pandas zu erzeugen, greift das Modell auf seine interne Vorstellung von „Robotern“ und „Pandas“ zurück und setzt diese Bausteine zu deinem gewünschten Bild zusammen.
Es könnte zum Beispiel ableiten, dass Roboter aus Metall und Zahnrädern bestehen, während Pandas schwarz‑weiß sind. Daraus entsteht ein metallischer, schwarz‑weißer Panda‑Roboter mit Zahnrädern.

Abbildung 17: Von DALL·E generiertes Bild mit dem Prompt „Panda Robot“.
Fazit
Dieses Tutorial gibt dir einen Überblick über die Bildanalyse – mit dem Ziel, ihre Rolle im Machine Learning besser zu verstehen. Du solltest nun ein besseres Gefühl dafür haben, wie Computer Bilder „sehen“ und manipulieren, und die Grundlagen wichtiger ML‑Konzepte wie Vorverarbeitung, Merkmalsextraktion und Klassifikationsalgorithmen kennen.
Bildverarbeitung prägt unseren Alltag – von Social Media über medizinische Bildgebung und Raumfahrt bis zur Überwachung. Wenn du tiefer einsteigen möchtest, schau dir Image Processing with Python , Image Processing with Keras in Python und Deep Learning for Images with PyTorch auf DataCamp an.
Ich bin promoviert und habe 13 Jahre Erfahrung in der Arbeit mit Daten in der biologischen Forschung. Ich entwickle Software in verschiedenen Programmiersprachen, darunter Python, MATLAB und R. Meine Leidenschaft ist es, meine Liebe zum Lernen mit der Welt zu teilen.



