Weiter zum Inhalt

Sehen wie eine Maschine: Einsteigerleitfaden zur Bildanalyse im Machine Learning

Erfahre, wie Computer Bilder „sehen“ und interpretieren, welche Techniken zur Bildmanipulation es gibt und wie Machine Learning das Feld verändert hat.
Aktualisiert 18. Sept. 2026  · 15 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Bilder und Videos sind allgegenwärtig. Wir Menschen verlassen uns für viele Aufgaben auf unser Sehvermögen – beim Autofahren, beim Erkennen von Freundinnen und Freunden oder bei Diagnosen. Da Computer immer tiefer in unseren Alltag vordringen, ist es umso wichtiger, dass auch sie mit Bildern umgehen können. Bildanalyse ist der Weg, wie Computer ein Bild „sehen“ und verstehen. Wird die Bildanalyse durch Machine Learning unterstützt, sprechen wir von Computer Vision.

Dieses Tutorial führt dich durch die Art und Weise, wie Computer Bilder „sehen“, erklärt die Grundlagen der Bildmanipulation und zeigt schließlich, wie sich Machine Learning und generative KI auf Bilder anwenden lassen. Legen wir los!

Wenn du mehr über Bildklassifikation lernen möchtest, schau dir unser Code-along zu Image Classification with Hugging Face an. 

Was ist Computer Vision?

Computer Vision ist ein Teilgebiet der Künstlichen Intelligenz, das Computern und Systemen ermöglicht, aus digitalen Bildern, Videos und anderen visuellen Eingaben sinnvolle Informationen zu gewinnen. Es ist die Wissenschaft und Technologie von Maschinen, die sehen können. Als wissenschaftliche Disziplin wendet Computer Vision Theorien und Modelle auf den Aufbau von Systemen an, die visuelle Informationen verarbeiten.

Im Kern geht es bei Computer Vision um das Interpretieren visueller Daten. Dazu gehört das Erfassen, Verarbeiten, Analysieren und Verstehen digitaler Bilder, um hochdimensionale Informationen aus der realen Welt zu extrahieren und als numerische oder symbolische Daten für Maschinen nutzbar zu machen. Dabei kommen Methoden und Techniken aus Physik, Mathematik, Elektrotechnik und Informatik zum Einsatz.

Einführung in die Bildanalyse

Auf der untersten Ebene arbeiten Computer mit 1 und 0. Das gilt auch für Bilder. Computer können ein Bild als Matrix aus 1 und 0 darstellen. Beim Anzeigen eines Bildes blendet der Computer ein Raster von Pixeln ein, von denen jedes mit genau einer Farbe gefüllt ist. Betrachte eine sehr einfache Form, etwa das schwarze Dreieck unten.

Figure 2: Black triangle with each pixel outlined.

Abbildung 1: Ein einfaches Dreieck mit niedriger Auflösung aus 28 Pixeln.

Diese Form besteht aus 28 Pixeln: 16 schwarzen und 12 weißen Pixeln. In der folgenden Abbildung siehst du die Umrandung jedes Pixels.

Abbildung 2: Schwarzes Dreieck mit umrandeten Pixeln.

Aber dieses Bild ist nur eine Darstellung der vom Computer gespeicherten Zahlenmatrix.

Figure 3: A demonstration of the 1's and 0's in the matrix that makes up the triangle image.

Abbildung 3: Veranschaulichung der 1 und 0 in der Matrix, aus der das Dreiecksbild besteht.

Das ist für Bilder mit nur zwei Farben – Schwarz und Weiß – recht einfach. Bei Graustufenbildern braucht es mehr Abstufung. In den Kästchen können dann Zahlen wie 0,015 stehen. Diese Zahl sagt dem Computer im Grunde, welche Leuchtdichte ein Pixel auf dem Bildschirm bekommen soll. Sie definiert einen Wert zwischen Schwarz (1) und Weiß (0).

Farbbilder analysieren

So eintönig sind Bilder aber selten. Wie gehen Computer mit Farbbildern um? Färben wir das Dreieck grün!

Figure 4: The same 28-pixel triangle as before, but with a splash of color!

Abbildung 4: Dasselbe 28-Pixel-Dreieck wie zuvor, jetzt mit Farbe!

Hier reicht eine Zahl zwischen Null und Eins nicht aus, um diese Farbe zu beschreiben. Es gibt zu viele Farben, als dass man jeder eine einzelne, intuitiv erfassbare Zahl zuweisen könnte.

Stattdessen wurden Systeme entwickelt, die die Bestandteile einer Farbe aufschlüsseln und jedem Bestandteil eigene Zahlen zuweisen.

Du hast zum Beispiel sicher schon von RGB gehört. Dieses Farbmodell zerlegt jede Farbe in die Anteile von Rot, Grün und Blau, die zusammen die gewünschte Farbe ergeben.

Das RGB-Modell stammt von Bildschirmen wie Fernsehern, die rote, grüne und blaue Pixel verwenden. Es unterstützt die additive Farbmischung, wie sie bei solchen Lichtquellen vorkommt.

In diesem System heißen Rot, Blau und Grün „Kanäle“. Bei einem 8‑Bit‑Bild erhält jeder Kanal einen Wert zwischen 0 und 255 (das ist der Maximalwert einer achtstelligen Binärzahl).

Schauen wir uns an, was das für unser grünes Dreieck bedeutet.

Die RGB‑Werte für dieses Grün lauten 154, 205 und 50. Wäre es reines Grün, wären Rot- und Blaukanal jeweils 0. Die RGB‑Darstellung zeigt, dass diesem Grün viel Rot und etwas Blau beigemischt ist. Jedes Pixel hat drei Kanalwerte, die es beschreiben. Jedes grüne Pixel wird durch 154, 205, 50 dargestellt, jedes weiße durch 0, 0, 0.

Das bedeutet: Dieses einfache grüne 28‑Pixel‑Dreieck wird durch drei 7x4‑Matrizen repräsentiert.

Du kannst dir vorstellen, wie diese drei Matrizen übereinandergestapelt das Bild ergeben.

Figure 5

Abbildung 5: Für dieses grüne Dreieck enthält jeder Farbkanal im RGB‑System eine Matrix von Pixelwerten. Zusammengestapelt entstehen daraus die Bilddaten.

Du siehst, wie Bilder schnell viel Speicherplatz benötigen, wenn jedes Pixel drei Zahlen braucht. Überlege kurz, wie viele Zahlen in einem hochauflösenden Bild stecken, etwa in 4K (mit 4.000 Pixeln).

RGB ist nicht das einzige System zur Farbcodierung. Vielleicht kennst du auch CMYK, das vier Zahlen pro Farbe nutzt: Cyan, Magenta, Gelb und Schwarz. Dieses subtraktive Farbmodell ist beispielsweise beim Drucken hilfreich.

Jedes Farbsystem hat Vor- und Nachteile. Wenn du bei der Analyse auf Speicherprobleme stößt, lohnt es sich, Alternativen zu prüfen. In diesem Tutorial bleiben wir jedoch bei RGB.

Was lässt sich nun mit diesen Pixelwertmatrizen anstellen?

Manuelle Techniken der Bildanalyse

Objekte mit Thresholding isolieren

Wie erkennt ein Computer, welche Pixel ein Gesicht oder ein anderes Objekt darstellen? Heute übernehmen das oft Machine‑Learning‑Modelle. Um die zu verstehen, hilft es, zunächst zu lernen, wie man eine Figur manuell in einem Bild isoliert.

Stell dir ein Video mit zwei Eidechsen vor, aufgenommen vor hellem Hintergrund. Der Einfachheit halber wandelst du das Video in Graustufen um, damit es nur noch einen Kanal gibt. Du möchtest die Bewegung der Eidechsen im Video verfolgen.

Ein Video ist nur eine Abfolge von Fotos (Frames). Zuerst zerlegst du also den Stapel und betrachtest jedes Foto einzeln. Nun musst du dem Computer zeigen, welcher Teil des Graustufenfotos die Eidechse ist und welcher nicht.

Theoretisch könntest du mit der Maus jedes einzelne Pixel, das zur Eidechse gehört, markieren und als „Eidechse“ beschriften. Angesichts der Auflösung und der vielen Bilder deines Videos ist das aber unrealistisch.

Stattdessen definierst du eine Regel, die dem Computer sagt, was zur Eidechse gehört und was nicht. Am einfachsten geht das mit Thresholding.

Figure 6: To simplify things, we'll work with this photo in grayscale.

Abbildung 6: Der Einfachheit halber arbeiten wir hier in Graustufen.

Was ist Thresholding?

Thresholding segmentiert ein Bild anhand des numerischen Werts jedes Pixels. Betrachte erneut das Graustufenbild der Eidechsen. Die Eidechsen erscheinen dunkler als der Hintergrund. Häufig gibt es in Bildern einen Helligkeitsunterschied zwischen dem Zielobjekt und dem Hintergrund.

Thresholding nutzt diesen Unterschied, um die Kontur des Objekts – hier der Eidechsen – zu finden. Ziel ist es, einen Schwellwert zu bestimmen, der helle und dunkle Pixel trennt.

Ein binäres Bild erzeugen

Stell dir die Zahlenmatrix dieses Graustufenbilds vor. Jedes Pixel hat einen Wert zwischen 0 und 255.

Mit Thresholding kannst du eine Regel festlegen, dass „alles ausreichend Dunkle“ Eidechse ist. Beispielsweise: Jedes Pixel mit einem Wert von 130 oder höher gehört zur Eidechse, alles darunter nicht.

Technisch setzt du dabei alles mit dem Schwellwert oder höher auf 255 und alles andere auf 0. So entsteht ein binäres Bild mit schwarzen und weißen Pixeln. Hast du einen guten Schwellwert gewählt, sind die Eidechsen schwarz vor weißem Hintergrund.

Figure 7: Binary image generated by setting a threshold of 130.

Abbildung 7: Binärbild, erzeugt mit einem Schwellwert von 130.

In diesem Beispiel haben wir 130 willkürlich gewählt. Um die Eidechsen sauber zu isolieren, solltest du einen Wert finden, der den Großteil der Eidechsen erfasst und gleichzeitig möglichst wenige Hintergrundpixel einschließt.

Dieser Ansatz, für das gesamte Bild einen einzigen Schwellwert zu wählen, heißt globales Thresholding. Es ist grob und oft ungenau. Bei einer perfekt silhouettierten Eidechse vor weißem Hintergrund funktioniert es gut. Wie du hier siehst, sind reale Bilder jedoch selten so einfach. Häufig brauchst du eine ausgefeiltere Methode.

Eine solche Methode ist lokales Thresholding. Dabei wählst du in verschiedenen Bildbereichen unterschiedliche Schwellwerte. Das ist besonders nützlich bei Helligkeitsverläufen im Hintergrund. Es gibt viele weitere Optimierungsverfahren – welches du wählst, hängt vom Anwendungsfall ab.

Auch Farbbilder lassen sich thresholden. Das ist jedoch deutlich komplizierter und sprengt den Rahmen dieses Tutorials.

Morphologische Analyse

Thresholding bringt dich bei der Isolierung der Eidechsen weit, ist aber nicht perfekt. Teile des Hintergrunds können fälschlich als Eidechse markiert werden oder Eidechsenteile fehlen. Du brauchst ein weiteres Werkzeug, um die Tiere besser abzugrenzen. Beim Thresholding hast du eine Regel auf Basis von Farbe oder Helligkeit definiert. Jetzt nutzt du Formregeln – sogenannte morphologische Operationen.

Formen mit Strukturelementen definieren

Morphologische Operationen verwenden Strukturelemente, um die Kanten von Formen zu bestimmen. Ein Strukturelement ist eine kleine Matrix mit bestimmter Form, meist Quadrat, Kreis oder Kreuz. Auch die Größe des Strukturelements lässt sich variieren.

Bei einer morphologischen Operation wird jedes Pixel mit seinen Nachbarn innerhalb dieser Form verglichen. Es gibt zwei grundlegende Operationen, um die Form des Zielobjekts zu definieren: Dilatation und Erosion.

Dilatation

Bei der Dilatation gilt: Wenn irgendein Nachbarpixel innerhalb des Strukturelements dunkel ist (hier 1), wird das Zielpixel ebenfalls auf 1 gesetzt.

Stell dir vor, du fährst mit einer quadratischen Lupe über ein Zahlenraster. Du legst eine Zahl in die Mitte und schaust dir die Zahlen im Quadrat an. Ist eine davon 1, markierst du die mittlere Zahl als 1 – unabhängig vom ursprünglichen Wert.

So kann die Dilatation Objektgrenzen ausdehnen oder Löcher füllen.

Erosion

Erosion funktioniert analog, aber mit umgekehrter Wirkung. Wenn ein Nachbarpixel 0 ist, wird das Zielpixel zu 0. Dadurch lassen sich Objekte trennen, Rauschen reduzieren und Kanten schärfen.

Figure 8

Abbildung 8: Visuelles Beispiel für Dilatation und Erosion mit kreuzförmigem Strukturelement. Im Beispiel wurde die Operation nur auf die zweite Zeile angewendet. In echten Bildern gilt sie für jedes Pixel. Schon hier siehst du: Erosion verschmälert die Linie, Dilatation macht sie dicker.

So wirken Dilatation und Erosion auf das binäre Eidechsenbild.

Abbildung 9: Beispiel für Erosion und Dilatation auf dem Eidechsenfoto. Das Strukturelement war ein 6x6‑Quadrat.

Dilatation und Erosion kombinieren

Dilatation und Erosion lassen sich iterativ oder nacheinander anwenden, um das Ergebnis zu beeinflussen. Üblich ist der kombinierte Einsatz beider Verfahren.

Folgt auf Erosion eine Dilatation, werden kleine Ausstülpungen und Rauschen entfernt, die verbleibende Kontur verstärkt sich. Das nennt man Opening.

Folgt auf Dilatation eine Erosion, werden kleine Löcher und Lücken gefüllt und die Kanten aufgeräumt. Das nennt man Closing.

Figure 10: Demonstration of opening and closing techniques using a 6x6 square structuring element on the lizard photo.

Abbildung 10: Demonstration von Opening und Closing mit einem 6x6‑Quadrat als Strukturelement.

Du siehst: Keines der Bilder isoliert die Eidechsen perfekt. Mit jeder Anpassung kommst du der Sache aber näher.

Im nächsten Schritt könntest du dem Computer sagen, er soll alles außerhalb eines gewissen Größenbereichs ignorieren. Das entfernt die meisten Sprenkel und lässt die Eidechsen übrig. Lerne das selbst im Image Processing in Python Course auf DataCamp!

Für jedes Bild oder jede Bildserie kannst du solche Regelketten definieren, die dem Computer sagen, wie dein Ziel aussieht. Auf dieser Basis kann er Entscheidungen treffen.

Solche Entscheidungen reichen vom Erkennen von Galaxien bis zum Auffinden von krankem Gewebe. Für jedes einzelne Bild Regeln zu schreiben, ist jedoch aufwendig und mühsam. Hier kommt Machine Learning ins Spiel.

Überwachtes Machine Learning für die Bildanalyse

Ein überwachtes ML‑Modell trainieren

Wie du gesehen hast, ist manuelle Bildanalyse anspruchsvoll, weil unzählige Variablen eine Rolle spielen. Zum Glück hilft Machine Learning (ML), diesen Prozess zu automatisieren. Einen tiefen Einblick bekommst du in Machine Learning Scientist with Python oder Supervised Machine Learning. Dieses Tutorial streift ML nur so weit, wie es fürs Verständnis der Bildverarbeitung nötig ist.

Es gibt zwei große ML‑Kategorien: überwachtes ML und unüberwachtes ML.

Beim überwachten ML gibst du dem Computer viele Bilder und beschriftest sie vorab. Das ist, als würdest du einem Baby Tiere zeigen und sagen: „Das ist ein Elefant.“ Das Baby muss selbst herausfinden, was Dinge zu „Elefanten“ macht – und was zu „Fischen“.

Beim überwachten ML macht der Computer etwas ganz Ähnliches.

Figure 11

Abbildung 11: Von DALL·E generiertes Bild: Eine Mutter zeigt auf Spieltiere, um dem Baby Formen beizubringen. Überwachtes Lernen funktioniert ähnlich: Es werden Beispiele mit richtiger Antwort bereitgestellt.

Annotation und Merkmalsextraktion

Angenommen, du möchtest ein Modell trainieren, das Objekte in unbekannten Bildern erkennt. Der erste Schritt beim Trainieren eines überwachten Modells ist das Annotieren und Labeln einer Bildsammlung, dem Trainingsdatensatz. Annotation bedeutet, interessante Bereiche im Bild manuell zu markieren.

Wollen wir ein Modell auf verschiedene Tierarten trainieren, würden wir in jedem Bild die Tiere umreißen und ihnen die passende Klasse zuweisen, etwa „cow“, „cat“ usw. Dieser annotierte Datensatz ist die Grundlage fürs Training. Es gibt auch viele bereits gelabelte Datensätze, die öffentlich verfügbar sind.

Sobald der Trainingsdatensatz vorliegt, müssen relevante Merkmale aus den Bildern extrahiert werden. Merkmalsextraktion bedeutet, wichtige Eigenschaften oder Muster zu identifizieren, die Klassen voneinander unterscheiden.

Im Tierbeispiel könnten „vier Beine“ und „Flecken“ typische Eigenschaften von Kühen sein.

Convolutional Neural Networks

Für die Merkmalsextraktion gibt es viele Techniken – von einfachen Farb- und Texturmerkmalen bis hin zu fortgeschrittenen Ansätzen wie Convolutional Neural Networks (CNNs).

CNNs sind ein populärer überwacht lernender Algorithmus, der während des Trainings wichtige Merkmale aus gelabelten Bildern automatisch lernt. Sie bestehen aus Schichten, die jeweils bestimmte Operationen auf die Bilddaten anwenden.

Convolution‑Schichten erfassen lokale Muster mittels Filtern, Pooling‑Schichten reduzieren die räumlichen Dimensionen. Voll verbundene Schichten kombinieren die Informationen. Durch diese Abfolge extrahiert und kombiniert das Netzwerk Merkmale, um präzise Vorhersagen zum Bildinhalt zu treffen.

Eine Architektur wählen

Das Training eines überwachten Modells wie eines CNN umfasst mehrere Schritte. Zunächst werden die Daten vorverarbeitet, um Konsistenz und Qualität sicherzustellen: Bilder skalieren, Pixelwerte normalisieren und den Datensatz per Transformationen wie Drehungen oder Spiegelungen erweitern.

Als Nächstes entwirfst du die Architektur des CNN. Im Kern ist das die Anzahl und Art der Schichten und deren Konfiguration. Die Architektur sollte Komplexität und Einfachheit ausbalancieren, damit das Modell wesentliche Merkmale erfasst, ohne zu überfitten. Es kann helfen, mit einer etablierten Architektur zu starten und sie anzupassen. Eine nützliche Übersicht findest du hier.

Figure 12: Simple example CNN architectures.

Abbildung 12: Einfache Beispielarchitekturen für CNNs.

Overfitting

Overfitting bedeutet, dass der Computer die Bilder im Trainingsdatensatz hervorragend beschriftet, unbekannte Bilder aber schlecht erkennt.

Oft liegt das daran, dass der Computer eine Verzerrung im Trainingsset gelernt hat, die im echten Leben nicht gilt (zum Beispiel wenn die meisten Katzenbilder einen blauen Hintergrund haben). Es gibt viele Techniken, um zu verhindern, dass das Modell die Trainingsdaten auswendig lernt, statt verallgemeinerbare Muster zu lernen.

Ein überwachtes ML‑Modell trainieren

Sobald die Architektur steht, initialisierst du die Modellparameter und startest das Training.

Während des Trainings passt das Modell seine Parameter iterativ mittels Optimierungsverfahren wie Gradientenabstieg an, um den Unterschied zwischen seinen Vorhersagen und den zuvor definierten Ground‑Truth‑Labels zu minimieren.

Dazu wird die Verlustfunktion berechnet, die den Vorhersagefehler quantifiziert, und die Parameter entsprechend aktualisiert.

Das Training eines überwachten ML‑Modells für die Bildanalyse ist ein iterativer Prozess. Du trainierst mit dem gelabelten Datensatz, bewertest die Leistung auf einem Validierungssatz und nimmst Anpassungen vor, bis die Ergebnisse zufriedenstellen.

Anwendungen überwachter ML‑Modelle in der Bildanalyse

Ist das überwachte ML‑Modell auf gelabelten Bilddaten trainiert, kann es für verschiedene Aufgaben der Bildanalyse eingesetzt werden. Hier sind gängige Anwendungen, die die Leistungsfähigkeit überwachter Modelle zeigen.

Bildklassifikation

Bei der Bildklassifikation geht es darum, einem Eingabebild ein Label bzw. eine Klasse zuzuweisen.

Ein überwacht trainiertes Modell kann beispielsweise Tierbilder den Kategorien „fish“, „lizard“ oder „beetle“ zuordnen.

Figure 13: An example of image classification. This image has been classified as “Dinner.”

Abbildung 13: Beispiel für Bildklassifikation. Dieses Bild wurde als „Dinner“ klassifiziert.

Durch das Lernen an einem vielfältigen, gelabelten Datensatz kann das Modell verallgemeinern und Bilder sehr genau klassifizieren. Einsatzgebiete sind u. a. das Erkennen von Krankheiten in medizinischen Bildern, das Erkennen von Objekten in Satellitenaufnahmen oder das Klassifizieren von Emotionen aus Gesichtsausdrücken. Mehr dazu in diesem DataCamp‑Webinar.

Objekterkennung

Objekterkennung ist eine weitere wichtige Anwendung. Anders als bei der Klassifikation werden hier Objekte nicht nur identifiziert, sondern auch lokalisiert – etwa durch Begrenzungsrahmen.

So kann das Modell mehrere Objekte in einem Bild erkennen.

Figure 14: An example of object detection. Various objects within this image have been identified.

Abbildung 14: Beispiel für Objekterkennung. Verschiedene Objekte im Bild wurden identifiziert.

Anwendungen reichen vom autonomen Fahren – Erkennung und Verfolgung von Fußgängern, Fahrzeugen und Verkehrsschildern – bis zu Überwachungssystemen zur Identifikation und Verfolgung relevanter Personen oder Objekte. Auch Facebook und Instagram nutzen solche Methoden, wenn dein Gesicht in Fotos markiert wird.

Herausforderungen überwachter ML‑Modelle

So beeindruckend überwachte Modelle sind, es gibt Einschränkungen und Herausforderungen.

Ein zentrales Problem ist der Bedarf an großen Mengen gelabelter Trainingsdaten. Das Annotieren und Labeln ist zeit- und ressourcenintensiv.

Überwachte Modelle reagieren zudem empfindlich auf Verzerrungen in den Trainingsdaten, was zu voreingenommenen oder unfairen Vorhersagen führen kann. Für neue Domänen oder Bildkategorien ist oft zusätzliches Training oder Feintuning nötig.

Die gelernten Repräsentationen und Entscheidungswege komplexer Modelle wie CNNs zu interpretieren, ist ebenfalls schwierig – es ist nicht immer klar, warum ein Modell eine bestimmte Vorhersage getroffen hat.

Trotzdem treiben überwachte ML‑Modelle die Bildanalyse voran und ermöglichen bemerkenswerte Fortschritte in Bereichen wie Gesundheitswesen, Landwirtschaft und Sicherheit.

Mit weiterer Forschung und Entwicklung lassen sich diese Herausforderungen adressieren und die Modelle verfeinern – für noch genauere und verlässlichere Bildverarbeitungslösungen.

Unüberwachtes Machine Learning für die Bildanalyse

Unüberwachtes Lernen einsetzen

Eine Alternative zum überwachten Lernen ist unüberwachtes Machine Learning. Anders als überwachtes Lernen kommt es ohne Labels aus und sucht stattdessen nach verborgenen Mustern, Strukturen oder Beziehungen in den Daten selbst.

Ziel des unüberwachten Lernens in der Bildanalyse ist es, aus unbeschrifteten Bilddaten sinnvolle Strukturen und Erkenntnisse zu gewinnen. Mit entsprechenden Techniken kannst du wertvolle Informationen extrahieren und die zugrunde liegenden Eigenschaften von Bildern besser verstehen.

Unüberwachtes Lernen kann ähnliche Bilder clustern, charakteristische Muster oder Texturen bestimmter Klassen entdecken und Anomalien bzw. Ausreißer erkennen.

Was unüberwachtes Lernen unterscheidet

Wenn überwachtes Lernen dem „Dies ist eine Kuh, das ist ein Fisch“ entspricht, dann ist unüberwachtes Lernen, einem Baby einfach einen Haufen Tiere zu geben und es selbst sortieren zu lassen. Es könnte nach Größe, Beinzahl, Textur oder Farbe sortieren.

Das Ergebnis kann deiner Sortierung nach Arten ähneln – oder ganz anders aussehen. Die Analyse der resultierenden Kategorien liefert dennoch nützliche Informationen.

Figure 15: DALL-E generated image of a baby sorting animal toys in an unsupervised learning environment.

Abbildung 15: Von DALL·E generiertes Bild: Ein Baby sortiert Tierfiguren in einer unüberwachten Lernumgebung.

Bildanalyse mit unüberwachten ML‑Modellen

Unüberwachte ML‑Modelle eröffnen spannende Möglichkeiten, indem sie Bilder ohne Labels in Gruppen oder Kategorien sortieren.

Stell dir vor, du hast eine riesige Bildsammlung und möchtest sie sinnvoll ordnen. Unüberwachte Modelle analysieren visuelle Merkmale und gruppieren Bilder anhand gemeinsamer Eigenschaften wie Farbe oder Form. So erhältst du wertvolle Einblicke und vereinfachst Analyseaufgaben.

Clustering‑Algorithmen

Clustering‑Algorithmen fassen ähnliche Bilder anhand gemeinsamer Merkmale zusammen. Ein weit verbreiteter Ansatz ist k‑means‑Clustering, das die Daten in eine vorgegebene Anzahl von Clustern aufteilt, indem es iterativ die Distanz innerhalb der Gruppen minimiert.

Hierarchisches Clustering ist ein anderer Ansatz, der durch wiederholtes Zusammenführen oder Aufteilen auf Basis der Ähnlichkeit eine hierarchische Struktur von Bildmengen erzeugt. So lassen sich natürliche Gruppierungen in unbeschrifteten Datensätzen entdecken und Ähnlichkeit sowie Vielfalt besser verstehen.

Bildsegmentierung

Besonders wertvoll ist unüberwachtes Lernen für die Bildsegmentierung, also das Aufteilen eines Bildes in sinnvolle Regionen oder Objekte.

Durch Clustering oder andere unüberwachte Methoden kannst du ein Bild in Bereiche mit ähnlicher Farbe, Textur oder anderen Eigenschaften zerlegen.

Das ist nützlich in der medizinischen Bildgebung zum Auffinden von Tumoren, in Satellitenbildern für Landbedeckungsklassen oder in der Computergrafik zum Trennen von Vorder- und Hintergrund.

Must­er­erkennung

Auch in der Mustererkennung glänzt unüberwachtes Lernen.

Unüberwachte Algorithmen lernen Repräsentationen oder Merkmale, die zugrunde liegende Muster oder Strukturen in den Daten erfassen. Durch diese gelernten Merkmale lassen sich Bilder anhand gemeinsamer Muster oder visueller Ähnlichkeiten klassifizieren oder gruppieren. So werden etwa Bildsuche oder Bildsynthese möglich.

Anomalieerkennung

Unüberwachtes Lernen wird auch zur Anomalieerkennung eingesetzt. Indem normale Muster eines Datensatzes gelernt werden, können abweichende Bilder oder Regionen identifiziert werden. Das ist besonders in der Überwachung hilfreich, wo das Erkennen ungewöhnlicher Aktivitäten bei der Sicherheitsüberwachung unterstützt.

Herausforderungen unüberwachter ML‑Modelle

Unüberwachtes Lernen bringt eigene Herausforderungen mit sich. Eine davon ist die Interpretation der Ergebnisse, da es keine Ground‑Truth‑Labels zum Vergleich gibt.

Zurück zum Tierbeispiel: Du könntest eine Kategorie mit braunem Pferd, Käfer und Oktopus erhalten, während eine andere Kategorie ein weißes Pferd, einen Hasen und eine Blume enthält. Ohne Vorgaben zur Sortierung entstehen Gruppen, die nicht besonders aussagekräftig sind.

Entsprechend ist es schwer, die Qualität und Aussagekraft der gefundenen Cluster oder Muster zu bewerten.

Vorteile unüberwachter ML‑Modelle

Unüberwachte Modelle bieten in der Bildverarbeitung mehrere Vorteile. Vor allem entfällt der Aufwand für umfangreiches manuelles Labeln – große Bilddatensätze lassen sich so leichter und kostengünstiger nutzen.

Stell dir vor, du müsstest jedes einzelne Instagram‑Bild manuell sichten und labeln. Unüberwachtes Lernen erspart einen solchen Kraftakt.

Zudem können unüberwachte Modelle verborgene Muster und Strukturen sichtbar machen und so neue Erkenntnisse und visuelle Beziehungen aufdecken, die nicht sofort ins Auge fallen.

Diese explorative Natur eröffnet neue Wege der Bildanalyse und kann Durchbrüche in Bereichen wie Raumfahrt, Robotik und Medizin ermöglichen.

 

Überwachtes ML

Unüberwachtes ML

Aufgaben

  • Bildklassifikation
  • Objekterkennung
  • Mustererkennung
  • Anomalieerkennung

Vorteile

  • Vorhersehbare, aussagekräftige Ergebnisse
  • Mit kleineren Datensätzen machbar
  • Weniger manueller Aufwand
  • Deckt verborgene Muster und neue Erkenntnisse auf

Nachteile

  • Mehr manueller Aufwand
  • Empfindlich gegenüber Verzerrungen in Trainingsdaten
  • Gruppen teils weniger aussagekräftig
  • Ergebnisse können unerwartet sein

Abbildung 16: Vergleich von überwachtem und unüberwachtem Machine Learning in der Bildverarbeitung.

Neue Bilder mit generativer KI erzeugen

Sobald ein Modell die Merkmale verschiedener Objekte in Bildern gelernt hat, kann es diese Information nutzen, um neue Bilder zu erzeugen.

DALL·E und Midjourney sind prominente Beispiele für unüberwachte ML‑Modelle, die generative Modellierung einsetzen, um neue Bilder zu erstellen. Durch Training auf riesigen Datensätzen lernen sie die Bausteine, die für Bilder bestimmter Klassen nötig sind.

Wenn du DALL·E also bittest, ein Bild eines Roboter‑Pandas zu erzeugen, greift das Modell auf seine interne Vorstellung von „Robotern“ und „Pandas“ zurück und setzt diese Bausteine zu deinem gewünschten Bild zusammen.

Es könnte zum Beispiel ableiten, dass Roboter aus Metall und Zahnrädern bestehen, während Pandas schwarz‑weiß sind. Daraus entsteht ein metallischer, schwarz‑weißer Panda‑Roboter mit Zahnrädern.

Figure 17: DALL-E generated image using the prompt 'Panda Robot'.

Abbildung 17: Von DALL·E generiertes Bild mit dem Prompt „Panda Robot“.

Fazit

Dieses Tutorial gibt dir einen Überblick über die Bildanalyse – mit dem Ziel, ihre Rolle im Machine Learning besser zu verstehen. Du solltest nun ein besseres Gefühl dafür haben, wie Computer Bilder „sehen“ und manipulieren, und die Grundlagen wichtiger ML‑Konzepte wie Vorverarbeitung, Merkmalsextraktion und Klassifikationsalgorithmen kennen.

Bildverarbeitung prägt unseren Alltag – von Social Media über medizinische Bildgebung und Raumfahrt bis zur Überwachung. Wenn du tiefer einsteigen möchtest, schau dir Image Processing with Python , Image Processing with Keras in Python und Deep Learning for Images with PyTorch auf DataCamp an.


Amberle McKee's photo
Author
Amberle McKee
LinkedIn

Ich bin promoviert und habe 13 Jahre Erfahrung in der Arbeit mit Daten in der biologischen Forschung. Ich entwickle Software in verschiedenen Programmiersprachen, darunter Python, MATLAB und R. Meine Leidenschaft ist es, meine Liebe zum Lernen mit der Welt zu teilen.

Themen
Maschinelles Lernen
Verwandt

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

Ein Leitfaden zu Python-Hashmaps

Finde heraus, was Hashmaps sind und wie sie in Python mit Hilfe von Wörterbüchern umgesetzt werden.
Javier Canales Luna's photo

Javier Canales Luna

11 Min.

Tutorial

Fibonacci-Folge in Python: Lerne und entdecke Programmiertechniken

Finde raus, wie die Fibonacci-Folge funktioniert. Schau dir die mathematischen Eigenschaften und die Anwendungen in der echten Welt an.
Laiba Siddiqui's photo

Laiba Siddiqui

6 Min.

Tutorial

Python-Lambda-Funktionen: Ein Leitfaden für Anfänger

Lerne mehr über Python-Lambda-Funktionen, wozu sie gut sind und wann man sie benutzt. Enthält praktische Beispiele und bewährte Methoden für eine effektive Umsetzung.
Mark Pedigo's photo

Mark Pedigo

10 Min.

Tutorial

Wie man Listen in Python aufteilt: Einfache Beispiele und fortgeschrittene Methoden

Lerne, wie du Python-Listen mit Techniken wie Slicing, List Comprehensions und itertools aufteilen kannst. Finde heraus, wann du welche Methode für die beste Datenverarbeitung nutzen solltest.
Allan Ouko's photo

Allan Ouko

11 Min.

Mehr AnzeigenMehr Anzeigen