Weiter zum Inhalt

Einführung in LangChain für Data Engineering & Datenanwendungen

LangChain ist ein Framework, um KI aus großen Sprachmodellen in Datenpipelines und Anwendungen einzubinden. Dieses Tutorial zeigt, was mit LangChain möglich ist: welche Probleme es löst und Beispiele für Dateneinsatzszenarien.
Aktualisiert 18. Sept. 2026  · 11 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Große Sprachmodelle (LLMs) wie OpenAI GPT, Google Bert und Meta LLaMA revolutionieren ganze Branchen. Sie können nahezu jeden denkbaren Text erzeugen – von Marketingtexten über Data-Science-Code bis hin zu Poesie. Während ChatGPT dank seiner intuitiven Chatoberfläche die größte Aufmerksamkeit bekommt, gibt es weit mehr Möglichkeiten, LLMs in anderer Software nutzbar zu machen.

So bietet DataLab einen KI-Assistenten, der Code und Text in deinen Analysen schreibt oder verbessert. Und die interaktiven Kurse von DataCamp enthalten eine „Erklär mir meinen Fehler“-Funktion, die dir aufzeigt, wo du dich vertan hast. Diese Funktionen werden von GPT angetrieben und über die OpenAI API genutzt.

LangChain stellt ein Framework über mehreren LLM-APIs bereit. Es soll Softwareentwicklerinnen, -entwickler und Data Engineers produktiver machen, wenn sie KI auf Basis von LLMs in Anwendungen und Datenpipelines integrieren.

Dieses Tutorial zeigt, welche Probleme LangChain löst und welche Hauptanwendungsfälle es gibt – damit du verstehst, wann und wofür du es einsetzen solltest. Hilfreich ist vorab ein Grundverständnis davon, was ein LLM ist. Zum Auffrischen eignet sich das Tutorial How NLP is Changing the Future of Data Science.

Welche Probleme löst LangChain?

Im Kern gibt es zwei Workflows für die Arbeit mit LLMs.

  1. „Chatten“: Du schreibst einen Prompt, sendest ihn an die KI und erhältst eine Textantwort.
  2. „Embedding“: Du schreibst einen Prompt, sendest ihn an die KI und erhältst ein numerisches Array zurück.

Beide Workflows – Chatten und Embedding – bringen Herausforderungen mit sich, die LangChain adressiert.

Prompts bestehen aus viel Boilerplate

Ein Problem beim Chatten wie auch beim Embedding: Ein guter Prompt umfasst weit mehr als nur die zu erledigende Aufgabe. Du musst auch die „Persönlichkeit“ und den Schreibstil der KI beschreiben und Anweisungen für faktenbasierte Antworten geben. Du könntest zwar einen einfachen Prompt zur Aufgabe schreiben:

Write an outline for a 500-word blog post targeted at teenagers about the health benefits of doing yoga.

Um konsistent gute Antworten zu bekommen, brauchst du aber eher so etwas:

You are an expert sports scientist. Your writing style is casual but terse.

Write an outline for a 500-word blog post targeted at teenagers about the health benefits of doing yoga.

Only include factually correct information. Explain your reasoning.

Vieles davon ist wiederkehrender Boilerplate-Text, der sich von Prompt zu Prompt wiederholt. Ideal wäre, ihn einmal zu schreiben und dann automatisch in die gewünschten Prompts einzufügen.

LangChain löst dieses Problem mit Prompt-Vorlagen. Sie kombinieren den eigentlichen Input (hier: der Text zur Blog-Outline über Yoga) mit dem Boilerplate (Schreibstil und Bitte um faktenbasierte Antworten).

Antworten sind unstrukturiert

Im Chat-Workflow liefert das Modell reinen Text zurück. Wird die KI jedoch in Software eingesetzt, ist häufig ein strukturiertes Outputformat gewünscht, mit dem sich programmatisch weiterarbeiten lässt. Soll etwa ein Datensatz erzeugt werden, braucht es ein konkretes Format wie CSV oder JSON.

Selbst wenn der Prompt die KI verlässlich zu strukturierten Antworten bewegt, musst du dieses Output handhaben. Dafür stellt LangChain Output-Parser bereit.

Der Wechsel zwischen LLMs ist aufwendig

GPT ist extrem erfolgreich, aber es gibt viele andere LLMs. Wenn du direkt gegen die API eines Anbieters programmierst, bindest du dich an dessen Ökosystem. Denkbar ist zum Beispiel, dass du nach dem Ausbau deiner KI-Features mit GPT feststellst, dass für dein Produkt bessere Mehrsprachigkeit nötig ist. Dann möchtest du vielleicht zu Polyglot wechseln oder – wenn du die KI in dein Produkt einbettest – ein kompakteres Modell wie StableLM von Stability AI einsetzen.

LangChain bietet dafür eine LLM-Klasse. Diese Abstraktion erleichtert den Austausch eines Modells durch ein anderes oder den parallelen Einsatz mehrerer Modelle erheblich.

LLMs haben ein kurzes Gedächtnis

Die Antwort eines LLM basiert auf dem bisherigen Verlauf (Prompts und frühere Antworten). Allerdings ist das Gedächtnis recht kurz. Selbst das aktuelle GPT-4 kommt standardmäßig auf 8.000 Tokens (etwa 6.000 Wörter).

Überschreitet ein Chat die Grenzen des Kontexts, werden die Antworten inkonsistent – die KI „weiß“ den Gesprächsbeginn nicht mehr. Gerade bei Chatbots ist das problematisch. Idealerweise erinnert sich der Bot an das gesamte Gespräch, um Widersprüche zu vermeiden.

LangChain löst das mit Chat-Nachrichtenverläufen. Damit kannst du frühere Nachrichten erneut an das LLM übergeben, um es an den Kontext zu erinnern.

LLM-Einsatz in Pipelines zu integrieren ist schwierig

In Datenpipelines oder Anwendungen ist die KI oft nur ein Baustein in einer größeren Funktion. Du möchtest zum Beispiel Daten aus einer Datenbank holen, an das LLM übergeben, die Antwort weiterverarbeiten und in ein anderes System einspeisen.

LangChain unterstützt solche Pipeline-Workflows mit Chains und Agents. Chains verketten mehrere Komponenten linear. Agents gehen weiter: Mit Business-Logik steuerst du, wie Komponenten interagieren. Etwa durch bedingte Pfade je nach LLM-Output.

Daten an das LLM zu übergeben ist heikel

Da LLMs textbasiert arbeiten, ist oft unklar, wie man Daten sinnvoll ans Modell übergibt. Das Problem hat zwei Seiten.

Erstens musst du Daten so speichern, dass du steuern kannst, welche Teile an das LLM gehen. Bei rechteckigen Datensätzen wie DataFrames oder SQL-Tabellen möchtest du typischerweise zeilenweise schicken.

Zweitens musst du entscheiden, wie du die Daten in den Prompt integrierst. Am einfachsten ist es, den Datensatz direkt in den Prompt zu packen („Prompt Stuffing“). Es gibt aber deutlich ausgereiftere Ansätze.

Den ersten Teil löst LangChain mit Indexes. Sie importieren Daten etwa aus Datenbanken, JSON-Dateien, pandas DataFrames, CSV-Dateien und anderen Formaten und speichern sie so, dass sie zeilenweise an ein LLM übergeben werden können.

Für den zweiten Teil bietet LangChain indexbezogene Chains und vier Verfahren zur Datenübergabe an ein LLM.

Prompt Stuffing fügt den gesamten Datensatz in den Prompt ein. Das ist simpel, funktioniert aber nur bei kleinen Datenmengen.

Map-Reduce teilt die Daten in Chunks, ruft das LLM mit einem ersten Prompt für jeden Chunk auf (der „Map“-Teil) und ruft das LLM anschließend mit einem anderen Prompt erneut auf, der die Antworten der ersten Runde enthält. Geeignet immer dann, wenn du an „group by“ denkst.

Refine ist ein iterativer Ansatz im Bayesian-Stil: Du startest mit einem Prompt auf dem ersten Chunk und bittest das LLM für jeden weiteren Chunk, das Ergebnis anhand der neuen Daten zu verfeinern. Das eignet sich, wenn die Antwort auf ein Ziel konvergieren soll.

Map-Rerank ist eine Variante von Map-Reduce. Der erste Teil ist identisch: Daten in Chunks teilen und pro Chunk prompten. Zusätzlich bittest du das LLM um einen Konfidenzwert zur Antwort, um die Outputs zu ranken. Das ist ideal für Empfehlungsszenarien mit einer „besten“ Antwort.

Welche Programmiersprachen unterstützt LangChain?

LangChain lässt sich über das langchain-Paket in JavaScript verwenden – ideal, um KI in Webanwendungen einzubetten.

Außerdem gibt es das Python-Paket langchain (PyPI, conda). Das eignet sich, um KI in Datenpipelines oder Python-basierte Software einzubauen.

Was sind die wichtigsten Einsatzszenarien für LangChain?

Grundsätzlich überall dort, wo du ein LLM nutzen möchtest. Im Folgenden findest du mehrere datenbezogene Beispiele und die jeweils relevanten LangChain-Funktionen.

Datasets mit natürlicher Sprache abfragen

Einer der größten Gamechanger in der Datenanalyse: SQL-Abfragen (oder entsprechender Python-/R-Code) per natürlicher Sprache schreiben. So wird explorative Datenanalyse auch ohne Programmierkenntnisse möglich.

Es gibt mehrere Varianten des Workflows. Bei kleinen Datensätzen kann das LLM Ergebnisse direkt erzeugen. Dazu lädst du die Daten mit den Document Loaders von LangChain in ein passendes Format, übergibst sie über indexbezogene Chains an das LLM und parsest die Antwort mit einem Output-Parser.

Häufiger gibst du dem LLM Metadaten zur Datenstruktur (Tabellennamen, Spaltennamen und -typen, Hinweise wie fehlende Werte) und bittest es um SQL-/Python-/R-Code, den du anschließend ausführst. Dieser Flow ist einfacher, da keine Datenübergabe nötig ist; LangChain hilft dennoch, weil es die Schritte modularisiert.

Eine weitere Variante: Du fügst einen zweiten LLM-Call zur Interpretation der Ergebnisse hinzu. Solche Workflows mit mehreren LLM-Aufrufen sind die Paradedisziplin von LangChain. Hier helfen die Tools für Nachrichtenverläufe, damit die Interpretation konsistent zu den zuvor bereitgestellten Strukturdaten bleibt.

Mit APIs interagieren

In Daten-Workflows wie dem Aufbau einer Pipeline ist die Einbindung eines LLM oft Teil einer längeren Kette mit weiteren API-Aufrufen – etwa für Börsendaten oder Cloud-Plattformen.

Die Chain- und Agent-Funktionen von LangChain, die Schritte sequenziell verbinden (und mit Logik für verzweigende Pipelines anreichern), sind dafür ideal.

Einen Chatbot bauen

Chatbots zählen zu den beliebtesten KI-Anwendungen, und generative KI verspricht sehr viel realistischeres Verhalten. Allerdings ist es aufwendig, die Persönlichkeit des Bots zu steuern und den Gesprächskontext zuverlässig im Gedächtnis zu halten.

Mit Prompt-Vorlagen von LangChain steuerst du Tonalität, Kommunikationsstil und die Art der Antworten deines Chatbots.

Zusätzlich sorgen die Tools für Nachrichtenverläufe für ein längeres Gedächtnis als die paar Hundert oder Tausend Wörter, die LLMs standardmäßig bieten – für mehr Konsistenz innerhalb eines Gesprächs oder sogar über mehrere Sessions hinweg.

Weitere Einsatzmöglichkeiten

Dieses Tutorial streift nur die Oberfläche. Es gibt viele weitere LLM-Anwendungsfälle für Datenprofis. Ob persönlicher Assistent, Report-Zusammenfassungen oder Q&A zu Support-Dokumenten und Wissensdatenbanken – mit LangChain integrierst du KI in jede Datenpipeline oder Datenanwendung, die dir vorschwebt.

Geh den nächsten Schritt

LangChain-Inhalte kommen bald zu DataCamp. Bis dahin kannst du einen der hier beschriebenen Use Cases kennenlernen – mit dem Kurs Building Chatbots in Python.

Themen
Datentechnik
Künstliche Intelligenz
Verwandt

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

Python-Tutorial zum Verknüpfen von Zeichenfolgen

Lerne verschiedene Methoden zum Verknüpfen von Zeichenfolgen in Python kennen, mit Beispielen, die jede Technik zeigen.
DataCamp Team's photo

DataCamp Team

5 Min.

Tutorial

Python-Lambda-Funktionen: Ein Leitfaden für Anfänger

Lerne mehr über Python-Lambda-Funktionen, wozu sie gut sind und wann man sie benutzt. Enthält praktische Beispiele und bewährte Methoden für eine effektive Umsetzung.
Mark Pedigo's photo

Mark Pedigo

10 Min.

Tutorial

Python-Schleifen-Tutorial

Ein umfassendes Einführungs-Tutorial zu Python-Schleifen. Lerne und übe while- und for-Schleifen, verschachtelte Schleifen, die Schlüsselwörter break und continue, die Range-Funktion und vieles mehr!
Satyabrata Pal's photo

Satyabrata Pal

15 Min.

Mehr AnzeigenMehr Anzeigen