course
Jeśli masz wrażenie, że sztuczna inteligencja (AI) jest nagle wszędzie, to dlatego, że tak jest. Zgodnie z najnowszymi badaniami McKinsey, globalne wdrożenia AI wzrosły z około 50–60% organizacji w latach 2020–2021 do imponujących 88% w 2025 roku.
To jednak gwałtowne tempo rozwoju stworzyło problem językowy. „AI” stało się pojemnym hasłem, którym opisuje się zupełnie różne technologie. Używa się go zamiennie w odniesieniu do prostych chatbotów opartych na regułach, generatorów obrazów i futurystycznych robotów rodem z sci‑fi.
Dla praktyków danych ta niejednoznaczność jest przeszkodą. Gdy interesariusz prosi o „rozwiązanie AI”, powinieneś wiedzieć: czy chodzi o prosty model regresji, agenta generatywnego, czy system wizyjny?
W tym kompleksowym przewodniku przyjrzymy się temu słownictwu. Nie ograniczymy się do listy definicji — spojrzymy na nie przez cztery różne pryzmaty: jak jest zbudowane, co potrafi, jak podejmuje decyzje i jak wpisuje się w realne procesy pracy.
Jeśli dopiero zaczynasz, polecam kurs Understanding Artificial Intelligence.
Czym jest AI?
Sztuczna inteligencja (AI) to dziedzina informatyki skupiona na tworzeniu inteligentnych agentów zdolnych do wykonywania zadań, które zwykle wymagają ludzkiej inteligencji, takich jak rozwiązywanie problemów, rozpoznawanie mowy czy podejmowanie decyzji.
AI to nauka interdyscyplinarna z wieloma podejściami. Może być oparta na regułach (działać w z góry określonych warunkach) lub wykorzystywać algorytmy uczenia maszynowego do uczenia się na danych, co pozwala systemom dostosowywać się do nieprzewidzianych scenariuszy.
Jednak precyzyjne zdefiniowanie AI okazuje się zaskakująco trudne z powodu zjawiska nazywanego przez badaczy „efektem AI”. Opisuje ono, jak społeczne postrzeganie AI nieustannie się przesuwa wraz z dojrzewaniem technologii. Gdy dana możliwość staje się powszechna, ludzie przestają nazywać ją „AI” i zaczynają traktować jako zwykłe oprogramowanie.
Ze względu na tę zmienność definicji i szeroki zakres, pojedyncza klasyfikacja nie wystarcza. Potrzebujemy wielu perspektyw, by zobaczyć pełny obraz:
- Technologia: Podstawowe algorytmy i architektury.
- Możliwości: Pomiar poziomu „inteligencji” — od wąskiej po superinteligencję.
- Funkcjonalność: Jak systemy przetwarzają informacje i utrzymują pamięć?

Na przykład samochód autonomiczny można jednocześnie sklasyfikować na trzy sposoby:
- Wąska AI (według konkretnej zdolności).
- Uczenie głębokie (według technologii bazowej).
- Ograniczona pamięć (według funkcjonalności).
W kolejnych sekcjach przyjrzymy się tym typom.
Jeśli szukasz zupełnie nietechnicznego wprowadzenia do podstaw, polecam nasz Przewodnik po AI dla początkujących.
Rodzaje AI według technologii
Najbardziej rygorystyczny sposób klasyfikacji AI opiera się na technologii bazowej, czyli „silniku” napędzającym system. Taki podział rozróżnia systemy w zależności od sposobu przetwarzania danych i uczenia się. Zobaczmy te różne typy.
Uczenie maszynowe
Uczenie maszynowe (ML) to podzbiór AI skupiony na systemach, które uczą się na danych i doskonalą bez ręcznego programowania każdej reguły. Zamiast pisać kod „jeśli to, to tamto”, dostarczasz algorytmowi dane i pozwalasz mu znaleźć wzorce.
Uczenie maszynowe dzieli się na trzy główne paradygmaty, z których każdy pasuje do innych problemów:
- Uczenie nadzorowane: Najpowszechniejsze w biznesie. Wykorzystuje dane z etykietami (pary wejście–wyjście) do trenowania algorytmów. Na przykład pokazujesz modelowi 1000 e‑maili oznaczonych jako „Spam” lub „Nie spam”, a on uczy się klasyfikować kolejny. Popularne algorytmy to regresja liniowa, K‑najbliższych sąsiadów (KNN) i drzewa decyzyjne.
- Uczenie nienadzorowane: Algorytm otrzymuje dane bez etykiet i samodzielnie musi znaleźć ukryte struktury lub wzorce. Często używane do segmentacji klientów (klasteryzacja). Do najczęściej stosowanych należą klasteryzacja k‑średnich i analiza głównych składowych (PCA).
- Uczenie ze wzmocnieniem (RL): Idzie zupełnie inną ścieżką — uczy agentów metodą prób i błędów w systemie nagród i kar. Agent RL otrzymuje informację zwrotną z interakcji ze środowiskiem i stopniowo uczy się zachowań maksymalizujących skumulowane nagrody w czasie. Tę metodę wykorzystuje się do trenowania robotów i zaawansowanych algorytmów do gier, takich jak AlphaGo.

Aby zbudować solidne podstawy uczenia maszynowego, przerób ścieżkę umiejętności Machine Learning Fundamentals with Python.
Uczenie głębokie
Uczenie głębokie (DL) to wyspecjalizowany podzbiór ML inspirowany strukturą ludzkiego mózgu. Wykorzystuje sztuczne sieci neuronowe z wieloma warstwami („głębokie”) do modelowania złożonych, nieliniowych relacji w ogromnych zbiorach danych. Podczas gdy tradycyjne ML może osiągać sufit wraz ze wzrostem ilości danych, DL często nadal się poprawia.
Kluczowe architektury obejmują:
- Konwolucyjne sieci neuronowe (CNN): Złoty standard w przetwarzaniu obrazów. Używają „filtrów” do automatycznego skanowania obrazów i wykrywania hierarchii przestrzennych, takich jak krawędzie, kształty i tekstury.
- Rekurencyjne sieci neuronowe (RNN): Projektowane do danych sekwencyjnych, takich jak szereg czasowy czy mowa. Utrzymują „pamięć” poprzednich wejść, które wpływają na bieżące wyjście.
- Transformatory: Architektura stojąca za nowoczesnymi dużymi modelami językowymi (LLM), takimi jak GPT 5.2 i Gemini 3. Wykorzystuje mechanizm uwagi do równoległego przetwarzania całych sekwencji danych, ważenia znaczenia słów względem siebie zamiast obróbki po kolei.
- Generatywne sieci przeciwstawne (GAN): Struktura, w której dwa modele rywalizują: „generator” tworzący fałszywe dane oraz „dyskryminator” próbujący je wykryć. Ta konkurencja prowadzi do niezwykle realistycznych wyników syntetycznych.
- Modele dyfuzyjne: Silnik stojący za narzędziami takimi jak Midjourney. Generują wysokiej jakości obrazy, ucząc się systematycznie odwracać losowy szum w wyraźne, rozróżnialne wizualnie obrazy.
Jeśli chcesz samodzielnie budować takie modele, zacznij od kursu Introduction to Deep Learning with PyTorch.
Przetwarzanie języka naturalnego
Przetwarzanie języka naturalnego (NLP) koncentruje się na umożliwianiu komputerom rozumienia, interpretowania i generowania ludzkiego języka w znaczący sposób. NLP wypełnia lukę między ludzką komunikacją a maszynowym rozumieniem, radząc sobie z niejednoznacznością, zależnością od kontekstu i złożonością języka naturalnego.
Techniki obejmują m.in.:
- Analizę sentymentu: Analizowanie wydźwięku frazy, np. klasyfikowanie recenzji jako pozytywnej lub negatywnej
- Rozpoznawanie nazwanych encji (NER): Identyfikowanie osób czy miejsc w tekście
- Tokenizację: Dzielenie tekstu na mniejsze jednostki, takie jak słowa, sylaby czy nawet pojedyncze znaki
Zobaczmy przykład analizy sentymentu z użyciem transformers w Pythonie:
# Example: Sentiment analysis using transformers
from transformers import pipeline
# Load pre-trained sentiment analysis model
sentiment_analyzer = pipeline("sentiment-analysis")
# Analyze multiple texts
texts = [
"This product exceeded my expectations!",
"Terrible customer service, very disappointed.",
"The quality is okay, nothing special."
]
results = sentiment_analyzer(texts)
for text, result in zip(texts, results):
print(f"Text: {text}")
print(f"Sentiment: {result['label']}, Confidence: {result['score']:.2f}\n")
Text: This product exceeded my expectations!
Sentiment: POSITIVE, Confidence: 1.00
Text: Terrible customer service, very disappointed.
Sentiment: NEGATIVE, Confidence: 1.00
Text: The quality is okay, nothing special.
Sentiment: NEGATIVE, Confidence: 0.98
Wizja komputerowa
Wizja komputerowa umożliwia maszynom wyciąganie znaczących informacji z obrazów i wideo, pozwalając komputerom postrzegać i rozumieć dane wizualne w sposób zbliżony do ludzkiej percepcji. Dziedzina ta obejmuje identyfikację obiektów, pomiary odległości, a nawet rozpoznawanie wzorców niewidocznych dla ludzkiego oka.
Systemy wizyjne łączą techniki przetwarzania obrazu z uczeniem maszynowym, zwłaszcza głębokim, aby z surowych danych wizualnych wyodrębniać coraz bardziej abstrakcyjne reprezentacje. Kluczowe zadania to:
- Klasyfikacja obrazów: Identyfikowanie, co znajduje się na obrazie (np. „To jest kot”).
- Detekcja obiektów: Lokalizowanie obiektu (np. „Pieszy na współrzędnych x,y”).
- Rozpoznawanie twarzy: Weryfikacja tożsamości na podstawie cech twarzy.
Obrazowanie medyczne to jedno z najbardziej wpływowych zastosowań wizji komputerowej: systemy AI wykrywają guzy na zdjęciach RTG, tomografii komputerowej i rezonansie magnetycznym z dokładnością dorównującą lub przewyższającą radiologów. Te systemy nie zastępują lekarzy, lecz ich wspierają — np. oznaczając potencjalne nieprawidłowości do eksperckiej weryfikacji.
Przetwarzanie dźwięku
Przetwarzanie dźwięku skupia się na rozpoznawaniu, interpretowaniu i syntezie sygnałów akustycznych — zarówno mowy, jak i dźwięków otoczenia. Celem jest, by maszyny „słuchały”, rozumiały i generowały treści audio, łącząc fale akustyczne ze znaczeniem.
ASR (Automatic Speech Recognition) zamienia mowę na tekst, napędzając asystentów głosowych, transkrypcję i narzędzia dostępności. Nowoczesne systemy ASR wykorzystują transformatory do bezpośredniego mapowania fal dźwiękowych na sekwencje tekstu, osiągając niemal ludzką dokładność przy czystej mowie i stale poprawiając się w trudnych warunkach, jak hałas tła czy akcenty.
Silniki Text‑to‑Speech (TTS), takie jak Amazon Polly, wykonują operację odwrotną — syntezują naturalnie brzmiącą mowę z tekstu za pomocą neuronalnych wokoderów, które generują realistyczną prozodię, intonację i ekspresję emocjonalną. Współczesne systemy TTS potrafią klonować głosy na podstawie zaledwie kilku minut próbek, co otwiera kreatywne możliwości, ale też rodzi dylematy etyczne.
Zastosowania wykraczają poza samą mowę w obszary kreatywne i praktyczne. Klonowanie głosu umożliwia spersonalizowanych asystentów, spójne głosy w audiobookach oraz kontrowersyjne audio deepfake.
Robotyka i ucieleśniona AI
To obszar na styku AI i inżynierii. Ucieleśniona AI polega na osadzaniu zaawansowanych „mózgów” (np. modeli wizyjno‑językowych) w fizycznych ciałach robotów. Podczas gdy wiele systemów AI istnieje wyłącznie cyfrowo, ucieleśniona AI musi radzić sobie z grawitacją, tarciem i nieprzewidywalną złożonością środowiska fizycznego.
To zakotwiczenie w rzeczywistości wprowadza wyzwania nieobecne w czysto obliczeniowej AI, ale też umożliwia bezpośrednią interakcję z fizycznym światem. Tradycyjne roboty wymagały jawnego programowania każdej czynności — inżynierowie ręcznie kodowali precyzyjne ruchy i drzewa decyzyjne dla konkretnych rezultatów.
Współczesne systemy ucieleśnionej AI rozumieją polecenia w języku naturalnym, takie jak „podnieś jabłko” czy „otwórz te drzwi”, wykorzystując percepcję wizualną do identyfikacji obiektów i planowania odpowiednich działań bez programowania pod konkretne zadania.
Ten postęp adresuje paradoks Moraveca — obserwację, że zadania banalne dla ludzi, jak składanie prania, otwieranie drzwi czy poruszanie się w zagraconych pomieszczeniach, są dla robotów niezwykle trudne, podczas gdy zadania trudne dla ludzi, jak szachy czy rachunek różniczkowy, są względnie łatwe dla AI.
Ucieleśniona AI, korzystając z modeli fundamentowych, wreszcie wypełnia tę lukę, zapewniając robotom percepcyjne rozumienie i adaptacyjne planowanie, które dla ludzi są oczywiste. Zastosowania obejmują urządzenia konsumenckie, jak roboty sprzątające, przemysłowe coboty oraz zaawansowane humanoidy, np. Atlas od Boston Dynamics.
Rodzaje AI według możliwości
Technologia definiuje, jak AI jest zbudowana, a możliwości — co potrafi w porównaniu z ludzką inteligencją. Ten podział działa jak oś czasu ewolucji AI: od obecnych ograniczeń po teoretyczne przyszłości.
Sztuczna inteligencja wąska
Artificial Narrow Intelligence (ANI), znana też jako słaba AI, to sztuczna inteligencja, którą mamy dziś. Oznacza systemy zaprojektowane do świetnego wykonywania konkretnych, z góry określonych zadań, które całkowicie zawodzą poza wąskimi parametrami treningu. Bot szachowy nie poprowadzi samochodu, a narzędzie diagnostyki medycznej nie napisze wiersza.
Jednak definicja „wąska” się poszerza. Aktualny stan sztuki to zaawansowane multimodalne duże modele językowe (LLM). Widzimy premiery modeli, takich jak GPT-5.2 i Gemini 3, które jednocześnie przetwarzają tekst, audio i obraz.
Choć naśladują rozumowanie, wciąż brakuje im prawdziwego zrozumienia świata. Deweloperzy korzystają z tych systemów ANI przez API, integrując je w aplikacjach.
Kolejny krok w ramach ANI to Agentic AI. To systemy, które wychodzą poza pasywną rozmowę; potrafią autonomicznie wykonywać wieloetapowe działania, jak przeglądanie sieci w celu rezerwacji lotu — stanowiąc pomost ku szerszej inteligencji.
Sztuczna inteligencja ogólna
Artificial General Intelligence (AGI) to święty Graal badań nad AI. Odnosi się do teoretycznego etapu, w którym maszyna potrafi uczyć się, rozumować i rozwiązywać problemy w zupełnie niepowiązanych dziedzinach, dorównując ludzkiej elastyczności poznawczej.
Kluczowym wyróżnikiem jest uogólnianie. System ANI wytrenowany do mówienia po portugalsku nie wykorzysta tej wiedzy, by szybciej nauczyć się hiszpańskiego. System AGI mógłby zastosować logikę z jednej dziedziny w innej bez ręcznego douczania.
Harmonogram AGI to przedmiot gorącej debaty. Optymiści z branży przewidują jego nadejście między 2026 a 2029 rokiem. Sceptycy twierdzą, że brakuje nam fundamentalnej architektury (w szczególności dokładnych „modeli świata”), by to osiągnąć, i przesuwają horyzont na 2040 rok lub później.
Sztuczna superinteligencja
Sztuczna superinteligencja (ASI) opisuje hipotetyczny etap, w którym AI przewyższa najbystrzejsze ludzkie umysły praktycznie w każdej dziedzinie: kreatywności naukowej, mądrości ogólnej, umiejętnościach społecznych i rozwiązywaniu problemów. ASI nie tylko dorównałaby Einsteinowi czy da Vinci; przewyższyłaby ich tak samo, jak oni przewyższali przeciętną ludzką inteligencję.
Największa obawa wobec ASI dotyczy rekurencyjnego samodoskonalenia: ASI przeprojektowuje własną architekturę, by stać się mądrzejszą, a następnie dzięki temu usprawnieniu dokonuje kolejnych ulepszeń — tworząc lawinową pętlę wykładniczego wzrostu inteligencji.
Taka eksplozja inteligencji mogłaby szybko doprowadzić do systemów tak daleko wykraczających poza ludzkie zrozumienie, że przewidywanie ich zachowań stałoby się niemożliwe, rodząc głębokie pytania o alignment i kontrolę. Jeśli cele ASI choć trochę rozmijają się z ludzkimi wartościami, jej przewyższająca inteligencja mogłaby realizować je w sposób szkodliwy dla ludzkości.

Nie istnieje wiarygodna mapa drogowa budowy ASI, a wielu badaczy kwestionuje, czy superinteligencja jest w ogóle osiągalna lub spójna pojęciowo. Mimo to teoretyczna możliwość ASI motywuje poważne prace nad alignmentem AI, aby coraz potężniejsze systemy pozostawały korzystne i możliwe do kontrolowania.
Rodzaje AI według funkcjonalności
Podczas gdy możliwości mierzą „moc”, funkcjonalność mierzy, jak system wchodzi w interakcje ze światem i przetwarza dane. Ten podział pozwala odróżnić komputer szachowy z lat 90. od społecznych robotów przyszłości. Przyjrzyjmy się poszczególnym typom.
Maszyny reaktywne
Maszyny reaktywne to najbardziej podstawowa i najstarsza forma AI. Systemy te nie mają pojęcia o przeszłości czy przyszłości — działają wyłącznie na podstawie bieżących wejść według zaprogramowanych reguł.
Cecha definiująca reaktywną AI to bezstanowość i determinizm. Jeśli podasz identyczne wejście dziesięć razy, otrzymasz identyczne wyjście dziesięć razy. Nie może uczyć się z doświadczenia, bo nie przechowuje pamięci.
Dobrym przykładem jest Deep Blue od IBM — komputer szachowy, który pokonał Garriego Kasparowa. Nie poznawał psychologii Kasparowa; po prostu obliczał najlepszy ruch na podstawie bieżącej pozycji. Standardowe filtry spamu, które flagują słowa kluczowe bez analizy historii e‑maili, też należą do tej kategorii.
AI z ograniczoną pamięcią
AI z ograniczoną pamięcią dominuje we współczesnych zastosowaniach. Tymczasowo przechowując niedawne dane lub kontekst do podejmowania decyzji, umożliwia dynamiczne zachowanie. W przeciwieństwie do maszyn reaktywnych, odwołuje się do informacji historycznych w ograniczonym oknie kontekstu.
Prawie wszystkie dziś używane narzędzia AI predykcyjnej i generatywnej należą do tej kategorii. LLM-y, takie jak Claude Opus 4.5, utrzymują historię rozmowy, pamiętając to, co powiedziałeś przed chwilą, aby udzielać spójnych odpowiedzi bazujących na wcześniejszych wymianach. Okno kontekstu determinuje, jak dużo historii system może przywołać.
Samochody autonomiczne śledzą prędkość i trajektorie pobliskich pojazdów przez kilka sekund, przewidując ich przyszłe pozycje, zamiast reagować wyłącznie na bieżącą lokalizację.
AI z teorią umysłu
AI z teorią umysłu zajmuje sporną przestrzeń między prototypem badawczym a praktyczną zdolnością. Systemy w tej kategorii modelowałyby ludzkie stany mentalne, przekonania, intencje, emocje i pragnienia, by trafnie przewidywać zachowanie.
Ta zdolność jest kluczowa dla naturalnej interakcji społecznej, pozwalając AI interpretować ukryte sygnały, wykrywać oszustwo lub dostosowywać odpowiedzi do nastroju użytkownika.
Wczesne modele czołowe, jak GPT‑4 od OpenAI, osiągnęły już wyniki na poziomie człowieka w zadaniach fałszywych przekonań, np. przewidywania działań opartych na błędnych wierzeniach, co pokazano w badaniu Michala Kosińskiego (PNAS 2024) ze Stanfordu.
Eksperci jednak debatują, czy oznacza to, że współczesne LLM-y można już uznać za systemy z prawdziwą teorią umysłu, czy tylko stosują dopasowywanie wzorców z treningu językowego. Wśród prototypów jest ToMnet od DeepMind, zaprojektowany do wnioskowania o przekonaniach innych agentów w środowiskach symulowanych.
AI samoświadoma
AI samoświadoma opisuje koncepcję maszyn posiadających świadomość, czucie i wyraźną świadomość własnego istnienia odrębnego od świata.
To oznacza nie tylko inteligencję, ale też subiektywne doświadczenie. Taka maszyna nie tylko przetwarzałaby informacje o sobie, lecz miałaby odczuwalne „ja istnieję” z towarzyszącymi uczuciami, potrzebami i pragnieniami.
Ten poziom wykracza poza czysto obliczeniowe możliwości, wchodząc na pole filozofii świadomości. Czy AI samoświadoma odczuwałaby ból, przyjemność lub strach przed wyłączeniem? Jeśli tak, czy zasługuje na względy moralne lub prawa? Te pytania przenoszą dyskusję z inżynierii na etykę.
Żaden istniejący system nie zbliża się do tego poziomu. Fikcyjne przykłady, jak HAL 9000 z 2001: Odysei kosmicznej czy Data ze Star Treka, ilustrują koncepcję, ale pozostaje spekulatywne, czy kiedykolwiek ją osiągniemy.
Kluczowe typy modeli AI
Poza teorią wysokiego poziomu, praktycy danych muszą rozumieć konkretne architektury spotykane w produkcji. Ogólnie rzecz biorąc, dziś w branży modele AI można sklasyfikować jako twórców lub analityków. Więcej o tym podziale przeczytasz w tekście o modelach generatywnych vs dyskryminacyjnych.
Generatywna AI: twórcy
Modele generatywne są projektowane do tworzenia nowych danych podobnych do danych treningowych. Uczą się rozkładu prawdopodobieństwa zbioru danych, by generować oryginalny tekst, obrazy, kod lub audio. To przesunięcie z analizy ku kreacji otwiera wiele możliwości: skalowalne tworzenie treści, wsparcie kreatywności i symulacje.
Popularne przykłady to LLM-y, takie jak Claude do pisania i kodowania, modele dyfuzyjne jak Midjourney czy Nano Banana Pro do syntezy obrazów oraz modele generowania wideo, takie jak Sora, które potrafią symulować złożone sceny. Warto dodać, że nie wszystkie generatory obrazów opierają się na dyfuzji; modele takie jak GPT Image 1.5 wykorzystują zamiast tego architekturę autoregresywną.
Generatywna AI to duży krok naprzód w agentycznych przepływach pracy — modele nie tylko odpowiadają, ale aktywnie tworzą zasoby lub plany. Do agentów wrócimy później.
Dyskryminacyjna AI: analitycy
Choć generatywna AI trafia na nagłówki, dyskryminacyjna AI, znana też jako AI predykcyjna, pozostaje kręgosłupem operacji w przedsiębiorstwach. Te modele nie tworzą nowych danych; zamiast tego uczą się granicy między klasami w zbiorze, by klasyfikować wejścia lub przewidywać wartości.

Wartość biznesowa dyskryminacyjnej AI polega na możliwości wspierania decyzji i oceny ryzyka. Organizacje używają tych modeli do automatyzacji osądów wymagających spójnego stosowania wyuczonych kryteriów.
W przeciwieństwie do modeli generatywnych, modele dyskryminacyjne nie skupiają się na kreatywności, lecz priorytetem są dokładność i niezawodność — często działają w sytuacjach wysokiego ryzyka, gdzie błędy niosą poważne konsekwencje.
Przykłady obejmują:
- Modele scoringu kredytowego przewidujące ryzyko niewypłacalności.
- Filtry spamu klasyfikujące e‑maile jako niechciane lub prawidłowe.
- Narzędzia diagnostyczne wykrywające anomalie na zdjęciach RTG.
- Systemy monitoringu finansowego wykrywające transakcje fraudowe.
Modele fundamentowe
Modele fundamentowe trenują na ogromnych, zróżnicowanych zbiorach danych — tekście, obrazach, kodzie i danych strukturalnych — ucząc się ogólnych wzorców stosowalnych w wielu dziedzinach. Taki model nie tylko uczy się klasyfikować obrazy czy generować tekst; rozwija szerokie rozumienie języka, rozumowania i wiedzy o świecie, które przenosi na nowe zadania przy minimalnym dodatkowym treningu.

To podejście drastycznie skraca czas i ilość danych potrzebnych do wdrożenia AI w nowych zastosowaniach. Zamiast budować oddzielny model do każdego problemu, organizacje dostrajają jeden model fundamentowy do zadań od analizy dokumentów prawnych, przez generowanie kodu, po tłumaczenia.
Obecnie obserwujemy wzrost popularności Small Language Models (SLM). To wydajne, destylowane wersje modeli fundamentowych zaprojektowane do działania lokalnie na urządzeniach (np. laptopy czy telefony), oferujące prywatność i szybkość bez ogromnych kosztów obliczeń w chmurze.
Typy agentów AI
AI ewoluuje z pasywnych narzędzi w autonomicznych agentów zdolnych realizować złożone przepływy pracy. Podczas gdy standardowy model czeka na wejście, by zwrócić wyjście, agent AI potrafi postrzegać środowisko, rozumować nad osiągnięciem celu i podejmować działania, by go zrealizować. Aby zrozumieć architekturę agentów i nauczyć się je budować, polecam kurs Introduction to AI Agents.
Typy agentów AI ogólnie klasyfikuje się według poziomu złożoności i autonomii. Spójrzmy na nie.
Proste agenty refleksyjne
Agenty refleksyjne to najprostsza forma agenta. Działają według sztywnej reguły „warunek–akcja”, reagując wyłącznie na bieżącą percepcję i ignorując historię. Inteligentny termostat ilustruje to takimi regułami: jeśli temperatura spadnie poniżej 68°F, włącz ogrzewanie. Jeśli przekroczy 72°F, uruchom chłodzenie.
Inny przykład to roboty na liniach montażowych — wykonują czynności, gdy sensory wykryją, że elementy dotarły w określone miejsca. Agenty refleksyjne świetnie sprawdzają się w powtarzalnych zadaniach w stabilnym środowisku, ale mają trudność przy nieoczekiwanych zmianach, bo brakuje im kontekstu do adaptacji.
Agenty refleksyjne oparte na modelu
Takie agenty utrzymują wewnętrzny model świata, śledząc stan w czasie, aby radzić sobie w środowiskach częściowo obserwowalnych. Nie tylko reagują, ale też zapamiętują kluczowe informacje potrzebne do poprawnego działania.
Przykładem są autonomiczne systemy awaryjnego hamowania, które łączą dane z radarów i kamer, by śledzić trajektorie pojazdów w czasie, zamiast reagować tylko na bezpośrednie zagrożenia. Utrzymują dokładny szacunek stanu nawet przy niepełnych informacjach — np. pamiętając szacowaną pozycję auta po zniknięciu za ciężarówką.
Agenty celowe
Agenty celowe działają tak, by osiągać konkretne cele, a nie tylko reagować. Mając cel „zaplanuj wakacje do Włoch”, rozważają wiele sekwencji działań i oceniają, które prowadzą do spełnienia celu. To dziś czołówka agentycznej AI.
Narzędzia takie jak Roo Code dla inżynierii oprogramowania czy autonomiczni asystenci rezerwacji realizują wieloetapowe procesy: wyszukiwanie, porównywanie, sprawdzanie ograniczeń i podejmowanie decyzji, by domknąć całe zadania. Platformy workflow, takie jak n8n, pozwalają budować złożone procesy, w których agenty AI obsługują punkty decyzyjne i logikę adaptacyjną.
Jeśli chcesz zbudować solidne podstawy w agentach AI, polecam ścieżkę AI Agent Fundamentals.
Agenty użytecznościowe
Agenty użytecznościowe idą o krok dalej: optymalizują najlepszą ścieżkę do celu, a nie jakąkolwiek działającą. Robią to, stosując funkcje użyteczności przypisujące wynikom wartości liczbowe, co umożliwia ilościowe porównania.
Podczas gdy agent celowy zarezerwuje dowolny lot do Rzymu, agent użytecznościowy uwzględni koszt, czas podróży, przesiadki i godziny wylotu, by zmaksymalizować łączną użyteczność.
Przykłady to systemy handlu algorytmicznego równoważące zysk i ryzyko oraz aplikacje nawigacyjne jak Waze, które optymalizują trasy pod preferencje użytkownika — najszybciej, najkrócej lub bez płatnych odcinków.
Agenty uczące się
Agenty uczące się działają w środowiskach nieznanych lub zmiennych, stale się ulepszając dzięki doświadczeniu, bez ingerencji człowieka. Architektura obejmuje krytyka dostarczającego informację zwrotną i element uczący, który modyfikuje politykę agenta.
Łaziki marsjańskie uczą się, które cechy terenu oznaczają bezpieczne ścieżki, gdy napotykają nowe formacje geologiczne. Innym przykładem jest algorytm rekomendacji Netflixa: nieustannie doprecyzowuje rozumienie preferencji użytkownika na podstawie historii oglądania, poprawiając propozycje w czasie.
Frameworki agentyczne: budowanie agentów
Frameworki agentyczne pełnią rolę systemu operacyjnego dla złożonych agentów, łącząc rdzeń rozumowania (zwykle LLM) z pamięcią, narzędziami i koordynacją wielu agentów. Zarządzają:
- Orkiestracją: Decydowaniem, który agent obsługuje dany podtask, oraz przepływem pracy między komponentami
- Planowaniem: Rozbijaniem złożonych celów na wykonalne kroki i adaptacją przy zmianach warunków
- Korzystaniem z narzędzi: Zapewnianiem agentom dostępu do wyszukiwarek, baz danych, API lub wykonywania kodu
- Pamięcią: Utrzymywaniem historii rozmowy i długoterminowego kontekstu poza bieżącą interakcją
Popularne frameworki to:
- LangChain/LangGraph: Standard branżowy do łączenia LLM z źródłami danych, z bogatymi integracjami.
- Google ADK: Otwartoźródłowy framework do budowy zaawansowanych agentów na Vertex AI.
- CrewAI: Orkiestruje wielu agentów odgrywających role, współpracujących przy złożonych zadaniach.
Dla szybkiej ściągi z tych architektur zajrzyj do AI Agents cheat sheet.
Wnioski
Omówiliśmy tu sporo — czas podsumować.
Zamiast postrzegać AI jako monolit, powinniśmy widzieć w niej zróżnicowany ekosystem wyspecjalizowanych podejść, z których każde najlepiej nadaje się do konkretnych problemów. Pełne zrozumienie AI wymaga spojrzenia na nią przez trzy pryzmaty: technologii, możliwości i funkcjonalności.
Obecnie znajdujemy się w przejściu od wąskiej AI skupionej na konkretnych zadaniach do wczesnych form agentycznej AI, które autonomicznie realizują złożone przepływy pracy — to kluczowy moment zwrotny dla wdrożeń w wielu branżach.
Zrób pierwszy krok ku byciu ekspertem AI, zapisując się na ścieżkę umiejętności AI Fundamentals.
Rodzaje AI — FAQ
Jakie są główne rodzaje AI?
AI klasyfikuje się przez trzy odrębne pryzmaty: według technologii (uczenie maszynowe, uczenie głębokie, NLP), według możliwości (ANI, AGI, ASI) oraz według funkcjonalności (maszyny reaktywne, ograniczona pamięć, teoria umysłu, AI samoświadoma).
Jaka jest różnica między generatywną a predykcyjną AI?
Generatywna AI tworzy nowe treści, takie jak tekst, obrazy czy kod, a AI predykcyjna (dyskryminacyjna) klasyfikuje dane i przewiduje wyniki na podstawie wzorców historycznych.
Czym są agenty AI i jak działają?
Agenty AI to autonomiczne systemy, które planują i wykonują wieloetapowe przepływy pracy, wykorzystując model językowy do rozumowania, narzędzia do interakcji ze światem zewnętrznym i warstwę orkiestracji do zarządzania zadaniami.
Jaka jest różnica między ANI a AGI?
Artificial Narrow Intelligence (ANI) świetnie radzi sobie z konkretnymi zadaniami, ale słabo wypada poza swoim obszarem treningowym. Z kolei Artificial General Intelligence (AGI) dorównałaby ludzkiej elastyczności poznawczej we wszystkich dziedzinach — czego jeszcze nie osiągnięto.
What is the difference between ANI and AGI?
Artificial Narrow Intelligence (ANI) excels at specific tasks but struggles outside its training domain. At the same time, Artificial General Intelligence(AGI) would match human cognitive flexibility across all domains, a capability that doesn’t yet exist.