Ana içeriğe atla

Somutlaştırılmış Yapay Zekâ Nedir? Robotlar 2026'da Hissetmeyi, Düşünmeyi ve Harekete Geçmeyi Nasıl Öğreniyor

Somutlaştırılmış yapay zekânın ne olduğunu, LLM’lerden nasıl farklılaştığını, algılama–akıl yürütme–eylem döngüsünün nasıl çalıştığını ve veri bilimciler için simden-gerçeğe eğitimin neden önemli olduğunu öğrenin.
Güncel 8 Eki 2026  · 15 dk. oku

Yapay Zeka ile Keşfedin

ChatGPTClaudePerplexity

Bir arkadaşınızdan bir meyve kasesinden size bir elma uzatmasını istediğinizi hayal edin. Kaseye bakar, hangisinin elma olduğunu anlar ve size uzatmadan önce ezilmeyecek kadar nazikçe alır.

Şimdi aynı şeyi bir sohbet robotundan isteyelim. Size bir elmayı nasıl tutacağınızı, hangi parmakları kullanacağınızı ve kabaca ne kadar sıkmanız gerektiğini tam olarak anlatabilir, ancak gerçekte elmayı alamaz. Elleri yoktur ve elmanın nasıl hissettirdiğine dair bir fikri yoktur.

Somutlaştırılmış yapay zekâ bu farkı kapatmaya çalışan alandır. Basitçe söylemek gerekirse, fiziksel bir bedene (bir robot, bir araba veya bir drone gibi) sahip olan ve yalnızca onlar hakkında okumak yerine gerçek dünyada bir şeyler yaparak öğrenen yapay zekâdır. Aynı fikir için yakından ilişkili “physical AI” terimini de göreceksiniz.

Şu anda alan büyük bir ivme yaşıyor. Ocak 2026’daki CES’te NVIDIA’dan Jensen Huang, bunu “robotik için ChatGPT anı” olarak nitelendirdi.

Para da peşinden geldi. CNBC’nin aktardığı Dealroom verilerine göre, robotik şirketleri 2026’da haziran ayı başına kadar 55,8 milyar $ topladı; bu, önceki yıllık rekorun neredeyse iki katı.

Bu yazıda şunları ele alacağım:

  • Somutlaştırılmış yapay zekâ nedir ve LLM’ler ile klasik robotik karşısında nasıl konumlanır
  • Neden fiziksel yapay zekâ dijital yapay zekâdan çok daha zordur
  • Somutlaştırılmış yapay zekânın algılama–akıl yürütme–eylem döngüsüyle nasıl çalıştığı
  • Robotların simülasyonda nasıl eğitildiği ve simden-gerçeğe boşluğunun ne olduğu
  • Somutlaştırılmış yapay zekânın 2026’da nerede kullanıldığı ve takip edilmesi gereken şirketler
  • Tüm bunların veri bilimciler için ne anlama geldiği

Daha önce hiç robotla çalışmadıysanız endişelenmeyin. Makine öğrenmesine aşinalık yardımcı olacaktır, ancak her kavramı en baştan kurarak her durumda rahatça takip edebilmenizi sağlayacağım.

Somutlaştırılmış Yapay Zekâ Kısaca

  • Somutlaştırılmış yapay zekâ; bir robot, araba veya drone gibi fiziksel bir bedene gömülü, dünyada eylemde bulunarak ve yalnızca metin ve görsellerden değil deneyimden öğrenen yapay zekâdır.
  • Başlıca darboğazı veridir: En büyük açık robotik veri kümelerinden biri olan Open X-Embodiment, LLM’lerdeki trilyonlarca tokene karşılık yalnızca 1 milyonun biraz üzerinde gerçek yörünge içeriyor.
  • Ekipler bunu simülasyon, alan rastgeleleştirme ve önceden eğitilmiş görsel-dil omurgalarıyla aşıyor.
  • 2026’da depolar ve robotaksilerde erken üretimde; çoğu insansı dağıtım ise hâlâ dar kapsamlı pilot aşamasında.

Somutlaştırılmış Yapay Zekâ Nedir?

Somutlaştırılmış yapay zekâ; bir robot, otonom araç veya drone gibi fiziksel bir bedene yerleştirilmiş, çevresini sensörlerle algılayan, ne yapacağına akıl yürüten ve motorları aracılığıyla dünyaya eylemde bulunan, kendi eylemlerinin sonuçlarından öğrenen bir yapay zekâ sistemidir.

Buradaki kilit terim somutlaştırılmıştır.

Çoğu yapay zekâ modeli, başkalarının topladığı verileri gözlemleyerek öğrenir. Somut bir sistem ise bir kupayı itmek, kupanın kaydığını görmek ve itilince kupaların nasıl davrandığına dair bilgisini güncellemek gibi çevresiyle etkileşime girerek öğrenir.

İşte bir örnek. Milyonlarca kapı fotoğrafıyla eğitilmiş bir görsel model, bir kapının nasıl göründüğünü bilir. 500 kapıyı açmayı gerçekten denemiş bir robot ise bazı kapıların itildiğini, bazılarının çekildiğini, bazılarının ağır olduğunu ve bazılarında önce aşağı bastırmanız gereken kollar bulunduğunu bilir.

Bu derinlikteki bilgiyi bir fotoğraftan elde edemezsiniz.

Ben şöyle ifade etmeyi seviyorum: Çoğu yapay zekâ dünyayı okuyarak öğrenir; somutlaştırılmış yapay zekâ ise dokunarak ve deneyimleyerek öğrenir.

Bu tek fark, ihtiyacınız olan veriyi, eğitimi ve işlerin nasıl ters gidebileceğini kökten değiştirir.

Somutlaştırılmış yapay zekâ vs. büyük dil modelleri vs. geleneksel robotik

Şimdiye kadar somutlaştırılmış yapay zekâyı bir sohbet robotuyla karşılaştırdım. Şimdi de insanların en çok karıştırdığı iki şeyle kıyaslayalım: büyük dil modelleri (LLM’ler) ve geleneksel kural tabanlı robotik.

  Somutlaştırılmış yapay zekâ Büyük dil modelleri (LLM’ler) Geleneksel kural tabanlı robotik
Çevreden öğrenir Evet, etkileşim ve geribildirimle Genellikle hayır, sabit bir metin korpusundan öğrenir Hayır, davranış elle programlanır
Fiziksel eylemde bulunur Evet Hayır Evet
İnternet verisiyle eğitilir Kısmen (görsel ve dil omurgaları) Evet, trilyonlarca token Hayır
Yeni ortamlara genelleme Orta düzeyde, hızla gelişiyor İyi, dil görevleri içinde Zayıf, kurulum değişince bozulur
2026’daki ticari olgunluk Erken üretim (depolar, fabrika pilotları) Olgun ve yaygın olarak kullanılıyor Olgun, fabrikalarda onlarca yıllık kullanım

Vurgulamak istediğim satırlar son ikisi.

Kural tabanlı endüstriyel kollar onlarca yıldır araba kaynatıyor ve son derece güvenilirdir; ancak sadece çalışma hücrelerinde hiçbir şeyin değişmemesi sayesinde. Somutlaştırılmış yapay zekâ, dünyayı dağınık bırakırken aynı güvenilirliği korumaya çalışır; araştırmacıların genelleme dediği şey budur.

LLM’ler ve somutlaştırılmış yapay zekâ ikisi de çok büyük miktarda veriden öğrenir, ancak çok farklı sorunları çözerler. Bir LLM metin alır ve sıradaki tokenın ne olması gerektiğini tahmin ederken, somut bir sistem kamera karelerini, eklem açılarını ve dokunma okumalarını alır ve sıradaki hareketin ne olması gerektiğini tahmin eder.

Kısacası, LLM’ler fiziksel dünya hakkında bilir, somutlaştırılmış yapay zekâ ise o dünyada eylemde bulunur. Elma örneğimize dönersek: Bir LLM onu nasıl kavrayacağınızı tam olarak tarif edebilir; somut bir yapay zekâ robotu ise gerçekten yapabilir.

Hata maliyeti de çok farklıdır. Bir LLM bir şeyi yanlış yaparsa biraz tuhaf bir cümle elde edersiniz. Somut bir sistem yanlış yaparsa bir bardak yere düşebilir—ya da daha kötüsü.

Şimdi bence birçok kişinin kaçırdığı noktaya gelelim: İkisi birlikte çalışır.

Görsel-dil-eylem (VLA) modellerinde önceden eğitilmiş bir görsel-dil modeli sistemin çekirdeğinde yer alır. Kamera görüntülerini ve talimatınızı (“meyveyi kaseye koy”) okur, ardından anladığını gerçek motor komutlarını üreten bir eylem kod çözücüye iletir.

Bir görsel-dil modelinin bir eylem uzmanına bağlandığını gösteren π₀ mimari diyagramı

Önceden eğitilmiş bir görsel-dil modeli, π₀ (pi-zero) içinde robot eylemlerine nasıl bağlanır. Kaynak görsel: Black ve ark., 2024

Neden Fiziksel Yapay Zekâ Dijital Yapay Zekâdan Çok Daha Zor?

Fiziksel yapay zekâ, başlıca veri nedeniyle dijital yapay zekâdan daha zordur.

Dil modelleri, insanların onlarca yıl boyunca çevrimiçi olarak metin, kod ve görsel paylaşması sayesinde hızla ilerledi; ancak buna karşılık gelebilecek gerçek dünya sensör verisi kaynağı yoktur. Günlük nesnelerle etkileşen robotlardan eklem açıları, kuvvet okumaları ve kamera kareleri gibi akışlar çok daha azdır.

Veri gereksinimlerine biraz daha yakından bakalım. Somut bir sistem, bulunması zor olan 3 tür veriye ihtiyaç duyar:

  1. Robotun kendi bakış açısından, kameralar, derinlik sensörleri, lidar ve dokunsal sensörlerden kaydedilmiş sensör verileri
  2. Eşyaların kayması, bükülmesi, devrilmesi ve kırılması gibi nesne fiziği
  3. Robotun ne yaptığını ve sonrasında ne olduğunu kaydeden eylem sonuçları

Şimdi buna biraz sayı katalım.

Öncü LLM’ler trilyonlarca tokenla eğitilir. 21 kurumdan 22 robot türünden veri toplayan en büyük açık robotik veri kümelerinden Open X-Embodiment, sadece 1 milyonun biraz üzerinde gerçek yörüngeyle sonuçlandı.

Birleştirilen robotları ve veri kümelerini gösteren Open X-Embodiment veri kümesi genel görünümü

Open X-Embodiment veri kümesinde birleştirilen robotlar ve görevler. Kaynak görsel: Open X-Embodiment Collaboration, 2023

Neden bu kadar az? Her yörünge, genellikle teleoperasyonla bir insan tarafından kontrol edilen, gerçek bir görevi yapan gerçek bir robot gerektirir; bu da yavaş ve pahalıdır.

Bu fark, fiziksel yapay zekânın dijital yapay zekâya göre daha yavaş genellemesinin de nedenidir. Bir model, en iyi benzer bir şeyi daha önce gördüğünde çeşitliliği kaldırır; bir milyon yörünge, trilyonlarca tokenın cümleleri kapsadığı kadar çok mutfağı, aydınlatma düzenini ve nesne şeklini kapsamaz.

Bu veri sorununu yazının geri kalanında aklınızın bir köşesinde tutun. Aşağıda göreceğiniz pek çok tasarım kararı—simülasyondan alan rastgeleleştirmeye ve önceden eğitilmiş görsel-dil omurgalarının ödünç alınmasına kadar—bunun etrafından dolanma yöntemleridir.

Somutlaştırılmış Yapay Zekâ Nasıl Çalışır? Algılama–Akıl Yürütme–Eylem Döngüsü

Somutlaştırılmış yapay zekâ, 3 aşamalı sürekli bir döngüyü çalıştırarak işler:

  • Algılama: dünyayı hisset
  • Akıl yürütme: ne yapacağına karar ver
  • Eylem: bedeni hareket ettir

Bu döngü saniyede birçok kez tekrar eder ve her hareket robotun bir sonrakinde algıladığını değiştirir; böylece bir çevrimin çıktısı bir sonrakinin girdisi olur.

Aynı döngü dünya modellerinin de arkasında yatar. Ha ve Schmidhuber’in 2018 “World Models” makalesi bir ajanı görsel modül, bellek modülü ve denetleyiciye ayırdı ve bir yarış oyunundaki bir arabada test etti. Somutlaştırılmış yapay zekâ aynı fikri tam bir robota uygular.

Döngüyü anlamanın iyi bir yolu top tutmayı hayal etmektir:

  • Önce gözleriniz topu takip eder ve nerede olduğunu, ne kadar hızlı geldiğini çıkarır.
  • Sonra beyniniz yarım saniye sonra topun nerede olacağını tahmin eder ve elinizin nereye gitmesi gerektiğine karar verir.
  • Son olarak kolunuz hareket eder ve top yaklaştıkça ayarlamaya devam edersiniz.

Bir robot da aynısını yapar; sadece göz yerine kameralar, kas yerine motorlar kullanır.

Şimdi her aşamayı sırayla ele alalım.

Algılama: fiziksel dünyayı anlamlandırmak

Algılama, ham sensör okumalarını sistemin geri kalanının üzerinde akıl yürütebileceği bir şeye dönüştüren aşamadır. Tek bir kamera nadiren yeterlidir; bu yüzden çoğu robot birden çok sensörü birleştirir:

  • Sahnenin düzenini yakalamak için genellikle birkaçı birlikte taşınan RGB kameralar (renk ve görünüm)
  • Uzaklık ve 3B şekil için derinlik sensörleri ve lidar
  • Robotun kendi bedenini hissetmesi anlamına gelen propriyosepsiyon (eklem açıları, hızlar ve torklar)
  • Parmak uçlarında temas, basınç ve kayma için dokunsal sensörler

Gemini Robotics-ER 1.5 algılama çıktıları: tespit, segmentasyon ve işaretleme

Gemini Robotics-ER 1.5’ten algılama çıktısı örnekleri. Kaynak görsel: Google DeepMind

Ardından algılama modelleri bu okumaları mekânsal haritalara, nesne kimliklerine, engel konumlarına ve sahneye dair genel bir anlayışa dönüştürür.

Bunların çoğu, genellikle DINOv2 veya SigLIP gibi önceden eğitilmiş görsel dönüştürücüler üzerine kurulan bilgisayarla görme standartlarıdır; nesne tespiti, segmentasyon ve derinlik kestirimi gibi.

Ancak bana göre şu anda dokunma algısı en az değer verilen algı parçası. Bir kamera masada bir bardak olduğunu söyleyebilir; fakat bardağın kavrayışınızdan kaymaya başladığını söyleyen şey dokunmadır.

Mevcut duruma örnek olsun diye, XELA Robotics Automate 2026’da pad içine yerleştirilmiş 30 üç eksenli kuvvet algılama noktasına sahip bir robotik parmak ucu gösterdi. Şirket ayrıca uSkin sensörlerinin 0,1 gram-kuvvet kadar küçük kuvvetleri tespit edebildiğini söylüyor.

XELA uSkin dokunsal parmak ucu sensörü

Üç eksenli dokunsal algı noktalarından oluşan bir dizi içeren bir uSkin robotik parmak ucu. Kaynak görsel: XELA Robotics

Akıl yürütme: dünya modelleri ve planlama

Akıl yürütme, sırada ne yapılacağına karar veren aşamadır. Yeni sistemlerde genellikle 2 katman bulunur:

  • Dünya modeli (alt katman): robot bir eylemi gerçekleştirmeden önce ortamın bu eyleme nasıl tepki vereceğini tahmin eden iç temsil
  • Planlama (üst katman): büyük bir hedefi daha küçük adımlara böler

Dünya modelleri, robotun eylemeden önce hayal kurmasını sağlar.

DreamerV3 iyi bir örnektir. Ortamının sıkıştırılmış bir modelini öğrenir ve ardından politikasını neredeyse tamamen o hayali dünya içinde eğitir.

DreamerV3’ü kendi araştırmalarımda kullanıyorum ve beni en çok şaşırtan şey, ajanın gerçek ortam yerine “kafasında” pratik yapmaya ne kadar daha fazla zaman ayırdığı oldu. Bu önemli, çünkü eğitim daha hızlı ve çok daha ucuz hale geliyor.

DreamerV3 dünya modeli öğrenimi ve hayali aktör-eleştirmen eğitimi diyagramı

DreamerV3, politikasını dünya modelinden üretilen hayali açılımlarda eğitir. Kaynak görsel: Hafner ve ark., 2023

Planlama ise giderek daha fazla dil modelleri tarafından üstleniliyor.

İyi bir örnek, yüksek düzeyli planlayıcı olarak görev yapan Google DeepMind’ın Gemini Robotics-ER 1.5’idir. Yerel geri dönüşüm kurallarına göre atık ayrıştırma gibi bir görev verildiğinde, Google Arama ile kurallara bakabilir, işi adımlara bölebilir ve her adımı fiziksel işi yapan Gemini Robotics 1.5 VLA modeline devredebilir.

Dil modelini yönetici, VLA modelini ise işi fiilen yapan çalışan olarak düşünebilirsiniz.

Gemini Robotics-ER 1.5'in planlamayı orkestre edip Gemini Robotics 1.5 VLA modeline delege etmesi

Gemini Robotics-ER 1.5, görevi planlar ve fiziksel icrayı Gemini Robotics 1.5 VLA’ya devreder. Kaynak görsel: Google DeepMind, 2025

Eylem: kararları harekete dönüştürmek

Eylem, bir kararı saniyede onlarca ila yüzlerce kez (hertz veya Hz cinsinden) her eklem ve motor için hassas komutlara çeviren aşamadır. Bu aşamanın düşük seviyeli kısmına kontrol denir.

Örneğin “Tutamaçı 5 cm sola hareket ettir” gibi bir komut basit gelmektedir; ancak 7 eklemli bir kolda bu, her eklem motoru için, kol hareket ettikçe sürekli yeniden hesaplanan belirli bir torka dönüşmelidir.

Zor olan, gerçekliğin nadiren robotun beklediğiyle eşleşmesidir. Nesneler kayar, zemin hafif eğridir, biri storu açınca aydınlatma değişir ve bir kablo tahmin edilenden farklı bükülür.

İyi bir denetleyici, beklediği ile gerçekte olan arasındaki farkı fark eder ve anında düzeltir.

Bence eylem, dağınık ve yapılandırılmamış ortamlarda doğru yapılması en zor aşamadır. Bir algılama hatası yeniden bakarak, bir planlama hatası yeniden planlayarak düzeltilebilir; ancak bir kontrol hatası gerçek zamanlı gerçekleşir.

Somutlaştırılmış Yapay Zekâ Nasıl Eğitilir? Simülasyonun Rolü

Somutlaştırılmış yapay zekâ, simülasyon ve gerçek dünya verilerinin bir karışımıyla eğitilir. Simülasyon, robotun gerçek donanıma dokunmadan önce milyonlarca kez pratik yapabildiği, fizik açısından doğru 3B nesnelerle dolu sanal ortamlar demektir.

Önceki veri sorununu hatırlayın. Simülasyon, özellikle yürüme ve manipülasyon için pekiştirmeli öğrenmede bunun başlıca çözümlerinden biridir. π₀ gibi temel modeller hâlâ yoğun biçimde gerçek gösterimlere yaslanır; bu yüzden çoğu ekip ikisini birlikte kullanır.

Gerçek dünyada veri toplamanın 3 büyük problemi vardır:

  • Yavaş: bir robot günde yalnızca birkaç yüz gösterim toplayabilir
  • Pahalı: robotlar bozulur ve insanların gözetimi gerekir
  • Tehlikeli: özellikle ağır insansılar veya arabalarla

Bir simülatör bu üçünü birden ele alır. Tek bir GPU’da binlerce sanal robotu paralel çalıştırabilir, gerekli oldukça başarısız olup yeniden başlamalarına izin verebilirsiniz. Bu, yılların robot deneyimini birkaç saate sıkıştırır.

İyi bir simülasyon ortamını ne yapar

Her simülatör robot eğitimi için eşit derecede yararlı değildir. Simülasyonda robot kollarıyla çalışmış biri olarak, iyi bir simülatörün 3 şeye ihtiyacı olduğunu söyleyebilirim:

  1. Fiziksel doğruluk: temas, sürtünme ve deformasyonun gerçek dünyadaki gibi davranması
  2. Nesne çeşitliliği: robotun aynı kupayı bin kez görmek yerine binlerce farklı kupa görmesi
  3. Alan rastgeleleştirme: eğitim bölümleri arasında aydınlatma, dokular, kütleler ve sürtünmenin değişmesi (buna birazdan değineceğim)

En sık karşılaşacağınız iki platform NVIDIA Isaac Sim (Isaac Lab ile) ve MuJoCo’dur:

Platform Geliştirici İyi olduğu alanlar En uygunu
NVIDIA Isaac Sim ve Isaac Lab NVIDIA Fotogerçekçi görselleştirme, sensör simülasyonu, GPU üzerinde binlerce paralel ortam Büyük pekiştirmeli öğrenme çalışmaları ve sentetik kamera verisi
MuJoCo Google DeepMind (açık kaynak) Hızlı, doğru temas fiziği, hafif, büyük araştırma topluluğu Araştırma, yürüme ve manipülasyon kıyaslamaları

En yeni ekleme, NVIDIA, Google DeepMind ve Disney Research tarafından geliştirilen, Linux Foundation tarafından yönetilen açık kaynaklı, GPU hızlandırmalı bir fizik motoru olan Newton.

Newton 1.0, Mart 2026’daki NVIDIA GTC’de yayımlandı. Isaac Lab’e fizik arka ucu olarak bağlanır; çözücülerinden biri olarak MuJoCo Warp’u ve kablolar ile kumaş gibi deformabl nesneler için ek çözücüleri içerir.

Deformabl’lar göründüklerinden daha önemlidir. Eski simülatörler kabloları ve kumaşı kötü ele alırdı; oysa fabrikalar ikisini de idare edebilen robotlara ihtiyaç duyar.

Simden-gerçeğe boşluğu

Simden-gerçeğe boşluğu, simülasyonda eğitilmiş bir politikanın gerçek bir robota aktarıldığında yaşadığı performans düşüşüdür ve somut sistemlerdeki en büyük sorunlardan biridir.

Örneğin, simüle sürtünme asla tam olarak doğru değildir, simüle kameralar fazla temizdir ve simüle nesneler fazla kusursuz olabilir; bu yüzden simülasyonda %95 başarıyla çalışan bir politika, gerçek donanımla ilk karşılaşmada bozulabilir.

Ekiplerin bu boşluğu kapatmasının 2 ana yolu vardır:

Eğitim sırasında alan rastgeleleştirme

Simülatörü mükemmelleştirmeye çalışmak yerine, ekipler onu birçok farklı şekilde rastgeleleştirir.

Tobin ve ark. (2017) dokuları ve aydınlatmayı o kadar ağır rastgeleleştirdi ki, gerçek dünya modele sadece bir başka varyasyon gibi göründü. OpenAI’nın Rubik Küpü robot eli bunu daha da ileri taşıyarak politika iyileştikçe rastgeleleştirmeyi otomatik olarak genişletti.

Ağır rastgeleleştirilmiş simüle eğitim sahnelerinin yanında gerçek dünya test sahnesi

Simülasyon sonrasında gerçek veride ince ayar

Simülasyonda önceden eğitilmiş bir politika, görevin genel şeklini zaten öğrendiğinden uyum sağlamak için genellikle yalnızca küçük bir gerçek gösterim setine ihtiyaç duyar.

Hiçbiri boşluğu tamamen ortadan kaldırmaz; bu yüzden ekipler gerçek dünya performansı üzerindeki etkisini azaltmak için çalışmayı sürdürür.

2026’da Somutlaştırılmış Yapay Zekâ Örnekleri

Somutlaştırılmış yapay zekâ artık birkaç sektörde laboratuvar dışına çıkmış durumda; ancak oldukça eşitsiz bir şekilde.

Gözlemlediğim kalıp, el ile betimlenemeyecek kadar değişken ortamlara önce iniş yaptığı; ancak bir şeyler ters giderse bir insanın hâlâ devreye girebildiği yerlerdir.

Otonom araçlar

Sürücüsüz arabalar, somutlaştırılmış yapay zekânın en veri aç türlerinden biridir.

Waymo Driver, tamamen otonom olarak neredeyse 200 milyon mil kat etti ve Waymo’nun Şubat 2026’daki World Model gönderisine göre simülasyonda milyarlarca mil üzerinde de eğitim ve test yaptı. Simülasyon, Waymo’nun gerçek olayları yeniden oynatmasına ve bir test filosunun gerçek yollarda asla karşılaşmayabileceği nadir senaryolar (örneğin, park edilmiş arabaların arasından fırlayan bir çocuk) üretmesine olanak tanır.

Sürücüsüz arabalar, algılama–akıl yürütme–eylem döngüsünün tam hızda çalışmasına da iyi bir örnektir. Bir Waymo aracı kameralar, lidar ve radarla algılar; her yaya ve aracın sırada ne yapabileceğine dair akıl yürütür ve saniyede birçok kez direksiyon ve frenleri kontrol ederek eylemde bulunur.

Depolar ve lojistik

Bana göre, şu anda somutlaştırılmış yapay zekânın en doğal ticari kullanım alanı depolardır.

Değişim, zemindeki çizgileri takip eden sabit yollu robotlardan, dinamik ve dağınık envanterle başa çıkabilen sistemlere geçiştir; örneğin, içine birlikte atılmış 40 farklı üründen seçim yapmak.

Agility Robotics’in Digit insansısı, 2024’te imzalanan çok yıllı bir anlaşma kapsamında GXO Logistics’te kasaları taşıyor ve Boston Dynamics’in Stretch robotu kamyonlardan kutu boşaltıyor.

Agility Robotics'in Digit insansısının bir GXO deposunda otonom mobil robotlar ile bir konveyör arasında kasaları taşıması

Agility Robotics’in Digit’i, bir GXO deposunda otonom mobil robotlar ile bir konveyör arasında kasaları taşıyor. Kaynak görsel: Agility Robotics/The Robot Report

Sağlık hizmetlerinde robotik

Sağlık hizmetlerinde somutlaştırılmış yapay zekânın en temkinli şekilde ilerlemesini bekliyorum.

Intuitive’in da Vinci’si gibi cerrahi sistemler hâlihazırda dünya çapında hastanelerde kullanılıyor; ancak bir cerrah tarafından kontrol ediliyor ve buradaki yapay zekâ araştırmalarının çoğu enstrüman takibi, kamera kontrolü ve sütür desteği gibi yardımlara odaklanıyor.

Sağlıkta düzenleyici onay, çoğu zaman model yeteneğinden daha büyük bir kısıttır ve haklı olarak öyle olmalıdır. Kişisel olarak özerk cerrahiye yakın herhangi bir şeyden çok önce yardımcı ve eğitim amaçlı kullanımların geleceğini beklerim.

Fabrika zeminlerinde insansı robotlar

İnsansılar en çok ilgiyi görüyor ve en az kanıtlanmış olanlar arasında yer alıyor.

CES 2026’da Boston Dynamics, Atlas’ın üretim sürümünü tanıttı ve 2026’da ürettiği her birimin Hyundai ve Google DeepMind’a ayrıldığını söyledi. Öte yandan Figure, Güney Carolina Spartanburg’daki BMW tesisinde sac metal yükleyen Figure 02 insansısının 11 aylık bir dağıtımını gerçekleştirdi.

Yine de dürüst olmak istiyorum: Çoğu insansı dağıtımı hâlâ dar bir görev setini yapan pilotlar. Örneğin Hyundai, Atlas’ı 2028’de parça sıralamada kullanmaya başlamayı planlıyor; bu da en büyük destekçilerin bile ne kadar temkinli ilerlediğinin bir göstergesi.

2026’da Bilinmesi Gereken Başlıca Somutlaştırılmış Yapay Zekâ Şirketleri

Şimdi tüm bunları gerçekte kimin inşa ettiğinden bahsedelim. Somutlaştırılmış yapay zekâya yeni başlayan herkesin tanıması gerektiğini düşündüğüm 5 kuruluş şunlar:

Kuruluş Ne inşa ediyorlar Neden önemli
NVIDIA Isaac Sim, Isaac Lab, Newton, GR00T ve Cosmos Çoğu ekibin üzerinde eğitim yaptığı simülasyon ve hesaplama yığını
Physical Intelligence Robot temel modeli ailesi π₀ Açık denetim noktalarıyla genel amaçlı robot politikaları
Agility Robotics Digit insansı Depo lojistiği için üretildi ve hâlihazırda müşterilerle çalışıyor
Boston Dynamics Atlas, Stretch ve Spot Atlas’ı 2026’da araştırma demolarından üretim birimlerine taşıyor
AMI Labs (Yann LeCun) JEPA tarzı dünya modelleri Piksel üretmeyen dünya modellerine aykırı bir yatırım

NVIDIA

NVIDIA, çoğunlukla robotun kendisinden ziyade robotun etrafındaki araçları inşa eder.

Isaac Sim fotogerçekçi simülasyonu, Isaac Lab bunun üzerinde pekiştirmeli öğrenmeyi, Newton ise artık fiziği sağlar. NVIDIA genel amaçlı bir robot satmasa da birçok robotik ekibi eğitimini NVIDIA yazılımı üzerinde yapar.

Physical Intelligence

Physical Intelligence, π₀’ı geliştirdi; çamaşır katlama gibi görevler için akıcı eylem parçaları üretmek üzere akış eşleştirme kullanan 3,3 milyar parametreli bir görsel-dil-eylem modeli.

openpi deposu üzerinden gerçekten indirebileceğiniz genel amaçlı bir robot modeline en iyi örnek olduğunu düşünüyorum.

“Temel model” kavramı sizin için yeniyse, Temel Modellerin Tanıtımı rehberimiz fikri iyi açıklar.

Agility Robotics

Agility Robotics, Digit ile dar yolu seçti.

Baştan beri depolarda kasa taşımaya göre tasarlandı ve bu dar odak, çoğu insansıdan daha erken ücretli müşterilere ulaşmasının önemli bir nedeni.

Boston Dynamics

Boston Dynamics, Atlas ile ters yolu seçti.

Robotun atletik sınırlarını yıllarca zorladı (muhtemelen parkur videolarını görmüşsünüzdür) ve ardından Google DeepMind’ın Gemini Robotics modelleriyle güçlendirmeyi planladığı, tamamen elektrikli bir fabrika ürününe dönüştürdü.

AMI Labs (Yann LeCun)

AMI Labs, Mart 2026’da 3,5 milyar $ ön para değerlemesiyle 1,03 milyar $ tohum turu kapatan, Yann LeCun’un Paris merkezli girişimidir. Tur; Cathay Innovation, Greycroft, Hiro Capital, HV Capital ve Bezos Expeditions tarafından ortaklaşa yönetildi; NVIDIA ve Samsung diğer yatırımcılar arasındaydı.

LeCun yıllardır geleceğin her pikselini tahmin etmenin israf olduğunu savunuyor; bu nedenle Birleşik Gömme Öngörü Mimarisinde (JEPA) tahminlerini piksel yerine soyut bir temsil uzayında yapıyor. Meta bu fikri V-JEPA 2 ile halihazırda test etti.

AMI’yi izlemeye değer kılan, alanın çoğunun gittiği yönün tersine gitmesi. Ancak henüz bir şey göndermedi; bu yüzden şimdilik kanıtlanmış bir yaklaşımdan ziyade, arkasında çok para olan bir araştırma bahsi olarak görürdüm.

Veri Bilimciler İçin Somutlaştırılmış Yapay Zekâ: Sizin Rolünüz Ne?

Somutlaştırılmış yapay zekâ yalnızca bir robotik mühendisliği sorunu değildir. Çalışmanın büyük bölümü—bence çoğu—makine öğrenmesi çalışmasıdır.

Doğrudan taşınan beceriler şunlardır:

Algılama–akıl yürütme–eylem döngüsünü kendiniz deneyin

Başlamak için bir robota ihtiyacınız yok. gymnasium kütüphanesi MuJoCo ortamlarıyla birlikte gelir; dolayısıyla pip install "gymnasium[mujoco]" çalıştırdıktan sonra tüm döngüyü simüle bir robot üzerinde çalıştırabilirsiniz:

import gymnasium as gym

# HalfCheetah is a 2D cheetah-like robot simulated with the MuJoCo physics engine
env = gym.make("HalfCheetah-v5")
observation, info = env.reset(seed=42)

for step in range(1000):
    # Perception: the observation holds joint angles and velocities
    # Reasoning: a trained policy would choose the action here, we pick randomly
    action = env.action_space.sample()

    # Action: apply torques to the joints and move the physics forward one step
    observation, reward, terminated, truncated, info = env.step(action)

    if terminated or truncated:
        observation, info = env.reset()

env.close()

Şu anda çita, “akıl yürütme” adımı env.action_space.sample() olduğu—yani her seferinde rastgele bir eylem seçildiği—için sadece çırpınıyor.

O tek satırı eğitilmiş bir politikayla değiştirmek, tam olarak pekiştirmeli öğrenmenin işidir ve daha büyük bir şeye geçmeden önce denemenizi öneririm.

Somutlaştırılmış Yapay Zekânın Sınırlamaları Nelerdir?

Somutlaştırılmış yapay zekâ hızlı ilerliyor; ancak hâlâ 4 noktada zorlanıyor ve bunları bilmeye değer buluyorum:

  • Hatalardan toparlanma. Çoğu eğitim verisi başarılı denemeleri gösterir; bu yüzden robotlar, bir kavrama görevinin ortasında tutuş kaydığında ne yapılacağına dair çok az örnek görmüştür.
  • Uzun görevler. Adımları zincirlerken küçük hatalar birikir. Her adım %95 başarıyor ve hatalar bağımsızsa, bir robot 20 adımlık bir görevi yalnızca yaklaşık %36 olasılıkla tamamlar.
  • Robotun üzerindeki hız. Milyarlarca parametreli bir modeli, robotun kendi donanımında gerçek zamanlı kontrol için yeterince hızlı çalıştırmak hâlâ zordur. Bu nedenle birçok sistem, yavaş akıl yürütmeyi hızlı kontrolden ayırır; bazen yavaş kısmı robot dışında çalıştırır.
  • Yabancı ortamlar. Robotlar, eğitim verilerine benzer sahneleri iyi, bunun dışını ise belirgin biçimde daha kötü idare eder; bu da bizi yazının başındaki veri sorununa geri götürür.

Son Düşünceler

Somutlaştırılmış yapay zekâ, makinelere fiziksel bir beden ve onu kullanacak zekâyı verir. Algılama–akıl yürütme–eylem döngüsüyle çalışır, esas olarak fiziksel verinin azlığından ötürü geride tutulur ve 2026’da araştırma laboratuvarlarından depolara ve ilk fabrika pilotlarına taşınmaktadır.

Beni asıl şaşırtan, sorunun nasıl değiştiği. Birkaç yıl önce insanlar LLM’lerin robotik araştırmayı gereksiz kılıp kılmayacağını soruyordu. Bunun yerine, LLM’ler somut sistemlerin içinde akıl yürütme katmanı haline geliyor ve iki alan birbirine doğru büyüyor.

Bu yazının başındaki elmayı hatırlayın. Onu nasıl kaldıracağını bilmek ile gerçekten kaldırmak iki çok farklı problem çıktı ve somutlaştırılmış yapay zekâ ikincisi üzerinde çalışan alandır.

Bunun makine öğrenmesi temellerini inşa etmek istiyorsanız, Python ile Pekiştirmeli Öğrenme öğrenme yolumuzla başlayın. Yığınını dil tarafı için Büyük Dil Modelleri (LLM’ler) Kavramları kursumuz ve Büyük Dil Modelleri Geliştirme öğrenme yolumuz iyi birer sonraki adımdır.

Somutlaştırılmış Yapay Zekâ SSS

Somutlaştırılmış yapay zekâ robotikle aynı şey midir?

Neredeyse! Robotik, fiziksel makineleri inşa etme ve kontrol etme alanının tamamıdır; somutlaştırılmış yapay zekâ ise özel olarak, el ile kodlanmış kuralları izlemek yerine çevresiyle etkileşimden öğrenen robotları ifade eder.

Somutlaştırılmış yapay zekâyı öğrenmeye başlamak için fiziksel bir robota ihtiyacım var mı?

Hayır. MuJoCo ve NVIDIA Isaac Sim gibi simülatörler, politikaları tamamen yazılım içinde eğitmenize ve test etmenize olanak tanır; araştırma ve endüstri ekiplerinin çoğu bu şekilde çalışır.

Somutlaştırılmış yapay zekâda hangi programlama dilleri ve araçlar kullanılır?

Python baskındır; model eğitimi için PyTorch veya JAX gibi çerçevelerle eşleştirilir; ayrıca MuJoCo, Isaac Lab gibi simülasyon araçları ve Gymnasium veya Stable-Baselines3 gibi pekiştirmeli öğrenme kütüphaneleri kullanılır.

Somutlaştırılmış yapay zekâ bilgisayarla görmekten nasıl farklıdır?

Bilgisayarla görme, somutlaştırılmış yapay zekânın bir bileşenidir. Bir görsel model bir görüntüdeki nesneleri sınıflandırabilir, segmente edebilir veya tespit edebilir; ancak somut bir sistem, gördüğü şeye ne yapacağına da karar vermeli ve sonra fiziksel olarak eyleme geçmelidir.

Somutlaştırılmış yapay zekâ modelleri LLM’ler gibi ince ayarlanabilir mi?

Evet. Kendi metin veriniz üzerinde bir LLM’i nasıl ince ayarla uyarlayabiliyorsanız, pi0 gibi robot temel modelleri de az sayıda göreve özel gösterimle ince ayarlanabilir; böylece sıfırdan eğitmeden, genel amaçlı bir politikayı yeni bir robota veya göreve uyarlayabilirsiniz.


Vaibhav Mehra's photo
Author
Vaibhav Mehra
LinkedIn
Konular
Yapay Zeka
Büyük Dil Modelleri

Öne Çıkan DataCamp Kursları

Kurs

Python ile Deep Reinforcement Learning

4 sa
6K
İyileştirme ve optimizasyon teknikleri dahil olmak üzere güçlü Derin Pekiştirme Öğrenimi algoritmalarını öğrenin ve kullanın.
Ayrıntıları GörüntüleRight Arrow
Kursa Başla
Devamını GörRight Arrow