Lewati ke konten utama

Apa Itu Embodied AI? Cara Robot Belajar Merasakan, Berpikir, dan Bertindak di 2026

Pelajari apa itu embodied AI, bagaimana bedanya dari LLM, cara kerja loop persepsi-penalaran-aksi, dan mengapa pelatihan sim-to-real penting bagi data scientist.
Diperbarui 8 Okt 2026  · 15 mnt Baca

Jelajahi bersama AI

ChatGPTClaudePerplexity

Bayangkan Anda meminta seorang teman untuk memberikan sebuah apel dari mangkuk buah. Ia melihat mangkuk itu, menentukan mana yang apel, lalu mengangkatnya dengan cukup lembut agar tidak penyok sebelum memberikannya kepada Anda.

Sekarang mari kita minta chatbot melakukan hal yang sama. Ia bisa menjelaskan dengan tepat cara mengambil apel, jari mana yang digunakan, dan seberapa kuat harus mencengkeramnya, tetapi ia tidak bisa benar-benar mengambilnya. Ia tidak punya tangan dan tidak tahu seperti apa rasanya apel.

Embodied AI adalah bidang yang mencoba menutup kesenjangan ini. Sederhananya, ini adalah AI yang memiliki tubuh fisik (seperti robot, mobil, atau drone) dan belajar dengan melakukan sesuatu di dunia nyata alih-alih hanya membacanya. Anda juga akan melihat istilah yang sangat terkait, “physical AI”, digunakan untuk gagasan yang sama.

Saat ini, bidang ini sedang mengalami momen besar. Di CES pada Januari 2026, Jensen Huang dari NVIDIA menyebutnya “momen ChatGPT untuk robotika.”

Dana pun mengikuti. Data Dealroom yang dilaporkan oleh CNBC menunjukkan perusahaan robotika menggalang US$55,8 miliar pada 2026 hingga awal Juni, hampir dua kali rekor tahunan sebelumnya.

Dalam artikel ini, saya akan membahas:

  • Apa itu embodied AI dan bagaimana perbandingannya dengan LLM serta robotika klasik
  • Mengapa physical AI jauh lebih sulit daripada digital AI
  • Bagaimana embodied AI bekerja melalui loop persepsi-penalaran-aksi
  • Bagaimana robot dilatih dalam simulasi, dan apa itu kesenjangan sim-to-real
  • Di mana embodied AI digunakan pada 2026, dan perusahaan mana yang perlu diperhatikan
  • Apa arti semua ini bagi data scientist

Jangan khawatir jika Anda belum pernah bekerja dengan robot sebelumnya. Pemahaman dasar tentang machine learning akan membantu, tetapi saya akan membangun setiap ide dari awal sehingga Anda tetap bisa mengikutinya.

Embodied AI Secara Singkat

  • Embodied AI adalah AI yang tertanam dalam tubuh fisik, seperti robot, mobil, atau drone, yang belajar dengan bertindak di dunia alih-alih hanya dari teks dan gambar.
  • Bottleneck utamanya adalah data: Open X-Embodiment, salah satu dataset robotika terbuka terbesar, hanya memiliki sedikit di atas 1 juta lintasan nyata, dibanding triliunan token untuk LLM.
  • Tim mengatasinya dengan simulasi, domain randomization, dan backbone visi-bahasa pralatih.
  • Pada 2026, ini berada pada produksi awal di gudang dan robotaksi, sementara sebagian besar penerapan humanoid masih berupa pilot yang sempit.

Apa Itu Embodied AI?

Embodied AI adalah sistem kecerdasan buatan yang dibangun ke dalam tubuh fisik, seperti robot, kendaraan otonom, atau drone, yang merasakan lingkungannya melalui sensor, menalar tentang apa yang harus dilakukan, dan bertindak pada dunia melalui motor, sembari belajar dari hasil tindakannya sendiri.

Istilah kuncinya di sini adalah embodied.

Kebanyakan model AI belajar dengan mengamati data yang dikumpulkan orang lain. Sistem embodied belajar dengan berinteraksi dengan lingkungannya, misalnya mendorong cangkir, melihat cangkir itu meluncur, dan memperbarui pengetahuannya tentang bagaimana perilaku cangkir saat didorong.

Berikut contohnya. Model visi yang dilatih pada jutaan foto pintu tahu seperti apa tampilan pintu. Robot yang benar-benar mencoba membuka 500 pintu tahu bahwa beberapa pintu didorong, beberapa ditarik, ada yang berat, dan ada yang memiliki gagang yang perlu ditekan dulu.

Anda tidak bisa mendapatkan kedalaman pengetahuan seperti ini dari sebuah foto.

Saya suka mengungkapkannya begini: sebagian besar AI mempelajari dunia dengan membacanya; embodied AI mempelajari dunia dengan menyentuh dan mengalaminya.

Perbedaan ini mengubah data yang Anda butuhkan, cara Anda melatih, dan bagaimana hal-hal bisa gagal.

Embodied AI vs. large language models vs. robotika tradisional

Sejauh ini, saya membandingkan embodied AI dengan chatbot. Sekarang mari bandingkan dengan dua hal yang paling sering disalahpahami sebagai embodied AI: large language models (LLM) dan robotika tradisional berbasis aturan.

  Embodied AI Large language models (LLMs) Robotika tradisional berbasis aturan
Belajar dari lingkungan Ya, melalui interaksi dan umpan balik Umumnya tidak, belajar dari korpus teks tetap Tidak, perilaku diprogram manual
Mengambil tindakan fisik Ya Tidak Ya
Latihan pada data internet Sebagian (backbone visi dan bahasanya) Ya, triliunan token Tidak
Generalisasi ke lingkungan baru Menengah, dan cepat membaik Baik, dalam tugas berbasis bahasa Buruk, rusak saat pengaturan berubah
Kedewasaan komersial pada 2026 Produksi awal (gudang, pilot pabrik) Dewasa dan tersebar luas Dewasa, digunakan di pabrik selama puluhan tahun

Dua baris terakhir yang ingin saya soroti.

Lengan industri berbasis aturan telah mengelas mobil selama puluhan tahun, dan sangat andal, tetapi hanya karena tidak ada yang berubah di dalam sel kerjanya. Embodied AI mencoba mempertahankan keandalan itu sambil membiarkan dunia tetap berantakan, yang oleh peneliti disebut generalisasi.

LLM dan embodied AI sama-sama belajar dari data dalam jumlah besar, tetapi mereka memecahkan masalah yang sangat berbeda. Sebuah LLM menerima teks dan memprediksi token mana yang seharusnya muncul berikutnya, sedangkan sistem embodied menerima bingkai kamera, sudut sendi, dan pembacaan sentuhan, lalu memprediksi gerakan mana yang seharusnya terjadi berikutnya.

Singkatnya, LLM tahu tentang dunia fisik, sementara embodied AI bertindak di dalamnya. Kembali ke apel kita: LLM dapat menjelaskan dengan tepat cara mengambilnya, dan robot embodied AI benar-benar bisa melakukannya.

Biaya kesalahan juga sangat berbeda. Jika LLM salah, Anda mendapat kalimat yang agak janggal. Jika sistem embodied salah, gelas bisa jatuh ke lantai, atau sesuatu yang lebih buruk.

Sekarang bagian yang menurut saya sering terlewat: keduanya bekerja bersama.

Dalam model vision-language-action (VLA), model visi-bahasa pralatih berada di inti sistem. Ia membaca gambar kamera dan instruksi Anda (“letakkan buah di mangkuk”), lalu meneruskan pemahamannya ke decoder aksi yang menghasilkan perintah motor yang sebenarnya.

diagram arsitektur π₀ yang menunjukkan model visi-bahasa terhubung ke ahli aksi

Cara model visi-bahasa pralatih terhubung ke aksi robot di π₀ (pi-zero). Gambar dari sumber: Black et al., 2024

Mengapa Physical AI Jauh Lebih Sulit daripada Digital AI?

Physical AI lebih sulit daripada digital AI terutama karena data.

Model bahasa maju pesat berkat dekade orang berbagi teks, kode, dan gambar secara daring, tetapi tidak ada sumber data sensor dunia nyata yang sebanding. Jauh lebih sedikit aliran sudut sendi, pembacaan gaya, dan bingkai kamera dari robot yang berinteraksi dengan objek sehari-hari.

Mari kita lihat kebutuhan data secara lebih rinci. Sistem embodied membutuhkan 3 jenis data yang sulit ditemukan:

  1. Data sensor yang direkam dari sudut pandang robot sendiri, dari kamera, sensor kedalaman, lidar, dan sensor sentuh
  2. Fisika objek, seperti bagaimana benda meluncur, melengkung, terbalik, dan pecah
  3. Hasil aksi, yakni catatan tentang apa yang dilakukan robot dan apa yang terjadi sesudahnya

Sekarang mari kita beri angka.

LLM frontier dilatih pada triliunan token. Open X-Embodiment, salah satu dataset robotika terbuka terbesar, menggabungkan data dari 22 jenis robot di 21 institusi dan menghasilkan sedikit di atas 1 juta lintasan nyata.

ikhtisar dataset Open X-Embodiment yang menunjukkan robot dan dataset gabungan

Robot dan tugas yang digabungkan dalam dataset Open X-Embodiment. Gambar dari sumber: Open X-Embodiment Collaboration, 2023

Mengapa begitu sedikit? Setiap lintasan membutuhkan robot nyata yang melakukan tugas nyata, biasanya dikendalikan manusia melalui teleoperation, yang lambat dan mahal.

Kesenjangan ini juga menjelaskan mengapa physical AI menggeneralisasi lebih lambat daripada digital AI. Model menangani variasi dengan baik ketika ia pernah melihat sesuatu yang serupa sebelumnya, dan sejuta lintasan mencakup jauh lebih sedikit dapur, pengaturan pencahayaan, dan bentuk objek dibanding triliunan token mencakup kalimat.

Saya akan menyimpan masalah data ini di belakang pikiran Anda untuk sisa artikel. Banyak keputusan desain yang Anda lihat di bawah, dari simulasi hingga domain randomization hingga meminjam backbone visi-bahasa pralatih, adalah solusi sementara untuk masalah ini.

Bagaimana Embodied AI Bekerja? Loop Persepsi-Penalaran-Aksi

Embodied AI bekerja dengan menjalankan loop berkelanjutan 3 tahap:

  • Persepsi: merasakan dunia
  • Penalaran: memutuskan apa yang harus dilakukan
  • Aksi: menggerakkan tubuh

Loop ini berulang berkali-kali per detik, dan setiap gerakan mengubah apa yang dirasakan robot berikutnya, sehingga keluaran satu siklus menjadi masukan bagi siklus berikutnya.

Loop yang sama juga berada di balik world models. Makalah “World Models” tahun 2018 oleh Ha dan Schmidhuber membagi agen menjadi modul visi, modul memori, dan pengendali, lalu mengujinya pada mobil dalam gim balap. Embodied AI menerapkan gagasan yang sama ke robot utuh.

Cara yang baik untuk memahami loop ini adalah membayangkan menangkap bola:

  • Pertama, mata Anda melacak bola dan menentukan di mana posisinya dan seberapa cepat datang.
  • Berikutnya, otak Anda memprediksi di mana bola berada setengah detik lagi dan memutuskan ke mana tangan harus bergerak.
  • Terakhir, lengan Anda bergerak, dan saat bola mendekat, Anda terus menyesuaikan.

Robot melakukan hal yang sama, hanya saja dengan kamera alih-alih mata dan motor alih-alih otot.

Mari kita bahas setiap tahap secara bergiliran.

Persepsi: memahami dunia fisik

Persepsi adalah tahap yang mengubah pembacaan sensor mentah menjadi sesuatu yang bisa ditalar oleh sisa sistem. Satu kamera jarang cukup, jadi kebanyakan robot menggabungkan beberapa sensor:

  • Kamera RGB untuk warna dan tampilan; robot biasanya membawa beberapa kamera untuk menangkap tata letak adegan
  • Sensor kedalaman dan lidar untuk jarak dan bentuk 3D
  • Propriosepsi, yakni indra robot tentang tubuhnya sendiri (sudut sendi, kecepatan, dan torsi)
  • Sensor taktil di ujung jari untuk kontak, tekanan, dan selip

keluaran persepsi Gemini Robotics-ER 1.5 termasuk deteksi, segmentasi, dan penunjukan

Contoh keluaran persepsi dari Gemini Robotics-ER 1.5. Gambar dari sumber: Google DeepMind

Model persepsi kemudian mengubah pembacaan ini menjadi peta spasial, identitas objek, posisi rintangan, dan pemahaman umum tentang adegan.

Kebanyakan ini adalah computer vision standar, seperti deteksi objek, segmentasi, dan estimasi kedalaman, biasanya dibangun di atas vision transformer pralatih seperti DINOv2 atau SigLIP.

Menurut saya, sentuhan adalah bagian paling diremehkan dari persepsi saat ini. Kamera dapat memberi tahu Anda ada gelas di meja, tetapi sentuhan yang memberi tahu Anda gelas mulai tergelincir dari genggaman.

Untuk memberi gambaran tentang posisinya, XELA Robotics memamerkan ujung jari robotik di Automate 2026 dengan 30 titik pengindra gaya tiga sumbu yang dipadatkan ke dalam bantalan. Perusahaan juga mengatakan sensor uSkin-nya dapat mendeteksi gaya sekecil 0,1 gram-force.

sensor ujung jari taktil XELA uSkin

Sebuah ujung jari robotik uSkin yang berisi array titik pengindra taktil tiga sumbu. Gambar dari sumber: XELA Robotics

Penalaran: world model dan perencanaan

Penalaran adalah tahap yang memutuskan apa yang harus dilakukan selanjutnya. Di sistem yang lebih baru, biasanya ada 2 lapis:

  • World model (lapis bawah): representasi internal yang memprediksi bagaimana lingkungan akan merespons sebuah aksi sebelum robot mengambilnya
  • Perencanaan (lapis atas): memecah tujuan besar menjadi langkah-langkah yang lebih kecil

World model memungkinkan robot membayangkan sebelum bertindak.

DreamerV3 adalah contoh yang bagus. Ia mempelajari model ringkas dari lingkungannya lalu melatih polisinya hampir sepenuhnya di dalam dunia imajiner itu.

Saya menggunakan DreamerV3 dalam riset saya sendiri, dan yang paling mengejutkan adalah betapa lebih banyak waktu agen berlatih di “kepalanya” daripada di lingkungan sebenarnya. Itu penting karena pelatihan menjadi lebih cepat dan jauh lebih murah.

diagram pembelajaran world model DreamerV3 dan pelatihan actor-critic terbayang

DreamerV3 melatih polisinya pada rollout terbayang dari world model-nya. Gambar dari sumber: Hafner et al., 2023

Perencanaan, di sisi lain, semakin banyak ditangani oleh model bahasa.

Contoh yang baik adalah Gemini Robotics-ER 1.5 dari Google DeepMind, yang bertindak sebagai perencana tingkat tinggi. Diberi tugas seperti memilah sampah sesuai aturan daur ulang lokal, ia dapat mencari aturan dengan Google Search, memecah pekerjaan menjadi langkah, dan menyerahkan setiap langkah ke model VLA Gemini Robotics 1.5 yang melakukan pekerjaan fisik.

Anda bisa menganggap model bahasa sebagai manajer dan model VLA sebagai pekerja yang benar-benar menyelesaikan tugas.

Gemini Robotics-ER 1.5 mengorkestrasi perencanaan dan mendelegasikan ke model VLA Gemini Robotics 1.5

Gemini Robotics-ER 1.5 merencanakan tugas dan mendelegasikan eksekusi fisik ke Gemini Robotics 1.5 VLA. Gambar dari sumber: Google DeepMind, 2025

Aksi: mengubah keputusan menjadi gerakan

Aksi adalah tahap yang mengonversi keputusan menjadi perintah presisi untuk setiap sendi dan motor, biasanya puluhan hingga ratusan kali per detik (diukur dalam hertz, atau Hz). Bagian level rendah dari tahap ini disebut kontrol.

Misalnya, perintah seperti “Gerakkan gripper 5 cm ke kiri” terdengar sederhana, tetapi pada lengan 7 sendi harus menjadi torsi spesifik untuk setiap motor sendi, dihitung ulang terus-menerus saat lengan bergerak.

Bagian tersulit adalah bahwa kenyataan jarang sesuai dengan yang diharapkan robot. Objek selip, lantai sedikit tidak rata, pencahayaan berubah saat seseorang membuka tirai, dan kabel melengkung berbeda dari yang diprediksi.

Kontroler yang baik menyadari perbedaan antara yang diharapkan dan yang sebenarnya terjadi, lalu segera mengoreksi.

Menurut saya, aksi adalah tahap tersulit untuk dikelola dengan benar di lingkungan yang berantakan dan tidak terstruktur. Kesalahan persepsi bisa diperbaiki dengan melihat lagi dan kesalahan perencanaan bisa diperbaiki dengan merencanakan ulang, tetapi kesalahan kontrol terjadi secara real time.

Bagaimana Embodied AI Dilatih? Peran Simulasi

Embodied AI dilatih pada campuran simulasi dan data dunia nyata. Simulasi berarti lingkungan virtual yang diisi objek 3D dengan fisika yang akurat, tempat robot dapat berlatih jutaan kali sebelum menyentuh perangkat keras nyata.

Ingat masalah data tadi? Simulasi adalah salah satu solusi utamanya, khususnya untuk reinforcement learning dalam lokomosi dan manipulasi. Model fondasi seperti π₀ masih sangat bergantung pada demonstrasi nyata, jadi kebanyakan tim menggunakan keduanya.

Mengumpulkan data di dunia nyata memiliki 3 masalah besar:

  • Lambat: satu robot hanya bisa mengumpulkan beberapa ratus demonstrasi per hari
  • Mahal: robot bisa rusak, dan manusia perlu mengawasinya
  • Berbahaya: terutama dengan humanoid berat atau mobil

Simulator mengatasi ketiganya sekaligus. Anda bisa menjalankan ribuan robot virtual secara paralel pada satu GPU dan membiarkan mereka gagal dan memulai ulang sesering yang dibutuhkan. Ini memadatkan pengalaman bertahun-tahun robot ke dalam beberapa jam.

Apa yang membuat lingkungan simulasi bagus

Tidak semua simulator sama bermanfaatnya untuk melatih robot. Dari pengalaman saya bekerja dengan lengan robot dalam simulasi, simulator yang baik butuh 3 hal:

  1. Akurasi fisik, sehingga kontak, gesekan, dan deformasi berperilaku seperti di dunia nyata
  2. Keberagaman objek, sehingga robot melihat ribuan mug berbeda alih-alih mug yang sama seribu kali
  3. Domain randomization, sehingga pencahayaan, tekstur, massa, dan gesekan berubah antar episode pelatihan (lebih lanjut tentang ini sebentar lagi)

Dua platform yang paling sering Anda temui adalah NVIDIA Isaac Sim (dengan Isaac Lab) dan MuJoCo:

Platform Pengembang Keunggulan Terbaik untuk
NVIDIA Isaac Sim dan Isaac Lab NVIDIA Rendering fotorealistik, simulasi sensor, ribuan lingkungan paralel di GPU Run reinforcement learning skala besar dan data kamera sintetis
MuJoCo Google DeepMind (sumber terbuka) Fisika kontak yang cepat dan akurat, ringan, komunitas riset besar Riset, tolok ukur lokomosi dan manipulasi

Tambahan terbaru adalah Newton, mesin fisika sumber terbuka yang dipercepat GPU, dibangun oleh NVIDIA, Google DeepMind, dan Disney Research serta dikelola melalui Linux Foundation.

Newton 1.0 dirilis pada NVIDIA GTC Maret 2026. Ini terhubung ke Isaac Lab sebagai backend fisika, dengan MuJoCo Warp sebagai salah satu solver dan solver tambahan untuk objek deformabel seperti kabel dan kain.

Deformabel lebih penting daripada kedengarannya. Simulator lama menangani kabel dan kain dengan buruk, dan pabrik membutuhkan robot yang bisa menangani keduanya.

Kesenjangan sim-to-real

Kesenjangan sim-to-real adalah penurunan kinerja yang terjadi ketika kebijakan yang dilatih dalam simulasi dipindahkan ke robot nyata, dan ini adalah salah satu masalah terbesar dalam sistem embodied.

Misalnya, gesekan yang disimulasikan tidak pernah benar-benar pas, kamera simulasi terlalu bersih, dan objek simulasi bisa terlalu sempurna, sehingga kebijakan yang berhasil 95% di simulasi bisa langsung gagal saat bertemu perangkat keras nyata.

Ada 2 cara utama tim menutup kesenjangan ini:

Domain randomization selama pelatihan

Alih-alih mencoba menyempurnakan simulator, tim melakukan randomisasi dengan banyak cara.

Tobin et al. (2017) merandomisasi tekstur dan pencahayaan begitu kuat sehingga dunia nyata tampak seperti variasi lain bagi model. Tangan robot Rubik’s Cube OpenAI melangkah lebih jauh dengan secara otomatis memperlebar randomisasi seiring kebijakan membaik.

Adegan pelatihan simulasi yang sangat diacak di samping adegan uji dunia nyata

Fine-tuning pada data nyata setelah simulasi

Kebijakan yang pralatih dalam simulasi sering hanya butuh sejumlah kecil demonstrasi nyata untuk beradaptasi, karena sudah mempelajari bentuk umum tugasnya.

Kedua teknik ini tidak menghilangkan kesenjangan sepenuhnya, sehingga tim terus bekerja untuk mengurangi dampaknya pada kinerja dunia nyata.

Contoh Embodied AI pada 2026

Embodied AI kini berjalan di luar lab di beberapa industri, meski sangat tidak merata.

Pola yang saya lihat adalah ia hadir lebih dulu di tempat lingkungan terlalu berubah-ubah untuk diskrip manual, tetapi manusia masih bisa turun tangan jika terjadi masalah.

Kendaraan otonom

Mobil swakemudi adalah salah satu jenis embodied AI yang paling haus data.

Waymo Driver telah menempuh hampir 200 juta mil sepenuhnya otonom, dan juga melatih serta menguji pada miliar-miliar mil dalam simulasi, menurut postingan Waymo Februari 2026 tentang World Model-nya. Simulasi memungkinkan Waymo memutar ulang insiden nyata dan menghasilkan skenario langka (misalnya, seorang anak berlari keluar di antara mobil parkir) yang mungkin tidak pernah ditemui armada uji di jalan nyata.

Mobil swakemudi juga contoh bagus dari loop persepsi-penalaran-aksi yang berjalan penuh. Kendaraan Waymo melakukan persepsi dengan kamera, lidar, dan radar, menalar tentang apa yang kemungkinan dilakukan setiap pejalan kaki dan kendaraan berikutnya, dan bertindak dengan mengontrol kemudi dan rem berkali-kali per detik.

Gudang dan logistik

Menurut saya, gudang adalah penggunaan komersial embodied AI yang paling alami saat ini.

Perubahannya adalah dari robot jalur tetap yang mengikuti garis di lantai ke sistem yang dapat menangani inventaris yang dinamis dan berantakan, seperti mengambil dari tote dengan 40 produk berbeda yang dicampur jadi satu.

Digit humanoid milik Agility Robotics telah memindahkan tote di GXO Logistics berdasarkan perjanjian multi-tahun yang ditandatangani pada 2024, dan Stretch dari Boston Dynamics membongkar kotak dari truk.

Digit humanoid Agility Robotics memindahkan tote antara robot mobile otonom dan konveyor di gudang GXO

Digit milik Agility Robotics memindahkan tote antara robot mobile otonom dan konveyor di gudang GXO. Gambar dari sumber: Agility Robotics/The Robot Report

Robotika kesehatan

Kesehatan adalah bidang yang saya perkirakan embodied AI akan bergerak paling hati-hati.

Sistem bedah seperti da Vinci dari Intuitive sudah digunakan di rumah sakit di seluruh dunia, tetapi dikendalikan oleh ahli bedah, dan sebagian besar riset AI di sini berfokus pada asistensi, seperti pelacakan instrumen, kontrol kamera, dan dukungan penjahitan.

Di kesehatan, persetujuan regulatori sering menjadi kendala yang lebih besar daripada kapabilitas model, dan memang seharusnya begitu. Saya pribadi memperkirakan penggunaan asistif dan pelatihan tiba jauh lebih dulu daripada apa pun yang mendekati pembedahan otonom.

Robot humanoid di lantai pabrik

Humanoid mendapat perhatian paling besar dan termasuk yang paling belum terbukti.

Di CES 2026, Boston Dynamics meluncurkan versi produksi Atlas dan mengatakan setiap unit yang dibuat pada 2026 sudah dialokasikan untuk Hyundai dan Google DeepMind. Sementara itu, Figure menjalankan penerapan selama 11 bulan robot humanoid Figure 02 di pabrik BMW di Spartanburg, South Carolina, untuk memuat lembaran logam.

Saya ingin jujur: sebagian besar penerapan humanoid masih pilot yang melakukan serangkaian tugas sempit. Hyundai, misalnya, berencana mulai menggunakan Atlas untuk penjenjangan suku cadang pada 2028, tanda betapa hati-hatinya bahkan para pendukung terbesar bergerak.

Perusahaan Embodied AI Kunci yang Perlu Dikenal pada 2026

Sekarang mari bicarakan siapa yang benar-benar membangun semua ini. Berikut 5 organisasi yang menurut saya perlu dikenali siapa pun yang baru di embodied AI:

Organisasi Apa yang mereka bangun Mengapa penting
NVIDIA Isaac Sim, Isaac Lab, Newton, GR00T, dan Cosmos Stack simulasi dan komputasi tempat kebanyakan tim berlatih
Physical Intelligence keluarga model fondasi robot π₀ Kebijakan robot serbaguna dengan checkpoint terbuka
Agility Robotics Humanoid Digit Dibuat untuk logistik gudang dan sudah bekerja dengan pelanggan
Boston Dynamics Atlas, Stretch, dan Spot Memindahkan Atlas dari demo riset ke unit produksi pada 2026
AMI Labs (Yann LeCun) World model gaya JEPA Taruhan berlawanan arus pada world model yang tidak menghasilkan piksel

NVIDIA

NVIDIA sebagian besar membangun alat di sekitar robot, bukan robot itu sendiri.

Isaac Sim menangani simulasi fotorealistik, Isaac Lab menangani reinforcement learning di atasnya, dan Newton kini dapat menyediakan fisikanya. Banyak tim robotika berlatih pada perangkat lunak NVIDIA meski NVIDIA tidak menjual robot serbaguna.

Physical Intelligence

Physical Intelligence membangun π₀, sebuah model visi-bahasa-aksi berukuran 3,3 miliar parameter yang menggunakan flow matching untuk menghasilkan potongan aksi yang mulus untuk tugas seperti melipat pakaian.

Ini adalah contoh terbaik yang saya tahu tentang model robot serbaguna yang benar-benar dapat Anda unduh, melalui repositori openpi.

Jika konsep “model fondasi” baru bagi Anda, panduan Introduction to Foundation Models kami menjelaskannya dengan baik.

Agility Robotics

Agility Robotics mengambil jalur sempit dengan Digit.

Digit dirancang sejak awal untuk memindahkan tote di gudang, dan fokus sempit itu menjadi alasan besar ia mencapai pelanggan berbayar lebih cepat daripada kebanyakan humanoid.

Boston Dynamics

Boston Dynamics mengambil jalur sebaliknya dengan Atlas.

Mereka menghabiskan bertahun-tahun mendorong batas atletik robot (Anda mungkin pernah melihat video parkournya) sebelum mengubahnya menjadi produk pabrik serba listrik yang direncanakan Google DeepMind untuk ditenagai oleh model Gemini Robotics.

AMI Labs (Yann LeCun)

AMI Labs adalah startup berbasis Paris milik Yann LeCun, yang menutup putaran seed US$1,03 miliar pada Maret 2026 dengan valuasi pra-uang US$3,5 miliar. Putaran ini dipimpin bersama oleh Cathay Innovation, Greycroft, Hiro Capital, HV Capital, dan Bezos Expeditions, dengan NVIDIA dan Samsung di antara investor lainnya.

LeCun telah berargumen selama bertahun-tahun bahwa memprediksi setiap piksel masa depan itu boros, jadi Joint Embedding Predictive Architecture (JEPA)-nya membuat prediksi di ruang representasi abstrak sebagai gantinya, sebuah gagasan yang sudah diuji Meta dengan V-JEPA 2.

Yang membuat AMI layak dipantau adalah ia menentang arah kebanyakan bidang ini bergerak. Namun, sejauh ini belum merilis apa pun, jadi saya akan memperlakukannya sebagai taruhan riset dengan banyak dana di belakangnya, bukan pendekatan yang telah terbukti untuk saat ini.

Embodied AI untuk Data Scientist: Di Mana Peran Anda?

Embodied AI bukan hanya masalah rekayasa robotik. Banyak pekerjaan, dan saya berargumen sebagian besar, adalah pekerjaan machine learning.

Keterampilan yang paling langsung dapat ditransfer adalah:

  • Computer vision, untuk model persepsi dan pemahaman adegan
  • Reinforcement learning (RL), untuk melatih kebijakan dalam simulasi (jika Anda pernah menemukan RLHF saat membaca tentang LLM, itu masih keluarga gagasan yang sama)
  • Simulasi dan data sintetis, untuk membuat data pelatihan yang tidak dapat Anda kumpulkan di dunia nyata
  • Evaluasi model, karena mengukur apakah robot “berhasil” jauh lebih berantakan daripada mengukur akurasi pada set uji
  • Rekayasa pipeline data, untuk menjaga video, status sendi, dan aksi tetap sinkron di ribuan episode

Coba sendiri loop persepsi-penalaran-aksi

Anda tidak memerlukan robot untuk memulai. Pustaka gymnasium dilengkapi dengan lingkungan MuJoCo, jadi setelah menjalankan pip install "gymnasium[mujoco]" Anda dapat menjalankan keseluruhan loop pada robot simulasi:

import gymnasium as gym

# HalfCheetah is a 2D cheetah-like robot simulated with the MuJoCo physics engine
env = gym.make("HalfCheetah-v5")
observation, info = env.reset(seed=42)

for step in range(1000):
    # Perception: the observation holds joint angles and velocities
    # Reasoning: a trained policy would choose the action here, we pick randomly
    action = env.action_space.sample()

    # Action: apply torques to the joints and move the physics forward one step
    observation, reward, terminated, truncated, info = env.step(action)

    if terminated or truncated:
        observation, info = env.reset()

env.close()

Saat ini, cheetah hanya meronta karena langkah “penalaran” adalah env.action_space.sample(), yang memilih aksi acak setiap saat.

Mengganti satu baris itu dengan kebijakan terlatih adalah tepatnya tujuan reinforcement learning, dan saya sarankan mencobanya sebelum beralih ke hal yang lebih besar.

Apa Keterbatasan Embodied AI?

Embodied AI bergerak cepat, tetapi masih kesulitan di 4 area, dan saya pikir ini penting untuk diketahui:

  • Pemulihan dari kesalahan. Kebanyakan data pelatihan menunjukkan percobaan yang berhasil, sehingga robot melihat sangat sedikit contoh tentang apa yang harus dilakukan ketika genggaman tergelincir di tengah tugas.
  • Tugas panjang. Kesalahan kecil bertambah saat Anda merangkai langkah. Jika setiap langkah berhasil 95% dan kegagalan independen, robot hanya menyelesaikan tugas 20 langkah sekitar 36% dari waktu.
  • Kecepatan pada robot itu sendiri. Menjalankan model dengan miliaran parameter cukup cepat untuk kontrol real-time pada perangkat keras robot masih sulit, itulah mengapa banyak sistem memisahkan penalaran lambat dari kontrol cepat, terkadang menjalankan bagian lambat di luar robot.
  • Lingkungan yang tidak familiar. Robot menangani skenario yang mirip dengan data pelatihannya dengan baik dan jauh lebih buruk di luar itu, yang membawa kita kembali ke masalah data dari awal artikel ini.

Penutup

Embodied AI memberi mesin tubuh fisik dan kecerdasan untuk menggunakannya. Ia bekerja melalui loop persepsi-penalaran-aksi, tertahan terutama oleh betapa sedikitnya data fisik yang ada, dan pada 2026 mulai keluar dari lab riset ke gudang dan pilot pabrik pertama.

Yang benar-benar mengejutkan saya adalah bagaimana pertanyaannya bergeser. Beberapa tahun lalu, orang bertanya apakah LLM akan membuat riset robotika tidak relevan. Sebaliknya, LLM menjadi lapisan penalaran di dalam sistem embodied, dan kedua bidang ini saling bertumbuh.

Ingat apel di awal artikel ini? Mengetahui cara mengambilnya dan benar-benar mengambilnya ternyata dua masalah yang sangat berbeda, dan embodied AI adalah bidang yang mengerjakan masalah kedua.

Jika Anda ingin membangun fondasi ML untuk ini, mulailah dengan Reinforcement Learning in Python track kami. Untuk sisi bahasa dari stack, kursus Large Language Models (LLMs) Concepts dan track Developing Large Language Models kami adalah langkah lanjut yang baik.

Embodied AI FAQs

Apakah embodied AI sama dengan robotika?

Hampir! Robotika adalah bidang yang lebih luas tentang membangun dan mengendalikan mesin fisik sedangkan Embodied AI secara khusus merujuk pada robot yang belajar dari interaksi dengan lingkungannya alih-alih mengikuti aturan yang dikodekan manual.

Apakah saya membutuhkan robot fisik untuk mulai belajar embodied AI?

Tidak. Simulator seperti MuJoCo dan NVIDIA Isaac Sim memungkinkan Anda melatih dan menguji kebijakan sepenuhnya dalam perangkat lunak, yang merupakan cara kerja sebagian besar tim riset dan industri.

Bahasa pemrograman dan alat apa yang digunakan dalam embodied AI?

Python mendominasi, dipasangkan dengan framework seperti PyTorch atau JAX untuk pelatihan model, plus alat simulasi seperti MuJoCo, Isaac Lab dan pustaka reinforcement learning seperti Gymnasium atau Stable-Baselines3.

Apa bedanya embodied AI dengan computer vision?

Computer vision adalah komponen dari embodied AI. Model visi dapat mengklasifikasi, melakukan segmentasi, atau mendeteksi objek dalam gambar tetapi sistem embodied juga harus memutuskan apa yang harus dilakukan terhadap apa yang dilihatnya dan kemudian bertindak secara fisik.

Bisakah model embodied AI di-fine-tune seperti LLM?

Ya. Sama seperti Anda dapat melakukan fine-tuning LLM pada data teks Anda sendiri, model fondasi robot seperti pi0 dapat di-fine-tune pada sejumlah kecil demonstrasi tugas spesifik, memungkinkan Anda mengadaptasi kebijakan serbaguna ke robot atau tugas baru tanpa melatih dari nol.


Vaibhav Mehra's photo
Author
Vaibhav Mehra
LinkedIn
Topik
Kecerdasan Buatan
Large Language Models

Kursus Teratas DataCamp

Kursus

Deep Reinforcement Learning dengan Python

4 jam
6K
Pelajari dan terapkan algoritma Deep Reinforcement Learning yang canggih, termasuk teknik penyempurnaan dan optimasi.
Lihat DetailRight Arrow
Mulai Kursus
Lihat SelengkapnyaRight Arrow
Terkait

blogs

40 Pertanyaan Wawancara DBMS Teratas di 2026

Kuasai pertanyaan wawancara basis data, dari konsep SQL dasar hingga skenario desain sistem tingkat lanjut. Panduan mendalam ini mencakup semua yang Anda perlukan untuk sukses di wawancara DBMS dan meraih peran berikutnya.
Dario Radečić's photo

Dario Radečić

15 mnt

blogs

12 Alternatif ChatGPT Terbaik yang Bisa Anda Coba pada 2026

Artikel ini menyajikan daftar alternatif ChatGPT yang akan meningkatkan produktivitas Anda.
Javier Canales Luna's photo

Javier Canales Luna

14 mnt

blogs

Tutorial Korelasi di R

Dapatkan pengenalan dasar-dasar korelasi di R: pelajari lebih lanjut tentang koefisien korelasi, matriks korelasi, plotting korelasi, dan sebagainya.
David Woods's photo

David Woods

13 mnt

blogs

Spaghetti Plot dan Jalur Badai

Temukan alasan mengapa Anda sebaiknya (tidak) menggunakan spaghetti plot untuk menyampaikan ketidakpastian jalur prediksi badai serta dampaknya terhadap interpretasi.
Hugo Bowne-Anderson's photo

Hugo Bowne-Anderson

13 mnt

Lihat SelengkapnyaLihat Selengkapnya