Program
AI engineer membangun dan menerapkan sistem AI di lingkungan produksi. Mereka mengubah model seperti LLM menjadi aplikasi andal yang memberikan nilai bisnis.
Peran ini secara inheren berbeda dari data scientist, yang fokus utamanya pada analisis data dan pemodelan eksploratif, dan tentu saja berbeda dari peneliti machine learning yang pada akhirnya fokus pada kemajuan teoretis dan algoritme baru.
Karena itu, wawancara AI engineer memprioritaskan pemikiran sistem yang praktis dibanding teori murni atau pemodelan statistik. Dalam artikel ini, saya akan membahas pertanyaan wawancara tentang LLM, konsep inti AI, desain sistem, deployment dan MLOps, pengkodean dan implementasi, serta skenario dunia nyata.
Pertanyaan Wawancara AI Engineer Tingkat Pemula
Pertanyaan dasar ini memastikan apakah Anda memahami kosakata dan pembedaan dasar yang membentuk cara sistem AI dibangun dan dibahas.
Apa perbedaan antara model AI dan model machine learning?
Model AI adalah sistem apa pun yang melakukan tugas yang umumnya memerlukan kecerdasan manusia, termasuk beberapa pendekatan berbasis aturan atau simbolik. Di sisi lain, model machine learning adalah subset yang mempelajari pola langsung dari data yang diberikan.
Dalam konteks produksi, AI engineer paling sering bekerja dengan model ML, khususnya LLM, namun juga harus mengintegrasikan beberapa komponen non-ML, seperti rule engine atau knowledge graph, bila diperlukan untuk keluaran yang sangat andal.
Apa itu LLM?
Large language model adalah, sesuai namanya, jaringan saraf berbasis transformer berukuran besar yang dilatih pada korpus teks masif untuk menghasilkan teks yang koheren. Dalam sistem produksi, LLM berfungsi sebagai mesin penalaran di balik chatbot, peringkas, dan agen.
Apa itu tokenization?
Tokenization mengonversi teks mentah menjadi token numerik yang dapat diproses model. Hal ini berdampak langsung pada biaya, panjang konteks, dan cara model memandang teks secara fundamental. Dengan kata lain, segmen teks diberi pengenal numerik, disebut token, sehingga teks siap diberi ke model. Sistem produksi menggunakan tokenizer subword seperti BPE dan memantau jumlah token untuk mengendalikan biaya API dan latensi.
Apa itu prompt?
Prompt adalah teks masukan yang diberikan ke LLM untuk menghasilkan keluaran. Umumnya ini merupakan artefak yang direkayasa yang berisi instruksi, terkadang contoh, dan konteks penuh untuk memaksimalkan kemampuan adaptasi LLM.
Apa perbedaan antara inference dan training?
Training memperbarui bobot model, sedangkan inference menghasilkan keluaran dari model yang sudah dilatih. AI engineer terutama fokus pada pengoptimalan dan penskalaan inference.
Apa itu sistem AI berbasis API?
Sistem ini mengonsumsi model pra-latih melalui endpoint cloud seperti OpenAI atau Anthropic untuk mengurangi overhead infrastruktur, sambil tetap memerlukan pengelolaan prompt dan biaya.
Apa perbedaan antara fine-tuning dan prompting?
Prompting mengubah perilaku pada saat inference. Namun, fine-tuning memperbarui bobot model, yang lebih lambat tetapi umumnya menghasilkan large language model yang lebih terpersonalisasi. Ini menjadikan prompting lebih cepat dan lebih murah untuk sebagian besar use case produksi.
Apa itu retrieval-augmented generation (RAG)?
RAG mengambil dokumen yang relevan dari basis pengetahuan yang Anda tentukan dan menambahkannya ke prompt. Dengan demikian, LLM menggunakan data terverifikasi tambahan tersebut untuk memprediksi informasi yang lebih andal dan mengurangi halusinasi.
Pertanyaan Wawancara Konsep Inti AI Engineer
Di luar definisi, pewawancara ingin melihat bahwa Anda memahami mekanisme di balik embedding, evaluasi, dan tantangan persisten berupa halusinasi.
Apa itu embedding, dan bagaimana penggunaannya?
Embedding adalah representasi vektor padat yang memahami makna semantik. Embedding membantu pencarian semantik dan pengambilan di basis data vektor. Anda dapat menganggap embedding sebagai tabel yang menerima masukan numerik dan memberinya vektor berdimensi tinggi di ruang yang berbeda dan lebih representatif.
Bagaimana Anda mengevaluasi sistem large language model?
Gabungkan metrik otomatis, seperti faithfulness dan relevansi, dengan tinjauan manusia dan KPI bisnis. Dalam produksi, kita pada dasarnya memerlukan pipeline evaluasi yang berkelanjutan.
Apa yang menyebabkan halusinasi pada LLM?
Celah dalam data pelatihan dan sifat prediksi token berikutnya yang terlalu percaya diri dapat memaksa model memprediksi token tanpa pijakan yang memadai, yang dikenal sebagai halusinasi.
Bagaimana Anda mengurangi halusinasi?
RAG adalah salah satu metode yang paling andal dan efisien, karena memberikan landasan pada sumber tepercaya yang Anda sediakan. Menggabungkannya dengan format keluaran terstruktur, pemeriksaan konsistensi diri, dan pemeriksaan fakta semakin mengurangi halusinasi.
Pertanyaan Wawancara LLM dan Generative AI
Bagian ini membahas arsitektur dan perilaku model itu sendiri, dari mekanisme attention hingga desain prompt.
Bagaimana cara kerja transformer pada tingkat tinggi?
Model memproses secara paralel menggunakan self-attention alih-alih rekuren. Large language model modern bersifat decoder-only dan memprediksi token secara autoregresif.
Apa itu attention?
Attention menghitung relevansi berbobot antar token untuk memungkinkan ketergantungan jarak jauh terlepas dari posisinya.
Apa itu context window?
Jumlah maksimum token yang dapat diproses model dalam satu panggilan inference. Ini membatasi desain prompt dan pengelolaan riwayat percakapan.
Apa itu temperature dalam generasi?
Parameter ini mengontrol tingkat keacakan dalam sampling: nilai lebih rendah menghasilkan keluaran yang lebih deterministik, sementara nilai lebih tinggi meningkatkan kreativitas. Dalam sistem produksi, nilainya disetel per use case untuk menyeimbangkan keandalan dan variasi.
Apa itu prompt engineering?
Perancangan, pengujian, verifikasi, penyetelan, dan iterasi prompt secara sistematis untuk mencapai perilaku yang paling andal. Prompt diberi versi bersama kode di produksi dan sangat bergantung pada model itu sendiri daripada templat generik.
Apa perbedaan system prompt dan user prompt?
System prompt mendefinisikan peran, batasan, dan format keluaran percakapan, sementara user prompt berisi permintaan spesifiknya.
Apa itu penggunaan alat atau function calling?
Ini memungkinkan large language model memanggil alat eksternal yang Anda inisiasi, seperti API dan basis data, serta memformat panggilannya dengan benar. Ini adalah gagasan utama di balik agen multi-langkah.
Bagaimana chain-of-thought prompting meningkatkan kinerja?
Ini menginstruksikan model untuk menghasilkan langkah penalaran perantara sebelum jawaban akhir sehingga dapat meningkatkan akurasi tugas yang kompleks.
Pertanyaan Wawancara Desain Sistem AI Engineer
Pertanyaan desain sistem menguji apakah Anda dapat menerjemahkan pengetahuan LLM ke arsitektur end-to-end yang menangani pengguna nyata dan kendala nyata.
Rancang sebuah chatbot menggunakan LLM.
Frontend, memori percakapan, orkestrasi prompt, panggilan API LLM, validasi keluaran, logging, pembatasan laju, dan pelacakan biaya.
Rancang sistem pencarian dokumen menggunakan embedding.
Ingest dan pemecahan dokumen menjadi potongan → embedding → penyimpanan di basis data vektor dengan metadata → embedding kueri → pencarian semantik (atau hibrida) → hasil berperingkat.
Rancang pipeline RAG.
Ingest dan pemecahan → embedding dan penyimpanan → pengambilan saat kueri dengan reranking → augmentasi prompt → generasi LLM → pascapemrosesan dan sitasi.
Bagaimana Anda menangani inference bertraffic tinggi?
Gunakan antrian, batching, kuantisasi, penskalaan horizontal, caching prompt, dan load balancing sambil memenuhi SLA latensi.
Bagaimana Anda mengurangi latensi dalam sistem AI?
Terapkan kompresi prompt, caching, model yang lebih kecil atau didistilasi, speculative decoding, dan akselerasi perangkat keras.
Bagaimana Anda mengevaluasi dan memantau keluaran?
Catat permintaan/respons, jalankan skor kualitas otomatis, ambil sampel untuk tinjauan manusia, lacak metrik bisnis, dan tetapkan peringatan degradasi.
Pertanyaan Deployment dan MLOps untuk AI Engineer
Setelah sistem dirancang, pewawancara ingin tahu bahwa Anda benar-benar dapat meluncurkannya, memantaunya, dan menjaganya tetap andal.
Bagaimana Anda menerapkan aplikasi yang didukung LLM?
Kontainerisasi dengan FastAPI, integrasi melalui SDK atau server self-hosted seperti vLLM, orkestrasi dengan Kubernetes atau serverless, dan gunakan CI/CD untuk prompt dan kode.
Bagaimana Anda menangani versioning model?
Versikan prompt, model embedding, dan adapter fine-tuned menggunakan LangChain Hub, MLflow, atau Hugging Face.
Bagaimana Anda memantau kinerja model di produksi?
Lacak latensi, throughput, biaya, tingkat error, dan kualitas keluaran menggunakan Prometheus, Grafana, dan evaluator LLM.
Apa itu drift model dalam sistem AI?
Degradasi yang disebabkan oleh beberapa perubahan pada distribusi input, perilaku pengguna, atau sumber data. Hal ini muncul sebagai penurunan relevansi atau meningkatnya halusinasi.
Bagaimana Anda melakukan penskalaan inference?
Terapkan continuous batching, kuantisasi seperti 4/8-bit, model parallelism, dan engine seperti vLLM atau TGI.
Alat apa yang digunakan untuk deployment AI?
Docker/Kubernetes, vLLM atau Text Generation Inference, basis data vektor seperti Pinecone atau Weaviate, LangSmith, dan platform cloud seperti AWS Bedrock, Azure OpenAI, atau GCP Vertex AI.
Pertanyaan Wawancara Berbasis Skenario untuk AI Engineer
Pertanyaan ini mensimulasikan insiden produksi nyata untuk melihat bagaimana Anda bernalar melalui proses debugging dan mitigasi di bawah tekanan.
Chatbot LLM Anda memberikan jawaban yang salah. Apa yang Anda lakukan?
Saya akan memeriksa prompt dan riwayat untuk memperkuat landasan RAG, menambahkan validasi keluaran, dan menerapkan loop umpan balik pengguna.
Tiba-tiba latensi meningkat. Bagaimana Anda melakukan debug?
Saya akan memprofil volume token, batas laju, jaringan, antrian, dan kesehatan endpoint menggunakan pelacakan end-to-end.
Biaya melonjak di produksi. Apa pendekatan Anda?
Analisis penggunaan token, tambahkan caching, perpendek prompt, arahkan ke model yang lebih murah, dan tetapkan beberapa peringatan anggaran otomatis.
Pengguna melaporkan halusinasi. Bagaimana Anda memitigasinya?
Tambahkan sitasi sumber, terapkan keluaran terstruktur dengan validasi, dan perkenalkan langkah self-critique.
Sistem RAG Anda mengembalikan hasil yang tidak relevan. Apa yang salah?
Periksa pemecahan potongan, kualitas embedding, filter metadata, ambang kemiripan, dan reranking pengambilan.
Perbedaan Wawancara AI Engineer vs. Machine Learning Engineer
AI engineer berfokus pada LLM, prompt engineering, RAG, orkestrasi API, dan aplikasi yang berhadapan dengan pengguna, sementara machine learning engineer berfokus pada pelatihan model, pipeline data, dan optimisasi.
Anda dapat menganggap AI engineer sebagai software engineer yang mengkhususkan diri dalam membangun aplikasi fungsional berbasis AI, sementara machine learning engineer lebih fokus pada penelitian dan pengembangan model dasarnya.
Wawancara umumnya menguji kandidat AI pada integrasi sistem dan keandalan produksi.
Kesalahan Umum dalam Wawancara AI Engineer
Bahkan kandidat kuat bisa terpeleset dengan beberapa jebakan berulang yang menandakan kurangnya pengalaman produksi.
- Terlalu fokus pada teori alih-alih alur kerja produksi yang nyata.
- Memperlakukan LLM sebagai kotak hitam tanpa membahas prompt atau mode kegagalan.
- Mengabaikan pertukaran desain sistem seperti latensi vs akurasi vs biaya.
- Mengabaikan praktik pemantauan dan iterasi.
- Kurang contoh konkret dari proyek yang sudah dideploy.
Cara Mempersiapkan Wawancara AI Engineer
Rencana persiapan yang terfokus harus membangun keterampilan praktis berdampingan dengan pengetahuan konseptual yang dibahas di atas.
- Bangun dan deploy dua proyek LLM end-to-end, seperti chatbot RAG dan aplikasi kecerdasan dokumen.
- Latih walkthrough desain sistem lengkap dari input hingga keluaran yang dipantau.
- Dapatkan pengalaman praktis dengan Docker, Kubernetes, vLLM, LangChain/LlamaIndex, dan basis data vektor.
- Kuasai integrasi API, parsing terstruktur, dan tracing.
- Pelihara proyek aktif dan coba ikuti pembaruan AI engineering yang berfokus pada produksi.
Kesimpulan
AI engineering adalah tentang membangun sistem yang andal. Wawancara yang paling sering menguji pemecahan masalah dunia nyata mulai dari arsitektur hingga deployment hingga pemikiran sistem.
Pengalaman langsung di produksi yang kuat merupakan pembeda paling signifikan dalam hal ini. Cobalah fokus pada penyampaian nilai yang terukur, dan Anda akan menonjol sebagai kandidat yang kuat.
Saya mengembangkan sistem AI terakselerasi yang memungkinkan kecerdasan di edge dengan pipeline ML federasi pada data terdesentralisasi dan beban kerja terdistribusi. Fokus kerja saya mencakup Model Besar, Pemrosesan Ucapan, Vision Komputer, Reinforcement Learning, dan Topologi ML tingkat lanjut.
FAQ
Seberapa teknis wawancara AI engineer?
Mereka menguji keterampilan praktis dalam LLM, desain sistem, RAG, dan deployment alih-alih teori mendalam atau algoritme LeetCode.
Apakah saya perlu pengalaman dengan alat tertentu?
Ya. Fokus pada LangChain/LlamaIndex, basis data vektor, vLLM, Docker, dan API LLM cloud.
Seberapa penting prompt engineering?
Kritis. Pewawancara mengharapkan diskusi tentang system prompt, pemanggilan alat, dan iterasi prompt dalam aplikasi nyata.
Proyek apa yang harus saya bangun untuk mempersiapkan diri?
Chatbot RAG end-to-end dan sistem pencarian dokumen menggunakan API publik dan penyimpanan vektor.
Apakah wawancara berbeda untuk pemula dan senior?
Ya. Pemula menghadapi hal-hal mendasar; senior menangani penskalaan sistem, trade-off MLOps, dan pemantauan produksi.

