Chuyển đến nội dung chính

Câu hỏi phỏng vấn Kỹ sư AI: Mong đợi điều gì và cách chuẩn bị

Chuẩn bị cho phỏng vấn kỹ sư AI với các câu hỏi tập trung vào LLM, triển khai mô hình, thiết kế hệ thống và các ứng dụng AI trong đời thực.
Đã cập nhật 12 thg 8, 2026  · 9 phút đọc

Khám phá với AI

ChatGPTClaudePerplexity

Kỹ sư AI xây dựng và triển khai các hệ thống AI trong môi trường sản xuất. Họ biến những mô hình như LLM thành các ứng dụng đáng tin cậy mang lại giá trị kinh doanh. 

Vai trò này khác biệt với nhà khoa học dữ liệu, người chủ yếu tập trung vào phân tích dữ liệu và mô hình hóa khám phá, và tất nhiên cũng khác với nhà nghiên cứu học máy, người rốt cuộc tập trung vào các tiến bộ lý thuyết và thuật toán mới.

Vì vậy, phỏng vấn kỹ sư AI ưu tiên tư duy hệ thống thực tiễn hơn là thuần lý thuyết hay mô hình hóa thống kê. Trong bài viết này, tôi sẽ đề cập các câu hỏi phỏng vấn về LLM, các khái niệm cốt lõi của AI, thiết kế hệ thống, triển khai và MLOps, mã hóa và hiện thực hóa, cũng như các tình huống thực tế.

Câu hỏi phỏng vấn Kỹ sư AI cấp độ cơ bản

Những câu hỏi nền tảng này nhằm xác định liệu bạn có hiểu thuật ngữ cơ bản và các khác biệt định hình cách xây dựng và thảo luận về hệ thống AI hay không.

Sự khác nhau giữa mô hình AI và mô hình học máy là gì?

Mô hình AI là bất kỳ hệ thống nào thực hiện các tác vụ vốn chủ yếu đòi hỏi trí tuệ con người, kể cả các cách tiếp cận dựa trên luật hoặc ký hiệu. Mô hình học máy, ngược lại, là một tập con học các mẫu trực tiếp từ dữ liệu được cung cấp.

Trong bối cảnh sản xuất, kỹ sư AI thường làm việc với các mô hình ML, đặc biệt là LLM, nhưng cũng phải tích hợp một số thành phần không phải ML, như máy suy luận luật hoặc đồ thị tri thức, khi cần để đạt đầu ra có độ tin cậy cao.

LLM là gì?

Mô hình ngôn ngữ lớn, như tên gọi, là một mạng nơ-ron dựa trên transformer quy mô lớn được huấn luyện trên kho văn bản khổng lồ để sinh văn bản mạch lạc. Trong hệ thống sản xuất, LLM đóng vai trò động cơ suy luận phía sau chatbot, công cụ tóm tắt và các agent.

Tokenization là gì?

Tokenization chuyển văn bản thô thành các token số để mô hình có thể xử lý. Nó ảnh hưởng trực tiếp đến chi phí, độ dài ngữ cảnh và cách mô hình nhìn nhận văn bản về mặt căn bản. Nói cách khác, các đoạn văn bản được gán định danh số, gọi là token, để văn bản sẵn sàng được đưa vào mô hình. Hệ thống sản xuất sử dụng bộ tokenizer ở mức dưới từ như BPE và theo dõi số lượng token để kiểm soát chi phí API và độ trễ.

Prompt là gì?

Prompt là văn bản đầu vào được đưa vào LLM để tạo ra đầu ra. Thông thường, đây là một tạo tác được thiết kế có chủ đích, bao gồm hướng dẫn, đôi khi có ví dụ, và bối cảnh đầy đủ để tối đa hóa khả năng thích ứng của LLM.

Khác biệt giữa suy luận (inference) và huấn luyện (training) là gì?

Huấn luyện cập nhật trọng số mô hình, trong khi suy luận tạo đầu ra từ một mô hình đã huấn luyện. Kỹ sư AI chủ yếu tập trung tối ưu hóa và mở rộng suy luận.

Hệ thống AI dựa trên API là gì?

Hệ thống này sử dụng các mô hình đã huấn luyện sẵn thông qua các endpoint đám mây như OpenAI hoặc Anthropic để giảm chi phí hạ tầng nhưng vẫn cần quản lý prompt và chi phí.

Sự khác nhau giữa fine-tuning và prompting là gì?

Prompting thay đổi hành vi tại thời điểm suy luận. Còn fine-tuning cập nhật trọng số mô hình, chậm hơn nhưng thường dẫn đến các mô hình ngôn ngữ lớn được cá nhân hóa hơn. Điều này khiến prompting nhanh và rẻ hơn cho hầu hết các trường hợp sản xuất.

Retrieval-augmented generation (RAG) là gì?

RAG truy xuất các tài liệu liên quan từ một cơ sở tri thức do bạn chỉ định và thêm chúng vào prompt. Do đó, LLM sử dụng dữ liệu bổ sung đã được xác thực đó để dự đoán thông tin đáng tin cậy hơn và giảm ảo giác.

Câu hỏi phỏng vấn về các khái niệm cốt lõi của Kỹ sư AI

Vượt ra ngoài định nghĩa, nhà tuyển dụng muốn thấy bạn hiểu cơ chế phía sau embeddings, đánh giá, và thách thức dai dẳng của ảo giác.

Embeddings là gì và được dùng như thế nào?

Embeddings là các biểu diễn vector dày đặc nắm bắt nghĩa ngữ nghĩa. Chúng hỗ trợ tìm kiếm ngữ nghĩa và truy xuất trong các cơ sở dữ liệu vector. Bạn có thể hình dung embedding như một phép ánh xạ nhận đầu vào số và gán cho nó một vector nhiều chiều trong một không gian khác, giàu biểu diễn hơn.

Bạn đánh giá một hệ thống mô hình ngôn ngữ lớn như thế nào?

Kết hợp các chỉ số tự động, như tính trung thành và mức độ liên quan, với đánh giá của con người và KPI kinh doanh. Trong sản xuất, về cơ bản chúng ta cần một pipeline đánh giá liên tục.

Điều gì gây ra ảo giác trong LLM?

Các lỗ hổng trong dữ liệu huấn luyện và bản chất tự tin thái quá của dự đoán token kế tiếp có thể buộc mô hình dự đoán token mà không đủ cơ sở, được gọi là ảo giác.

Làm thế nào để giảm ảo giác?

RAG là một trong những phương pháp đáng tin cậy và hiệu quả nhất, vì nó cung cấp sự neo bám vào các nguồn tin cậy do bạn cung cấp. Kết hợp với các định dạng đầu ra có cấu trúc, kiểm tra tính tự nhất quán và kiểm chứng sự thật sẽ giảm ảo giác hơn nữa.

Câu hỏi phỏng vấn về LLM và Generative AI

Phần này đi sâu vào kiến trúc và hành vi của chính các mô hình, từ cơ chế attention đến thiết kế prompt.

Transformer hoạt động ở mức cao như thế nào?

Chúng xử lý song song bằng self-attention thay vì hồi quy tuần tự. Các mô hình ngôn ngữ lớn hiện đại thường chỉ dùng decoder và dự đoán token theo cách tự hồi quy.

Attention là gì?

Attention tính toán mức độ liên quan có trọng số giữa các token để cho phép phụ thuộc tầm xa bất kể vị trí của chúng. 

Cửa sổ ngữ cảnh (context window) là gì?

Số lượng token tối đa mà mô hình có thể xử lý trong một lần gọi suy luận. Nó giới hạn thiết kế prompt và quản lý lịch sử hội thoại.

Nhiệt độ (temperature) trong quá trình sinh là gì?

Nó kiểm soát tính ngẫu nhiên khi lấy mẫu: giá trị thấp tạo đầu ra quyết định hơn, trong khi giá trị cao tăng tính sáng tạo. Trong hệ thống sản xuất, thông số này được tinh chỉnh theo từng trường hợp sử dụng để cân bằng giữa độ tin cậy và đa dạng.

Prompt engineering là gì?

Quy trình thiết kế, kiểm thử, xác minh, tinh chỉnh và lặp lại prompt một cách hệ thống để đạt hành vi đáng tin cậy nhất. Trong sản xuất, prompt được quản lý phiên bản cùng với mã và phụ thuộc nhiều vào chính mô hình thay vì một mẫu chung chung.

Prompt hệ thống khác gì prompt của người dùng?

Prompt hệ thống xác định vai trò, ràng buộc và định dạng đầu ra của hội thoại, còn prompt của người dùng chứa yêu cầu cụ thể.

Sử dụng công cụ hoặc gọi hàm (function calling) là gì?

Nó cho phép mô hình ngôn ngữ lớn gọi các công cụ bên ngoài do bạn khởi tạo, như API và cơ sở dữ liệu, và định dạng lời gọi đúng cách. Đây là ý tưởng chính đằng sau các agent nhiều bước.

Chain-of-thought prompting cải thiện hiệu suất như thế nào?

Nó hướng dẫn mô hình tạo thêm các bước suy luận trung gian trước câu trả lời cuối cùng, nhờ đó cải thiện độ chính xác cho các tác vụ phức tạp.

Câu hỏi phỏng vấn Thiết kế Hệ thống cho Kỹ sư AI

Câu hỏi thiết kế hệ thống kiểm tra liệu bạn có thể chuyển kiến thức về LLM thành các kiến trúc end-to-end xử lý người dùng thật và các ràng buộc thực tế hay không.

Thiết kế một chatbot dùng LLM. 

Frontend, bộ nhớ hội thoại, điều phối prompt, gọi API LLM, xác thực đầu ra, ghi log, giới hạn tần suất và theo dõi chi phí.

Thiết kế hệ thống tìm kiếm tài liệu bằng embeddings.

 Nạp và chia nhỏ tài liệu → tạo embedding → lưu trong cơ sở dữ liệu vector kèm metadata → embedding truy vấn → tìm kiếm ngữ nghĩa (hoặc lai) → xếp hạng kết quả.

Thiết kế một pipeline RAG. 

Nạp và chia nhỏ → embedding và lưu trữ → truy xuất lúc truy vấn kèm reranking → bổ sung prompt → sinh từ LLM → hậu xử lý và trích dẫn nguồn.

Bạn sẽ xử lý suy luận lưu lượng cao như thế nào? 

Dùng hàng đợi, gộp lô, lượng tử hóa, mở rộng theo chiều ngang, bộ nhớ đệm prompt và cân bằng tải trong khi đáp ứng SLA về độ trễ.

Bạn sẽ giảm độ trễ trong hệ thống AI như thế nào? 

Áp dụng nén prompt, bộ nhớ đệm, mô hình nhỏ hơn hoặc chưng cất, giải mã suy đoán và tăng tốc phần cứng.

Bạn sẽ đánh giá và giám sát đầu ra như thế nào? 

Ghi log yêu cầu/đáp ứng, chạy điểm chất lượng tự động, lấy mẫu để con người đánh giá, theo dõi chỉ số kinh doanh và đặt cảnh báo suy giảm.

Câu hỏi về Triển khai và MLOps cho Kỹ sư AI

Khi hệ thống đã được thiết kế, nhà tuyển dụng muốn biết bạn có thể thực sự đưa nó vào vận hành, giám sát và giữ cho nó hoạt động ổn định hay không.

Bạn triển khai một ứng dụng dùng LLM như thế nào? 

Đóng gói bằng FastAPI, tích hợp qua SDK hoặc máy chủ tự lưu như vLLM, điều phối bằng Kubernetes hoặc serverless, và dùng CI/CD cho prompt và mã.

Bạn xử lý quản lý phiên bản mô hình như thế nào? 

Quản lý phiên bản prompt, mô hình embedding và adapter fine-tune bằng LangChain Hub, MLflow hoặc Hugging Face.

Bạn giám sát hiệu năng mô hình trong sản xuất như thế nào? 

Theo dõi độ trễ, thông lượng, chi phí, tỷ lệ lỗi và chất lượng đầu ra bằng Prometheus, Grafana và các công cụ đánh giá LLM.

Model drift trong hệ thống AI là gì?

Sự suy giảm gây ra bởi thay đổi trong phân phối đầu vào, hành vi người dùng hoặc nguồn dữ liệu. Nó thể hiện qua mức độ liên quan giảm dần hoặc ảo giác gia tăng.

Bạn mở rộng suy luận như thế nào? 

Áp dụng gộp lô liên tục, lượng tử hóa như 4/8-bit, song song hóa mô hình và các engine như vLLM hoặc TGI.

Công cụ nào được dùng để triển khai AI? 

Docker/Kubernetes, vLLM hoặc Text Generation Inference, cơ sở dữ liệu vector như Pinecone hoặc Weaviate, LangSmith và các nền tảng đám mây như AWS Bedrock, Azure OpenAI hoặc GCP Vertex AI.

Câu hỏi phỏng vấn theo kịch bản cho Kỹ sư AI

Những câu hỏi này mô phỏng sự cố sản xuất thực tế để xem bạn lý luận qua quá trình gỡ lỗi và giảm thiểu dưới áp lực như thế nào.

Chatbot LLM của bạn đưa ra câu trả lời sai. Bạn làm gì?

Tôi sẽ kiểm tra prompt và lịch sử để củng cố nền tảng RAG, bổ sung xác thực đầu ra và triển khai vòng phản hồi từ người dùng.

Độ trễ đột ngột tăng. Bạn sẽ gỡ lỗi thế nào?

Tôi sẽ phân tích khối lượng token, giới hạn tần suất, mạng, hàng đợi và tình trạng endpoint bằng các bản vết end-to-end.

Chi phí tăng vọt trong sản xuất. Cách tiếp cận của bạn?

Phân tích mức sử dụng token, bổ sung bộ nhớ đệm, rút ngắn prompt, định tuyến sang mô hình rẻ hơn và đặt các cảnh báo ngân sách tự động.

Người dùng báo cáo ảo giác. Bạn giảm thiểu thế nào?

Thêm trích dẫn nguồn, bắt buộc đầu ra có cấu trúc kèm xác thực và đưa vào các bước tự phê bình.

Hệ thống RAG của bạn trả về kết quả không liên quan. Vấn đề là gì?

Kiểm tra cách chia nhỏ, chất lượng embedding, bộ lọc metadata, ngưỡng tương đồng và xếp hạng lại khi truy xuất.

Khác biệt phỏng vấn Kỹ sư AI so với Kỹ sư Học máy

Kỹ sư AI tập trung vào LLM, prompt engineering, RAG, điều phối API và các ứng dụng hướng người dùng, trong khi kỹ sư học máy tập trung vào huấn luyện mô hình, pipeline dữ liệu và tối ưu hóa. 

Bạn có thể hình dung kỹ sư AI như những kỹ sư phần mềm chuyên xây dựng các ứng dụng hoạt động dựa trên AI, còn kỹ sư học máy tập trung nhiều hơn vào nghiên cứu và phát triển các mô hình nền tảng.

Phỏng vấn thường kiểm tra ứng viên AI về tích hợp hệ thống và độ tin cậy trong sản xuất.

Lỗi thường gặp trong phỏng vấn Kỹ sư AI

Ngay cả ứng viên mạnh cũng có thể vấp phải một vài cái bẫy lặp lại, cho thấy thiếu kinh nghiệm sản xuất.

  • Quá tập trung vào lý thuyết thay vì các quy trình làm việc thực tế trong sản xuất.
  • Xem LLM như hộp đen mà không đề cập đến prompt hoặc các chế độ lỗi.
  • Bỏ qua các đánh đổi trong thiết kế hệ thống như độ trễ so với độ chính xác so với chi phí.
  • Bỏ sót thực hành giám sát và lặp cải tiến.
  • Thiếu ví dụ cụ thể từ các dự án đã triển khai.

Cách chuẩn bị cho phỏng vấn Kỹ sư AI

Một kế hoạch ôn luyện trọng tâm nên xây dựng kỹ năng thực hành song song với kiến thức khái niệm đã nêu ở trên.

  • Xây dựng và triển khai hai dự án LLM end-to-end, như chatbot RAG và ứng dụng khai thác tài liệu.
  • Luyện tập trình bày thiết kế hệ thống đầy đủ từ đầu vào đến đầu ra có giám sát.
  • Tích lũy kinh nghiệm thực tiễn với Docker, Kubernetes, vLLM, LangChain/LlamaIndex và cơ sở dữ liệu vector.
  • Thành thạo tích hợp API, phân tích có cấu trúc và tracing.
  • Duy trì các dự án đang hoạt động và cố gắng theo dõi các cập nhật kỹ thuật AI tập trung vào sản xuất.

Kết luận

Kỹ thuật AI là xây dựng các hệ thống đáng tin cậy. Những buổi phỏng vấn phổ biến nhất kiểm tra khả năng giải quyết vấn đề thực tế, trải dài từ kiến trúc đến triển khai đến tư duy hệ thống. 

Kinh nghiệm thực hành trong môi trường sản xuất là yếu tố tạo khác biệt mạnh mẽ nhất trong trường hợp này. Hãy tập trung vào việc tạo ra giá trị đo lường được, và bạn sẽ nổi bật như một ứng viên mạnh.


Iheb Gafsi's photo
Author
Iheb Gafsi
LinkedIn

Tôi làm việc trên các hệ thống AI tăng tốc, cho phép trí tuệ ở biên với các pipeline ML liên kết (federated) trên dữ liệu phi tập trung và khối lượng công việc phân tán.  Công việc của tôi tập trung vào Mô hình Lớn, Xử lý Giọng nói, Thị giác Máy tính, Học tăng cường và các cấu trúc tô-pô ML tiên tiến.

Câu hỏi thường gặp

Các buổi phỏng vấn kỹ sư AI mang tính kỹ thuật đến mức nào?

Họ kiểm tra kỹ năng thực tiễn về LLM, thiết kế hệ thống, RAG và triển khai nhiều hơn là lý thuyết sâu hoặc thuật toán LeetCode.

Tôi có cần kinh nghiệm với các công cụ cụ thể không?

Có. Hãy tập trung vào LangChain/LlamaIndex, cơ sở dữ liệu vector, vLLM, Docker và các API LLM trên đám mây.

Prompt engineering quan trọng đến mức nào?

Rất quan trọng. Nhà tuyển dụng kỳ vọng thảo luận về prompt hệ thống, gọi công cụ và lặp lại prompt trong các ứng dụng thực tế.

Tôi nên xây dựng những dự án nào để chuẩn bị?

Chatbot RAG end-to-end và hệ thống tìm kiếm tài liệu sử dụng API công khai và kho vector.

Phỏng vấn có khác nhau giữa người mới và cấp cao không?

Có. Người mới đối mặt với nền tảng cơ bản; cấp cao xử lý mở rộng hệ thống, đánh đổi MLOps và giám sát sản xuất.

Chủ đề
Trí tuệ Nhân tạo
Kỹ thuật Dữ liệu

Học cùng DataCamp

Tracks

Kỹ sư Trợ lý Trí tuệ Nhân tạo (AI) cho Lập trình viên

26 giờ
Học cách tích hợp trí tuệ nhân tạo (AI) vào các ứng dụng phần mềm thông qua việc sử dụng các giao diện lập trình ứng dụng (API) và các thư viện mã nguồn mở. Hãy bắt đầu hành trình trở thành Kỹ sư Trí tuệ Nhân tạo ngay hôm nay!
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow