Tracks
หากค้นหาคอร์สวิศวกรรมข้อมูลบนคลาวด์ คุณอาจรู้สึกท่วมท้นกับจำนวนแหล่งเรียนรู้และไม่แน่ใจว่าจะเรียนจากผู้ให้บริการรายใหญ่ 3 รายเจ้าไหน หรือกี่เจ้าดี คำตอบที่ชุมชนมักจะลงความเห็นตรงกันคือ เริ่มจากเจ้าใดเจ้าหนึ่งก่อน และค่อยหยิบคลาวด์เจ้าที่สองเมื่อเจ้าแรกเริ่มรู้สึกน่าเบื่อ หากกำลังถามตัวเองว่าจะเลือกอันไหน ต่อไปนี้คือกรอบการตัดสินใจ:
- เริ่มเรียน AWS หากอยากได้ จำนวนตำแหน่งงานที่เปิดรับมากที่สุด
- เริ่มเรียน GCP หากงานที่ต้องการ เน้น BigQuery และ Dataflow
- เริ่มเรียน Azure หากนายจ้างของคุณ ใช้งาน SQL Server และ Power BI อยู่แล้ว
ลิสต์นี้เหมาะกับผู้ที่กำลังย้ายเข้าสู่งานวิศวกรข้อมูลบนคลาวด์: นักวิเคราะห์ที่อยากเป็นเจ้าของ pipeline วิศวกรซอฟต์แวร์ที่กำลังขยับสู่แพลตฟอร์มข้อมูล และวิศวกรข้อมูลที่ทำ Spark แบบ on-premise และต้องเริ่มใช้ Glue, Synapse หรือ Dataflow ฉันเลือกทรัพยากรเหล่านี้โดยดูจากว่าสิชามีเดียนตรงกับกรอบการรับรองจริง (CLF-C02, AZ-900, DP-203, Google Professional Data Engineer) ครอบคลุมบริการด้านข้อมูล ไม่ใช่แค่การดูแลระบบคลาวด์ทั่วไป และได้รับคำแนะนำจากผู้ปฏิบัติงานจริง
สมมติว่ามีพื้นฐาน Python และ SQL ถ้ายังไม่มี ช่องว่างตรงนี้สำคัญกว่าการเลือกคลาวด์เสียอีก ก่อนเลือกคลาวด์ ควรอุดช่องว่างนั้นด้วยคอร์สอาชีพ Associate Data Engineer in SQL ของ DataCamp ที่สร้างรากฐาน SQL และ ETL/ELT ซึ่งทุกบริการ Spark แบบจัดการล้วนคาดหวังว่าคุณมี
สรุปย่อ
| ทรัพยากร | ประเภท | ระดับ | เหมาะสำหรับ |
|---|---|---|---|
| DataCamp: Understanding Cloud Computing | คอร์ส | ผู้เริ่มต้น | เรียนรู้คำศัพท์คลาวด์ก่อนลงมือใช้คอนโซล |
| DataCamp: AWS Cloud Practitioner (CLF-C02) | เส้นทางทักษะ | ผู้เริ่มต้น | วางพื้นฐานบริการและการคิดค่าบริการของ AWS |
| DataCamp: Microsoft Azure Fundamentals (AZ-900) | เส้นทางทักษะ | ผู้เริ่มต้น | ผู้เรียนที่เริ่มจาก Azure และนายจ้างที่ใช้เทคโนโลยีไมโครซอฟท์ |
| John Savill's Technical Training (YouTube) | วิดีโอฟรี | ผู้เริ่มต้น | รากฐานโครงสร้างพื้นฐาน Azure แบบไม่เสียค่าใช้จ่าย |
| DataCamp: Introduction to GCP | คอร์ส | ผู้เริ่มต้น | เริ่มต้นใช้ BigQuery และ Cloud Storage ได้อย่างรวดเร็ว |
| DataCamp: Google Cloud Data Engineer | เส้นทางทักษะ | ระดับกลาง | เส้นทางตรงที่สุดสู่การทำ data pipeline บน GCP |
| Adrian Cantrill's AWS Solutions Architect Associate (SAA-C03) | คอร์สเสียเงิน | ระดับกลาง | ลงลึก IAM, VPC และที่เก็บข้อมูลที่รองรับงานด้านข้อมูลของคุณ |
| Google Cloud Skills Boost data engineer path | การฝึกของผู้ให้บริการ + แล็บ | ระดับกลาง | แล็บลงมือทำกับ BigQuery, Dataflow และ Pub/Sub |
| Grow Data Skills data engineering tracks | คอร์สเรียนตามอัธยาศัย + โปรเจกต์ | ระดับกลาง | สร้างผลงาน portfolio ของ pipeline แบบ end-to-end |
| Smart Data Learning: Data Engineering With Azure, AWS & GCP | กลุ่มเรียนสด 14 สัปดาห์ | ระดับกลาง | ผู้เรียนที่ต้องการเดดไลน์และการสอนสด |
| AWS Skill Builder Data Engineer learning path | การฝึกของผู้ให้บริการ | ขั้นสูง | Glue, Redshift, EMR และ Kinesis ในระดับความลึกเทียบข้อสอบ |
| Microsoft Learn Azure data engineering (DP-203) path | การฝึกของผู้ให้บริการ | ขั้นสูง | Synapse, Data Factory และ Stream Analytics แบบฟรี |
| r/dataengineering cloud-choice threads | การพูดคุยของชุมชน | ทุกระดับ | ตัดสินใจว่าจะมุ่งกับคลาวด์เจ้าไหนก่อน |
1. DataCamp: Understanding Cloud Computing Course
คอร์ส Understanding Cloud Computing เหมาะอย่างยิ่งสำหรับผู้ที่ไม่เคยมีบัญชี AWS, Azure หรือ GCP และต้องการคำศัพท์ร่วมก่อนจะเริ่มคลิกไปมาบนคอนโซล คอร์สนี้เน้นแนวคิดมากกว่าการลงมือปฏิบัติ ซึ่งตรงกับสิ่งที่ควรทำในชั่วโมงแรก
ครอบคลุมโมเดลการให้บริการ (IaaS, PaaS, SaaS) โมเดลการปรับใช้ (public, private, hybrid) ความแตกต่างของผู้ให้บริการรายใหญ่ และการแบ่งความรับผิดชอบด้านความปลอดภัยและธรรมาภิบาลระหว่างคุณกับผู้ให้บริการ เพราะเป็นคอร์สที่ไม่ยึดติดกับค่าย คุณจะสามารถอ่านทั้งบทความสอน AWS Glue และ Azure Data Factory แล้วมองเห็นว่ากำลังแก้ปัญหาเดียวกัน เพียงแค่ใช้คำเรียกต่างกัน
คอร์สเรียนผ่านเบราว์เซอร์ จึงไม่ต้องติดตั้งอะไรในเครื่องและไม่มีบิลคลาวด์ระหว่างเรียน แผนรายบุคคลมีค่าใช้จ่ายประมาณ $25 ถึง $33 ต่อเดือน คิดเป็นรายปี สำหรับการเข้าถึงคอร์ส DataCamp ทั้งหมดในลิสต์นี้ไม่จำกัด
- ระดับ: ผู้เริ่มต้น ไม่ต้องมีบัญชีคลาวด์
- รูปแบบ: คอร์สเชิงโต้ตอบ ไม่ต้องมีพื้นฐานการเขียนโค้ด
- เหมาะสำหรับ: นักวิเคราะห์และผู้เปลี่ยนสายอาชีพที่ต้องการแนวคิดคลาวด์ก่อนใช้คอนโซล
2. DataCamp: AWS Cloud Practitioner (CLF-C02) Skill Track
หากฉันทามติของ r/dataengineering ชี้ให้คุณไปที่คลาวด์ของ Amazon เส้นทางทักษะ AWS Cloud Practitioner (CLF-C02) เป็นวิธีที่ประหยัดที่สุดในการทำความเข้าใจภาพรวมบริการอย่างมีโครงสร้างในครั้งเดียว โดยยึดตามกรอบข้อสอบ CLF-C02 ไม่ใช่การพาเที่ยวคอนโซลแบบสุ่ม
คุณจะได้เรียนแนวคิดคลาวด์ บริการหลักของ AWS (รวมถึง S3, EC2 และ IAM) ความปลอดภัยและโมเดลความรับผิดชอบร่วม ตลอดจนด้านการคิดค่าบริการและราคา ซึ่งผู้เริ่มต้นส่วนใหญ่มักมองข้ามจนเผลอปล่อยคลัสเตอร์ EMR ค้างไว้ข้ามสัปดาห์ สำหรับวิศวกรข้อมูล บทเรียนเรื่องค่าใช้จ่ายมีคุณค่าในตัวเอง: การควบคุมต้นทุนเป็นส่วนหนึ่งของงาน ไม่ใช่เรื่องท้ายๆ
CLF-C02 เป็นการรับรองระดับพื้นฐาน จึงไม่ได้สอนวิธีเขียนงาน Glue หรือออกแบบ schema ของ Redshift ให้ ถือว่าเป็นแผนที่ แล้วค่อยไปที่เส้นทาง AWS Skill Builder Data Engineer ในหัวข้อที่ 6 สำหรับงาน pipeline จริง
- ระดับ: ผู้เริ่มต้น สอดคล้องกรอบข้อสอบ CLF-C02
- รูปแบบ: เส้นทางทักษะ มีหลายคอร์สเชิงโต้ตอบ
- เหมาะสำหรับ: ผู้เรียนที่เลือก AWS ก่อนเพราะตลาดงานกว้าง
3. DataCamp: Microsoft Azure Fundamentals (AZ-900) Skill Track
เริ่มที่นี่แทนเส้นทาง AWS หากนายจ้างของคุณใช้งาน SQL Server, Power BI และ Active Directory อยู่แล้ว ซึ่งพบได้บ่อยในทีมข้อมูลขององค์กร AZ-900 คือจุดเริ่มต้นที่ไมโครซอฟท์ออกแบบมาสำหรับสถานการณ์นี้โดยเฉพาะ
เส้นทาง Microsoft Azure Fundamentals (AZ-900) พาไล่ตั้งแต่แนวคิดหลักของ Azure ตระกูลบริการสำคัญ การจัดการและธรรมาภิบาล ไปจนถึงการตั้งราคาและการสนับสนุน คุณจะได้รู้จัก Azure Blob Storage และ Data Lake Storage ในฐานะชื่อบริการ ซึ่งเพียงพอที่จะทำให้เนื้อหา DP-203 อ่านรู้เรื่องแทนที่จะงงงวย
หมายเหตุด้านต้นทุน: ค่าเรียนอย่างหนึ่ง ค่าสอบอย่างหนึ่ง ค่าสอบ AZ-900 อยู่ที่ประมาณ $99 ถึง $120 ขึ้นกับภูมิภาค และไม่จำเป็นต้องเข้าสอบเพื่อให้ได้คุณค่าจากเส้นทางนี้ แนะนำให้จ่ายค่าสอบเฉพาะเมื่อประกาศรับสมัครงานหรือกระบวนการเลื่อนตำแหน่งในองค์กรระบุชัดเจนว่าต้องการ
- ระดับ: ผู้เริ่มต้น เงื่อนไขเบื้องต้นน้อย
- รูปแบบ: เส้นทางทักษะผูกกับโดเมนของ AZ-900
- เหมาะสำหรับ: ผู้เชี่ยวชาญด้านข้อมูลในองค์กรที่ใช้ไมโครซอฟท์หนัก
4. John Savill's Technical Training (YouTube)
เพลย์ลิสต์ YouTube ฟรีของ Savill คือเหตุผลที่คุณอาจไม่จำเป็นต้องเสียเงินกับการเรียนรากฐาน Azure ซีรีส์เตรียมสอบ AZ-900 และ AZ-104 ของเขาได้รับการอ้างถึงกันอย่างกว้างขวางว่าเป็นจุดเริ่มต้นที่ทั้งฟรีและคุณภาพดี
เนื้อหา AZ-104 จะโฟกัสด้านผู้ดูแลระบบ และนั่นแหละคือประเด็นสำหรับวิศวกรข้อมูล: ตัวตนเครือข่าย บัญชีที่เก็บข้อมูล และธรรมาภิบาล คือสิ่งที่คุณจะต้องถกเถียงเมื่อ Data Factory pipeline ของคุณเข้าถึง private endpoint ไม่ได้ เขายังมีคลาสสดและอธิบายด้วยไวท์บอร์ดที่มักดีกว่าวิดีโอเสียเงินหลายเจ้า
สิ่งที่จะไม่ได้จากที่นี่คือการเรียนเชิงโต้ตอบหรือการออกแบบ pipeline ไม่มีการทำแบบจำลองเชิงมิติใน Synapse ไม่มีแพตเทิร์น incremental load และไม่มี dbt ใช้เพลย์ลิสต์เพื่อเสริมชั้นโครงสร้างพื้นฐาน แล้วค่อยทุ่มเวลาไปที่เส้นทาง DP-203
- ระดับ: ผู้เริ่มต้นถึงระดับกลาง
- รูปแบบ: เพลย์ลิสต์ YouTube ฟรีและคลาสสดเตรียมสอบ
- เหมาะสำหรับ: ผู้เรียน Azure ที่งบศูนย์และต้องการรากฐานโครงสร้างพื้นฐาน
5. DataCamp: Introduction to GCP Course
เลือกคอร์ส Introduction to GCP ของ DataCamp หากงานเป้าหมายของคุณเน้นการวิเคราะห์ เพราะ GCP ได้รับคำชมอย่างสม่ำเสมอในเธรด r/dataengineering เรื่องเครื่องมือด้านข้อมูล และเรื่องที่ BigQuery ต้องพิธีรีตองน้อยกว่าเมื่อเทียบกับการตั้งค่า Redshift cluster
คอร์สจะแนะนำภูมิทัศน์บริการของ GCP ตัวเลือกด้านที่เก็บข้อมูลและคอมพิวต์ และบทบาทของ BigQuery ในสแตกด้านวิเคราะห์ เหตุผลที่จัดให้อยู่เหนือวัสดุจากผู้ให้บริการคือเรื่องลำดับ: แล็บบน Google Cloud Skills Boost สมมติว่าคุณรู้จัก project service account และ region อยู่แล้ว และคอร์สนี้ให้สิ่งนั้นได้ในไม่กี่รอบนั่งเรียน
ข้อจำกัดอย่างตรงไปตรงมาคือความลึก คุณจะยังไม่สามารถออกแบบ pipeline สตรีมมิงด้วย Pub/Sub และ Dataflow ได้หลังจบคอร์สเบื้องต้น และไม่ควรคาดหวังเช่นนั้น นั่นคือหน้าที่ของรายการถัดไป
- ระดับ: ผู้เริ่มต้น
- รูปแบบ: คอร์สเชิงโต้ตอบ ผ่านเบราว์เซอร์
- เหมาะสำหรับ: นักวิเคราะห์และวิศวกรที่มุ่งสู่งานข้อมูลที่ศูนย์กลางคือ BigQuery
6. DataCamp: Google Cloud Data Engineer Skill Track
เส้นทางทักษะ Google Cloud Data Engineer บน DataCamp เป็นเส้นทางตรงที่สุดในลิสต์ จาก \"รู้ SQL บ้าง\" ไปสู่ \"สร้าง pipeline บน GCP ได้\" และเป็นเส้นทางที่อยากชี้ให้ผู้เปลี่ยนอาชีพส่วนใหญ่ไปต่อ เนื้อหาโฟกัสที่บริการด้านข้อมูล ไม่เตลิดไปที่การดูแลคลาวด์ทั่วไป
โฟกัสคือมุมของวิศวกรข้อมูลบน GCP: ที่เก็บข้อมูล BigQuery และการขนย้ายข้อมูลผ่าน pipeline ในขอบเขตเดียวกับการรับรอง Google Professional Data Engineer ที่ครอบคลุม BigQuery, Dataflow, Pub/Sub, Cloud Composer และ Dataproc การเรียนผ่านเบราว์เซอร์ช่วยให้ไม่ต้องวุ่นกับการแจ้งเตือนบิลลิงและข้อผิดพลาด IAM ระหว่างที่กำลังเรียนรู้ windowed aggregations ครั้งแรก
สิ่งหนึ่งที่ควรรู้: สมมติว่ามี Python และ SQL หากยังไม่มั่นใจในอย่างใดอย่างหนึ่ง คุณจะเสียเวลาไปกับการแก้ไวยากรณ์แทนการเรียนออกแบบ pipeline DataCamp ยังมีเส้นทางอาชีพ Associate Data Engineer in SQL เพื่ออุดช่องว่างก่อนลงลึกใน GCP
- ระดับ: ระดับกลาง สมมติว่ามี Python และ SQL
- รูปแบบ: เส้นทางทักษะ มีหลายคอร์สและโปรเจกต์เชิงโต้ตอบ
- เหมาะสำหรับ: ผู้มุ่งสู่วิศวกรข้อมูลที่เลือก GCP แล้วและต้องการลงมือทำ ไม่ใช่แค่สไลด์
7. Adrian Cantrill's AWS Certified Solutions Architect Associate (SAA-C03)
คอร์ส SAA-C03 ของ Cantrill ถูกยกให้เป็นตัวเลือกยอดนิยมของชุมชนสำหรับรากฐาน AWS และสมศักดิ์ศรีเพราะลงลึกที่ระบบท่อประปามากกว่ากว้างไปตามบริการที่ดูฉูดฉาด
สำหรับวิศวกรข้อมูลบนคลาวด์ คุณค่าจะกระจุกในส่วนที่คอร์สข้อมูลอื่นมักไล่ผ่านๆ: บทบาทและนโยบาย IAM เครือข่าย VPC และ endpoints คลาสที่เก็บข้อมูลและกฎวงจรชีวิต และการเข้ารหัสด้วย KMS
เป็นคอร์สเสียเงินที่ขายบนเว็บไซต์ของ Cantrill เอง ราคาอยู่ที่นั่นและอาจเปลี่ยนตามโปรโมชัน และเป็นพันธะสัญญาที่ยาวเป็นสัปดาห์ ไม่ใช่ไม่กี่ค่ำคืน อีกทั้งไม่ใช่คอร์สวิศวกรรมข้อมูล จึงควรมองเป็นชั้นรองรับใต้หัวข้อที่ 11 มากกว่าจะมาแทนที่
- ระดับ: ระดับกลาง สมมติว่ามีพื้นฐานไอที
- รูปแบบ: คอร์สวิดีโอเสียเงินพร้อมแล็บและไดอะแกรมสถาปัตยกรรม
- เหมาะสำหรับ: วิศวกรที่อยากเข้าใจว่าทำไม AWS pipeline ถึงพัง ไม่ใช่แค่รู้วิธีสร้าง
8. Google Cloud Skills Boost: Data Engineer Learning Path
แพลตฟอร์มการฝึกของ Google เองคือที่ที่ดีที่สุดสำหรับการฝึก GCP แบบลงมือทำโดยไม่ต้องจัดเตรียมอะไรเอง เพราะแล็บใน Data Engineer Learning Path จะให้โปรเจกต์ชั่วคราวที่เปิดใช้ API ไว้แล้ว หลายคอร์สและแล็บเป็นแบบฟรี
เส้นทางวิศวกรข้อมูลครอบคลุม BigQuery สำหรับ data warehouse และ SQL analytics, Dataflow สำหรับการแปลงแบบ batch และสตรีมมิง, Pub/Sub สำหรับการรับเหตุการณ์เข้า, Cloud Composer สำหรับการ orchestration ด้วย Airflow และ Dataproc สำหรับ Spark แบบจัดการ รายการบริการนี้แทบจะตรงกับกรอบข้อสอบ Google Professional Data Engineer จึงใช้เตรียมสอบไปในตัว
ค่าใช้จ่ายแตกต่างกันตามเส้นทาง แล็บและภารกิจแบบฟรีครอบคลุมพื้นที่มาก ขณะที่เวอร์ชันที่โฮสต์โดยพาร์ตเนอร์มักอยู่ที่ค่าสมาชิก $39 ถึง $79 ต่อเดือน ดังนั้นตรวจสอบก่อนว่าเส้นทางฟรีให้สิ่งที่ต้องการแล้วหรือยัง ก่อนจะจ่ายซ้ำสำหรับหลักสูตรเดียวกัน
- ระดับ: ระดับกลาง
- รูปแบบ: คอร์สจากผู้ให้บริการพร้อมแล็บแบบจับเวลา มีทั้งชั้นฟรีและเสียเงิน
- เหมาะสำหรับ: ผู้เรียน GCP ที่อยากฝึกใช้คอนโซลโดยไม่ต้องใช้บัญชีบิลลิงส่วนตัว
9. Grow Data Skills: เส้นทาง Data Engineering สำหรับ AWS, Azure และ GCP
Grow Data Skills มีเส้นทางเรียนแยกตามคลาวด์ และจุดขายคือผลงานพอร์ตโฟลิโอ ไม่ใช่จำนวนชั่วโมงบรรยาย สำหรับผู้ที่ไม่มีประสบการณ์ทำงานบนคลาวด์ โปรเจกต์สำคัญกว่ากระดาษรับรอง
แต่ละเส้นทางเริ่มจากพื้นฐานอย่างการออกแบบข้อมูล การทำ data warehouse และความแตกต่างระหว่าง batch กับ stream ก่อนจะไปสู่โมดูลเฉพาะคลาวด์ในด้านการรับเข้า จัดเก็บ แปลง และ orchestration งานโปรเจกต์คือจุดต่าง: pipeline แบบ end-to-end และสถาปัตยกรรม lakehouse ที่ใส่ในรีโปได้และอธิบายในสัมภาษณ์ได้
เป็นเส้นทางเสียเงิน ราคาจะแสดงตอนชำระเงินและต่างกันตามภูมิภาคและโปรโมชัน และสมมติว่ามีพื้นฐาน Python และ SQL รวมถึงคุ้นเคยกับคลาวด์บ้าง หากยังไม่จบเส้นทางผู้เริ่มต้น ควรทำให้จบก่อน ไม่เช่นนั้นจะกลายเป็นลอกคำสั่งที่ไม่เข้าใจในโปรเจกต์
- ระดับ: ระดับกลาง
- รูปแบบ: วิดีโอตามอัธยาศัยพร้อมโปรเจกต์แนะนำ แบบเสียเงิน
- เหมาะสำหรับ: ผู้เปลี่ยนสายที่ต้องการ pipeline 3–4 ชิ้นในพอร์ต ไม่ใช่กระดาษรับรองใบใหม่
10. Smart Data Learning: Data Engineering With Azure, AWS & GCP
นี่คือ โปรแกรมสดแบบเสมือนจริง 14 สัปดาห์ ที่ครอบคลุมทั้งสามคลาวด์ในหลักสูตรเดียว เหมาะสำหรับผู้ที่ลองเรียนวิดีโอตามอัธยาศัยมาแล้วสองครั้งแล้วยังไปไม่รอด เดดไลน์และการเรียนเป็นกลุ่มเหมาะกับบางคน และการแกล้งทำเป็นว่าไม่ใช่ก็เป็นคำแนะนำที่ไม่ดี
โครงสร้างเริ่มจากแนวคิดแกนกลางของวิศวกรรมข้อมูล แล้วจึงลงมือทำบนแต่ละคลาวด์: S3, Glue, Redshift และ EMR บน AWS; Data Lake, Data Factory และ Synapse บน Azure; BigQuery, Dataflow และ Pub/Sub บน GCP การบ้านและแล็บรันไปพร้อมกับคลาสสด จึงมีงานที่ได้รับการตรวจ ไม่ใช่แค่นั่งดูเฉยๆ
ต้องมีประสบการณ์ Python และ SQL มาก่อน และเอาตรงๆ ว่าจำเป็น ค่าธรรมเนียมเป็นราคาคงที่ของโปรแกรมที่ระบุบนหน้าเว็บคอร์สและต่างกันตามภูมิภาค ซึ่งโปร่งใสน้อยกว่าที่อยากให้เป็น ควรถามตัวเลขเป็นลายลักษณ์อักษรก่อนจะผูกมัดตัวเอง 14 สัปดาห์
- ระดับ: ระดับกลาง แนะนำให้มีประสบการณ์เขียนโปรแกรม Python และ SQL มาก่อน
- รูปแบบ: กลุ่มเรียนสดแบบเสมือน 14 สัปดาห์ มีการบ้านและแล็บ
- เหมาะสำหรับ: ผู้เรียนที่ต้องการตารางเรียนตายตัวและอยากครอบคลุมทั้งสามคลาวด์ในครั้งเดียว
11. AWS Skill Builder: เส้นทางเรียน AWS Certified Data Engineer – Associate
เส้นทางเรียนนี้บน AWS Skill Builder คือปลายทางถัดไปของผู้เรียน AWS หลัง CLF-C02 เพราะเป็นทรัพยากร AWS เพียงรายการเดียวในลิสต์นี้ที่สร้างมาเพื่อบริการด้านวิศวกรรมข้อมูลโดยเฉพาะ ไม่ใช่สถาปัตยกรรมทั่วไป เป็นแพลตฟอร์มฝึกของ Amazon เอง เนื้อหาจึงอิงตามคู่มือข้อสอบปัจจุบัน
โฟกัสอยู่ที่บริการที่คุณจะได้รับค่าจ้างให้ดูแล: AWS Glue สำหรับ ETL, Lake Formation สำหรับ data lake ภายใต้การกำกับดูแล, Amazon Redshift สำหรับ data warehouse, EMR สำหรับงาน Spark และ Hadoop และ Kinesis สำหรับการรับข้อมูลแบบสตรีมมิง ราคาเป็นแบบผสม โดยมีหลักสูตรดิจิทัลฟรีจำนวนหนึ่ง และสมาชิก Skill Builder Individual ราว $29 ต่อเดือน หรือ $299 ต่อปี สำหรับแล็บและสื่อเตรียมสอบ
ความยากจะกระโดดจาก CLF-C02 อย่างชัดเจน เนื้อหานี้เล็งระดับความลึกเทียบข้อสอบ และสมมติว่าคุณนำทางในคอนโซล อ่านนโยบาย IAM และให้เหตุผลเรื่องการวาง VPC ได้แล้ว จึงไม่ควรเริ่มที่นี่เป็นการสัมผัส AWS ครั้งแรก
- ระดับ: ขั้นสูง แนะนำหลัง CLF-C02 และมีประสบการณ์ลงมือทำมาบ้าง
- รูปแบบ: เส้นทางเรียนของผู้ให้บริการ มีคอร์สฟรีและชั้นสมาชิกแบบเสียเงิน
- เหมาะสำหรับ: วิศวกรที่เล็งสอบ AWS Certified Data Engineer – Associate
12. Microsoft Learn: เส้นทาง Azure Data Engineering (DP-203)
หลักสูตร Azure ด้านวิศวกรรมข้อมูลระดับสูงแบบฟรีที่ดีที่สุดมาจาก Microsoft เอง และ เส้นทาง DP-203 คือสิ่งที่ควรเรียนเมื่อแนวคิด AZ-900 ลงตัวแล้ว โมดูลบน Learn ทั้งหมดอ่านและทำได้ฟรี
ครอบคลุมสแตกข้อมูลของ Azure อย่างแท้จริง: Azure Data Lake Storage, Synapse Analytics สำหรับ data warehouse และ Spark pools, Data Factory สำหรับ orchestration และกิจกรรมคัดลอกข้อมูล, Stream Analytics สำหรับคิวรีแบบสตรีม และ Azure Databricks สำหรับงานแปลงข้อมูลบนสมุดบันทึก ถ้าทีมของคุณมาตรฐานอยู่กับงาน Synapse ในยุค Fabric นี่คือเนื้อหาที่ใกล้งานจริงที่สุด
มีสองปัญหาที่ต้องบอกตามตรง Microsoft Learn มีการอ่านเยอะและอาจให้ความรู้สึกเหมือนเอกสารประกอบพร้อมแถบความคืบหน้า จึงควรจับคู่กับบัญชีสมัครสมาชิกของคุณเองแล้วลงมือสร้างสิ่งต่างๆ อย่าแค่คลิก ถัดไป และค่าสอบ DP-203 ประมาณ $165 ซึ่งเป็นรายการที่แพงที่สุดในลิสต์นี้เมื่อเทียบกับชั่วโมงการเรียน
- ระดับ: ขั้นสูง แนะนำหลัง AZ-900 และมีประสบการณ์ลงมือทำ
- รูปแบบ: โมดูลเรียนตามอัธยาศัยฟรี ค่าสอบเสียเงิน
- เหมาะสำหรับ: วิศวกรข้อมูล Azure ที่ต้องการความถูกต้องตามผู้ให้บริการโดยไม่เสียค่าเรียนคอร์ส
13. r/dataengineering cloud-choice threads
ทรัพยากรฟรีที่มีประโยชน์ที่สุดในลิสต์นี้ไม่ใช่คอร์สเลยด้วยซ้ำ: ซับเรดดิต r/dataengineering กระทู้เช่น \"ควรเรียนคลาวด์เจ้าไหนสำหรับผู้เริ่มต้นสาย Data Engineering?\" และ \"Data engineering บน GCP, Azure หรือ AWS เจ้าไหนเหมาะแก่การอัปสกิลและย้ายงาน\" คือจุดที่การตัดสินใจจริงเกิดขึ้น และผู้ตอบคือคนที่นั่งอยู่ในคณะสัมภาษณ์
มุมมองที่ย้อนมาบ่อยพอสรุปได้ว่า: AWS ถูกมองว่าเป็นการลงทุนอาชีพที่ปลอดภัยที่สุดเพราะส่วนแบ่งตลาด GCP ถูกแนะนำสำหรับงานที่เน้นข้อมูลและ ML จากจุดแข็งของ BigQuery และ Dataflow และ Azure ชนะเมื่อองค์กรใช้ไมโครซอฟท์หนักหรือสอดคล้องกับตลาดท้องถิ่น คำแนะนำที่พูดซ้ำบ่อยอีกข้อคือเลือกคลาวด์เจ้าเดียวให้เก่งก่อน แล้วค่อยเพิ่มเจ้าอื่น
อ่านเธรดเพื่อเก็บรายละเอียดระดับภูมิภาคที่ไม่มีอยู่ในหลักสูตร ไม่ว่าประกาศรับสมัครงานในเมืองของคุณจะพูดถึง Synapse หรือ Snowflake เป็นคำถามที่มีแค่ผู้ปฏิบัติงานท้องถิ่นตอบได้ และควรมีน้ำหนักกว่าคำแนะนำอื่นทั้งหมดที่นี่
- ระดับ: ทุกระดับ
- รูปแบบ: การสนทนาของชุมชนแบบฟรี
- เหมาะสำหรับ: ตัดสินใจก่อนจะทุ่มเงินกับการฝึกว่าอยากมุ่งกับคลาวด์เจ้าไหน
ทักษะที่วิศวกรข้อมูลบนคลาวด์ต้องมี
วิศวกรข้อมูลบนคลาวด์ออกแบบ สร้าง และรัน data pipeline บน AWS, Azure หรือ GCP ซึ่งในทางปฏิบัติหมายถึงงาน ETL และ ELT ที่ป้อนข้อมูลเข้าสู่ data lake และ data warehouse พร้อมกับการควบคุมความปลอดภัยและต้นทุน งานนี้อยู่กึ่งกลางระหว่างวิศวกรรมซอฟต์แวร์และงานวิเคราะห์ และรายการทักษะก็สะท้อนเช่นนั้น
- การเขียนโปรแกรมและการคิวรี: Python และ SQL สำคัญแบบไม่อาจต่อรอง
- Object storage: Amazon S3, Azure Blob และ Data Lake Storage หรือ Google Cloud Storage
- คลังข้อมูลและเอนจินวิเคราะห์: Redshift, BigQuery หรือ Synapse และ Snowflake เมื่อองค์กรทำหลายคลาวด์
- Orchestration: Airflow พร้อมเครื่องมือกำหนดตารางงานของเจ้าต่างๆ (AWS Step Functions, Azure Data Factory pipelines, Cloud Composer)
- สตรีมมิง: Kinesis, Azure Event Hubs หรือ Pub/Sub และ Kafka เมื่อทีมรัน broker เอง
- Infrastructure as code: Terraform, CloudFormation หรือ Bicep
- พื้นฐานงานปฏิบัติการ: Linux เครือข่าย Git และความคล่องตัวในเชลล์
สำหรับเนื้อหาในระดับการรับรองด้านล่าง ควรคาดหวังว่าต้องมีประสบการณ์ลงมือทำบนคลาวด์ 6 ถึง 12 เดือนเป็นฐาน DP-203 และเส้นทาง AWS Data Engineer จะไม่ปรานีก่อนถึงจุดนั้น
เส้นทางการเรียนที่แนะนำ
นี่คือลำดับที่ฉันจะทำ หากวันนี้เริ่มจากนักวิเคราะห์และอยากสัมภาษณ์งานวิศวกรข้อมูลบนคลาวด์ภายในหนึ่งปี
ระยะที่ 1: เก็บคำศัพท์และเลือกคลาวด์เจ้าเดียว
เรียน Understanding Cloud Computing จากนั้นอ่านสองสามเธรดใน r/dataengineering โดยเปิดประกาศงานในพื้นที่ของคุณไว้ข้างๆ ตัดสินใจเลือกผู้ให้บริการเจ้าเดียวก่อนซื้ออะไรเพิ่มเติม
ระยะที่ 2: เรียนพื้นฐานของผู้ให้บริการที่เลือกอย่างจริงจัง
เลือกเรียน เส้นทาง AWS Cloud Practitioner (CLF-C02) หรือ เส้นทาง Microsoft Azure Fundamentals (AZ-900) หรือ Introduction to GCP บวกกับคอร์สแรกๆ ของ เส้นทาง Google Cloud Data Engineer ขึ้นกับผลลัพธ์ของระยะที่ 1 หากเลือก Azure ไม่มีงบเลย และไม่ต้องการคอนเทนต์เชิงโต้ตอบ เพลย์ลิสต์ AZ-900 และ AZ-104 ของ John Savill ครอบคลุมเนื้อหาเดียวกันแบบฟรี
ระยะที่ 3: ลงลึกบริการด้านข้อมูลของคลาวด์เจ้านั้น
ในระยะนี้คุณจะเริ่มมีความพร้อมสำหรับงาน
- ผู้เรียน GCP ควรเรียนจบ เส้นทาง Google Cloud Data Engineer แล้วไปทำแล็บ BigQuery, Dataflow และ Pub/Sub แบบฟรีบน Google Cloud Skills Boost
- ผู้เรียน AWS ไปที่ เส้นทาง Skill Builder Data Engineer สำหรับ Glue, Lake Formation, Redshift และ Kinesis
- ผู้เรียน Azure ไปที่ เส้นทาง Microsoft Learn DP-203 แบบฟรีสำหรับ Data Lake Storage, Synapse และ Data Factory
ระยะที่ 4: สร้างโปรเจกต์และเสริมชั้นโครงสร้างพื้นฐาน
ส่งมอบ pipeline แบบ end-to-end สองถึงสามชุดที่อธิบายได้ จะผ่าน โมดูลโปรเจกต์ของ Grow Data Skills หรือทำเองด้วย Terraform และ Airflow ก็ได้ ควบคู่กัน คอร์ส SAA-C03 ของ Cantrill จะเติมช่องว่างเรื่อง IAM, VPC และการเข้ารหัสที่คอร์สเน้นข้อมูลมักเว้นไว้ หากปัญหาจริงคือเดดไลน์ไม่ใช่เนื้อหา ให้สลับมาลง Smart Data Learning แบบ 14 สัปดาห์แทน
ข้อคิดท้ายเรื่อง
สำหรับคนส่วนใหญ่ที่อ่านสิ่งนี้ ลำดับคือ Understanding Cloud Computing ตามด้วยเส้นทางพื้นฐานของผู้ให้บริการรายใดรายหนึ่ง แล้วจึงตามด้วยเส้นทางบริการด้านข้อมูลของผู้ให้บริการนั้น งานแนวคิดสองสัปดาห์ช่วยประหยัดความสับสนไปได้เป็นเดือน และการเลือกคลาวด์เจ้าเดียวดีกว่าลองชิมสามเจ้า
อีกเรื่องที่ควรรู้: ค่าสอบมีการเปลี่ยนแปลง และตัวเลข $99 ถึง $120 สำหรับ AZ-900, $165 สำหรับ DP-203 และ $299 ต่อปีสำหรับ AWS Skill Builder เป็นตัวเลข ณ เวลาที่เขียน ไม่ใช่การรับประกัน
ข้อแม้สำคัญอีกข้อหนึ่งคือสิ่งที่ไม่มีใครขายคอร์สอยากพูดดังๆ ไม่มีทรัพยากรใดในที่นี้ทำให้ได้งานเพียงลำพัง สิ่งที่พาคุณเข้ารอบสัมภาษณ์คือ pipeline สองสามชุดที่คุณสร้างเอง ทำพังเอง และอธิบายได้ โดยดีสุดคือมี Terraform อยู่ในรีโป ใบรับรองช่วยผ่านสายคัดกรอง โปรเจกต์ช่วยชนะรอบเทคนิค
FAQs
ควรเรียนคลาวด์เจ้าไหนก่อนในฐานะผู้มุ่งสู่สาย Data Engineer: AWS, Azure หรือ GCP?
เลือกเจ้าเดียว ฝึกให้เก่งจริง แล้วค่อยเพิ่มคลาวด์เจ้าอื่น เรียน AWS ก่อนหากเป้าหมายคือจำนวนประกาศงานที่เปิดกว้างต่อคุณ เพราะส่วนแบ่งตลาดคือเหตุผลที่เธรดใน r/dataengineering เรียกมันว่าเป็นการลงทุนอาชีพที่ปลอดภัยที่สุด เรียน GCP ก่อนหากงานที่ต้องการเน้นการวิเคราะห์ เพราะ BigQuery และ Dataflow ได้รับคำชมว่าเริ่มต้น pipeline ได้รวดเร็ว เรียน Azure ก่อนหากนายจ้างหรือ ตลาดท้องถิ่นของคุณใช้งาน SQL Server, Power BI และ Active Directory
ต้องมี Python และ SQL ก่อนเริ่มคอร์สวิศวกรรมข้อมูลบนคลาวด์หรือไม่?
ต้องมี หากเกินระดับพื้นฐานไปแล้ว วัสดุสำหรับผู้เริ่มต้นอย่าง Understanding Cloud Computing, AZ-900 และ CLF-C02 ไม่ต้องเขียนโค้ด แต่เส้นทาง Google Cloud Data Engineer เส้นทาง AWS Skill Builder Data Engineer และโมดูล DP-203 สมมติว่าคุณเขียน SQL และอ่าน Python ได้เอง เพิ่มพื้นฐาน Linux, Git และความคล่องตัวในเชลล์เข้าไปด้วย หากไม่มี คุณจะเสียเวลาไปกับข้อผิดพลาดทางไวยากรณ์แทนการออกแบบ pipeline
ใบรับรองด้านวิศวกรรมข้อมูลของ AWS, Azure และ GCP มีค่าใช้จ่ายเท่าไร?
โดยมาก แยกกันระหว่างการเรียนกับค่าสอบ เนื้อหา Microsoft Learn ฟรี และค่าสอบ DP-203 ราว $165 ส่วนค่าสอบ AZ-900 อยู่ราว $99 ถึง $120 ตามภูมิภาค AWS Skill Builder มีหลักสูตรดิจิทัลฟรีจำนวนหนึ่ง และสมาชิก Individual ราว $29 ต่อเดือนหรือ $299 ต่อปี ขณะที่ Google Cloud Skills Boost มีแล็บฟรี และเวอร์ชันที่โฮสต์โดยพาร์ตเนอร์มักอยู่ที่ค่าสมาชิก $39 ถึง $79 ต่อเดือน DataCamp มีเส้นทางการเรียนสำหรับแต่ละแพลตฟอร์มและส่วนลดใบรับรองของผู้ให้บริการในราคา $25–$33 ต่อเดือน จ่ายค่าสอบก็ต่อเมื่อประกาศงานหรือกระบวนการเลื่อนตำแหน่งต้องการใบรับรองนั้นจริงๆ
ใบรับรองคลาวด์เพียงอย่างเดียวพอสำหรับงานวิศวกรข้อมูลไหม?
หลายกรณี ไม่เพียงพอ CLF-C02 และ AZ-900 เป็นข้อสอบระดับพื้นฐานที่ใช้เวลามากกับแนวคิดคลาวด์ทั่วไป การคิดค่าบริการ และธรรมาภิบาล ดังนั้นการสอบผ่านไม่ได้พิสูจน์ว่าคุณเคยสร้างงาน Glue หรือดีบัก Dataflow pipeline มาแล้ว สิ่งที่พาคุณผ่านการสัมภาษณ์คือ pipeline แบบ end-to-end สองถึงสามชุดที่คุณสร้างเอง โดยดีสุดคือเตรียมด้วย Terraform และคอมมิตไว้ในรีโปสาธารณะ ใช้ใบรับรองเพื่อผ่านสายคัดกรอง และใช้โปรเจกต์เพื่อชนะรอบเทคนิค