Трек
Профессиональный инженер данных на Python
Создать бесплатный аккаунт
Продолжить через GoogleПоказать больше вариантовили
Любимая обучающимися из тысяч компаний
Обучаете команду?
Попробуйте для бизнесаОписание трека
Профессиональный инженер данных на Python
Необходимые условия
Инженер данныхCourse
Откройте ключевые компоненты современной архитектуры данных: от ingestion и serving до governance и orchestration.
Course
Командная строка Unix помогает объединять существующие программы по-новому, автоматизировать рутинные задачи и запускать программы на кластерах и в облаках.
Course
Изучите основы ВМ, контейнеров, Docker и Kubernetes. Поймите различия, чтобы начать!
Course
Курс знакомит с dbt для моделирования данных, преобразований, тестирования и создания документации.
Course
Изучите основы объектно-ориентированного программирования (OOP), создавая собственные классы и объекты!
Course
Course
В этом введении в DevOps вы освоите основы DevOps и изучите ключевые концепции, инструменты и методы для повышения продуктивности.
Course
Освойте тестирование Python: Освойте методы, создавайте проверки и обеспечьте безошибочный код с pytest и unittest.
Project
бонусDebugging Code
Sharpen your debugging skills to enhance sales data accuracy.
Course
Познакомьтесь с Docker и узнайте, почему он важен в арсенале специалиста по данным. Узнайте о контейнерах Docker, образах и многом другом.
Course
Освойте PySpark для работы с большими данными: обрабатывайте, запрашивайте и оптимизируйте огромные наборы данных для мощной аналитики!
Chapter
This chapter introduces the exciting world of Big Data, as well as the various concepts and different frameworks for processing Big Data. You will understand why Apache Spark is considered the best framework for BigData.
Chapter
The main abstraction Spark provides is a resilient distributed dataset (RDD), which is the fundamental and backbone data type of this engine. This chapter introduces RDDs and shows how RDDs can be created and executed using RDD Transformations and Actions.
Chapter
In this chapter, you'll learn about Spark SQL which is a Spark module for structured data processing. It provides a programming abstraction called DataFrames and can also act as a distributed SQL query engine. This chapter shows how Spark SQL allows you to use DataFrames in Python.
Project
Step into a data engineer's shoes and master data cleaning with PySpark on an e-commerce orders dataset!
Chapter
In this chapter, we learn how to download data files from web servers via the command line. In the process, we also learn about documentation manuals, option flags, and multi-file processing.
Chapter
In the last chapter, we bridge the connection between command line and other data science languages and learn how they can work together. Using Python as a case study, we learn to execute Python on the command line, to install dependencies using the package manager pip, and to build an entire model pipeline using the command line.
Course
Узнайте о разнице между пакетной и потоковой обработкой, масштабировании потоковых систем и реальных сценариях применения.
Course
Course
В этом курсе вы изучите основы Kubernetes и научитесь разворачивать и оркестрировать контейнеры с помощью Manifests и инструкций kubectl.
Resource
Understand how data engineering can impact your business.
завершён
Получить сертификат об окончании
Добавьте эту квалификацию в профиль LinkedIn, резюме или CVПоделитесь в социальных сетях и в обзоре эффективностиЗаписаться сейчас
Присоединяйтесь к более чем 19 миллионам обучающихся и начните Профессиональный инженер данных на Python уже сегодня!
Создать бесплатный аккаунт
Продолжить через GoogleПоказать больше вариантовили
Развивайте свои навыки работы с данными с помощью DataCamp для мобильных устройств.
Успевайте в обучении на ходу с помощью наших мобильных курсов и ежедневных 5-минутных заданий по программированию.