Чему вы научитесь
- Строить полный жизненный цикл данных (end-to-end) — от получения данных из источников до аналитических дашбордов.
- Понимать основные принципы работы современных систем обработки данных.
- Разбираться в архитектуре современного конвейера данных и взаимодействии его основных компонентов.
- Получать данные из файлов различных форматов и внешних API.
- Загружать данные в PostgreSQL и организовывать их хранение.
- Реализовывать ETL-процессы для сбора и первичной обработки данных.
- Использовать SQL для выборки, проверки и анализа данных.
- Автоматизировать выполнение конвейеров данных с помощью Apache Airflow.
- Выполнять преобразование данных с использованием dbt.
- Контейнеризировать приложения и инфраструктуру с помощью Docker и Docker Compose.
- Использовать Git для контроля версий проекта.
- Понимать принципы потоковой обработки данных на примере Apache Kafka.
- Проводить базовый анализ данных в Jupyter Notebook.
- Создавать аналитические дашборды в Apache Superset.
- Настраивать базовый мониторинг инфраструктуры с использованием Prometheus и Grafana.
- Работать с объектным хранилищем MinIO.
- Строить гибридную архитектуру хранения (data lakehouse) с использованием Apache Iceberg и Trino.
- Собирать и запускать полноценный конвейер данных на современном open-source стеке.
О курсе
Хотите войти в инженерию данных, но устали от курсов, где всё сводится к разрозненным лекциям про синтаксис Python и SQL? Этот курс — не набор теории, а последовательное построение одного настоящего проекта: полноценного конвейера данных о рейсах и погоде аэропорта, от сырых данных до готовых дашбордов.
Почему стоит выбрать именно этот курс:
Вместо разрозненных примеров — один сквозной проект, на котором вы шаг за шагом разбираетесь, как все компоненты современного дата-стека работают и взаимодействуют между собой: как данные попадают из источника в хранилище, как трансформируются, как автоматизируется их обработка и как в итоге превращаются в дашборд. Это не набор изолированных лекций про отдельные инструменты, а целостная картина того, как устроен реальный конвейер данных.
Что вы получите после успешного прохождения курса:
Готовый pet-проект в портфолио и понимание всего жизненного цикла данных — от источника до дашборда — а главное, практическое понимание того, как отдельные инструменты (Python, PostgreSQL, dbt, Airflow, Kafka, Superset, Grafana) складываются в единую работающую систему.
Особенности курса:
- Один сквозной проект вместо разрозненных примеров по каждому инструменту отдельно
- Акцент на понимании взаимодействия компонентов, а не только их изучении по отдельности
- Вся инфраструктура поднимается через Docker Compose.
- Помимо классического пути, рассматривается и архитектура озера данных.
Для кого этот курс
Начальные требования
Для комфортного прохождения курса рекомендуются:
- Базовые знания Python (переменные, циклы, функции, работа с библиотеками) — или готовность повторить материал по ходу курса.
- Базовое знакомство с SQL (SELECT, JOIN, GROUP BY, оконные функции) — или готовность повторить материал по ходу курса.
- Общее представление о том, что такое базы данных.
- Желателен, но не обязателен опыт работы с командной строкой/терминалом.
Как проходит обучение
Курс построен вокруг одного сквозного практического проекта — вы последовательно проходите уроки, где после каждой темы закрепляете материал на практике. Формат каждого урока: краткое введение в тему → настройка нужной инфраструктуры → написание кода → разбор и объяснение → сборка через Docker Compose → запуск и проверка результата.
В курс входят:
- Текстовые уроки с пошаговыми инструкциями и объяснением, зачем нужен каждый инструмент.
- Практические задания и тесты с автоматической проверкой после ключевых тем.
- Работа с реальной инфраструктурой через Docker Compose на каждом этапе — от баз данных до мониторинга.
К концу курса вы соберёте полноценный дата-пайплайн от источника данных до аналитического дашборда — не разрозненные примеры, а один работающий проект, который можно показать на собеседовании, а также на основе которого можно продолжить изучение других инструментов.
Программа курса
Сертификат
Что вы получаете
- Практический опыт сборки полноценного дата-пайплайна уровня Junior Data Engineer.
- Работающий pet-проект для портфолио, который можно показать на собеседовании.
- Понимание того, как компоненты современного дата-стека (Python, PostgreSQL, dbt, Airflow, Kafka, Superset, Grafana) работают и взаимодействуют друг с другом.
- Навыки практической работы с инфраструктурой: развёртывание сервисов через Docker Compose, запуск и отладка пайплайнов, базовая настройка мониторинга и логирования.
- Доступ к форуму студентов — обсуждение решений, вопросы и обратная связь от однокурсников.
- Сертификат о прохождении курса от Stepik.