Чему вы научитесь
- объяснять путь от байтов и кодировки до записей, типов и бизнес-семантики
- надёжно читать и записывать CSV, JSON, NDJSON, Parquet и Avro
- работать со схемами, nested-данными, эволюцией и совместимостью producer/consumer
- выбирать row groups, codecs, partitioning и compaction для Parquet
- строить атомарный и идемпотентный обмен через файловые системы и S3
- диагностировать повреждения, проверять качество и защищать чувствительные данные
О курсе
Как стать Senior Data Engineer за 3 года и не сойти с ума?
Меня зовут Дима. Я Senior Data Engineer в Сбере. Мой путь включает шесть лет фундаментального образования на ПМИ в НИЯУ МИФИ, стажировку в «Гринатоме» и рост от начинающего инженера до работы с архитектурой высоконагруженных платформ данных.
Курс входит в образовательную линейку Telegram-канала «Логово Дата-Инженера». В канале выходят hard-skill материалы, live-собеседования, архитектурные разборы и практические карты роста от junior до senior.
О курсе
Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера — Курс раскрывает файловые форматы от байтов до архитектуры Data Lake. Вы научитесь диагностировать повреждения, сохранять типы и схемы, выбирать формат под нагрузку и строить надёжный файловый обмен.
Технологическая база: Код на Python 3.12+, PyArrow, fastavro, Polars и DuckDB.
Кому подойдёт
- начинающие и растущие дата-инженеры, работающие с файловыми источниками
- Python, pandas, Polars и Spark-разработчики, которым нужна глубина форматов
- аналитические инженеры, строящие staging и Data Lake
- платформенные инженеры, отвечающие за S3, Schema Registry и data contracts
Чему вы научитесь
- объяснять путь от байтов и кодировки до записей, типов и бизнес-семантики
- надёжно читать и записывать CSV, JSON, NDJSON, Parquet и Avro
- работать со схемами, nested-данными, эволюцией и совместимостью producer/consumer
- выбирать row groups, codecs, partitioning и compaction для Parquet
- строить атомарный и идемпотентный обмен через файловые системы и S3
- диагностировать повреждения, проверять качество и защищать чувствительные данные
Как построена программа
- Файловый фундамент: байты, Unicode, буферизация, хеши, сжатие и атомарная запись.
- Текстовые форматы: CSV, JSON, NDJSON, schema-on-read и quarantine.
- Бинарные форматы: Arrow, внутреннее устройство Parquet и Avro OCF.
- Production-практики: эволюция схем, Kafka, S3, partitioning, security и observability.
- Итоговый пайплайн: raw/staging/cleansed/curated, конвертация, тесты и восстановление.
Формат обучения
В курсе 26 модулей и 156 уроков. Каждый урок содержит подробное объяснение, небольшие нарастающие примеры, проверку понимания и практические задачи. Решения практики доступны для разбора после самостоятельной попытки.
Всего внутри 675 тестовых вопросов и 417 практических задач. Ориентировочная нагрузка: 110-170 часов. Курс рассчитан на самостоятельный темп без обязательных дедлайнов.
Итоговый проект
Production-пайплайн файлового Data Lake: безопасный приём CSV/JSON, валидация и quarantine, преобразование в Parquet/Avro, партиционирование, контрольные суммы, атомарная публикация, тесты и мониторинг.
Что потребуется на старте
- базовый Python: функции, файлы, исключения и установка пакетов
- Python 3.12+, PyArrow, fastavro, Polars и DuckDB; окружение разбирается в курсе
- опыт с Data Lake или Kafka полезен, но не обязателен
Как получить максимум пользы
- Запускайте примеры и меняйте входные данные, а не ограничивайтесь чтением.
- Сначала отвечайте на тест и решайте задачу самостоятельно, затем сверяйтесь с разбором.
- Ведите журнал ошибок, решений и технических компромиссов.
- Собирайте упражнения в отдельный репозиторий и регулярно возвращайтесь к старым задачам.
- Связывайте каждый инструмент с проблемой, которую он решает в реальной системе.
Результат прохождения
Вы сможете осознанно выбирать формат и параметры хранения, сохранять контракт данных между системами и восстанавливать пайплайн после повреждённых файлов.
Telegram: Логово Дата-Инженера
В Telegram-канале автора публикуются материалы по Rust, Java, Python, Go, SQL, pandas, Polars, Scala, Spark, Flink, Kafka, Hadoop, Airflow, DWH, Trino, ClickHouse, S3, файловым форматам, Docker/Kubernetes, разборы собеседований и архитектура Enterprise-проектов. Подписка поможет дополнять последовательную программу курса живыми кейсами из профессии.
Для кого этот курс
Начальные требования
Наши преподаватели
Как проходит обучение
Каждый урок проходится по циклу: понять идею, запустить и изменить пример, ответить на тест, самостоятельно решить практику и только затем свериться с разбором.
Материал выстроен последовательно, без обязательных дедлайнов. Рекомендуется вести учебный репозиторий и журнал ошибок.
Программа курса
Что вы получаете
- полный текстовый конспект курса с рабочими примерами
- 675 тестовых вопросов для самопроверки
- 417 практических задач с решениями
- итоговый проект: Production-пайплайн файлового Data Lake: безопасный приём CSV/JSON, валидация и quarantine, преобразование в Parquet/Avro, партиционирование, контрольные суммы, атомарная публикация, тесты и мониторинг.