Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера

CSV, JSON, Parquet и Avro для дата-инженера: байты и кодировки, схемы, сжатие, Arrow, эволюция, S3, качество, безопасность и production-пайплайн.
Средний уровень
110-170 часов

Чему вы научитесь

  • объяснять путь от байтов и кодировки до записей, типов и бизнес-семантики
  • надёжно читать и записывать CSV, JSON, NDJSON, Parquet и Avro
  • работать со схемами, nested-данными, эволюцией и совместимостью producer/consumer
  • выбирать row groups, codecs, partitioning и compaction для Parquet
  • строить атомарный и идемпотентный обмен через файловые системы и S3
  • диагностировать повреждения, проверять качество и защищать чувствительные данные

О курсе

Как стать Senior Data Engineer за 3 года и не сойти с ума?

Меня зовут Дима. Я Senior Data Engineer в Сбере. Мой путь включает шесть лет фундаментального образования на ПМИ в НИЯУ МИФИ, стажировку в «Гринатоме» и рост от начинающего инженера до работы с архитектурой высоконагруженных платформ данных.

Курс входит в образовательную линейку Telegram-канала «Логово Дата-Инженера». В канале выходят hard-skill материалы, live-собеседования, архитектурные разборы и практические карты роста от junior до senior.

О курсе

Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера — Курс раскрывает файловые форматы от байтов до архитектуры Data Lake. Вы научитесь диагностировать повреждения, сохранять типы и схемы, выбирать формат под нагрузку и строить надёжный файловый обмен.

Технологическая база: Код на Python 3.12+, PyArrow, fastavro, Polars и DuckDB.

Кому подойдёт

  • начинающие и растущие дата-инженеры, работающие с файловыми источниками
  • Python, pandas, Polars и Spark-разработчики, которым нужна глубина форматов
  • аналитические инженеры, строящие staging и Data Lake
  • платформенные инженеры, отвечающие за S3, Schema Registry и data contracts

Чему вы научитесь

  • объяснять путь от байтов и кодировки до записей, типов и бизнес-семантики
  • надёжно читать и записывать CSV, JSON, NDJSON, Parquet и Avro
  • работать со схемами, nested-данными, эволюцией и совместимостью producer/consumer
  • выбирать row groups, codecs, partitioning и compaction для Parquet
  • строить атомарный и идемпотентный обмен через файловые системы и S3
  • диагностировать повреждения, проверять качество и защищать чувствительные данные

Как построена программа

  1. Файловый фундамент: байты, Unicode, буферизация, хеши, сжатие и атомарная запись.
  2. Текстовые форматы: CSV, JSON, NDJSON, schema-on-read и quarantine.
  3. Бинарные форматы: Arrow, внутреннее устройство Parquet и Avro OCF.
  4. Production-практики: эволюция схем, Kafka, S3, partitioning, security и observability.
  5. Итоговый пайплайн: raw/staging/cleansed/curated, конвертация, тесты и восстановление.

Формат обучения

В курсе 26 модулей и 156 уроков. Каждый урок содержит подробное объяснение, небольшие нарастающие примеры, проверку понимания и практические задачи. Решения практики доступны для разбора после самостоятельной попытки.

Всего внутри 675 тестовых вопросов и 417 практических задач. Ориентировочная нагрузка: 110-170 часов. Курс рассчитан на самостоятельный темп без обязательных дедлайнов.

Итоговый проект

Production-пайплайн файлового Data Lake: безопасный приём CSV/JSON, валидация и quarantine, преобразование в Parquet/Avro, партиционирование, контрольные суммы, атомарная публикация, тесты и мониторинг.

Что потребуется на старте

  • базовый Python: функции, файлы, исключения и установка пакетов
  • Python 3.12+, PyArrow, fastavro, Polars и DuckDB; окружение разбирается в курсе
  • опыт с Data Lake или Kafka полезен, но не обязателен

Как получить максимум пользы

  1. Запускайте примеры и меняйте входные данные, а не ограничивайтесь чтением.
  2. Сначала отвечайте на тест и решайте задачу самостоятельно, затем сверяйтесь с разбором.
  3. Ведите журнал ошибок, решений и технических компромиссов.
  4. Собирайте упражнения в отдельный репозиторий и регулярно возвращайтесь к старым задачам.
  5. Связывайте каждый инструмент с проблемой, которую он решает в реальной системе.

Результат прохождения

Вы сможете осознанно выбирать формат и параметры хранения, сохранять контракт данных между системами и восстанавливать пайплайн после повреждённых файлов.

Telegram: Логово Дата-Инженера

В Telegram-канале автора публикуются материалы по Rust, Java, Python, Go, SQL, pandas, Polars, Scala, Spark, Flink, Kafka, Hadoop, Airflow, DWH, Trino, ClickHouse, S3, файловым форматам, Docker/Kubernetes, разборы собеседований и архитектура Enterprise-проектов. Подписка поможет дополнять последовательную программу курса живыми кейсами из профессии.

Для кого этот курс

начинающие и растущие дата-инженеры, работающие с файловыми источниками; Python, pandas, Polars и Spark-разработчики, которым нужна глубина форматов; аналитические инженеры, строящие staging и Data Lake; платформенные инженеры, отвечающие за S3, Schema Registry и data contracts.

Начальные требования

базовый Python: функции, файлы, исключения и установка пакетов Python 3.12+, PyArrow, fastavro, Polars и DuckDB; окружение разбирается в курсе опыт с Data Lake или Kafka полезен, но не обязателен

Наши преподаватели

Как проходит обучение

Каждый урок проходится по циклу: понять идею, запустить и изменить пример, ответить на тест, самостоятельно решить практику и только затем свериться с разбором.

Материал выстроен последовательно, без обязательных дедлайнов. Рекомендуется вести учебный репозиторий и журнал ошибок.

Программа курса

загружаем...

Что вы получаете

  • полный текстовый конспект курса с рабочими примерами
  • 675 тестовых вопросов для самопроверки
  • 417 практических задач с решениями
  • итоговый проект: Production-пайплайн файлового Data Lake: безопасный приём CSV/JSON, валидация и quarantine, преобразование в Parquet/Avro, партиционирование, контрольные суммы, атомарная публикация, тесты и мониторинг.
Price: Бесплатно

Расскажите о курсе друзьям

Price: Бесплатно