Поглощение данных для production AI-систем

Полный курс по проектированию production-пайплайнов поглощения данных (ingestion): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.
Средний уровень
21 час видео + практические задания
Сертификат Stepik

Чему вы научитесь

  • Построение production-пайплайнов парсинга документов (PDF, HTML, DOCX)
  • Настройка OCR для сканированных документов и таблиц
  • Нормализация, дедупликация и санитизация данных перед индексированием
  • Асинхронная и потоковая обработка ingestion-нагрузок
  • Восстановление после сбоев: идемпотентность, retry, dead-letter queue
  • Мониторинг качества данных и метрик пайплайна поглощения

О курсе

Это курс 3 программы "Проектирование ИИ систем для production".

В этом курсе вы научитесь:

  • Проектировать production-пайплайны поглощения данных с учётом failure modes
  • Выбирать стратегию парсинга под конкретный формат и тип документа
  • Настраивать OCR-пайплайн и диагностировать ошибки распознавания
  • Строить асинхронные и потоковые пайплайны поглощения без узких мест
  • Восстанавливать пайплайн после сбоев без потери и дублирования данных
  • Внедрять метрики качества данных и мониторинг деградации ingestion

 

🔥 Как устроен курс

Каждый урок начинается с реального production-инцидента: система упала, деньги потеряны, команда разбирает причины. Затем — архитектурный разбор: что пошло не так и как это спроектировать правильно. В конце — практическое задание на Python, которое закрепляет паттерн.

Формат: инцидент → архитектура → реализация

🎓 Это третьий курс программы AI Engineering. Последующие курсы (RAG, Ingestion, Context Engineering, Routing, Deployment, Agents, Evaluation, Reliability) строятся на архитектурном фундаменте, заложенном здесь.

Обсуждение и новости курса в Телеграме: Канал "ИИ Спираль"

Другие курсы программы "Проектирование ИИ систем для production":

1 — Архитектура ИИ-систем

2 — Системы RAG

3 — Загрузка данных в ИИ системы

4 — Инженерия контекста

5 — Слой маршрутизации

6 — Структурированный вывод + Экономика

7 — Агенты и рабочие процессы

8 — Оценка + LLMOps

9 — Надежность + Вывод

10 — Развертывание и масштабирование

11 — Финальный проект

Для кого этот курс

Python-разработчики и AI-инженеры, отвечающие за пайплайны обработки документов для RAG и поисковых систем. Рекомендуется пройти Курс 2 (Проектирование RAG-систем) или иметь эквивалентный опыт работы с векторными индексами.

Начальные требования

  • Опыт коммерческой разработки на Python
  • Понимание async/await в Python
  • Базовое знакомство с RAG-системами и векторными БД (рекомендуется Курс 2) или эквивалентный опыт
  • Базовое знакомство с Docker и контейнерами

Наши преподаватели

Как проходит обучение

Каждый модуль: история production-инцидента → архитектура → реализация

Практические задания в репозитории enterprise-ai-assistant

Failure-first подход: сначала показываем, как ломается, потом как чинить

Оценка качества встроена в практику с первого урока

Программа курса

загружаем...
Certificate

Сертификат

Сертификат о завершении выдаётся при успешном прохождении всех модулей

Отзывы прошедших курс

5
из 5
из 1 отзыва
1 отзыв
загружаем...

Что вы получаете

  • Модуль app/ingestion/ для enterprise-ai-assistant (git tag v3.0-ingestion)
  • Библиотека парсеров под разные форматы документов (PDF, HTML, Markdown)
  • OCR-пайплайн с диагностикой качества распознавания
  • Набор инструментов дедупликации и нормализации документов
  • Пайплайн метрик качества данных для регрессионного контроля

Сколько стоит обучение

Price: 1 890 
Вы попробовали и поняли, что вам сейчас не подходит этот курс? Ничего страшного, мы вернём вам деньги в течение 30-ти дней после покупки.

Часто задаваемые вопросы

Расскажите о курсе друзьям

Price: 1 890