Чему вы научитесь
- Построение production-пайплайнов парсинга документов (PDF, HTML, DOCX)
- Настройка OCR для сканированных документов и таблиц
- Нормализация, дедупликация и санитизация данных перед индексированием
- Асинхронная и потоковая обработка ingestion-нагрузок
- Восстановление после сбоев: идемпотентность, retry, dead-letter queue
- Мониторинг качества данных и метрик пайплайна поглощения
О курсе
Это курс 3 программы "Проектирование ИИ систем для production".
В этом курсе вы научитесь:
- Проектировать production-пайплайны поглощения данных с учётом failure modes
- Выбирать стратегию парсинга под конкретный формат и тип документа
- Настраивать OCR-пайплайн и диагностировать ошибки распознавания
- Строить асинхронные и потоковые пайплайны поглощения без узких мест
- Восстанавливать пайплайн после сбоев без потери и дублирования данных
- Внедрять метрики качества данных и мониторинг деградации ingestion
🔥 Как устроен курс
Каждый урок начинается с реального production-инцидента: система упала, деньги потеряны, команда разбирает причины. Затем — архитектурный разбор: что пошло не так и как это спроектировать правильно. В конце — практическое задание на Python, которое закрепляет паттерн.
Формат: инцидент → архитектура → реализация
🎓 Это третьий курс программы AI Engineering. Последующие курсы (RAG, Ingestion, Context Engineering, Routing, Deployment, Agents, Evaluation, Reliability) строятся на архитектурном фундаменте, заложенном здесь.
Обсуждение и новости курса в Телеграме: Канал "ИИ Спираль"
Другие курсы программы "Проектирование ИИ систем для production":
3 — Загрузка данных в ИИ системы
5 — Слой маршрутизации
6 — Структурированный вывод + Экономика
7 — Агенты и рабочие процессы
8 — Оценка + LLMOps
9 — Надежность + Вывод
10 — Развертывание и масштабирование
11 — Финальный проект
Для кого этот курс
Начальные требования
- Опыт коммерческой разработки на Python
- Понимание async/await в Python
- Базовое знакомство с RAG-системами и векторными БД (рекомендуется Курс 2) или эквивалентный опыт
- Базовое знакомство с Docker и контейнерами
Наши преподаватели
Как проходит обучение
Каждый модуль: история production-инцидента → архитектура → реализация
Практические задания в репозитории enterprise-ai-assistant
Failure-first подход: сначала показываем, как ломается, потом как чинить
Оценка качества встроена в практику с первого урока
Программа курса
Сертификат
Отзывы прошедших курс
Что вы получаете
- Модуль app/ingestion/ для enterprise-ai-assistant (git tag v3.0-ingestion)
- Библиотека парсеров под разные форматы документов (PDF, HTML, Markdown)
- OCR-пайплайн с диагностикой качества распознавания
- Набор инструментов дедупликации и нормализации документов
- Пайплайн метрик качества данных для регрессионного контроля