Алина Иванычева
Райффайзен Банк
В нашем проекте автоматизации налоговой отчетности тема Data Quality была острой и требующей внимания изначально. Когда сроки сдачи «горят», аналитики и тестировщики вынуждены вручную и в авральном режиме вылавливать ошибки в данных — а цена таких ошибок в банке может быть очень высокой и приводить к существенным финансовым последствиям.
Сначала мы пошли по практичному пути: выделили часть ресурсов внутри команды на локальные DQ-проверки, чтобы снять нагрузку с команды и ускорить поиск проблем. Для этого использовали фреймворк PyDeequ — он позволил быстро формализовать критичные проверки рядом с расчетами и получить измеримый эффект. Спойлер: хоть наше решение и было «написано на коленке» — оно действительно сэкономило время, помогло стабилизировать расчеты и уложиться в сроки сдачи.
Далее на уровне проекта внедрили уже платформенное решение — полноценный DQ‑сервис на базе Soda Core. Мы осмысленно сравнили подходы и инструменты: где PyDeequ сильнее, где Soda удобнее, какие типы проверок и сценарии эксплуатации лучше покрывает каждый — свели выводы в наглядную сравнительную таблицу.
В итоге мы не стали выбирать «либо PyDeequ, либо Soda». В нашем случае максимальный эффект дала синергия:
— PyDeequ закрыл часть задач как «локальный инструмент контроля качества», ближе к вычислениям и инженерной логике пайплайна (быстро, гибко, удобно для кастомных правил).
— Soda стала основой платформенного уровня качества данных: стандартизация, масштабирование, единые практики для команд, прозрачность проверок и их результатов.
Вместе они дали более полное покрытие: и на уровне конкретных расчетов/витрин, и на уровне централизованного DQ‑процесса — в итоге наши данные и ключевые расчеты теперь стали покрыты проверками максимально широко и практично.
Новой ступенькой в развитии качества данный стала автоматизация процесса e2e. Мы начали разработку собственного DQ-generator — это cервис, который использует большую языковую модель (под капотом — Kimi) для автоматического анализа метаданных и семплирования данных. Генератор предлагает готовые шаблоны проверок (для Soda и PySpark), выявляя типовые паттерны ошибок и специфические взаимосвязи полей, характерные для финансовой отчетности. Человеку остается только валидировать набор и качество проверок, что ускорило процесс покрытия данных DQ-checks многократно.
Доклад будет полезен тестировщикам, аналитикам, дата‑инженерам и техлидам. Особенно тем специалистам, кто только планирует внедрять DQ и хочет заранее понимать сильные стороны, ограничения и подводные камни готовых популярных решений на рынке, а также рабочие способы автоматизировать цикл дата-проверок.
Райффайзен Банк