компания genesis group ag ???? about us yesim is an international esim provider with 7+ years of experience in delivering secure, seamless connectivity ...
Data Engineer в направление «Интеллектуальные решения»
Описание вакансии
компания "транстелеком"
ключевые задачи:- строить пайплайны выгрузки данных из систем заказчика: postgresql, oracle, hive-таблицы, kafka-топики, файлы, api;
- разрабатывать и сопровождать dag'и в airflow - инкрементальная загрузка, ретраи, алертинг, восстановление после сбоев;
- собирать витрины для аналитики и датасеты для ai-сервисов;
- отвечать за качество данных: проверки на входе, контроль расхождений, понятная диагностика при инцидентах;
- оптимизировать запросы и модели данных, когда витрина перестаёт укладываться в sla;
-
мы строим корпоративную ai-платформу: интеллектуальный поиск по внутренним документам, аналитику операционных процессов, выявление аномалий в данных. всё это работает ровно настолько хорошо, насколько хорош слой данных под ним. ландшафт неоднородный, и мы говорим об этом сразу. источники живут в унаследованном контуре заказчика на huawei cloud stack - hive, spark, объектное хранилище, базы на oracle и postgresql. наш собственный контур современный: kubernetes, airflow, аналитическая субд, gpu-сегмент под инференс.
-
ваша задача - аккуратно вытащить данные из первого и качественно уложить во второй.
- 3 + года в роли data engineer или близкой - etl, dwh, backend с дата-уклоном;
- уверенный sql: оконные функции, планы выполнения, умение объяснить, почему запрос тормозит;
- postgresql на практике - индексы, блокировки, партиционирование;
- python на уровне промышленной разработки пайплайнов, а не разовых скриптов;
- airflow или другой оркестратор - dagster, prefect, аналог;
- опыт хотя бы с одной аналитической субд: clickhouse, greenplum, gaussdb(dws), vertica;
- понимание распределённого хранения: hdfs, hive-таблицы, движок вроде spark. конкретный дистрибутив не важен;
- docker: собрать образ, разобраться, почему контейнер падает;
-
будет плюсом знание: huawei cloud stack (mrs, gaussdb, obs); kafka и cdc (debezium); orac как источник; dbt; kubernetes; spark; prometheus и grafana; data quality и data contracts; подготовка данных для ml: обработка документов, векторные хранилища, эмбеддинги.
- работа в стабильной и динамичной компании;
- карьерный рост;
- социальный пакет по коллективному договору
- отпуск 28 дней;
- яркая корпоративная жизнь.
