Big Data Engineer
Grupa Kapitałowa Inter Cars
Big Data Engineer
Miejsce pracy: Warszawa
Technologie, których używamy
Wymagane
- Databricks
- Kafka
Twój zakres obowiązków
- Projektowanie i rozwój pipeline'ów batchowych i strumieniowych w Azure Databricks (PySpark, Structured Streaming, Delta Lake),
- Konsumowanie strumieni CDC (Debezium/Kafka) i ich materializacja w warstwach Lakehouse z zachowaniem poprawności (deduplikacja, kolejność zdarzeń, ponowne przetwarzanie),
- Integracja danych z relacyjnych baz danych (Oracle, SQL Server, PostgreSQL), API i systemów plikowych,
- Projektowanie struktur danych w architekturze Medallion (bronze / silver / gold) w Unity Catalog,
- Optymalizacja wydajności i kosztów przetwarzania (partycjonowanie, layout tabel, dobór klastrów),
- Monitoring pipeline'ów, alertowanie, diagnozowanie problemów z wydajnością, dostępnością i jakością danych,
- Opisywanie danych w katalogu OpenMetadata: własność, klasyfikacja, kontrakty danych, produkty danych,
- Utrzymanie kodu w GitLab z CI/CD (Databricks Asset Bundles), testy, code review,
- Współpraca z właścicielami systemów źródłowych, zespołami BI, Data Science i odbiorcami biznesowymi,
- Udział w kształtowaniu standardów technicznych platformy.
Nasze wymagania
- Praktyczne doświadczenie w Azure Databricks: joby, klastry, Delta Lake, Unity Catalog,
- Bardzo dobra znajomość Apache Spark i PySpark, w tym Spark Structured Streaming,
- Umiejętność diagnozowania i optymalizacji wydajności procesów Spark oraz layoutu tabel Delta (partycjonowanie, compaction, ewolucja schematu).
- Znajomość podstaw Apache Kafka: topics, partitions, consumer groups, offsets, Schema Registry, formaty Avro/JSON,
- Rozumienie mechanizmów Change Data Capture i replikacji zmian z relacyjnych baz danych,
- Umiejętność projektowania procesów idempotentnych, odpornych na duplikaty, zmianę kolejności i ponowne przetwarzanie zdarzeń.
- Bardzo dobra znajomość SQL i Pythona w kontekście przetwarzania danych,
- Doświadczenie w pracy z SQL Server i/lub Oracle,
- Znajomość architektury Lakehouse i wzorca Medallion,
- Rozumienie zagadnień jakości, kompletności i śledzenia pochodzenia danych (lineage).
- Git, CI/CD (GitLab CI, Azure DevOps lub podobne), testy jednostkowe i integracyjne procesów danych,
- Rozumienie modelu tożsamości i sekretów w Azure (Entra ID, Key Vault) w stopniu pozwalającym bezpiecznie budować rozwiązania.
Mile widziane
- Samodzielność w analizie złożonych problemów w rozproszonych systemach danych,
- Świadomość wpływu decyzji architektonicznych na wydajność, koszt, bezpieczeństwo i utrzymanie,
- Projektowanie rozwiązań z myślą o ich obserwowalności i późniejszym utrzymaniu,
- Jasna komunikacja i dokumentowanie decyzji technicznych - zarówno dla zespołów technicznych, jak i biznesu.
To oferujemy
- Stabilne warunki zatrudnienia i przyjazna atmosfera pracy.
- Pracę hybrydową z naszego biura, znajdującego się w Galerii Młociny.
- Możliwość rozwoju zawodowego w strukturach wewnętrznych.
- Możliwość skorzystania z benefitów pozapłacowych na preferencyjnych warunkach.
- Możliwość współpracy z zespołem ekspertów.
- Zniżkę pracowniczą na części samochodowe grupy Inter Cars.
- Szkolenia wewnętrzne i zewnętrzne rozwijające
Grupa Kapitałowa Inter Cars
Dołącz do zespołu budującego Operational Analytics Platform (OAP) – platformę danych Inter Cars działającą w przeszło 20 krajach Europy. Platforma składa się z trzech elementów: replikacji danych w czasie zbliżonym do rzeczywistego (Debezium → Kafka → Spark Structured Streaming), środowiska analitycznego Azure Databricks (Lakehouse, Unity Catalog) oraz katalogu danych OpenMetadata obejmującego całą grupę. Szukamy osoby, która będzie projektować i rozwijać pipeline'y danych na tej platformie – od strumieni CDC z systemów źródłowych, przez warstwy Lakehouse, po dane produktowe udostępniane zespołom biznesowym, BI i Data Science. Pracujemy w modelu hybrydowym: systemy źródłowe i Kafka on-premise, przetwarzanie i analityka w Azure.
Wszystkie informacje o przetwarzaniu danych osobowych w tej rekrutacji znajdziesz w formularzu aplikacyjnym, po kliknięciu w przycisk "Aplikuj Teraz".