Utwórz profil, aby pracodawcy mogli Cię znaleźć, otrzymywać lepiej dopasowane oferty pracy i szybciej aplikować.
  • Wyszukiwanie ofert pracy
  • Zapisane
  • Stwórz CV
    Nowe
  • Wynagrodzenia
  • Subskrypcje

Data Engineer

8000 - 12000 zł

MMD-TC CAPITAL LIMITED

Wymagane, Python, SQL, Docker, Git, ML

Mile widziane, C++, AirFlow, Dagster, PySpark, DevOps

System operacyjny, Linux

O projekcie, Budujemy systematyczne strategie oparte na ML dla akcji, kontraktów terminowych i danych makro. Szukamy osoby odpowiedzialnej za dane i infrastrukturę, która dostarcza je do trenowania modeli i do handlu na żywo.

Tak pracujemy, wewnątrz organizacji, rozwijasz kilka projektów jednocześnie, masz wpływ na wybór narzędzi i technologii, masz wpływ na rozwiązania technologiczne

Twój zakres obowiązków, Utrzymanie historii cen (bary 1m/1h/1d) dla ponad tysiąca instrumentów z kilku źródeł oraz porównywanie źródeł między sobą, Wykrywanie i naprawa błędów w cenach: splity i zmiany tickerów, dziwne bary, dziury, duplikaty, nieprawidłowe mnożniki, delisting, Budowa ciągłych serii kontraktów terminowych: wybór frontu, rolki, skalowanie cen, znaczniki rolki, Zarządzanie danymi makro i fundamentalnymi w wersji point-in-time z datą i godziną publikacji, Zapewnienie, że dane nie zawierają podglądu przyszłości: poprawne przypisanie publikacji do barów, strefy czasowe, kalendarze sesji i świąt, Projektowanie i utrzymanie magazynów cech (feature store), Zapewnienie zgodności danych między treningiem i handlem na żywo: te same producenty cech, ten sam kod łączenia, testy zgodności bit w bit, Wersjonowanie zbiorów treningowych: zamrożone migawki, odcisk danych i kodu w manifeście, pełna odtwarzalność wyników, Tworzenie potoków przygotowania danych dla treningu rozproszonego: pakowanie, wysyłka i kontrola kompletności paczek, Przyrostowe liczenie cech w trybie live i optymalizacja czasu tego procesu, Automatyczne bramki jakości przed treningiem i przed wdrożeniem modeli, monitoring świeżości danych, alerty, Utrzymanie i orkestracja cyklicznych zadań (cron, Dagster lub podobne), uzupełnianie luk po awariach źródeł, Dokumentowanie źródeł, zakresów dat i znanych ograniczeń każdej serii i każdej cechy

Bardzo dobry Python i pandas/NumPy: praca na dużych, niekompletnych szeregach czasowych, łączenie po czasie (as-of), resampling, strefy czasowe, Doświadczenie w budowie potoków danych dla modeli ML (przygotowanie cech, zbiory treningowe, zgodność trening/produkcja), Rozumienie danych rynkowych: OHLCV, splity i dywidendy, sesje giełdowe, kontrakty terminowe i rolki, Świadomość look-ahead bias i różnicy między datą wartości a datą publikacji, Dociekliwość i precyzja: każdą zmianę danych potwierdzasz liczbami, Linux, Git, SQL na poziomie praktycznym, Docker

Mile widziane, Doświadczenie z API dostawców danych (Databento, Polygon, FRED/ALFRED, IBKR, TradeStation), Obliczenia rozproszone (Ray, Dask lub Spark) i Kubernetes, MLflow lub inne narzędzia do śledzenia eksperymentów i wersjonowania modeli; XGBoost, Parquet, dane na dysku sieciowym (NFS), optymalizacja I/O dla dużych zbiorów, Znajomość danych makro (PKB, CPI, rewizje, pierwsze publikacje) lub danych COT/EIA/USDA, Podstawy statystyki szeregów czasowych (zmienność, GARCH, HMM), Doświadczenie w funduszu, prop tradingu lub zespole danych rynkowych

Tak pracujemy nad projektem, dokumentacja
Oferta pracy dodana 5 dni temu