Jakie dane są potrzebne do oceny zmian korelacji?
Bezpośrednia odpowiedź
Aby ocenić zmiany korelacji, potrzebujesz danych, które pozwolą Ci (1) zmierzyć zależność między dwoma szeregami czasowymi w czasie, (2) zweryfikować pochodzenie danych, (3) zapewnić porównywalność pomiarów w czasie oraz (4) sprawdzić, czy wynik nie jest artefaktem złego czyszczenia danych, braków w danych lub niestabilnych założeń.
Co najmniej zgromadź dwa szeregi, które chcesz ze sobą powiązać, znaczniki czasu i zasady próbkowania, transformację, którą zastosujesz (na przykład użycie stóp zwrotu zamiast surowych poziomów), oraz dokumentację jakości danych. Zaplanuj również kontrolę pochodzenia danych i kontrolę „trybów awarii” (czyli sposobów, w jakie wyniki mogą się załamać, gdy zmienią się dane lub warunki).
Mechanizm i definicja: co oznacza „zmiana korelacji”
Zmiana korelacji oznacza, że szacowana zależność statystyczna między dwiema zmiennymi nie jest stała w czasie. W praktyce szacujesz korelację w wielu oknach (na przykład krocząco lub według reżimów) i obserwujesz, jak zmienia się oszacowanie.
Dwa kluczowe wyjaśnienia pomogą Ci uniknąć nieporozumień:
- Stosuj odpowiednią skalę danych. Korelację zwykle oblicza się na przekształconych szeregach (najczęściej na zmianach w czasie). Używanie surowych szeregów cen/poziomów może prowadzić do mylących wniosków o zależności.
- Korelacja zależy od metody i okna. Różne częstotliwości próbkowania, długości okien i konwencje obliczeniowe mogą zmienić oszacowanie korelacji, nawet jeśli podstawowa zależność nie zmieniła się „fundamentalnie”.
Zatem Twoja lista „potrzebnych danych” to w rzeczywistości lista składników spójnego eksperymentu: sparowane szeregi czasowe, sposób przekształcenia ich w porównywalne liczby oraz sposób wyboru okien czasowych.
Dowody: jakie dane wejściowe zebrać (i jak zapewnić ich porównywalność)
Zgromadź następujące dane wejściowe i udokumentuj przyjęte założenia:
- Dwa szeregi czasowe do porównania
- Szereg A i szereg B, które chcesz przetestować pod kątem zależności.
- Dla każdego z nich podaj definicję pomiaru (co reprezentuje), jednostki oraz to, czy jest to cena średnia, cena ostatnia, kwotowanie czy inna wartość pochodna.
- Oś czasu i zasady próbkowania
- Znaczniki czasu rozpoczęcia i zakończenia.
- Częstotliwość próbkowania (np. co minutę, co godzinę, codziennie).
- Czy znaczniki czasu są wyrównane do tego samego zegara rynkowego oraz sposób obsługi luk.
- Transformacja do obliczeń
- Formuła zastosowana przed obliczeniem korelacji (na przykład użycie stóp zwrotu dla każdego interwału zamiast surowych poziomów).
- Sposób postępowania z brakującymi wartościami: pomijanie interwałów, wypełnianie w przód (forward-fill) lub usuwanie konkretnych punktów. Wybór ten może znacząco wpłynąć na oszacowania.
- Konfiguracja estymacji korelacji
- Podejście do okien: okno kroczące lub stałe podokresy.
- Długość okna i nakładanie się okien (nakładanie zmienia gładkość i zależność statystyczną między oszacowaniami).
- Rodzaj korelacji (najczęściej Pearson dla zależności liniowej; inny wybór mierzy zależność w odmienny sposób).
- Pochodzenie danych i dokumentacja
- Identyfikacja systemu źródłowego/dostawcy.
- Znane zdarzenia korporacyjne lub zasady rolowania kontraktów (jeśli mają zastosowanie).
- Identyfikatory plików/wersji oraz metoda pobrania.
- Wskaźniki jakości i dziennik czyszczenia danych
- Odsetek brakujących znaczników czasu dla każdego szeregu.
- Metoda wykrywania wartości odstających oraz to, czy wartości odstające są zachowywane, czy usuwane.
- Proste testy poprawności: czy występują nagłe skoki spowodowane resetami danych, a nie ruchami rynkowymi?
Jeden przykład roboczy (założenia muszą być jawne)
Załóżmy, że wybierasz dwa szeregi obserwowane z tą samą częstotliwością próbkowania i obliczasz korelację na zmianach interwałowych. Wybierasz stałą długość okna, a następnie przesuwasz je w czasie. „Zmiana” korelacji to po prostu różnica między oszacowaniami korelacji w dwóch sąsiednich oknach.
Aby wynik był interpretowalny, musisz określić:
- Co uważasz za zmianę interwałową.
- Jak obsługujesz brakujące znaczniki czasu.
- Że oba szeregi korzystały z tego samego harmonogramu próbkowania i transformacji. Jeśli te elementy nie są kontrolowane, zaobserwowane zmiany korelacji mogą odzwierciedlać różnice w przetwarzaniu danych, a nie rzeczywistą zmianę zależności.
Ograniczenia i ryzyka: typowe tryby awarii
Zmiany korelacji są szczególnie podatne na artefakty i niestabilność. Istotne ograniczenia obejmują:
- Niestacjonarność: korelacja nie jest gwarantowana jako stała; nawet przy doskonałych danych zależności mogą się zmieniać wraz ze zmianą warunków.
- Efekty próbkowania i okna: różne częstotliwości i rozmiary okien mogą prowadzić do różnych trajektorii korelacji.
- Problemy z jakością danych: brakujące dane, niezsynchronizowane znaczniki czasu lub przypadkowe mieszanie różnych instrumentów/definicji mogą przesunąć korelację.
- Wartości odstające i grube ogony: niewielka liczba ekstremalnych punktów może zdominować oszacowanie.
- Błędna interpretacja przyczynowości: zmiana korelacji nie dowodzi przyczyny.
- Koszty i realia wykonania (jeśli później przełożysz to na decyzje): oczekiwania oparte na korelacji mogą być zniekształcone, gdy zastosujemy rzeczywiste tarcia rynkowe.