IQVIA ukarana za nieskuteczną anonimizację danych zdrowotnych pacjentów - Security Bez Tabu

IQVIA ukarana za nieskuteczną anonimizację danych zdrowotnych pacjentów

Cybersecurity news

Wprowadzenie do problemu / definicja

Anonimizacja danych medycznych ma uniemożliwić identyfikację konkretnej osoby nawet po połączeniu rekordu z innymi informacjami. W praktyce wiele organizacji myli jednak anonimizację z pseudonimizacją, czyli zastąpieniem bezpośrednich identyfikatorów kodem lub innym znacznikiem. Najnowsza sprawa dotycząca IQVIA pokazuje, że takie podejście może zostać zakwestionowane przez regulatora, jeśli pozostałe atrybuty nadal pozwalają na ustalenie tożsamości pacjenta.

W skrócie

Włoski organ ochrony danych nałożył na IQVIA karę 7 mln euro za niewłaściwe przetwarzanie danych zdrowotnych. Sprawa dotyczyła bazy obejmującej około miliona pacjentów, utworzonej na podstawie danych od 800 lekarzy podstawowej opieki zdrowotnej.

  • regulator uznał, że zastosowane mechanizmy nie zapewniały skutecznej anonimizacji,
  • dane mogły umożliwiać śledzenie pacjentów w czasie i ich ponowną identyfikację,
  • wskazano również braki w podstawie prawnej przetwarzania, informowaniu pacjentów oraz retencji danych,
  • dodatkowym problemem była obecność danych bezpośrednio identyfikujących dla części rekordów.

Kontekst / historia

Postępowanie wobec włoskiego oddziału IQVIA rozpoczęło się w kwietniu 2025 roku. Organ nadzorczy przeanalizował sposób gromadzenia i przetwarzania danych medycznych pochodzących od setek lekarzy, koncentrując się na tym, czy baza rzeczywiście zawierała dane anonimowe, czy jedynie pseudonimowe.

Według ustaleń regulatora zestaw danych obejmował szeroki zakres informacji, w tym rok urodzenia, płeć, diagnozy, objawy, recepty, badania, szczepienia oraz dane lokalizacyjne. Taki zbiór metadanych znacząco zwiększa ryzyko reidentyfikacji, zwłaszcza gdy rekordy są utrzymywane przez długi czas i mogą być zestawiane z innymi źródłami.

Sprawa wpisuje się w rosnącą presję regulacyjną wobec podmiotów zajmujących się analityką danych medycznych. Coraz wyraźniej widać, że zgodność formalna nie wystarcza, jeśli wdrożone zabezpieczenia nie zapewniają realnej ochrony prywatności.

Analiza techniczna

Kluczowy problem polegał na zastosowaniu unikalnych identyfikatorów przypisanych do pacjentów, które umożliwiały śledzenie ich historii medycznej w czasie. Z perspektywy analitycznej to rozwiązanie jest wygodne, ale z punktu widzenia prywatności oznacza utrzymanie trwałego odniesienia do tej samej osoby.

Jeżeli taki identyfikator zostanie połączony z zestawem quasi-identyfikatorów, takich jak dane demograficzne, kliniczne i geograficzne, ryzyko reidentyfikacji znacząco rośnie. Nawet bez imienia i nazwiska rekord może być unikalny w określonym regionie, placówce lub przedziale czasowym. To otwiera drogę do ataków opartych na korelacji danych, łączeniu zbiorów oraz inferencji statystycznej.

Dodatkowo regulator wskazał, że dla około 3300 pacjentów w bazie znajdowały się także dane bezpośrednio identyfikujące, w tym imiona i nazwiska, numery identyfikacji podatkowej, adresy i dane kontaktowe. Taka sytuacja podważa nie tylko skuteczność modelu prywatności, ale też wiarygodność klasyfikacji całego zbioru jako odpowiednio zabezpieczonego.

Osobnym problemem była retencja danych. W bazie miały znajdować się rekordy sięgające 2001 roku, co sugeruje brak skutecznego egzekwowania polityk przechowywania i usuwania informacji. Długi cykl życia danych zwiększa powierzchnię ryzyka i skalę potencjalnych skutków incydentu.

Konsekwencje / ryzyko

Dla organizacji przetwarzających dane medyczne decyzja ta stanowi istotny sygnał ostrzegawczy. Regulatorzy oceniają dziś nie tylko to, czy zastosowano techniki maskowania danych, ale także czy są one odporne na praktyczne scenariusze reidentyfikacji.

Ryzyko dla pacjentów obejmuje naruszenie prywatności, możliwość profilowania, dyskryminacji oraz nadużyć związanych z informacjami o stanie zdrowia. Szczególnie niebezpieczne są przypadki, w których dane kliniczne można połączyć z lokalizacją, historią leczenia i wieloletnią obserwacją.

Z perspektywy cyberbezpieczeństwa błędne oznaczenie zbioru jako anonimowego może prowadzić do wdrożenia słabszych kontroli bezpieczeństwa. W praktyce oznacza to mniejszy rygor w zakresie dostępu, monitoringu, audytu i zarządzania ryzykiem, co zwiększa prawdopodobieństwo ekspozycji danych.

Rekomendacje

Organizacje operujące na danych wrażliwych powinny jednoznacznie odróżniać anonimizację od pseudonimizacji. Jeżeli rekord może być śledzony w czasie dzięki stałemu identyfikatorowi, nie powinien być traktowany jako anonimowy.

  • przeprowadzać formalne oceny ryzyka reidentyfikacji przed uruchomieniem zbiorów analitycznych,
  • minimalizować zakres quasi-identyfikatorów do niezbędnego minimum,
  • stosować agregację, generalizację, perturbację i inne techniki ochrony prywatności tam, gdzie deklarowana jest anonimizacja,
  • weryfikować, czy w zbiorach wtórnych nie pozostają dane bezpośrednio identyfikujące,
  • definiować i egzekwować polityki retencji wraz z automatycznym usuwaniem lub archiwizacją,
  • utrzymywać rozdzielenie systemów źródłowych, analitycznych i badawczych,
  • prowadzić regularne audyty zgodności i testy skuteczności zabezpieczeń prywatności,
  • zapewnić właściwą podstawę prawną przetwarzania oraz przejrzystą komunikację z osobami, których dane dotyczą.

Podsumowanie

Sprawa IQVIA pokazuje, że zastąpienie nazwiska kodem nie wystarcza, jeśli pozostałe elementy rekordu nadal pozwalają na ustalenie tożsamości pacjenta. Dla sektora ochrony zdrowia i analityki danych to wyraźne przypomnienie, że skuteczna ochrona prywatności wymaga zarówno zgodności regulacyjnej, jak i technicznie odpornego modelu anonimizacji.

Źródła