IQVIA ukarana 7,8 mln dolarów za niewystarczającą anonimizację danych zdrowotnych - Security Bez Tabu

IQVIA ukarana 7,8 mln dolarów za niewystarczającą anonimizację danych zdrowotnych

Cybersecurity news

Wprowadzenie do problemu / definicja

Anonimizacja danych medycznych należy do najbardziej wymagających obszarów ochrony prywatności i bezpieczeństwa informacji. Samo usunięcie imienia i nazwiska pacjenta nie oznacza jeszcze, że rekord przestaje mieć charakter danych osobowych. Jeżeli zestaw informacji nadal pozwala śledzić osobę w czasie lub ponownie ją zidentyfikować przy użyciu rozsądnie dostępnych środków, mamy do czynienia raczej z pseudonimizacją niż pełną anonimizacją.

Sprawa IQVIA pokazuje, że błędne zakwalifikowanie procesu deidentyfikacji może prowadzić nie tylko do naruszenia prywatności, ale również do poważnych konsekwencji regulacyjnych i operacyjnych. To istotny sygnał dla organizacji przetwarzających dane zdrowotne na potrzeby analiz, badań i usług komercyjnych.

W skrócie

Włoski organ ochrony danych osobowych nałożył na IQVIA karę w wysokości 7 mln euro, czyli około 7,8 mln dolarów, za nieprawidłowe przetwarzanie danych zdrowotnych. Postępowanie dotyczyło bazy obejmującej informacje o około 1 mln pacjentów, zasilanej danymi od 800 lekarzy podstawowej opieki zdrowotnej.

Regulator uznał, że zastosowane mechanizmy nie zapewniały skutecznej anonimizacji, ponieważ rekordy można było śledzić w czasie i potencjalnie ponownie identyfikować. Dodatkowo wskazano brak właściwej podstawy prawnej, niewystarczającą transparentność wobec pacjentów, problemy z retencją danych oraz obecność danych bezpośrednio identyfikujących w części zbioru. Firmie nakazano również dostosowanie praktyk do wymogów prawa w ciągu 120 dni.

Kontekst / historia

Postępowanie wobec włoskiego oddziału IQVIA było następstwem działań kontrolnych rozpoczętych w kwietniu 2025 roku. W centrum zainteresowania regulatora znalazł się sposób budowy i utrzymania hurtowni danych zawierającej informacje zdrowotne agregowane w ramach projektu opartego na danych z gabinetów lekarzy rodzinnych.

Sprawa wpisuje się w szerszy europejski trend zaostrzania oceny procesów deidentyfikacji danych medycznych. Organy nadzorcze coraz częściej podkreślają, że ryzyko reidentyfikacji należy oceniać nie tylko na poziomie pojedynczych pól, ale całego zbioru, jego szczegółowości, długości retencji i możliwości łączenia z innymi bazami danych. W praktyce oznacza to, że nawet rekordy określane przez organizację jako zanonimizowane mogą nadal podlegać rygorom ochrony danych osobowych.

Analiza techniczna

Sednem problemu było zastosowanie unikalnego kodu przypisanego do pacjenta zamiast klasycznych identyfikatorów, takich jak imię i nazwisko. Taki mechanizm może ograniczać ekspozycję danych, ale sam w sobie nie eliminuje ryzyka identyfikacji. Jeżeli ten sam znacznik występuje konsekwentnie w kolejnych rekordach, umożliwia budowanie długoterminowego profilu konkretnej osoby.

Według ustaleń regulatora rekordy zawierały szczegółowe dane i metadane, w tym między innymi rok urodzenia, płeć, diagnozy, objawy, recepty, badania, szczepienia oraz informacje lokalizacyjne. Taka kombinacja cech znacząco zwiększa ryzyko reidentyfikacji, zwłaszcza gdy podmiot dysponuje dodatkowymi źródłami referencyjnymi. W praktyce możliwe staje się dopasowanie wzorca leczenia, miejsca i czasu do konkretnego pacjenta.

  • Anonimizacja ma uniemożliwić identyfikację osoby w sposób nieodwracalny.
  • Pseudonimizacja zastępuje bezpośredni identyfikator innym znacznikiem, ale nadal pozwala wiązać rekordy ze sobą.

Dodatkowym problemem była obecność danych bezpośrednio identyfikujących w części zbioru. Dla około 3,3 tys. pacjentów miały znaleźć się między innymi nazwiska, numery identyfikacyjne, adresy i dane kontaktowe. Z technicznego punktu widzenia wskazuje to na poważny błąd w łańcuchu przetwarzania danych — na etapie ekstrakcji, transformacji albo walidacji przed załadowaniem do docelowej bazy.

Taki przypadek często świadczy o braku skutecznych mechanizmów DLP, niewystarczających reguł walidacji schematu, słabej segmentacji danych i braku automatycznych testów wykrywających pola jawnie identyfikujące. Regulator zwrócił również uwagę na brak jasno zdefiniowanych okresów retencji, przy czym w bazie miały znajdować się rekordy sięgające nawet 2001 roku. Tak długi okres przechowywania zwiększa powierzchnię ryzyka i potencjalny wpływ incydentu.

Konsekwencje / ryzyko

Najważniejszym skutkiem tej sprawy jest potwierdzenie, że organizacje operujące na danych zdrowotnych nie mogą utożsamiać pseudonimizacji z anonimizacją. To rozróżnienie ma bezpośrednie skutki prawne, architektoniczne i operacyjne.

Ryzyko dla pacjentów obejmuje ujawnienie wrażliwych informacji o stanie zdrowia, profilowanie historii leczenia, wtórne wykorzystanie danych bez wiedzy osoby, której dane dotyczą, oraz korelację z innymi bazami prowadzącą do ponownej identyfikacji.

Ryzyko dla organizacji obejmuje wysokie kary administracyjne, obowiązek szybkiego wdrożenia działań naprawczych, potencjalne spory cywilne i kontraktowe, utratę zaufania partnerów oraz konieczność przebudowy modeli analitycznych i procesów data governance.

Z perspektywy cyberbezpieczeństwa jest to również sygnał, że dane medyczne przetwarzane do celów analitycznych powinny być traktowane jak aktywa o wysokiej krytyczności, nawet jeśli formalnie opisano je jako anonimowe. Jeżeli istnieje możliwość odtworzenia tożsamości poprzez łączenie atrybutów, taki zbiór powinien podlegać ścisłej kontroli dostępu, audytowi, klasyfikacji i monitorowaniu.

Rekomendacje

Organizacje przetwarzające dane zdrowotne powinny wdrożyć zestaw środków technicznych i organizacyjnych ograniczających ryzyko podobnych naruszeń. Kluczowe znaczenie ma formalna ocena ryzyka reidentyfikacji przed uznaniem zbioru za anonimowy.

  • Przeprowadzać ocenę ryzyka reidentyfikacji z uwzględnieniem możliwości łączenia danych z innymi źródłami.
  • Stosować zasadę minimalizacji danych i ograniczać szczegółowość tam, gdzie nie jest niezbędna.
  • Wdrożyć wielowarstwowe kontrole jakości i bezpieczeństwa w pipeline ETL.
  • Automatycznie wykrywać pola PII i dane wrażliwe przed zapisaniem do hurtowni.
  • Regularnie przeglądać retencję i usuwać dane, które nie są już potrzebne.
  • Prowadzić niezależne testy reidentyfikacji, audyty uprawnień i przeglądy ścieżek eksportu danych.

W praktyce warto stosować podejście privacy by design, w którym decyzje dotyczące anonimizacji, pseudonimizacji, retencji oraz podstaw prawnych są integralną częścią projektu od samego początku. Pozwala to zmniejszyć ryzyko sytuacji, w której środowisko analityczne zostaje zbudowane szybciej niż mechanizmy ochronne.

Podsumowanie

Sprawa IQVIA stanowi ważne ostrzeżenie dla sektora health data, compliance i cyberbezpieczeństwa. Granica między anonimizacją a pseudonimizacją ma realne znaczenie praktyczne. Jeżeli rekord można śledzić w czasie, a zestaw cech pozwala na jego powiązanie z konkretną osobą, ryzyko reidentyfikacji pozostaje wysokie.

Dla zespołów bezpieczeństwa, ochrony prywatności i data engineering to wyraźny sygnał, że skuteczność ochrony danych musi być potwierdzana technicznie, a nie wyłącznie deklarowana w dokumentacji. Obejmuje to łączenie privacy engineering, kontroli retencji, walidacji ETL i rygorystycznego zarządzania danymi wrażliwymi.

Źródła

  1. IQVIA fined $7.8 million for failing to properly anonymize health data
  2. COMUNICATO STAMPA – Dati sanitari: il Garante privacy sanziona IQVIA per 7 milioni di euro
  3. Provvedimento del 23 settembre 2026 [10302112]
  4. Health data: fine of 5 million euros against IQVIA