Blog

Pseudonimizacja i ochrona danych · 24 marca 2026 · 6 min

Jedno przeoczone nazwisko: dlaczego suma detektorów bije ich część wspólną

Pojedynczy model wykrywający nazwiska zawsze coś przeoczy. Pytanie brzmi, co zrobić z tym przeoczeniem — a odpowiedź nie jest intuicyjna.

Autor: Adam Parszewski

Żaden pojedynczy model wykrywający nazwiska nie jest doskonały. Pytanie nie brzmi „czy coś przeoczy”, tylko „co zrobić, żeby przeoczenie jednego modelu nie stało się przeoczeniem całego systemu”.

Suma, nie część wspólna

Naturalna intuicja podpowiada, żeby ukrywać tylko te nazwiska, co do których zgadzają się wszystkie użyte modele — brzmi to jak ostrożniejsze podejście. W praktyce jest odwrotnie. Część wspólna wyrzuca dokładnie te nazwiska, które zauważył tylko jeden detektor, a to jest właśnie klasa przeoczeń, przez którą realne nazwisko zostaje czytelne w gotowym pliku. Rozwiązaniem jest suma: dokument ukrywa każdą wartość, którą znalazł którykolwiek z uruchomionych detektorów.

Cena sumy

Suma oznacza więcej fałszywych trafień — słów błędnie rozpoznanych jako nazwiska. To jednak wyraźnie tańszy błąd niż przeoczenie. Fałszywe trafienie to oznaczenie, którego w tekście nie musiało być. Przeoczenie to nazwisko, które zostaje czytelne tam, gdzie miało zniknąć.

Skład detektorów jako jawna konfiguracja

Zestaw uruchomionych modeli nie jest tym, co akurat jest zainstalowane na danej maszynie — jest jawnie zdefiniowany, a awaria któregokolwiek z wymienionych detektorów zatrzymuje przetwarzanie dokumentu, zamiast po cichu przejść dalej z krótszą sumą. Krótsza suma jest bowiem nie do odróżnienia od dokumentu z mniejszą liczbą nazwisk — nie da się z zewnątrz stwierdzić, czy detektor faktycznie nic nie znalazł, czy po prostu przestał działać.

Kto pilnuje samych detektorów

Pusta odpowiedź detektora — „nic nie znalazłem” — jest przyjmowana wyłącznie od modelu, który wcześniej na zdaniu kontrolnym udowodnił, że w ogóle jest w stanie coś znaleźć. Bez tego zabezpieczenia model, który po cichu przestał działać, wyglądałby identycznie jak model pracujący na czystym dokumencie.

Poznaj szczegóły procesu pseudonimizacji →

Powiązana usługa

Zajmujemy się tym na co dzień: pseudonimizacja akt

Jeśli temat z tego artykułu Cię dotyczy — sprawdź, jak dokładnie to działa.

Zobacz usługę: Pseudonimizacja akt