Zanim wkleisz umowę do czatu. Co realnie wysyłasz i jak to wyciąć
Najczęstszy wyciek danych do AI nie wygląda jak włamanie, tylko jak wklejenie dokumentu do okna rozmowy. Pokazuję, co w polskim tekście identyfikuje osobę wprost, jak to podmienić na etykiety i jak potem wstawić prawdziwe dane z powrotem do odpowiedzi.

👁 132 przeczytań
- Przed wysłaniem umowy do czatu należy podmienić każdy identyfikator na etykietę w nawiasie kwadratowym, a prawdziwe dane wstawić dopiero po otrzymaniu odpowiedzi od modelu.
- Narzędzie do anonimizacji wykrywa 17 typów danych, sprawdza sumy kontrolne i liczy wszystko w przeglądarce użytkownika, więc dokument nie trafia na żaden serwer.
- Automat nie wykryje danych identyfikujących przez kontekst - opis firmy z Wrocławia produkującej wagi kolejowe może wskazać konkretną osobę bez podania nazwiska.
Scena, którą widziałem u kilku znajomych prowadzących firmy, wygląda identycznie. Przychodzi umowa albo pismo, trzeba je zrozumieć albo streścić, więc ląduje w oknie czatu w całości. Razem z numerem PESEL, adresem, numerem konta i nazwiskami obu stron. Nikt nie robi tego złośliwie ani lekkomyślnie. Po prostu nikt nie zatrzymuje się na sekundę, żeby pomyśleć, co dokładnie właśnie wysłał na cudzy serwer.
Nie wszystkie dane są tak samo groźne
Warto rozdzielić dwie rzeczy. Pierwsza to identyfikatory, które same z siebie wskazują konkretnego człowieka: numer PESEL, seria i numer dowodu, numer rachunku bankowego, numer karty. Tu nie ma miejsca na interpretację, to jest ta klasa danych, przez którą wklejenie dokumentu robi się problemem, a nie zwykłą pomocą w pracy.
Druga to dane, które identyfikują pośrednio: nazwisko, adres, numer telefonu, nazwa firmy. Osobno bywają nieszkodliwe, razem układają się w komplet.
Dobra wiadomość dotyczy pierwszej grupy. Polskie identyfikatory mają sumy kontrolne, więc da się je wykryć pewnie, a nie na wyczucie. PESEL liczy się z wag przypisanych kolejnym cyfrom, numer NIP z innego zestawu wag i dzielenia z resztą przez jedenaście, numer rachunku ze standardu międzynarodowego i dzielenia przez dziewięćdziesiąt siedem, numer karty z algorytmu Luhna. Dzięki temu przypadkowy ciąg jedenastu cyfr w dokumencie nie zostanie uznany za PESEL, a prawdziwy PESEL nie prześlizgnie się niezauważony.
Podmiana zamiast rezygnacji
Rada w stylu „nie wklejaj wrażliwych dokumentów do AI” jest poprawna i kompletnie bezużyteczna, bo ludzie i tak je wklejają, tylko po cichu. Sensowniejsze jest podejście, w którym model dostaje dokument bez numerów.
Metoda jest prosta. Przed wysłaniem podmieniasz każdy identyfikator na etykietę w rodzaju kwadratowego nawiasu z nazwą typu i numerem porządkowym. Model dostaje tekst, w którym struktura zostaje nienaruszona, więc rozumie, że w tym miejscu jest numer PESEL, tylko nie wie który. Odpowiedź wraca z tymi samymi etykietami. Wtedy wstawiasz prawdziwe dane z powrotem, korzystając z mapy zamienników.
Dokładnie to robi narzędzie do anonimizacji. Wykrywa siedemnaście typów danych, sprawdza sumy kontrolne, buduje mapę i ma drugą zakładkę do odtworzenia odpowiedzi. Wszystko liczy się w Twojej przeglądarce, więc dokument nie trafia na mój serwer ani na niczyj inny. Mapę możesz pobrać do pliku, jeśli chcesz wrócić do sprawy następnego dnia.
Czego żaden automat nie wytnie
Tu muszę być uczciwy, bo to jest granica tej metody. Automat rozpoznaje wzorce. Nie rozpoznaje kontekstu.
Jeśli po anonimizacji w tekście zostaje zdanie o prezesie spółki z Wrocławia produkującej wagi kolejowe, to nazwisko nie jest już potrzebne, żeby ustalić, o kogo chodzi. Podobnie z opisem sprawy sądowej, datą zdarzenia i nazwą miejscowości. Żaden filtr tego nie złapie, bo to nie jest wzorzec, tylko wiedza o świecie.
Dlatego wynik zawsze warto przeczytać oczami, zanim się go wyśle. Traktuj podmianę jak wycięcie tego, co da się wyciąć mechanicznie, a nie jak certyfikat bezpieczeństwa.
Sprawdź też ustawienia własnego konta
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Ostatnia rzecz, o której warto pamiętać. To, czy Twoje rozmowy są wykorzystywane do dalszego rozwoju modelu, zależy od dostawcy, rodzaju konta i ustawień, a te potrafią się zmieniać. Nie będę tu podawał konkretów, bo szybciej się zdezaktualizują, niż zdążysz je przeczytać. Wejdź w ustawienia prywatności swojego konta i sprawdź to u siebie. Przy kontach firmowych warunki bywają inne niż przy zwykłych i akurat to jest argument, który przekonuje księgowość szybciej niż wykład o RODO.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →W firmie to nie jest decyzja jednej osoby
Jeśli pracujesz sam, wystarczy nawyk. Jeśli w firmie jest was kilkoro, nawyk jednej osoby nie zabezpiecza niczego, bo dokument wklei ten, kto akurat się spieszy. Z tego, co widzę u klientów, działa jedna kartka z trzema zdaniami: co wolno wklejać, czego nie wolno nigdy i co zrobić, kiedy ktoś nie jest pewien. Regulamin na dwadzieścia stron nie działa, bo nikt go nie czyta.
Warto do tej kartki dopisać dwie rzeczy, o których ludzie zapominają. Pierwsza: zrzut ekranu jest takim samym dokumentem jak plik tekstowy. Widziałem wklejone do czatu zrzuty z systemu księgowego razem z nazwiskami i kwotami, robione przez osoby, które nigdy nie wkleiłyby tego samego jako tekst. Druga: nazwy plików też bywają danymi. Plik nazwany nazwiskiem klienta i numerem sprawy mówi wystarczająco dużo, nawet jeśli w środku wszystko jest wyczyszczone.
Przy większych zespołach sensowniejsze bywa konto firmowe u dostawcy, bo warunki przetwarzania danych są tam zwykle inne niż przy kontach prywatnych. To jednak nie zwalnia z wycinania numerów. Warunki umowy zmniejszają ryzyko prawne, a nie techniczne.
Dokument bez numerów nadal da się streścić, wyjaśnić i przepisać. Z numerami zyskujesz dokładnie zero, a ryzykujesz sporo.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy wklejenie umowy z numerem PESEL do czatu AI jest bezpieczne?
Nie jest bezpieczne, bo dokument trafia na serwer dostawcy i może być wykorzystany do dalszego rozwoju modelu. Bezpieczniejsze jest podmienienie każdego identyfikatora na etykietę przed wysłaniem i przywrócenie danych dopiero po otrzymaniu odpowiedzi.
Jak działa anonimizacja dokumentu przed wysłaniem do AI?
Każdy identyfikator zastępuje się etykietą w nawiasie kwadratowym z nazwą typu i numerem porządkowym, a mapa zamienników pozwala później przywrócić prawdziwe dane. Model rozumie strukturę dokumentu, bo ona pozostaje nienaruszona, tylko nie zna konkretnych wartości.
Jak sprawdzić czy moje rozmowy z AI są używane do trenowania modelu?
Należy wejść w ustawienia prywatności własnego konta u danego dostawcy i sprawdzić to samodzielnie. Przy kontach firmowych warunki przetwarzania danych bywają inne niż przy kontach prywatnych.
Czy anonimizacja automatyczna w pełni zabezpiecza dokument przed identyfikacją?
Nie, bo automat rozpoznaje wzorce, a nie kontekst - zdanie opisujące prezesa spółki z konkretnej branży i miasta może wystarczyć do identyfikacji bez podania nazwiska. Wynik anonimizacji zawsze warto przeczytać oczami przed wysłaniem.



