Twoje dane w AI: co naprawdę trafia na serwery i jak to ograniczyć
Czy czaty trenują modele? Sprawdziłem polityki ChatGPT, Claude, Gemini, Copilota i DeepSeeka. Plus opt-out krok po kroku, RODO i kiedy ratuje lokalny model.
👁 113 przeczytań
- Każde z pięciu opisanych narzędzi domyślnie włącza trening na rozmowach użytkownika, a wyłączenie wymaga ręcznego opt-outu w ustawieniach.
- Anthropic zmienił politykę 28 sierpnia 2025: plany Free, Pro i Max mają trening domyślnie włączony, a przy jego zachowaniu dane mogą być przechowywane do pięciu lat.
- DeepSeek przechowuje dane na serwerach w Chinach, co skutkowało blokadą przez włoski Garante już 30 stycznia 2025 i wszczęciem postępowań w kolejnych krajach UE.
Wpisujesz w okienko czatu pytanie o umowę, wklejasz fragment kodu z firmowego repozytorium, prosisz o przeredagowanie maila do szefa. Naciskasz Enter. I tu zaczyna się pytanie, które większość z nas odkłada na potem: dokąd właściwie poleciał ten tekst, kto może go przeczytać i czy za pół roku wróci do mnie jako fragment odpowiedzi wygenerowanej komuś zupełnie obcemu?
Spędziłem ostatnie dni czytając aktualne polityki prywatności pięciu najpopularniejszych narzędzi. Nie streszczenia, nie poradniki sprzed roku - same dokumenty, plus najnowsze decyzje regulatorów. Bo to się zmienia szybko. Anthropic przestawił domyślne ustawienia jesienią 2025. GitHub Copilot zrobił to wiosną 2026. To, co było prawdą, gdy zakładałeś konto, dziś prawdą być nie musi.
Poniżej masz konkret: per narzędzie, co domyślnie trafia na serwery, gdzie kliknąć, żeby to ograniczyć, i kiedy żadne kliknięcie nie wystarczy.

Domyślnie znaczy: tak, używamy
Zacznijmy od mentalnego resetu. W większości darmowych i konsumenckich planów domyślnie jest zgoda na wykorzystanie Twoich rozmów do trenowania modeli. Opt-out istnieje, ale to Ty musisz po niego sięgnąć. Cisza oznacza zgodę.
ChatGPT (OpenAI)
Dla kont darmowych, Plus i Pro rozmowy domyślnie zasilają trening. Wyłączasz to w Ustawienia > Kontrola danych (Data Controls) > „Ulepszaj model dla wszystkich” (Improve the model for everyone). Przesuń suwak na wyłączony. OpenAI w centrum pomocy pisze wprost:
„By default, OpenAI may use content you provide to ChatGPT to improve our models. (…) once you opt out, new conversations won’t be used to train our models.”
Kluczowe słowo: new. To, co już trafiło do zakończonego treningu, jest nie do wyjęcia. Alternatywa na pojedyncze rozmowy to tryb tymczasowy (Temporary Chat) - nie zapisuje historii, nie tworzy pamięci, nie trenuje.
Jest też haczyk, o którym mało kto mówi: w sporze sądowym z New York Times sąd nakazał OpenAI zachowanie logów. Nakaz całościowy zniesiono jesienią 2025, ale dane zapisane w jego trakcie pozostają dostępne, a w styczniu 2026 sąd podtrzymał obowiązek wydania powodom próbki 20 milionów zanonimizowanych logów. „Usunięte” nie zawsze znaczy zniknięte.
Claude (Anthropic)
Tu nastąpiła najgłośniejsza zmiana. Do sierpnia 2025 Anthropic domyślnie nie trenował na rozmowach konsumenckich. 28 sierpnia 2025 odwrócił to: dla planów Free, Pro i Max trening jest włączony, chyba że się wypiszesz. Firma ujęła to tak:
„We will train new models using data from Free, Pro, and Max accounts when this setting is on.”
- Anthropic, Updates to Consumer Terms and Privacy Policy
I uwaga na retencję: jeśli zostawisz trening włączony, dane mogą być przechowywane do pięciu lat. Jeśli się wypiszesz, wraca dawne okno 30 dni. Wyłączasz w Ustawienia > Prywatność (Privacy Settings). Jest jeszcze zastrzeżenie z czerwca 2026: rozmowy oznaczone do przeglądu bezpieczeństwa mogą być użyte do treningu niezależnie od Twojej preferencji, a firma nie precyzuje, co taką flagę uruchamia.
Gemini (Google)
Domyślnie część rozmów może trafić do ludzkich recenzentów i posłużyć trenowaniu modeli. Wyłączasz to przez myactivity.google.com/product/gemini > karta „Aktywność w aplikacjach Gemini” (Gemini Apps Activity) > wyłącz. Po wyłączeniu przyszłe rozmowy nie idą do recenzji ani treningu, choć mogą być przechowywane krótko (do około 72 godzin) na potrzeby działania usługi.
Najbrutalniejszy szczegół: rozmowy, które ludzki recenzent zdążył już przeczytać, są trzymane do trzech lat na osobnej ścieżce i nie ma przycisku, żeby je skasować.
Copilot (Microsoft)
W konsumenckim Copilocie możesz wyłączyć trening, zachowując personalizację. W aplikacji mobilnej: ikona profilu > Konto > Prywatność > Trenowanie na aktywności w rozmowach (oraz osobno na rozmowach głosowych). To wyłącza wykorzystanie przyszłych rozmów do treningu.
Osobna sprawa to GitHub Copilot: od 24 kwietnia 2026 dane interakcji z planów Free i Pro są domyślnie używane do treningu, chyba że deweloper się wypisze. Jeśli kodujesz, sprawdź to ustawienie osobno.
DeepSeek
Tu nie ma niuansów - jest twardy fakt geograficzny. Polityka prywatności DeepSeeka mówi wprost:
„We store the information we collect in secure servers located in the People’s Republic of China.”
- DeepSeek Privacy Policy
Dane (prompty, pliki, dane konta, IP) lądują na serwerach w Chinach i mogą służyć trenowaniu modeli. Pod chińskim prawem wywiadowczym firma musi współpracować z żądaniami państwa. To dlatego włoski Garante już 30 stycznia 2025 zablokował przetwarzanie danych włoskich użytkowników, a kolejne kraje UE wszczęły postępowania. Mój wniosek jest prosty: do firmowych ani wrażliwych danych nie tykam DeepSeeka przez chmurę.
RODO: w UE masz mocniejsze karty
W Unii nie jesteś na łasce suwaka. RODO daje prawo dostępu, sprostowania, usunięcia i sprzeciwu wobec przetwarzania. Kluczowa zasada przy DeepSeeku: RODO ogranicza transfer danych obywateli UE do krajów bez odpowiednich gwarancji, a Chiny do takich nie należą. Stąd działania Garante.
Druga rzecz: rozróżnienie konto konsumenckie vs biznesowe. To nie kosmetyka. OpenAI deklaruje, że domyślnie nie trenuje na danych z ChatGPT Enterprise, Team, Edu oraz API, a do tego podpisuje umowę powierzenia (DPA) wspierającą zgodność z RODO. Anthropic wyłącza z nowych zasad treningowych Claude for Work, Government, Education i dostęp przez API. Innymi słowy: ta sama firma, dwa różne reżimy danych w zależności od tego, jakie konto masz.

Co realnie ryzykujesz, wklejając firmowe dane
Najczęstszy błąd to wkładanie do darmowego czatu rzeczy, których nie powiesiłbyś na tablicy ogłoszeń: danych osobowych klientów, fragmentów umów pod NDA, kluczy API, niepublikowanych wyników. Ryzyko jest potrójne. Po pierwsze, retencja - dane mogą żyć latami (Claude: do pięciu lat przy włączonym treningu). Po drugie, ludzki przegląd - realni recenzenci mogą zobaczyć fragmenty (Gemini). Po trzecie, ujawnienie sądowe - sprawa OpenAI pokazała, że logi bywają wydawane w postępowaniu, niezależnie od Twoich ustawień.
Jeśli przetwarzasz dane osobowe klientów przez konsumenckie konto bez DPA, to nie jest tylko ryzyko techniczne. To potencjalne naruszenie RODO, za które odpowiadasz Ty, nie dostawca.
Kiedy sensowny jest model lokalny
Jest jedna kategoria, w której żadna polityka prywatności nie jest potrzebna, bo dane fizycznie nie opuszczają komputera: model uruchomiony lokalnie. Ollama (wiersz poleceń, lekka, świetna do automatyzacji) i LM Studio (interfejs graficzny, prościej dla początkujących) pozwalają odpalić otwarte modele w stylu Llama czy Mistral na własnym sprzęcie. Połączenie sieciowe możesz odciąć całkowicie.
Kiedy to ma sens? Gdy pracujesz z danymi wrażliwymi (medyczne, prawne, NDA), gdy chcesz zerowej retencji u kogokolwiek, albo gdy po prostu nie ufasz chmurze. Cena: lokalne modele bywają słabsze od najlepszych modeli chmurowych i potrzebują przyzwoitego GPU lub sporo RAM. Dla wielu zadań - redakcja tekstu, streszczenia, klasyfikacja - są jednak całkowicie wystarczające, a Twoje dane zostają u Ciebie.
Ciekawostka: nawet sam DeepSeek można pobrać i odpalić lokalnie. Wersja chmurowa wysyła dane do Chin, wersja lokalna - donikąd. To dobra ilustracja zasady ogólnej: ryzykiem nie jest „model”, ryzykiem jest „czyj serwer”.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Minimalny zestaw na dziś
Gdybyś miał zrobić tylko cztery rzeczy: wyłącz trening w każdym narzędziu, którego używasz (ustawienia powyżej). Do wrażliwych rzeczy używaj trybu tymczasowego albo modelu lokalnego. Firmowych danych nie tykaj kontem konsumenckim bez DPA. I zapamiętaj najtrudniejszą prawdę z tego tekstu: opt-out działa na przyszłość, nie na przeszłość. Najlepszy moment, żeby kliknąć ten suwak, był wczoraj. Drugi najlepszy jest teraz.
Źródła
- OpenAI Help Center - How your data is used to improve model performance
- OpenAI Help Center - Data Controls FAQ
- OpenAI - Enterprise privacy
- Anthropic - Updates to Consumer Terms and Privacy Policy
- Google - Gemini Apps Activity i prywatność
- GitHub Blog - Updates to Copilot interaction data usage policy
- DeepSeek - Privacy Policy
- Ollama - lokalne uruchamianie modeli
- LM Studio
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jak wyłączyć trening modelu w ChatGPT?
Wyłączasz to w Ustawienia - Kontrola danych - "Ulepszaj model dla wszystkich" i przesuwasz suwak na wyłączony. Opt-out działa tylko na nowe rozmowy - dane już użyte w zakończonym treningu są nie do wyjęcia.
Czy dane wpisywane w Gemini trafiają do ludzkich recenzentów?
Tak, domyślnie część rozmów może trafić do ludzkich recenzentów i posłużyć trenowaniu modeli. Wyłączasz to przez myactivity.google.com/product/gemini, a rozmowy już przeczytane przez recenzenta są przechowywane do trzech lat bez możliwości ich skasowania.
Czy GitHub Copilot używa mojego kodu do trenowania modelu?
Od 24 kwietnia 2026 dane interakcji z planów Free i Pro są domyślnie używane do treningu, chyba że deweloper ręcznie się wypisze. To ustawienie jest osobne od konsumenckiego Copilota Microsoftu i trzeba je sprawdzić niezależnie.
Kiedy warto uruchomić model AI lokalnie zamiast korzystać z chmury?
Model lokalny ma sens, gdy pracujesz z danymi wrażliwymi - medycznymi, prawnymi lub objętymi NDA - bo dane fizycznie nie opuszczają komputera. Narzędzia takie jak Ollama i LM Studio pozwalają odpalić modele w stylu Llama czy Mistral na własnym sprzęcie, choć lokalne modele bywają słabsze od chmurowych i wymagają przyzwoitego GPU lub dużej ilości RAM.


