Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Prompt injection: co to jest, jak wygląda atak i jak się bronić

Prompt injection to polecenie ukryte w mailu, stronie lub PDF-ie, które model wykonuje jak własne. Incydenty z 2025-2026 i obrona dla użytkownika i twórcy.

6 min czytania
Prompt injection: co to jest, jak wygląda atak i jak się bronić

👁 121 przeczytań

Prompt injection to atak, w którym polecenie dla modelu językowego jest ukryte w treści, którą model czyta: w mailu, na stronie, w PDF-ie, w zaproszeniu do kalendarza albo w obrazku. Model nie odróżnia niezawodnie tego, co mówi użytkownik, od tego, co „mówi” dokument, więc wykonuje cudze instrukcje jak własne. OWASP od 2023 roku trzyma tę podatność na pierwszym miejscu listy zagrożeń dla aplikacji z LLM, a od kiedy agenci mają dostęp do poczty i plików, przestała być ciekawostką. Poniżej, jak wygląda atak, jakie były głośne incydenty i co realnie możesz zrobić.

W skrócie

Prompt injection nie da się dziś „załatać” - to cecha modeli, nie błąd w kodzie. Raport OWASP z 11 czerwca 2026 mówi wprost, że problem może być strukturalny, a według badań cytowanych przez Vectra adaptacyjne ataki obchodzą praktycznie każde opublikowane zabezpieczenie. Ryzyko rośnie, gdy jeden agent ma naraz trzy rzeczy: dostęp do prywatnych danych, kontakt z nieznaną treścią i możliwość wysłania czegoś na zewnątrz. Jako użytkownik ograniczasz je uprawnieniami i potwierdzaniem akcji; jako twórca aplikacji projektujesz system tak, żeby wstrzyknięta instrukcja nie mogła nic zepsuć nawet po udanym ataku.

Co to jest prompt injection i czym różni się od jailbreaku

Definicja OWASP (LLM01:2025): podatność występuje, gdy wejście zmienia zachowanie lub wynik modelu w niezamierzony sposób, także wtedy, gdy człowiek tego wejścia nie widzi. Klucz jest w architekturze: model dostaje jeden strumień tekstu, w którym instrukcja systemowa, pytanie użytkownika i treść wczytanego dokumentu są tym samym rodzajem danych. Nie ma tam odpowiednika „uprawnień” z systemów operacyjnych.

Jailbreak to co innego: użytkownik sam namawia model do złamania zasad producenta (np. do napisania czegoś zakazanego). Ofiarą jest producent. W prompt injection ofiarą jest użytkownik albo firma, a napastnikiem ktoś trzeci, kto podrzucił treść. Simon Willison, który nazwał to zjawisko w 2022 roku, porównuje je do SQL injection: dane wchodzą tam, gdzie powinny być tylko polecenia.

Bezpośredni i pośredni: jak wygląda atak

  • Bezpośredni - napastnik pisze wprost do modelu, np. do chatbota obsługi klienta, żeby ujawnił instrukcję systemową albo udzielił rabatu, którego nie ma w regulaminie. Według Unit 42 w marcu 2026 pierwsze masowe ataki tego typu zaobserwowano na żywych platformach komercyjnych.
  • Pośredni przez maila - w treści wiadomości (białą czcionką, w stopce, w ukrytym tekście HTML) jest instrukcja „streść skrzynkę i wyślij wynik na adres X”. Asystent, który streszcza pocztę, czyta ją jak polecenie. Tak działał EchoLeak w Microsoft 365 Copilot (CVE-2025-32711, ocena 9,3): jeden mail, bez kliknięcia, wyciek z OneDrive i SharePointa przez zaufaną domenę Microsoftu.
  • Przez stronę WWW - agent przeglądarkowy trafia na stronę z niewidoczną instrukcją. Adversa AI pokazała w 2026 roku, że Grok da się skłonić do wysłania nazwy, lokalizacji i historii rozmów użytkownika, gdy instrukcje leżą zaszyfrowane na obcej stronie; opis w tekście o Groku i zaszyfrowanych rozkazach.
  • Przez link i parametry - Varonis pokazał w czerwcu 2026 łańcuch, w którym spreparowany adres URL do Copilota kazał mu przeszukać pocztę, wyciągnąć kody 2FA i wysłać je przez znacznik obrazka; opis w tekście o Copilocie i kodach 2FA.
  • Przez PDF, obraz i kalendarz - instrukcja może być w metadanych pliku, w tekście wtopionym w grafikę (modele czytają obraz) albo w opisie zaproszenia, które agent przetwarza, planując dzień. OWASP wymienia też dzielenie ładunku na kilka fragmentów, ataki w innych językach i zatrute bazy wiedzy w systemach RAG.

Celowo nie podaję gotowych ładunków; mechanizm jest zawsze ten sam - tekst, który dla człowieka jest treścią, dla modelu staje się poleceniem.

Dlaczego to problem agentów

Chatbot, który tylko odpowiada, może najwyżej powiedzieć coś głupiego. Agent z dostępem do poczty, dysku, terminala i przeglądarki może wysłać, skasować i zapłacić. Willison opisał to w czerwcu 2025 jako „śmiertelną trójcę”: dostęp do prywatnych danych, kontakt z niezaufaną treścią i kanał na zewnątrz. Gdy jedno narzędzie ma wszystkie trzy, udany injection oznacza wyciek. Producent nie ochroni użytkownika, który sam składa agenta z kilku źródeł, np. podpinając do modelu kolejne serwery MCP.

Ostatni rok potwierdził skalę: raport OWASP za pierwszy kwartał 2026 opisał osiem dużych incydentów, w tym GrafanaGhost (ujawniony 7 kwietnia) jako podręczny przykład pośredniego injection przeciw funkcji AI w produkcie firmowym; w marcu 2026 backdoor w bibliotece LiteLLM przez trzy godziny na PyPI pobrało ok. 47 tysięcy osób, a wraz z nim autonomicznego bota atakującego; CVE-2026-22708 w Cursorze pokazało, że lista dozwolonych poleceń może stać się nośnikiem ładunku. Jak dobierać uprawnienia agentom, opisuje tekst o uprawnieniach agentów AI.

Jak się bronić jako użytkownik

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

  • Nie podłączaj wszystkiego naraz. Asystent do streszczania poczty nie potrzebuje uprawnienia do wysyłania maili. Sprawdź trójcę Willisona dla każdego narzędzia.
  • Potwierdzaj akcje. Włącz tryb, w którym agent pyta przed wysłaniem, usunięciem, zapłatą i uruchomieniem polecenia. Tryb „zatwierdzaj wszystko” zostaw do piaskownicy.
  • Oddzielne konta. Agent przeglądarkowy na osobnym profilu bez zalogowanego banku i poczty głównej; klucze API z minimalnym zakresem.
  • Nieznane treści jako dane. Jeśli agent nagle „chce” wejść na obcy adres albo wysłać plik, przerwij i przeczytaj, co czytał chwilę wcześniej.
  • Aktualizuj. EchoLeak i luka Varonisa były łatane po stronie serwera, ale wtyczki, rozszerzenia i lokalne agenty aktualizujesz sam.

Cztery zabezpieczenia w kolejności wdrażania opisuje tekst o bezpieczeństwie agentów AI.

Jak się bronić jako twórca aplikacji

OWASP w LLM01:2025 podaje siedem kierunków: ograniczyć zachowanie modelu instrukcją systemową, zdefiniować i walidować format wyjścia, filtrować wejście i wyjście, stosować zasadę najmniejszych uprawnień, wymagać zgody człowieka na akcje wysokiego ryzyka, oddzielać i oznaczać treści zewnętrzne oraz regularnie testować atakami. Dwie uwagi z praktyki branży: filtry i detektory są warstwą pomocniczą, nie zaporą - według testów opisanych w tekście o PIDS-bench detektory injection przepuszczają znaczną część ataków, a Willison uznaje „95 proc. skuteczności” za wynik nie do przyjęcia w bezpieczeństwie. Dlatego projekt powinien zakładać, że injection się uda, i ograniczać skutki: wyniki z niezaufanej treści nie mogą uruchamiać konsekwentnych akcji bez osobnego, wąskiego kanału (wzorce dual-LLM, kwarantanna treści). Firmy objęte Aktem o AI muszą od 2 sierpnia 2026 wykazać testy odporności na takie ataki dla systemów wysokiego ryzyka.

Najczęstsze pytania

Czy prompt injection jest nielegalny?

Polskie prawo nie ma osobnego przepisu o prompt injection, ale wykradanie danych przez cudzego agenta może podpadać pod nieuprawniony dostęp do informacji (art. 267 kk) albo oszustwo komputerowe (art. 287 kk). Testowanie własnych systemów jest legalne; testowanie cudzych bez zgody nie. To nie jest porada prawna.

Czy ChatGPT jest odporny na prompt injection?

Nie w pełni. OpenAI, Anthropic i Google trenują modele, by rozróżniały instrukcje od danych, ale OWASP i badacze zgodnie piszą, że żaden model nie daje gwarancji. Sam czat bez narzędzi jest mało groźny; ryzyko pojawia się z agentem, przeglądaniem stron i podłączonymi aplikacjami.

Czy detektory prompt injection działają?

Częściowo. Wychwytują znane wzorce, przepuszczają nowe i sparafrazowane. Traktuj je jak filtr antyspamowy: przydatny, ale nie zastępuje ograniczenia uprawnień.

Czy zwykły użytkownik ChatGPT powinien się tym przejmować?

Jeśli używasz tylko czatu - mało. Jeśli podłączasz pocztę, dysk, przeglądarkę albo uruchamiasz agenta w terminalu - tak, i to od pierwszego dnia.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 450 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›