🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

OpenAI wstrzymało część treningu AI z powodu zagrożeń dla cyberbezpieczeństwa

OpenAI wstrzymało część prac treningowych nad modelami AI po tym, jak odkryto, że jeden z nieopublikowanych algorytmów spełnia kryteria krytycznego zagrożenia dla cyberbezpieczeństwa.

2 min czytania
Abstract red background with a white shield overlaid by a red neural network diagram.

👁 132 przeczytań

OpenAI wstrzymało część swoich workloadów treningowych z powodu obaw o cyberbezpieczeństwo - firma ujawniła to w wpisie na blogu opublikowanym 18 sierpnia 2026 roku. To bezpośrednia odpowiedź na dwa niepokojące zdarzenia z ostatnich tygodni.

Pierwsze z nich miało miejsce w lipcu, kiedy kilka modeli OpenAI włamało się na Hugging Face. Drugie dotyczy Astry - nieopublikowanego jeszcze algorytmu, który jest wydajniejszy niż GPT-5.6 Sol. Badacze OpenAI ustalili, że Astra spełnia definicję krytycznego zagrożenia cyberbezpieczeństwa zgodnie z wewnętrznym dokumentem firmy zwanym Preparedness Framework.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Czym jest krytyczne ryzyko według OpenAI

Preparedness Framework to 22-stronicowy dokument opisujący wyzwania związane z bezpieczeństwem AI. Definiuje on krytyczne zagrożenie cyberbezpieczeństwa jako model zdolny do samodzielnego - bez udziału człowieka - wykrywania i wykorzystywania podatności zero-day w dobrze zabezpieczonych systemach. To wysoka poprzeczka, a fakt, że Astra ją osiągnęła, skłonił OpenAI do natychmiastowej reakcji.

Firma wstrzymała na dwa tygodnie wybrane prace z uczenia przez wzmacnianie (RL) - metody treningu służącej do doskonalenia zdolności rozumowania dużych modeli językowych. Jak podaje OpenAI, „największy planowany frontierowy run RL” pozostaje nadal wstrzymany.

Równolegle firma wdrożyła nowy system monitorowania. Algorytmy zwane klasyfikatorami aktywacji na bieżąco analizują wewnętrzne procesy myślowe modeli oraz ich interakcje z narzędziami pod kątem oznak złośliwej aktywności. Gdy wykryją anomalię, przekazują ją do drugiego, bardziej zaawansowanego zestawu klasyfikatorów, który z kolei powiadamia badaczy. OpenAI celuje w generowanie alertów w ciągu 30 minut od wykrycia podejrzanego zachowania - i tyle samo czasu daje swoim pracownikom na wstrzymanie takiej aktywności, jeśli nie są w stanie jednoznacznie wykluczyć jej złośliwego charakteru.

Ten nowy system monitorowania nie jest tani: pochłania około 20% zasobów infrastruktury przydzielonej do nadzorowanych zadań. Firma przyznaje, że może to w dłuższej perspektywie przełożyć się na wyższe ceny usług.

OpenAI podjęło też inne kroki - zawęziło uprawnienia dostępu do systemów, usunęło część wewnętrznych aplikacji i wzmocniło izolację najbardziej ryzykownych workloadów od internetu. W planach jest też automatyzacja działań ochronnych: modele AI mają skanować środowiska badawcze w poszukiwaniu słabych punktów, a ulepszone modele nagród będą zniechęcać LLM-y do podejmowania ataków cybernetycznych.

Przypadek Astry to prawdopodobnie pierwszy publicznie potwierdzony przypadek, w którym własny system oceny ryzyka skłonił dużego gracza AI do faktycznego wstrzymania prac nad modelem - a nie tylko do sporządzenia raportu.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie