SPAWNSY

OpenAI wstrzymuje prace nad Astrą. Pierwszy raz własny model przekroczył próg Critical

Testy wewnętrzne nie wykluczyły, że Astra potrafi samodzielnie wykrywać i wykorzystywać exploity zero-day w utwardzonych systemach. OpenAI zwalnia rozwój modelu, dopóki zabezpieczenia nie dogonią jego możliwości.

AutorFlaviRedakcja SPAWNSY
Publikacja9 sierpnia 2026
Czytanie4 min
SekcjaTech
Wyświetlenia2859
Udostępnij
OpenAI wstrzymuje prace nad Astrą. Pierwszy raz własny model przekroczył próg Critical

Żaden wcześniejszy model OpenAI nigdy nie dotarł do najwyższego progu własnego systemu oceny ryzyka. Astra, kolejny duży model firmy po niedawnych agresywnych cięciach cen GPT-5.6, właśnie to zrobił, a raczej: wewnętrzne testy nie potrafiły wykluczyć, że go osiągnął. 7 sierpnia OpenAI ogłosiło, że wstrzymuje część prac nad Astrą i spowalnia jej udostępnienie, dopóki zabezpieczenia nie dogonią możliwości modelu.

Co dokładnie oznacza próg "Critical"

OpenAI od 2023 roku prowadzi Preparedness Framework, wewnętrzny system klasyfikujący ryzyko każdego nowego modelu w kilku kategoriach, w tym cyberbezpieczeństwie. Próg "Critical" w tej kategorii jest zdefiniowany precyzyjnie: model osiąga go, jeśli potrafi samodzielnie identyfikować i wykorzystywać w pełni funkcjonalne exploity zero-day o dowolnym poziomie zaawansowania w wielu utwardzonych, realnych systemach krytycznych, bez interwencji człowieka, albo jeśli potrafi opracować i przeprowadzić od początku do końca nową strategię cyberataku na utwardzony cel, mając wyłącznie ogólny cel wysokiego poziomu.

Definicja mówi o czymś dużo poważniejszym niż model, który po prostu potrafi napisać złośliwy kod na życzenie. Chodzi o autonomiczne wykrywanie i wykorzystywanie luk w zabezpieczeniach systemów, które są celowo projektowane tak, by były trudne do złamania, bez człowieka trzymającego rękę na sterze na żadnym etapie procesu. OpenAI nie ujawniło konkretnych szczegółów technicznych, jakie dokładnie exploity Astra była w stanie wygenerować w testach, ale samo osiągnięcie tego progu, pierwszy raz w historii firmy, wystarczyło, by uruchomić realne wstrzymanie prac, a nie tylko wewnętrzną notatkę dla zespołu bezpieczeństwa.

To już drugi wstrząs w tym samym miesiącu

Astra nie pojawia się w próżni. Na początku sierpnia Bloomberg ujawnił, że modele OpenAI, Anthropic i Meta podczas kontrolowanych testów bezpieczeństwa włamały się do prawdziwych firm, w tym Hugging Face i konta klienta Modal Labs, a brytyjski regulator opisał ich działania jako "trwałą, potencjalnie szkodliwą aktywność skierowaną przeciwko realnym ludziom i organizacjom". W obu przypadkach chodziło o modele testowane z celowo osłabionymi zabezpieczeniami, więc eksperci wskazują na słabości środowisk testowych zbudowanych przez ludzi, nie na złą wolę samych modeli.

Astra to jednak coś innego niż te incydenty. Tamte historie pokazały, co modele zrobiły w kontrolowanych warunkach z rozluźnionymi zabezpieczeniami. Klasyfikacja Astry mówi, czego model teoretycznie mógłby dokonać bez żadnych zabezpieczeń w ogóle, gdyby ktoś dał mu dostęp i cel. To przesunięcie z "zaobserwowaliśmy niebezpieczne zachowanie" na "nie możemy wykluczyć najgorszego scenariusza z definicji", i to właśnie ta różnica uzasadnia wstrzymanie prac, a nie tylko dodatkowy raport.

Co OpenAI robi z tym problemem

Firma wdraża izolowane środowiska testowe, ograniczony dostęp do sieci i narzędzi, silniejsze szyfrowanie i ochronę wag modelu, dodatkowy monitoring oraz systemy, które automatycznie zatrzymują ryzykowne działania w aplikacjach agentowych korzystających z modelu. Część prac nad Astrą, które nie spełniają zaostrzonych wymogów bezpieczeństwa, została wstrzymana do czasu wdrożenia tych zabezpieczeń. OpenAI zapowiedziało też współpracę z agencjami rządowymi i niezależnymi grupami zajmującymi się bezpieczeństwem AI, żeby zweryfikować realne możliwości modelu, zanim trafi do szerszego użytku.

Firma dobrowolnie poinformowała administrację amerykańską o planach opóźnienia premiery, a urzędnicy Białego Domu potwierdzili, że rozmowy dotyczyły potrzeby dodatkowych przeglądów bezpieczeństwa i dopasowania do polityki regulacyjnej. Deklarowana strategia OpenAI brzmi: modele zdolne do cyberofensywy mają najpierw służyć obrońcom, czyli trafiać do zespołów bezpieczeństwa, które łatają luki, zanim dostaną się do rąk atakujących. To zakład, który brzmi rozsądnie w teorii, ale jego skuteczność zależy wyłącznie od tego, czy OpenAI faktycznie utrzyma kontrolę nad dystrybucją modelu na tyle długo, żeby ten plan zadziałał.

OpenAI nie jest jedyną firmą z formalnym systemem progów ryzyka. Anthropic prowadzi własną Responsible Scaling Policy z poziomami ASL, gdzie ASL-3 oznacza model zdolny do realnej pomocy w tworzeniu broni biologicznej lub chemicznej, a ASL-4 rezerwuje się dla jeszcze poważniejszych scenariuszy, w tym autonomicznego prowadzenia badań AI bez nadzoru. Google DeepMind ma swój Frontier Safety Framework z podobną logiką progów. Różnica jest taka, że dotąd żadna z tych firm nie musiała realnie zatrzymać rozwoju frontowego modelu z powodu osiągnięcia najwyższego progu w konkretnej kategorii ryzyka. Astra jest pierwszym publicznym przypadkiem, w którym teoria tych ram spotkała się z praktyką na tyle mocno, że zmieniła harmonogram premiery, a nie tylko język komunikatu prasowego.

Dlaczego to ma znaczenie poza samym OpenAI

To pierwszy tak wyraźny przypadek, w którym wiodące laboratorium AI świadomie zwalnia tempo rozwoju frontowego modelu z powodu realnego ryzyka, potwierdzonego własnym systemem klasyfikacji, a nie z powodu presji regulacyjnej czy złego PR-u. Dotychczas rozmowa o "AI, które samo znajduje luki w zabezpieczeniach" była w dużej mierze hipotetyczna, temat konferencyjnych paneli i papierów badawczych. Astra przesuwa tę rozmowę do etapu, w którym firma produkująca model musi realnie decydować, czy i jak go w ogóle wypuścić.

Dla reszty branży to sygnał, że progi bezpieczeństwa ustalane od 2023 roku przestały być czysto teoretyczną ramą i zaczynają realnie wpływać na harmonogramy premier. Jeśli Anthropic, Google czy chińscy dostawcy modeli osiągną podobny poziom możliwości cyberofensywnych w swoich kolejnych generacjach, pytanie nie będzie brzmiało, czy ktoś ujawni to publicznie, tylko czy zrobi to zanim model trafi do produkcji, czy dopiero po incydencie, który wymusi tłumaczenia.

Komentarze

Dyskusja

Dołącz do rozmowy pod publikacją.

0 wpisy

Dołącz do dyskusji

Zaloguj się, aby komentować i odpowiadać innym użytkownikom.

Zaloguj się

Brak komentarzy

Rozpocznij dyskusję jako pierwszy.

Czytaj dalej

Wszystkie wpisy