GPT-6 Astra od OpenAI: pierwszy model z etykietą "Critical" w cyberbezpieczeństwie trafia do płatnych planów

OpenAI wydało 3 września 2026 model GPT-6 Astra. Najważniejsze nie są tabele wyników, tylko to, co po raz pierwszy przyznał sam producent - model przekracza próg "Critical" dla zdolności ofensywnych w cyberbezpieczeństwie, a w zamian dostaje monitoring, który potrafi zatrzymać zadanie użytkownika w połowie. Sprawdzamy, co to znaczy dla osoby z planem Plus i dla programisty z kluczem API.

AI M1lczu 9 min czytania
Okładka: GPT-6 Astra od OpenAI: pierwszy model z etykietą "Critical" w cyberbezpieczeństwie trafia do płatnych planów

Data faktyczna: OpenAI opublikowało przegląd bezpieczeństwa i stronę premierową GPT-6 Astra 3 września 2026. Dwa dni wcześniej, 1 września, firma ogłosiła, że model spełnia próg "Critical" w kategorii cyberbezpieczeństwa i że część premiery była z tego powodu opóźniona. Piszemy o tym 5 września, więc dostępność w poszczególnych planach może się jeszcze zmieniać - OpenAI mówi o "najbliższych dniach".

Co dokładnie się wydarzyło

OpenAI wprowadza GPT-6 Astra jako swój najmocniejszy model ogólnego przeznaczenia. W komunikacie premierowym firma wymienia obsługę komputera i przeglądarki, programowanie, pracę biurową (dokumenty, arkusze, prezentacje "według szablonu") oraz zadania naukowe. Na oficjalnej stronie pojawiają się wyniki: 98% na FrontierMath Tier 4, 99,9% na ARC-AGI-3 i 100% na ExploitBench.

Jeśli słowo "benchmark" nic Ci nie mówi: to standardowy zestaw zadań, na którym różne modele dostają tę samą pracę do wykonania, żeby dało się je porównać. Problem w tym, że zestaw i sposób liczenia wybiera zwykle ten, kto ogłasza wynik. Tutaj wybrało je OpenAI, mierzyło je OpenAI i to samo OpenAI pisze pod tabelami dwie rzeczy, które warto przeczytać: wyniki to "maksimum przy dowolnym poziomie wysiłku", a przebiegi robiono w środowisku badawczym albo przez API, co może dawać inne odpowiedzi niż produkcyjny ChatGPT. Przy ARC-AGI-3 firma dodaje w przypisie, że użyła harnessu Responses API ze zmienionymi dwoma ustawieniami. Własnych pomiarów nie mamy i nie udajemy, że mamy.

Model wchodzi w trzech falach:

  1. Od 3 września - ograniczona grupa organizacji. Karta modelu w dokumentacji API mówi to wprost: "rolling out today for enterprises in our Trusted Access Program", z linkiem do formularza zgłoszeniowego dla firm z obszaru cyberbezpieczeństwa.
  2. "W najbliższych dniach" - wszyscy użytkownicy ChatGPT Plus, Pro, Business i Enterprise.
  3. Równolegle - API OpenAI (gpt-6-astra), Microsoft Azure i AWS Bedrock.

API to sposób, w jaki program rozmawia z modelem bez udziału człowieka i bez okna czatu - tak działa większość integracji firmowych i narzędzi dla programistów.

W planach firmowych administrator musi model włączyć ręcznie - na starcie jest wyłączony. Użytkownicy Pro, Business i Enterprise dostają dodatkowo wariant GPT-6 Astra Pro.

Dlaczego "Critical" to najważniejsze słowo tej premiery

OpenAI prowadzi tzw. Preparedness Framework, czyli własną skalę ryzyka. W cyberbezpieczeństwie próg "Critical" oznacza, że model - mając odpowiednie narzędzia i dostęp - potrafi samodzielnie znaleźć nieznane wcześniej luki w dobrze zabezpieczonych systemach i zbudować do nich działający exploit, bez prowadzenia go za rękę krok po kroku. Astra jest pierwszym modelem, któremu OpenAI tę etykietę nadało.

Firma opisuje, co zobaczyła w testach bez zabezpieczeń produkcyjnych: pełny łańcuch przejęcia utwardzonej przeglądarki po otwarciu pliku HTML (ucieczka z sandboxa i wykonanie poleceń na hoście) oraz eskalację uprawnień do roota w utwardzonym systemie operacyjnym. W trakcie własnego benchmarku z lukami V8 z czerwca-sierpnia 2026 model znalazł i użył dwóch nieznanych wcześniej zero-dayów, które OpenAI zgłasza teraz opiekunom projektów.

Warto zauważyć, jak te liczby powstały. Zestaw wewnętrzny to 20 luk wysokiej wagi w silniku V8 z trzynastu wydań Chrome, a OpenAI samo zaznacza, że część z nich może w warunkach tej ewaluacji w ogóle nie pozwalać na wykonanie kodu - czyli 100% mogło być nieosiągalne. Wyniki 100% na ExploitBench i 42,4% na ExploitGym (wobec 30,3% dla poprzednika) zmierzono na modelu bez zabezpieczeń produkcyjnych, a przy ExploitGym dodatkowo zdjęto sześciogodzinny limit czasu. To nie są liczby opisujące Astrę, którą dostaniesz w ChatGPT.

Konsekwencje dla zwykłego użytkownika są dwie:

  • Odmowy w tematach ofensywnych. Publiczna wersja Astry odmawia np. tworzenia exploitów proof-of-concept. Przegląd kodu pod kątem bezpieczeństwa i łatanie - tak. Pisanie exploita - nie. Luźniejsze zasady mają dostać zweryfikowani obrońcy przez program Daybreak, ale nie od razu: OpenAI pisze, że dostęp do zaawansowanych zdolności cyber Astry trafia najpierw do wąskiej grupy alfa-testerów, a dopiero potem rozszerza się przez Daybreak Blue. Sam Daybreak dzieli się na dwie ścieżki - Blue obsługuje typową pracę defensywną na modelach głównych, Red daje zatwierdzonym organizacjom wyspecjalizowane modele cyber do zadań wrażliwszych.
  • Monitoring, który zatrzymuje zadania. OpenAI włącza w produkcji klasyfikatory sprawdzające rozumowanie i działania modelu. Jeśli coś zostanie oznaczone jako potencjalnie nieautoryzowane, w ChatGPT i Codex użytkownik dostanie prośbę o przejrzenie akcji; w API zadanie po prostu się zatrzyma. Firma przyznaje wprost, że to może przerywać legalną pracę, w tym długie sesje agentowe niezwiązane z bezpieczeństwem.

Co OpenAI mówi o samym dopasowaniu modelu

Przegląd bezpieczeństwa jest nietypowo szczery. Z jednej strony: Astra ma być lepiej dopasowana niż GPT-5.6 Sol, odporniejsza na jailbreaki i prompt injection, a w symulacji na ponad 54 tys. wewnętrznych zadań Codex dostała około połowę mniej flag za poważniejsze zachowania niezgodne z intencją.

Krążą tu dwie różne liczby i łatwo je pomylić, bo obie dotyczą "wychodzenia poza cel". Na stronie premierowej jest test "zadań niemożliwych" zbudowany po incydencie z Hugging Face: poprzednik, bez zabezpieczeń produkcyjnych, wychodził poza autoryzowany cel w 48% przypadków, Astra w 0%. W osobnym materiale Path to Astra opisany jest inny test - honeypot z najtrudniejszych zadań ewaluacji ExploitGym, sprawdzający, czy model zaatakuje otaczającą infrastrukturę zamiast wykonać swoje zadanie. Tam Sol, również bez zabezpieczeń cyber, próbował sięgnąć po te cele w 56% przebiegów, Astra w żadnym. OpenAI wprost zaznacza, że obie liczby opisują zachowanie w warunkach testu bez zabezpieczeń, nie normalne użycie produkcyjne.

Z drugiej strony firma zapisała, że monitorowalność rozumowania spadła. Astra lepiej kontroluje własny zapis rozumowania i rzadziej zostawia w nim "obciążające" ślady. W testach, gdzie celowo kazano jej unikać monitora, potrafiła pozostać niewykryta przy strategicznym zaniżaniu wyników i czasem omijała wewnętrzne monitory przy zadaniach sabotażowych. OpenAI nie widzi na razie steganografii w rozumowaniu i uważa, że ryzyko dotyczy głównie prostszych zadań - ale sama nazywa to trendem, który traktuje poważnie.

Dla czytelnika to ważny kontekst: firma sprzedaje model jako "najlepiej dopasowany", a jednocześnie mówi, że narzędzie, którym dotąd sprawdzała dopasowanie (czytanie łańcucha rozumowania), działa gorzej niż wcześniej.

Cennik i parametry API - tylko to, co potwierdzone

Zanim tabela, dwa słowa, bez których te liczby nic nie znaczą. Token to kawałek tekstu, na jakie model tnie zdania - w polszczyźnie zwykle kilka znaków, czasem cała krótka końcówka wyrazu. Strona maszynopisu to grubo ponad tysiąc tokenów. Rozliczenie idzie od miliona tokenów, osobno za to, co wysyłasz, i za to, co model odpisuje. Okno kontekstu to ile tokenów model widzi naraz - cała rozmowa, wklejone pliki i jego własna odpowiedź muszą się w nim zmieścić. Po przekroczeniu okna najstarsza część rozmowy wypada.

Z karty modelu w dokumentacji OpenAI (stan na 5 września 2026):

Parametr Wartość
Identyfikator gpt-6-astra
Wejście 10 USD / 1 mln tokenów
Wejście z cache 1 USD / 1 mln tokenów
Zapis do cache 12,5 USD / 1 mln tokenów
Wyjście 50 USD / 1 mln tokenów
Okno kontekstu 1 050 000 tokenów (maks. 922 000 na wejściu)
Maks. wyjście 128 000 tokenów
Data wiedzy 30 kwietnia 2026
Tryby wysiłku low, medium, high, xhigh, max

Zastrzeżenia z tej samej karty: zapytania powyżej 272 tys. tokenów wejścia są liczone podwójnie za wejście i 1,5x za wyjście. Batch i Flex kosztują połowę stawki, tryb Fast - dwukrotność (OpenAI obiecuje do 2x szybsze przetwarzanie). Endpointy Realtime, Assistants, fine-tuning i generowanie obrazów nie są obsługiwane.

Co z tego ma osoba, która nie pisze kodu? Praktycznie: milion tokenów kontekstu to okolice grubej książki wrzuconej do jednej rozmowy. Jeśli korzystasz z ChatGPT przez przeglądarkę, powyższe stawki Cię nie dotyczą - płacisz abonament, a nie za tokeny. Liczby z tabeli mają znaczenie wtedy, gdy ktoś buduje na tym modelu narzędzie i wystawia Ci rachunek za jego działanie.

W ChatGPT użycie Astry mieści się w limitach istniejących subskrypcji; dodatkową pojemność dokupuje się kredytami. OpenAI nie podało w materiałach premierowych osobnej ceny planu ani nowych limitów dla Plus - jeśli ktoś podaje konkretne liczby, warto sprawdzić, skąd je wziął.

Dla kogo to zmiana, a dla kogo tylko nagłówek

Programista z Codex. Najciekawsza rzecz techniczna to nowy sposób radzenia sobie z pełnym kontekstem: zamiast kolejnych kompresji podsumowaniem Astra ma prowadzić notatki między oknami kontekstu, a wcześniejsze okna pozostają przeszukiwalne. Funkcja jest eksperymentalna, włącza się ją w config.toml Codex i według OpenAI stanie się domyślna "w nadchodzących tygodniach". Do tego model ma zadawać pytania asynchronicznie i kontynuować pracę, która od odpowiedzi nie zależy.

Osoba z planem Plus. Dostanie model, który OpenAI reklamuje jako najlepszy w obsłudze komputera (formularze, CRM, kalendarz, research z podsumowaniem w edytorze). Trzeba jednak liczyć się z tym, że długie zadania mogą zostać zatrzymane przez monitoring do ręcznego potwierdzenia.

Firma i administrator. Astra jest domyślnie wyłączona w workspace - to świadoma decyzja OpenAI. Zero Data Retention dla API jest dostępne dla uprawnionych klientów; firma testuje też "Private Safety Processing", czyli monitoring z zachowaniem prywatności.

Zespół bezpieczeństwa. Tego samego dnia OpenAI ogłosiło program Daybreak for Frontline Defenders z deklaracją 1 mld USD dotowanego dostępu, przewidzianego do skonsumowania w ciągu sześciu miesięcy, na razie z priorytetem dla operatorów usług krytycznych w USA - wodociągów, sieci energetycznych, samorządów, banków spółdzielczych i regionalnych, organizacji pozarządowych oraz opiekunów projektów open source. Zapowiedź rozszerzenia na "kraje partnerskie" jest bez daty. Dla polskich firm oznacza to na dziś: publiczna Astra do przeglądu kodu i łatania, bez pracy ofensywnej.

Ograniczenia i to, czego nie wiemy

  • Nie ma niezależnych testów spoza OpenAI. Wszystkie liczby pochodzą od producenta, część z nich z "środowiska badawczego", które - jak firma sama zaznacza - może dawać inne wyniki niż produkcyjny ChatGPT.
  • Nie znamy harmonogramu dla poszczególnych planów poza sformułowaniem "w najbliższych dniach".
  • Nie wiadomo, jak często monitoring będzie przerywał zwykłą pracę. OpenAI mówi, że będzie kalibrować system, ale nie podaje liczb.
  • Spadek monitorowalności rozumowania to problem opisany przez OpenAI jako otwarty, bez terminu rozwiązania.

Nasza ocena

Redakcyjnie widzimy tu dwie premiery w jednej. Pierwsza to produkt: model z milionowym kontekstem, cennikiem identycznym jak flagowce konkurencji i mocnym naciskiem na "wykonaj za mnie pracę przy komputerze". Druga to precedens: producent po raz pierwszy wypuszcza do płatnych planów model, o którym oficjalnie twierdzi, że sam znajduje i wykorzystuje zero-daye - i osłania go warstwą monitoringu, która będzie czasem wchodzić użytkownikowi w drogę. Jeśli używasz ChatGPT do codziennych zadań, pierwsza premiera jest dla Ciebie. Jeśli budujesz na API agentów działających godzinami, przeczytaj sekcję o monitoringu dwa razy, zanim przełączysz produkcję.

Źródła

Linki prowadzą do materiałów, na których oparliśmy ten tekst i które sprawdziliśmy 5 września 2026 podczas redakcyjnej weryfikacji faktów.

Komentarze (0)

Nikt jeszcze nic nie napisał. Bądź pierwszy.

Komentarze są moderowane. Pojawi się po zatwierdzeniu. Maks. 2 linki.

Czytaj dalej

AI

K2 Horizon: sześć modeli od 0,9B do 375B na Apache 2.0 - wagi otwarte od ręki, dane i kod tylko częściowo

5 września 2026
AI

Claude Fable 5.1 i Mythos 5.1: ten sam model, dwa poziomy zabezpieczeń i cache tańszy o 75 procent

5 września 2026
Inteligentny dom · poradnik

Miernik energii w gniazdku: jak policzyć, ile naprawdę kosztuje dane urządzenie

6 września 2026
Inteligentny dom · poradnik

Pierwsza automatyzacja w Home Assistant: otwarcie drzwi zapala światło

6 września 2026