SPAWNSY

Grok 4.7 z miesięcznym opóźnieniem: lepszy od 4.6 w każdym teście, ale wciąż za Fable 5.1

xAI wypuściło Grok 4.7 31 dni po pierwotnym terminie Muska: cena bez zmian, wynik w Terminal-Bench prawie dwukrotnie wyższy niż w 4.6. Tabela xAI pokazuje jednak, że Fable 5.1 wygrywa w czterech z siedmiu testów, a niezależny ranking daje Grokowi 46 punktów przy 53.

AutorTwenZyRedakcja SPAWNSY
Publikacja21 września 2026
Czytanie6 min
SekcjaTech
Wyświetlenia546
Udostępnij
Grok 4.7 z miesięcznym opóźnieniem: lepszy od 4.6 w każdym teście, ale wciąż za Fable 5.1

Grok 4.7 wyszedł 21 września, o 31 dni później, niż zapowiadał Elon Musk, i xAI nazywa go „zauważalną poprawą" względem Groka 4.6 przy tej samej cenie i prędkości. Liczby firmy to potwierdzają: w Terminal-Bench wynik wzrósł z 20,3% do 38,0%, a w każdym z siedmiu testów z tabeli xAI nowy model jest lepszy od poprzedniego. Ta sama tabela pokazuje jednak coś, o czym w komunikacie się nie mówi. Model, który 14 września Musk opisał jako „mniej więcej na poziomie Opusa 5.0, nie 5.1", nadal przegrywa z Claude Fable 5.1 w czterech z siedmiu testów, a niezależny ranking Artificial Analysis daje mu 46 punktów przy 53 dla Fable i GPT-6.

Co xAI faktycznie wypuściło

Grok 4.7 to według xAI (firma podpisuje się dziś jako SpaceXAI) większy model bazowy niż Grok 4.6, dotrenowany dłuższym uczeniem ze wzmocnieniem na trudniejszych zadaniach, ze szczególnym naciskiem na to, żeby sam sprawdzał własne wyniki. Cena zostaje bez zmian: 2 dolary za milion tokenów wejściowych i 6 dolarów za milion wyjściowych. Jest też szybszy wariant, dwa razy droższy i dwa razy szybszy w generowaniu. Model jest dostępny w API xAI, w Cursorze, w Grok Build, na zewnętrznych platformach do kodowania i przez routery modeli oraz usługi chmurowe.

Liczby parametrów xAI nie podało. Musk mówił w lipcu o modelu z 2,1 biliona parametrów, ale oficjalnej potwierdzającej informacji nie ma. Dwa dni po tym, jak 11 września powiedział, że 4.7 „potrzebuje jeszcze kilku dni", ogłosił Groka 4.8 z 2,5 biliona parametrów i bez daty premiery. Tydzień później 4.7 jednak wyszedł.

Tabela xAI: ile naprawdę jest w tej poprawie

Poprawa względem Groka 4.6 jest realna. Najwięcej dało wnioskowanie inżynierskie i praca w terminalu, a wszystkie siedem pozycji poszło w górę. Trzeba jednak czytać tę tabelę uważnie, bo xAI zestawia Groka 4.7 w trybie najwyższego wysiłku (xHigh) z Grokiem 4.6 w trybie High. Część skoku może więc wynikać z tego, że nowy model dostał więcej mocy obliczeniowej na odpowiedź.

* Wynik DeepSWE dla Groka 4.7 to według xAI rezultat w trybie High. Wszystkie liczby pochodzą z materiałów xAI.

Na tle GPT-5.6 Sol Max, z którym xAI porównywało poprzednika, Grok 4.7 wygrywa w pięciu z siedmiu testów, choć w Terminal-Bench przewaga to 0,7 punktu. Fable 5.1 jest wyraźnie mocniejszy tam, gdzie liczy się praca agenta w terminalu (57,9% wobec 38,0%) i w medycznym rozumowaniu. Grok wygrywa z nim w inżynierii elektrycznej i zadaniach prawniczych, a tę drugą niszę xAI nagłaśniało już przy Groku 4.6, o czym pisaliśmy w artykule o tamtej premierze.

Jedna uwaga o samej tabeli: otwiera ją CursorBench, czyli wewnętrzny zestaw testów firmy Cursor, którą SpaceX kupił w sierpniu, co opisywaliśmy przy konflikcie OpenAI z Cursorem. Grok 4.7 przegrywa w nim z Fable, więc nie wygląda to na test dobrany pod wynik, ale warto wiedzieć, kto go pisze.

Niezależny pomiar mówi mniej przyjemne rzeczy

W Artificial Analysis Intelligence Index (v4.3.2) Grok 4.7 zdobywa 46 punktów, a Claude Fable 5.1 i GPT-6 po 53. The Decoder, który opisał tę różnicę, zwraca uwagę, że luka rośnie w kodowaniu agentowym. W Terminal-Bench 4.0 cytowane przez ten serwis wyniki to 26% dla Groka 4.7, 55% dla Fable 5.1 i 60% dla GPT-6 Astra. Ta liczba różni się od 38,0% z tabeli xAI, prawdopodobnie przez inne ustawienia i tryb wysiłku, i pokazuje, jak bardzo wynik zależy od sposobu pomiaru.

W tabeli xAI nie ma ani GPT-6, ani Astry, chociaż OpenAI wypuściło ją 3 września i opisywaliśmy to w tekście o GPT-6 Astra. To najmocniejszy model OpenAI. Liczby w tabeli zgadzają się z oficjalną stroną xAI, ale porównanie ograniczone do Sol Max jest dla firmy wygodne.

Cena to jedyny argument, który nie wymaga zaufania

Z zestawienia xAI wynika prosty rachunek. Grok 4.7 kosztuje 2 i 6 dolarów za milion tokenów, GPT-5.6 Sol Max 4 i 20, a Fable 5.1 Max 10 i 50. Względem Fable to jedna piąta ceny wejścia i ponad ośmiokrotnie taniej na wyjściu. Kto uruchamia model tysiące razy dziennie w agencie albo w potoku analizy dokumentów, za takie różnice płaci realne pieniądze, i dlatego model o kilka punktów słabszy potrafi wygrać kontrakt.

Ma to swoje ograniczenie. Cena tokena to nie cena zadania: jeśli słabszy model potrzebuje więcej prób albo więcej tokenów na rozumowanie, oszczędność się kurczy. Tego xAI nie pokazuje, a niezależne pomiary kosztu całego zadania dla Groka 4.7 dopiero się pojawią.

Historia z terminami

Musk zapowiedział 24 lipca, że Grok 4.6 pojawi się za dwa tygodnie, a Grok 4.7 za cztery, czyli około 21 sierpnia. Wersja 4.6 wyszła 12 sierpnia, a 4.7 dopiero 21 września. Na początku września Musk mówił o około dziesięciu dniach. 11 września stwierdził, że model „potrzebuje jeszcze kilku dni", tłumacząc, że w treningu mógł nałożyć zbyt dużą karę za długość odpowiedzi, przez co model „poddawał się za wcześnie" w zadaniach, które dało się rozwiązać. 14 września ocenił, że 4.7 będzie „mniej więcej na poziomie Opusa 5.0, nie 5.1, w czymś lepszy, w czymś gorszy", a wielomodalność wymaga poprawy.

To zdanie z 14 września jest najlepszym punktem odniesienia dla premiery. Niezależny wynik 46 punktów przy 53 dla najlepszych modeli zgadza się z tym, jak sam Musk opisał swój model tydzień wcześniej.

Bezpieczeństwo: deklaracje xAI

xAI twierdzi, że Grok 4.7 to „najmocniejszy model, jaki testowaliśmy" pod względem odmów i odporności na jailbreaki, z wynikiem 62,4% w teście biobezpieczeństwa LatchBio i 3,3% ryzykownych promptów przepuszczonych w HackerBench v0.3. To dane firmy, bez niezależnej weryfikacji, więc traktujemy je jako zapowiedź do sprawdzenia.

Grok 4.7 to wyraźny krok naprzód względem 4.6 i nic więcej. Model prawie podwoił wynik w terminalu, poprawił inżynierię elektryczną i zadania prawnicze, a cena została bez zmian. Kto zbudował coś na Groku 4.6, ma dobry powód do aktualizacji.

Frontier to jednak nadal Fable 5.1 i GPT-6. Niezależny ranking daje Grokowi 4.7 46 punktów przy 53, luka w agentowym kodowaniu jest duża, a tabela xAI pomija najnowszy model OpenAI. Po miesiącu opóźnienia Musk sam ocenił model na poziomie Opusa 5.0. W naszej ocenie premiera wygląda na domknięcie długo przeciąganej obietnicy: model jest lepszy od 4.6, ale nie na tyle, żeby uzasadnić tyle miesięcy zapowiedzi.

Ma za to argument cenowy, z którym rywale nie mogą konkurować: pięciokrotnie niższą cenę wejścia niż Fable. Przy zadaniach, w których Grok wygrywa (inżynieria, dokumenty prawne, część kodowania), to wystarczy, żeby go wybrać. W pracy agentowej w terminalu i przy zadaniach, gdzie liczy się absolutna jakość, przewaga Anthropic i OpenAI jest za duża.

Rekomendacja: testuj Groka 4.7 na własnych zadaniach i własnym rachunku za tokeny, zamiast wierzyć jednej tabeli. Jeśli koszt jest twoim głównym ograniczeniem, to model wart zaufania. Jeśli chcesz najlepszy wynik za każdą cenę, kupujesz gdzie indziej.

Komentarze

Dyskusja

Dołącz do rozmowy pod publikacją.

0 wpisy

Dołącz do dyskusji

Zaloguj się, aby komentować i odpowiadać innym użytkownikom.

Zaloguj się

Brak komentarzy

Rozpocznij dyskusję jako pierwszy.

Czytaj dalej

Wszystkie wpisy