xAI wypuściło 12 sierpnia Grok 4.6 i od razu ustawiło go w bezpośrednim starciu z GPT-5.6 Sol Max: taki sam wynik w niezależnym rankingu Artificial Analysis Intelligence Index, ale za jedną piątą ceny. Ten sam wynik, kilka razy mniejszy rachunek, to nie jest szczegół, na jaki OpenAI może po prostu nie zareagować.
Ten sam wynik, inna cena
Grok 4.6 zdobył 61 punktów w Artificial Analysis Intelligence Index, wyprzedzając popularny chiński model open-weight Kimi K3 i remisując z GPT-5.6 Sol Max. Wyżej w rankingu są tylko Claude Opus 5 i Claude Fable 5 od Anthropic. Cena zaczyna się od 2 dolarów za milion tokenów wejściowych i 6 dolarów za milion wyjściowych, a przy promptach powyżej 200 000 tokenów stawka rośnie do 4 i 12 dolarów za milion. To około jedna piąta tego, co za porównywalny wynik liczy sobie OpenAI za wyjście z GPT-5.6 Sol.
Model jest już dostępny w API xAI, w Grok Build, w Cursorze oraz przez OpenRouter, Vercel i Cloudflare, czyli dokładnie tam, gdzie deweloperzy realnie wybierają, którego modelu użyć w swoich narzędziach. Dostępność od pierwszego dnia w tylu miejscach naraz to sygnał, że xAI mierzy w ten sam segment klientów co OpenAI i Anthropic, nie tylko w konsumentów korzystających z aplikacji Grok.
Remis, który nie jest remisem
Ogólny wynik maskuje różnice, które w praktyce mają większe znaczenie niż jedna liczba na wykresie. Sol wygrywa wyraźnie w trudniejszych zadaniach inżynierskich: DeepSWE (73% wobec 65,9%) i Terminal-Bench (34,6% wobec 26%), czyli tam, gdzie liczy się rzeczywista praca z kodem i terminalem, nie tylko rozumienie polecenia. Grok z kolei wygrywa w pracy umysłowej typu profesjonalnego: GDPVal-AA, AA-Briefcase, a przede wszystkim w teście Harvey LAB, gdzie wynik Groka (15,8%) jest sześciokrotnie wyższy niż Sol (2,5%). To zadania symulujące pracę prawniczą, analizę dokumentów, wnioskowanie na podstawie długich, gęstych tekstów.
Taki rozkład wyników sugeruje, że oba modele trenowano z innym naciskiem: xAI postawiło mocniej na długie, złożone zadania agentowe i pracę z tekstem prawniczym czy biznesowym, OpenAI wciąż trzyma przewagę tam, gdzie trzeba faktycznie napisać i przetestować działający kod. Dla kogoś wybierającego model do konkretnego zastosowania to ważniejsza informacja niż sam wynik zbiorczy.
Co dokładnie oznacza "długo działający agent"
xAI opisuje Grok 4.6 jako model zbudowany z myślą o zadaniach rozciągniętych w czasie, a nie pojedynczych zapytaniach z natychmiastową odpowiedzią. W praktyce chodzi o scenariusze, w których model dostaje cel, sam planuje kroki, uruchamia narzędzia, sprawdza wyniki pośrednie i poprawia się po drodze, zamiast czekać na kolejną instrukcję po każdym kroku. To dokładnie ten sam kierunek, w którym idą Claude Code, Codex czy Gemini CLI: model przestaje być czatem, a zaczyna działać jak pracownik, któremu można zlecić zadanie na kilka godzin i wrócić po gotowy efekt.
Wysoki wynik w Harvey LAB pasuje do tej samej narracji. To benchmark symulujący realną pracę prawniczą, analizę wielostronicowych umów, wyszukiwanie precedensów, wnioskowanie na podstawie długich, gęstych dokumentów, czyli dokładnie ten typ zadania, gdzie liczy się wytrzymałość modelu na długim kontekście, a nie tylko błyskotliwość pojedynczej odpowiedzi. Sześciokrotna przewaga nad Sol w tym jednym teście sugeruje, że xAI świadomie inwestowało w tę konkretną niszę, zamiast próbować być najlepszym wszędzie naraz.
Dlaczego cena robi tu więcej niż benchmark
Remis w rankingu przy pięciokrotnie niższej cenie zmienia rachunek ekonomiczny dla każdego, kto buduje produkt na cudzym modelu, nie tylko testuje go w przeglądarce. Firma budująca agenta kodującego albo narzędzie do analizy dokumentów płaci za każdy token, a przy dużej skali różnica rzędu pięciu razy w cenie wyjścia potrafi zdecydować, który dostawca wygrywa kontrakt, niezależnie od tego, kto ma o punkt czy dwa lepszy wynik w jednym konkretnym teście.
xAI buduje Groka 4.6 z wyraźnym naciskiem na długo działających agentów oraz bardziej ambitną pracę interaktywną i wizualną, rozwijając to, co zaczęło się w Grok 4.5. To kierunek zgodny z tym, dokąd zmierza cała branża: modele coraz rzadziej ocenia się już tylko po tym, jak dobrze odpowiadają na pojedyncze pytanie, a coraz częściej po tym, jak radzą sobie z wieloetapowymi zadaniami rozłożonymi na wiele godzin pracy.
Dla użytkownika końcowego oznacza to prostą rzecz: jeśli budujesz coś na dużą skalę, wybór między Grokiem 4.6 a GPT-5.6 Sol Max przestaje być pytaniem "który jest mądrzejszy", a staje się pytaniem "które konkretne zadanie robisz i ile jesteś w stanie za nie zapłacić". Przy identycznym wyniku ogólnym to drugie pytanie zaczyna ważyć więcej niż pierwsze.





Komentarze
Dyskusja
Dołącz do rozmowy pod publikacją.
Dołącz do dyskusji
Zaloguj się, aby komentować i odpowiadać innym użytkownikom.
Zaloguj sięBrak komentarzy
Rozpocznij dyskusję jako pierwszy.