SPAWNSY
TechWyróżnione

Qwen3.8-Max ma już ceny i benchmarki. Alibaba nie powiedziała tylko, z czym dokładnie go porównała

Dwa tygodnie po zapowiedzi bez benchmarków i cennika, Qwen3.8-Max trafił do pełnej sprzedaży: 2 dolary za milion tokenów wejścia, 6 za wyjście, własna tabela wyników Alibaby. Jeden z porównań jest jednak zbudowany na słabszym modelu bazowym niż powinien być.

AutorFlaviRedakcja SPAWNSY
Publikacja3 sierpnia 2026
Czytanie6 min
SekcjaTech
Wyświetlenia2896
Udostępnij
Qwen3.8-Max ma już ceny i benchmarki. Alibaba nie powiedziała tylko, z czym dokładnie go porównała

Dwa tygodnie temu Qwen3.8-Max istniał tylko jako dwa wpisy na X i płatny endpoint podpisany kryptonimem "Kaleb". Bez karty modelu, bez raportu technicznego, bez jednej tabeli wyników. 3 sierpnia Alibaba wypuściła model naprawdę: pełny cennik API, konkretne limity i własną tabelę benchmarków wobec GPT-5.6 Sol, Claude Fable 5 i Claude Opus 4.8. Część z tych liczb wygląda dobrze dla Qwena. Jedna z nich jest zbudowana w sposób, który sztucznie zawyża postęp względem poprzednika.

Co się zmieniło od zapowiedzi z 19 lipca

Gdy pisaliśmy o pierwszej zapowiedzi Qwen3.8-Max, dwa dni po premierze Kimi K3 od Moonshot AI, lista niewiadomych była dłuższa niż lista faktów: brak liczby aktywnych parametrów, brak cennika, brak jednego opublikowanego wyniku benchmarku, a data premiery otwartych wag ograniczała się do plotki o "końcu lipca". Trzy sierpnia zamyka większość tych pytań naraz. Cennik jest jawny, model działa przez standardowe API, a Alibaba w końcu opublikowała tabelę porównawczą zamiast samych deklaracji o "drugim miejscu na świecie".

Nie zamyka jednak najważniejszego pytania sprzed dwóch tygodni: ile faktycznie kosztuje uruchomienie tego modelu u siebie. Bez liczby aktywnych parametrów per token nikt poza samą Alibabą nie policzy realnego kosztu inferencji, tylko cenę, jaką firma zdecydowała się za nią pobierać.

Wątek Moonshot AI też nie zniknął. Alibaba wciąż jest właścicielem około 36 procent spółki, której model, Kimi K3, sprowokował całą tę serię ogłoszeń. Premiera pełnej wersji Qwen3.8-Max nie jest już bezpośrednią odpowiedzią w czasie rzeczywistym, tak jak zapowiedź z 19 lipca, złożona dwa dni po Kimi K3. To już osobny etap: firma, która ma udziały w rywalu, wypuszcza własny produkt z pełnym cennikiem i realnymi liczbami, niezależnie od tego, co dzieje się po drugiej stronie tej samej struktury właścicielskiej.

Cennik, który faktycznie coś mówi

2 dolary za milion tokenów wejścia i 6 za milion wyjścia to jedna płaska stawka na cały milion tokenów kontekstu: wysłanie 5 tysięcy tokenów kosztuje tyle samo za token, co wysłanie 900 tysięcy. Do tego dochodzą tańsze warianty cache: 25 centów za milion tokenów odczytanych z pamięci podręcznej, 2,5 dolara za utworzenie jawnego cache i 17 centów za jego odczyt. Limity są wysokie jak na model tej klasy: 2 miliony tokenów na minutę i 15 tysięcy zapytań na minutę, co sugeruje, że Alibaba faktycznie chce, żeby ktoś budował na tym produkcyjne aplikacje, a nie tylko testował demo.

Model domyślnie działa w trybie rozumowania xhigh, a tokeny generowane w tym trybie liczą się jako tokeny wyjścia, czyli po droższej stawce. To szczegół łatwy do przeoczenia przy pierwszym rachunku za API.

Benchmarki: dobre wyniki tam, gdzie Alibaba wybrała pole bitwy

Na PaperBench i IFBench Qwen3.8-Max rzeczywiście prowadzi, i to wyraźnie, nie o ułamek punktu. Na Terminal-Bench 2.1 przegrywa z GPT-5.6 Sol, ale wyprzedza oba modele Anthropic. Poza tabelą sytuacja robi się mniej wygodna dla Alibaby: na SWE-bench Pro Qwen notuje 67,7 punktu wobec 80,0 dla Claude Fable 5, na FrontierSWE 73,5 wobec 88,8, a na Humanity's Last Exam model ląduje na ostatnim miejscu wśród czterech porównywanych flagowców, z wynikiem 43,6 wobec 53,3 dla Fable 5. Na GPQA Diamond wynik 92,6 to zaledwie ułamek punktu więcej niż 92,4 poprzedniej wersji, Qwen3.7-Max.

Wszystkie te liczby pochodzą z materiałów opublikowanych przez samą Alibabę. Żadna niezależna organizacja benchmarkowa, w tym Artificial Analysis, nie opublikowała jeszcze własnego pomiaru Qwen3.8-Max w chwili premiery. Dla porównania, poprzednik, Qwen3.7-Max, w niezależnym pomiarze Artificial Analysis Intelligence Index zaliczył wyraźny spadek między kolejnymi wersjami metodologii: 56,6 punktu w wersji 4.0 z maja, 46 w wersji 4.1 z lipca. To dobre przypomnienie, że sama metodologia pomiaru potrafi zmienić wynik bardziej niż kolejna wersja modelu, więc warto poczekać na niezależne liczby, zanim ktokolwiek ogłosi ostateczny ranking.

Rozkład wyników układa się w dość czytelny wzór: tam, gdzie liczy się precyzyjne trzymanie się złożonych instrukcji (IFBench) albo streszczanie i analiza długich dokumentów (PaperBench), Qwen3.8-Max rzeczywiście prowadzi z wyraźnym marginesem. Tam, gdzie liczy się autonomiczna praca na realnym kodzie przez dłuższy czas, czyli SWE-bench Pro i FrontierSWE, przewaga odwraca się na korzyść Claude Fable 5, i to nie o kilka punktów, tylko o kilkanaście. Dla kogoś, kto szuka modelu do agentowego programowania bez nadzoru, ta różnica ma większe znaczenie niż sam ogólny ranking.

Otwarte wagi: obietnica przesunięta o tydzień

W lipcu jedyną informacją o otwartych wagach była plotka o "końcu lipca", bez potwierdzenia ze strony Alibaby. Ta data już minęła, a firma teraz mówi o "przyszłym tygodniu" licząc od premiery 3 sierpnia, czyli realnie o połowie sierpnia. Zapowiedziane są dwa warianty: pełne 2,4 biliona parametrów, wymagające klastra wielowęzłowego (same wagi w precyzji 4-bitowej zajęłyby około 1,2 terabajta pamięci), oraz Qwen3.8-27B, pomyślany jako wersja możliwa do uruchomienia na pojedynczym serwerze z GPU. To druga zapowiedziana, a wciąż niedotrzymana data w historii tego modelu, co samo w sobie warto zapamiętać przy ocenie kolejnych obietnic Alibaby.

Werdykt SPAWNSY

Komentarze

Dyskusja

Dołącz do rozmowy pod publikacją.

0 wpisy

Dołącz do dyskusji

Zaloguj się, aby komentować i odpowiadać innym użytkownikom.

Zaloguj się

Brak komentarzy

Rozpocznij dyskusję jako pierwszy.

Czytaj dalej

Wszystkie wpisy