Newsy
Co słychać w robotyce i AI — wybór redakcji wujec.ai.
Najlepszym modelem do kodowania OpenAI nazywa maszynę z lutego — a ta nie wie nic, co powstało po sierpniu 2025
Dokumentacja OpenAI opisuje GPT-5.3-Codex jako „najlepszy jak dotąd model do agentowego kodowania". Model trafił do sprzedaży 24 lutego 2026 r. Pół roku później to zdanie wciąż obowiązuje, bo nic go nie zastąpiło: wyspecjalizowana linia Codex nie dostała od tego czasu żadnej nowej pozycji. Ogólna linia w tym samym czasie nie stała w miejscu. GPT-5.5 pojawił się 24 kwietnia, a trzyczęściowa rodzina GPT-5.6 — Sol, Terra i Luna — 9 lipca, przy czym firmowy opis GPT-5.6 Sol brzmi dziś „zacznij tu, gdy chodzi o złożone rozumowanie i kodowanie". Specjalista i model ogólny są więc kierowani do tej samej pracy. Różnica między nimi nie jest marketingowa. GPT-5.6 Sol ma okno kontekstu 1 050 000 tokenów wobec 400 000 u modelu Codex i granicę wiedzy z 16 lutego 2026 r. wobec 31 sierpnia 2025 r. W modelu do kodowania ta druga liczba waży więcej, niż się wydaje: granica z sierpnia 2025 r. oznacza, że narzędzie piszące wywołanie biblioteki nie widziało roku jej wydań, wycofanych funkcji i zmian łamiących zgodność. Starszy model broni się ceną. GPT-5.3-Codex kosztuje 1,75 dolara za milion tokenów wejściowych i 14 dolarów za milion wyjściowych wobec 4 i 20 dolarów u GPT-5.6 Sol — czyli nieco ponad połowę stawki wejściowej. Jest też z założenia węższy: linia Codex działa wyłącznie przez interfejs Responses, bez Chat Completions, bez trybu wsadowego i bez dostrajania. Zostaje wybór, którego OpenAI nigdzie nie przedstawia w jednym miejscu. Tani specjalista stoi w czasie, drogi model ogólny jest aktualny. W dokumentacji nie ma informacji, że linia Codex została zamknięta, nie ogłoszono też dla niej daty wyłączenia — i właśnie dlatego półroczna cisza zasługuje na odnotowanie, a nie na domysły. Liczby w tym artykule pochodzą z firmowych kart modeli i tabel cennika OpenAI, odczytanych 26 sierpnia 2026 r.; daty premier sprawdziliśmy dodatkowo w niezależnym rejestrze modeli, bo OpenAI swoich kart nie datuje.
Pobierany flagowiec Alibaby to nie ten sam model, który firma wynajmuje — karta modelu wymienia cztery braki
Qwen3.8-Max, model o 2,446 biliona parametrów, którego wagi Alibaba opublikowała 8 sierpnia, jest pierwszym modelem klasy Max wydanym przez tę firmę do pobrania. Prawie żadne omówienie nie wspomina jednak, że plik do pobrania i model wołany przez API to nie ten sam produkt — a różnicę opisuje sama Alibaba, w nocie u góry karty modelu. Nota mówi, że wersja z API jest „oparta na" opublikowanym punkcie kontrolnym i ma „więcej funkcji, takich jak wejście obrazu i tryb bez rozumowania, milion tokenów kontekstu domyślnie, oficjalne narzędzia wbudowane". Czytana jako lista braków pobieranej wersji, daje cztery pozycje: - **Brak obrazu.** Repozytorium zawiera architekturę wyłącznie tekstową (`qwen3_5_moe_text`, znacznik `text-generation`). Hostowany Qwen3.8-Max przyjmuje zdjęcia i wideo; pobierany nie. - **Nie da się wyłączyć rozumowania.** Otwarty punkt kontrolny zawsze rozumuje przed odpowiedzią — głębokość reguluje `reasoning_effort`, ale tryb bez rozumowania istnieje tylko w API. - **262 144 tokenów, nie milion.** Karta podaje to wprost: 262 144 natywnie, z możliwością rozszerzenia do 1 010 000. Wersja hostowana ma milion domyślnie; kto uruchamia model u siebie, musi okno rozciągnąć sam i przyjąć konsekwencje dla jakości. - **Brak narzędzi wbudowanych.** Wyszukiwanie w sieci, uruchamianie kodu i reszta hostowanego zestawu należą do usługi, nie do wag. Nic z tego nie jest ukrywane — to jeden akapit we własnej karcie Alibaby, i właśnie dlatego warto go powtórzyć: krążące wyniki Qwen3.8-Max (Terminal-Bench 2.1 86,6, SWE-bench Pro 67,7, DeepSWE 1.1 56,6) zmierzono na konfiguracji hostowanej, a wdrożenie u siebie startuje z węższej. Karta rozstrzyga też, czym ten model jest architektonicznie — materiały premierowe mówiły o tym ogólnikami. To hybryda: 92 warstwy ułożone jako 23 powtórzenia trzech bloków Gated DeltaNet i jednego bloku uwagi bramkowanej, więc pełnej uwagi używa tylko co czwarta warstwa, a pozostałe korzystają z uwagi liniowej. W mieszance ekspertów jest ich 512, z czego na token uruchamia się 10 wybieranych i 1 wspólny. To ten układ sprawia, że 2,4 biliona parametrów kosztuje przy pracy 95 miliardów na token — i Qwen zastosował go po raz pierwszy w modelu flagowym. Nasz profil modelu ma już wpisane natywne okno kontekstu, architekturę hybrydową i wyraźną adnotację, że opublikowane wagi są wyłącznie tekstowe.
Qwen3.8-Max →