Newsy

Co słychać w robotyce i AI — wybór redakcji wujec.ai.

Premiery28.08.2026 · Z.AI Developer Documentation / Hugging Face

Z.ai otworzył wagi taniego modelu — flagowca obiecanego dwa tygodnie temu wciąż nie ma do pobrania

Z.ai opublikował GLM-5.3-Flash 26 sierpnia 2026 i w tym samym tygodniu wystawił jego wagi na Hugging Face, na czystej licencji MIT. Dwa tygodnie wcześniej firma wypuściła flagowy model GLM-5.3 z obietnicą, że wagi pojawią się mniej więcej po dwóch tygodniach. Termin właśnie minął, a repozytorium flagowca nie istnieje: najnowszym modelem Z.ai, który każdy może pobrać, jest ten tani. Ostatnim flagowcem z faktycznie opublikowanymi wagami pozostaje GLM-5.2 z czerwca 2026, liczący 753,3 miliarda parametrów. GLM-5.3-Flash jest od niego ponad dwukrotnie mniejszy — 320 miliardów parametrów, z czego 18 miliardów aktywnych na token, co potwierdza opublikowany indeks wag: 321,3 miliarda. Mniejszy model nie jest przy tym okrojoną wersją większego. Z.ai przedstawia go jako pierwszy model czołowej klasy z otwartymi wagami, który łączy uwagę rzadką z liniową, i podaje zysk w liczbach: obliczenia uwagi spadają 3,01 raza, a pamięć podręczna KV 4,44 raza wobec GLM-5.3. To również pierwszy natywnie multimodalny model rodziny, czyli taki, który potrafi obejrzeć wyrenderowany interfejs i poprawić własny kod, zamiast pisać go na ślepo. Architektura widać po cenie. GLM-5.3-Flash kosztuje katalogowo 0,15 dolara za milion tokenów wejścia i 0,50 dolara za milion wyjścia; GLM-5.3 kosztuje 1,40 i 4,40. To 9,3 raza taniej na wejściu i 8,8 raza taniej na wyjściu — blisko, ale jednak nie tyle, ile firma nazywa jedną dziesiątą ceny. Do 9 września 2026 obowiązuje promocja 50 procent, która na razie podwaja tę różnicę. Deklaracje o skuteczności pozostają wyłącznie po stronie producenta. Z.ai twierdzi, że model bije GLM-5.2 we wszystkich testach i zbliża się do Claude Opus 4.8 w zadaniach programistycznych i agentowych, ale wyniki publikuje tylko jako obrazek z wykresem, a żadne niezależne laboratorium ich nie powtórzyło. Zweryfikować można za to licencję: plik LICENSE w repozytorium to goły tekst MIT, bez dopisku o atrybucji i bez ograniczenia użytku komercyjnego.

GLM-5.3-Flash
Premiery26.08.2026 · OpenAI — developer documentation (model cards and pricing)

Najlepszym modelem do kodowania OpenAI nazywa maszynę z lutego — a ta nie wie nic, co powstało po sierpniu 2025

Dokumentacja OpenAI opisuje GPT-5.3-Codex jako „najlepszy jak dotąd model do agentowego kodowania". Model trafił do sprzedaży 24 lutego 2026 r. Pół roku później to zdanie wciąż obowiązuje, bo nic go nie zastąpiło: wyspecjalizowana linia Codex nie dostała od tego czasu żadnej nowej pozycji. Ogólna linia w tym samym czasie nie stała w miejscu. GPT-5.5 pojawił się 24 kwietnia, a trzyczęściowa rodzina GPT-5.6 — Sol, Terra i Luna — 9 lipca, przy czym firmowy opis GPT-5.6 Sol brzmi dziś „zacznij tu, gdy chodzi o złożone rozumowanie i kodowanie". Specjalista i model ogólny są więc kierowani do tej samej pracy. Różnica między nimi nie jest marketingowa. GPT-5.6 Sol ma okno kontekstu 1 050 000 tokenów wobec 400 000 u modelu Codex i granicę wiedzy z 16 lutego 2026 r. wobec 31 sierpnia 2025 r. W modelu do kodowania ta druga liczba waży więcej, niż się wydaje: granica z sierpnia 2025 r. oznacza, że narzędzie piszące wywołanie biblioteki nie widziało roku jej wydań, wycofanych funkcji i zmian łamiących zgodność. Starszy model broni się ceną. GPT-5.3-Codex kosztuje 1,75 dolara za milion tokenów wejściowych i 14 dolarów za milion wyjściowych wobec 4 i 20 dolarów u GPT-5.6 Sol — czyli nieco ponad połowę stawki wejściowej. Jest też z założenia węższy: linia Codex działa wyłącznie przez interfejs Responses, bez Chat Completions, bez trybu wsadowego i bez dostrajania. Zostaje wybór, którego OpenAI nigdzie nie przedstawia w jednym miejscu. Tani specjalista stoi w czasie, drogi model ogólny jest aktualny. W dokumentacji nie ma informacji, że linia Codex została zamknięta, nie ogłoszono też dla niej daty wyłączenia — i właśnie dlatego półroczna cisza zasługuje na odnotowanie, a nie na domysły. Liczby w tym artykule pochodzą z firmowych kart modeli i tabel cennika OpenAI, odczytanych 26 sierpnia 2026 r.; daty premier sprawdziliśmy dodatkowo w niezależnym rejestrze modeli, bo OpenAI swoich kart nie datuje.

Biznes24.08.2026 · OpenAI — cennik API i strona wycofań (developers.openai.com), stan na 24.08.2026

OpenAI wyłącza do 1 grudnia całą swoją linię obrazową — a razem z nią najtańszy model

Strona wycofań OpenAI wyznacza już termin końca dla każdego modelu obrazowego firmy poza jednym. gpt-image-1 gaśnie 23 października 2026 roku; gpt-image-1.5, gpt-image-1-mini i chatgpt-image-latest odchodzą 1 grudnia. Każdy z nich wskazuje tego samego następcę: gpt-image-2. Dla większości użytkowników to obniżka. W przeliczeniu na milion tokenów obrazu pochodzący z 2025 roku gpt-image-1 jest najdroższym modelem całej linii: 10 dolarów za wejście i 40 za wyjście. gpt-image-1.5 kosztuje 8 i 32 dolary. Model, który zostaje — gpt-image-2 — kosztuje 8 i 30 dolarów, czyli o 25% mniej na wyjściu niż model, który zastępuje. To odwrotność tego, co branża robiła w tym roku. Wyjątkiem jest jedyny model zbudowany dla tych, którzy liczą koszty. gpt-image-1-mini kosztuje 2,50 dolara za milion tokenów obrazu na wejściu i 8 dolarów na wyjściu. Nie ma własnego następcy: tabela migracji kieruje go również do gpt-image-2. To 3,2 razy drożej na wejściu i 3,75 razy drożej na wyjściu — dla kogoś, kto wybrał wersję mini właśnie dlatego, że była tania. Schemat zaczyna być rozpoznawalny. Tanie warianty ogłasza się jako próg wejścia, a potem po cichu wchłania do flagowca przy porządkowaniu linii — i rachunek za migrację dostają ci użytkownicy, którzy od początku najbardziej patrzyli na cenę. Cennik wsadowy dzieli wszystkie te kwoty na pół, ale dzieli tak samo stary model i nowy, więc proporcja się nie zmienia.

Biznes23.08.2026 · Mistral AI — cennik API i tabela wycofań w dokumentacji, komunikat premierowy Medium 3; zestawienie własne wujec.ai

Mistral gasi Medium 3 za osiem dni — wskazany przez niego następca kosztuje 3,75 raza więcej za token

31 sierpnia 2026 Mistral AI wyłącza dwa modele naraz: Mistral Medium 3 (nazwa w API mistral-medium-2505, premiera w maju 2025) i Mistral Medium 3.1 (mistral-medium-2508, sierpień 2025). Oba oznaczono jako przestarzałe 22 maja 2026 i oba kosztują 0,40 dolara za milion tokenów wejścia oraz 2,00 dolary za milion tokenów wyjścia. Dokumentacja producenta wskazuje dla nich jednego następcę: Mistral Medium 3.5. Ten następca figuruje w cenniku po 1,50 dolara za wejście i 7,50 dolara za wyjście. Mnożnik jest w obie strony taki sam — 3,75 raza. Zespół, który nie zmieni ani zapytań, ani wolumenów, ani linijki kodu, a jedynie pójdzie ścieżką migracji wydrukowaną we własnej tabeli Mistrala, zobaczy pierwszego września rachunek za tę linię modeli wyższy o 275%. Łatwo przeoczyć, że tańsze wyjście prowadzi w górę, a nie w bok. Mistral Large 3, większy i starszy model tej samej firmy z grudnia 2025, kosztuje 0,50 dolara za wejście i 1,50 dolara za wyjście — jedną trzecią ceny wejścia Medium 3.5 i jedną piątą ceny jego wyjścia. Na publicznym cenniku Mistrala porządek jest więc odwrócony: model średniej klasy jest tym drogim, a model stojący nad nim w nazewnictwie jest tańszy i od tego, nad którym stoi, i od tego, którego Medium 3.5 zastępuje. Niżej Mistral Small 4 chodzi po 0,15 i 0,60 dolara. To odwrócenie warto odnotować ze względu na to, jak Medium 3 sprzedawano. Mistral wprowadził go w maju 2025 pod nagłówkiem „Medium is the new large”, a cała argumentacja opierała się właściwie na cenie: około ośmiokrotnie taniej od porównywalnych modeli, wdrożenie już na czterech kartach graficznych, wynik na poziomie 90% Claude Sonnet 3.7 lub wyższy we własnych testach firmy. Piętnaście miesięcy później warstwa stworzona po to, by być tanią, jest w tym cenniku najdroższa za token. Nie znaczy to, że Medium 3.5 jest modelem słabym — jest nowszy i Mistral stawia go wyżej z tych dwóch. Ale nota migracyjna w dokumentacji mówi tylko „użyj Mistral Medium 3.5 do nowych integracji” i nie mówi nic o tym, ile to kosztuje. Kto nadal woła mistral-medium-2505 albo mistral-medium-2508, ma osiem dni na decyzję, czy właściwym celem jest wskazany następca, model większy, czy mniejszy.

Mistral Medium 3
Premiery22.08.2026 · xAI developer documentation (pricing, release notes, Batch API)

Nowy model wideo xAI kosztuje o 60% więcej za sekundę — i jako jedyny nie wchodzi do własnego trybu wsadowego

Dokumentacja deweloperska xAI wymienia dziś dwie generacje modelu wideo obok siebie, a różnica między nimi nie jest wyłącznie techniczna. Grok Imagine Video 1.5, którego pełen zestaw trybów ogłoszono 31 lipca 2026 roku, kosztuje 0,080 USD za sekundę wygenerowanego materiału. Model pierwszej generacji, grok-imagine-video, wciąż stoi w cenniku po 0,050 USD za sekundę — nowszy jest więc droższy o 60 procent. Za wyższą stawkę użytkownik dostaje natywne 1080p w trybach tekst-do-wideo i zdjęcie-do-wideo, zamiast renderu w niższej rozdzielczości powiększanego po fakcie, a do tego tryb referencyjny, w którym kilka obrazów podpowiada wygląd postaci lub przedmiotu, nie ustalając pierwszej klatki, oraz możliwość dołączenia do trzech gotowych głosów. Klipy trwają od jednej do piętnastu sekund; osobne punkty API przedłużają gotowe nagranie od ostatniej klatki albo je edytują, przy czym edycja jest ograniczona do 720p i około 8,7 sekundy. Mniej reklamowana część stoi w dokumentacji trybu wsadowego. Batch API xAI, które przetwarza duże wolumeny zapytań asynchronicznie i taniej, przyjmuje zlecenia obrazowe i wideo wyłącznie dla modeli pierwszej generacji: grok-imagine-image i grok-imagine-video. Oba modele generacji 1.5 — wideo oraz Grok Imagine Image 2.0 — są odsyłane komunikatem o braku obsługi przetwarzania wsadowego. Dla kogoś, kto generuje materiał hurtowo, nowszy model jest zatem droższy podwójnie: wyższa stawka za sekundę i brak dostępu do tańszej kolejki. Dokumentacja zdradza też, jak naprawdę działa w tym modelu generowanie z opisu. To nie jest jeden przebieg: producent pisze, że model najpierw tworzy z opisu pierwszą klatkę, a dopiero potem wprawia ją w ruch. Obraz pośredni nie wraca do użytkownika, choć całość jest jednym płatnym zapytaniem.

Grok Imagine Video 1.5
Biznes21.08.2026 · BytePlus ModelArk — cennik modeli (docs.byteplus.com), stan na 21.08.2026

Chmura ByteDance włączyła podwyżkę DeepSeeka — a starszą wersję tego samego modelu zostawiła po dawnej cenie

Podwyżka, którą BytePlus zapowiedział pięć dni temu, weszła w życie. Od północy czasu pekińskiego 21 sierpnia 2026 ModelArk liczy za model deepseek-v4-flash-ga-260731 0,44 USD za milion tokenów wejścia, 1,32 USD za milion tokenów wyjścia i 0,014 USD za trafienie w pamięć podręczną. Przetwarzanie wsadowe kosztuje dokładnie połowę: 0,22 i 0,66 USD. Komunikat przemilcza wiersz, który stoi bezpośrednio pod nim w tej samej tabeli. Kwietniowa wersja tego samego modelu, deepseek-v4-flash-260425, nadal jest w sprzedaży i jej stawek nikt nie ruszył: 0,14 USD za wejście, 0,28 USD za wyjście. To 3,1 raza taniej na wejściu i 4,7 raza taniej na wyjściu niż wersja, którą platforma dziś poleca. Tylko jedna liczba idzie w drugą stronę — wejście z pamięci podręcznej kosztuje w starszej wersji 0,028 USD, czyli dwa razy więcej niż w nowej. Po podwyżce ModelArk zrównał się z cennikiem samego DeepSeeka, ale tylko o określonej porze doby. Producent liczy 0,44 / 1,32 USD w godzinach szczytu (01–04 i 06–10 czasu UTC) i dokładnie połowę tego przez pozostałe osiemnaście godzin. ModelArk nie ma żadnej stawki zależnej od pory dnia. Rachunek można tam zmniejszyć o połowę wyłącznie przetwarzaniem wsadowym — ta sama zniżka 50%, tyle że płaci się za nią opóźnieniem, a nie zegarem. Parytet nie dotyczy jedynie mniejszego modelu. Sierpniowa, ostateczna wersja większego modelu, deepseek-v4-pro-ga-260813, figuruje w cenniku ModelArk po 1,32 USD za wejście i 3,96 USD za wyjście — znów co do centa stawka szczytowa producenta i znów bez odpowiednika taryfy nocnej.

DeepSeek-V4-Flash
Biznes20.08.2026 · OpenAI — karty modeli i strona wycofań (deprecations)

W API OpenAI zgasła każda numerowana wersja modelu z ChatGPT — to, co zostało, kosztuje cztery razy więcej

OpenAI od zawsze sprzedaje pod podobnymi nazwami dwie różne rzeczy: modele w swoim API oraz model, który naprawdę odpowiada w ChatGPT. Do tego drugiego prowadziła niewielka rodzina aliasów — chatgpt-4o-latest, później gpt-5-chat-latest i jego następcy. Od 10 sierpnia 2026 każdy z nich, który miał numer wersji, jest wyłączony. Kolejność jest krótka. chatgpt-4o-latest usunięto 17 lutego 2026. gpt-5-chat-latest i gpt-5.1-chat-latest wyłączono razem 23 lipca 2026 na podstawie ogłoszenia z 22 kwietnia. gpt-5.2-chat-latest i gpt-5.3-chat-latest poszły 10 sierpnia 2026, po wycofaniu ogłoszonym 8 maja. Za każdym razem OpenAI wskazywało jako następcę GPT-5.6 Sol — model z API, a nie czatowy. Została jedna pozycja o nazwie chat-latest, a sedno tkwi w zapisie na jej karcie: „wskazuje na najnowszy model Instant obecnie używany w ChatGPT”, a „migawka pod spodem będzie regularnie aktualizowana”. Nie ma numeru wersji, który dałoby się zablokować. Programista, który chce zachowania modelu z ChatGPT, wciąż może je mieć — ale nie zamrożone i bez gwarancji, że dzisiejsze odpowiedzi będą przypominać te za miesiąc. Cena poszła w tę samą stronę. gpt-5-chat-latest i gpt-5.1-chat-latest kosztowały 1,25 dolara za milion tokenów wejścia i 10 dolarów za milion wyjścia. Migawki 5.2 i 5.3 podniosły to do 1,75 i 14 dolarów. chat-latest jest wyceniony na 5 i 30 dolarów — czterokrotność ceny wejścia z pierwszych dwóch i dokładnie tyle, ile kosztuje flagowy GPT-5.6 Sol. Część tej różnicy to realna zdolność: okno urosło ze 128 000 tokenów do 400 000, a limit wyjścia z 16 384 do 128 000 tokenów, czyli ośmiokrotnie. Tyle że wersje, które dało się zablokować, były tymi tanimi — i to ich właśnie zabrakło. Za terminami stoi też reguła, którą producent publikuje. Jego zasady wycofań obiecują modelom ogólnodostępnym co najmniej sześć miesięcy wypowiedzenia, a wariantom specjalistycznym co najmniej trzy — i jako pierwszy przykład tych drugich podają „warianty czatowe, takie jak gpt-5.1-chat-latest”. Linia najbliższa produktowi konsumenckiemu ma więc najkrótszą gwarancję w całym katalogu. Przypis dla czytających dokumentację wprost: karta GPT-5.1 Chat nadal opisuje ten model jako migawkę aktualnie używaną w ChatGPT i zachęca do testowania na niej usprawnień czatu. Tabela wycofań to zdanie wyprzedziła. Warto też trzymać jedno rozróżnienie: skończył się alias w API, a nie obecność modelu w samym ChatGPT.

OpenAI Chat Latest
Biznes19.08.2026 · OpenAI — dokumentacja modeli i lista wycofań (platform.openai.com)

Ceny modeli głosowych OpenAI spadły przez 22 miesiące tylko raz — a tekst na wyjściu w tym czasie podrożał

OpenAI powiadomiło programistów, że dziewięć starszych modeli głosowych — cała linia GPT-4o audio i realtime oraz pierwsza generacja GPT-Audio i GPT-Realtime — przestanie odpowiadać 20 stycznia 2027 roku. Uzupełnienie naszego katalogu o cztery brakujące profile głosowych GPT-4o zebrało w jednym miejscu całą historię cen tej linii, a czyta się ją inaczej niż historię cen tekstu. Gdy 1 października 2024 roku ruszyły GPT-4o Audio i GPT-4o Realtime, token dźwiękowy kosztował 40 USD za milion na wejściu i 80 USD na wyjściu. W sierpniu 2025 następcy, GPT-Audio i GPT-Realtime, zeszli do 32 i 64 USD. Dzisiejsze modele ogólnie dostępne — gpt-audio-1.5 i gpt-realtime-2.1, czyli te, które OpenAI wskazuje w zawiadomieniu o wyłączeniu — liczą dokładnie te same 32 i 64 USD. To jedna obniżka, o 20%, w dwadzieścia dwa miesiące i nic więcej. Tekst w tych samych modelach poszedł w dwie strony naraz. W linii czasu rzeczywistego wejście stopniało z 5 do 4 USD za milion, a wejście z pamięci podręcznej runęło z 2,50 do 0,40 USD, czyli o 84%. Wyjście zdrożało: 20 USD w 2024 roku, dziś 24 USD — o jedną piątą więcej. Proporcja, która najbardziej obchodzi budujących produkty głosowe, nie drgnęła w ogóle. W październiku 2024 token dźwięku na wejściu kosztował osiem razy tyle co token tekstu; w sierpniu 2026, przy 32 USD wobec 4 USD, kosztuje dokładnie tyle samo razy więcej. Za te same pieniądze klient dostał za to miejsce. GPT-4o Realtime pamiętał 32 tysiące tokenów i odpowiadał najwyżej 4096; gpt-realtime-2.1 mieści 128 tysięcy i oddaje do 32 tysięcy — czterokrotnie większy kontekst i ośmiokrotnie dłuższa odpowiedź przy niezmienionej stawce za dźwięk. Tania półka mówi to samo od dołu: GPT-4o mini Realtime, udostępniony 17 grudnia 2024 roku, miał najkrótszą pamięć w rodzinie, 16 tysięcy tokenów. Jedno zastrzeżenie: to ceny katalogowe z kart modeli OpenAI, a nie to, co płaci konkretny klient, a tokenów dźwiękowych nie da się wprost porównywać z tekstowymi — sekunda mowy zużywa ich znacznie więcej niż sekunda czytania. Porównanie dotyczy wyłącznie OpenAI z samym sobą, jednej generacji głosowej z następną.

GPT-4o Realtime
Biznes19.08.2026 · DeepSeek — dokumentacja API (Models & Pricing)

Zegar DeepSeeka jest pekiński: ten sam dzień pracy kosztuje tam 75% więcej niż w San Francisco

Cennik DeepSeeka, obowiązujący od 16 sierpnia 2026, jest pierwszym u dużego dostawcy modeli, w którym godzina doby jest pełnoprawnym elementem taryfy, a nie promocją: szczyt to 01:00–04:00 i 06:00–10:00 czasu UTC, a wszystko poza nim kosztuje dokładnie połowę. Opublikowane okna nie mówią nic o tym, gdzie te godziny wypadają. Po przeliczeniu mówią bardzo dużo. Pekin trzyma UTC+8 przez cały rok, bez czasu letniego. Oba okna szczytu wypadają lokalnie na 09:00–12:00 i 14:00–18:00 — czyli w chińskich godzinach pracy. Przerwa między nimi, 04:00–06:00 UTC, to 12:00–14:00 w Pekinie: pora obiadowa, wyceniona po połowie stawki. Dokumentacja nigdzie nie opisuje taryfy w kategoriach geograficznych, ale jest ona obrysowana wokół dnia pracy jednego kraju. Ma to arytmetyczny skutek, którego nikt nie policzył. Weźmy zespół korzystający z DeepSeek-V4-Pro równomiernie przez dzień pracy 09:00–17:00 czasu lokalnego i wyceńmy milion tokenów wyjściowych (3,96 dolara w szczycie, 1,98 poza nim). W San Francisco dzień pracy przypada na 16:00–24:00 UTC i mija się z oboma oknami szczytu, więc każda godzina liczy się po 1,98 dolara. W Warszawie to 07:00–15:00 UTC, z czego trzy godziny są w szczycie: 2,72 dolara za milion, o 37,5% więcej niż w San Francisco. W Pekinie to 01:00–09:00 UTC, z czego w szczycie jest sześć godzin: 3,47 dolara za milion — o 75% więcej niż w San Francisco, za identyczną pracę na identycznych wagach. Bangalur wypada pośrodku: 3,09 dolara, czyli o 56% drożej. Europejskie rachunki ruszają się także wraz ze zmianą czasu. Zimą Warszawa przechodzi na UTC+1, w szczycie zostają tylko dwie godziny pracy, a ten sam milion tanieje do 2,48 dolara — dziewięcioprocentowa zniżka wynikająca wyłącznie z końca czasu letniego. Czego to nie dowodzi: DeepSeek nie liczy nikomu według miejsca. Taryfa jest na całym świecie identyczna i zależna od czasu, a firma przedstawia ją jako zarządzanie obciążeniem — okna szczytu to po prostu godziny, w których jej serwery są najbardziej zajęte, czyli te, w których pracuje jej rodzimy rynek. Zadania wsadowe i nocne może przesunąć w tanie godziny każdy i wszędzie, a w większości wdrożeń produkcyjnych dużo bardziej niż zegar liczy się wejście z pamięci podręcznej, rozliczane po pięćdziesiątej części stawki za brak trafienia. Powyższe liczby zakładają też użycie rozłożone równo na godziny pracy, czego żaden prawdziwy zespół nie robi dokładnie. Kierunek nie jest jednak artefaktem: im dalej dzień pracy użytkownika leży od pekińskiego, tym mniej kosztuje go podwyżka DeepSeeka.

DeepSeek-V4-Pro
Biznes19.08.2026 · AWS Price List API — Amazon Bedrock, us-east-1 (cennik z 13 sierpnia 2026)

Nowszy model głosowy Amazona słucha o 12% taniej — i pisze jedenaście razy drożej

Amazon nigdy nie opublikował porównania cen swoich dwóch modeli mowy, ale cennik Bedrocka robi to za każdego, kto przeczyta wszystkie cztery stawki, a nie tylko tę pierwszą. W cenniku regionu us-east-1 z 13 sierpnia 2026 Nova 2 Sonic kosztuje 3,00 dolara za milion tokenów mowy na wejściu i 12,00 dolarów za milion na wyjściu, wobec 3,40 i 13,60 dolara w pierwszym Nova Sonic. To obniżka o 11,8 procent po obu stronach dźwięku. Stawki za tekst poszły w przeciwną stronę i znacznie mocniej. Tekst na wejściu podrożał z 0,06 do 0,33 dolara za milion tokenów, czyli pięć i pół raza, a tekst na wyjściu z 0,24 do 2,75 dolara — jedenaście i pół raza. Oba modele liczą dźwięk i tekst osobno, więc rachunek za sesję zależy od tego, w jakich proporcjach się mieszają. Te proporcje mają wyliczalny próg opłacalności. Przesiadka na Nova 2 Sonic oszczędza 1,60 dolara na milionie tokenów mowy na wyjściu i dokłada 2,51 dolara na milionie tokenów tekstu na wyjściu. Nowszy model jest więc tańszy tylko dopóty, dopóki tekst na wyjściu nie przekroczy mniej więcej 64 procent objętości mowy. Model, który głównie mówi, pozostaje tani; taki, który dodatkowo zwraca transkrypcje, wywołania narzędzi i ustrukturyzowane odpowiedzi, przekracza tę granicę. Czego to nie dowodzi: nie zmierzyliśmy, jak każdy z tych modeli faktycznie dzieli tokeny w prawdziwej sesji, a Amazon takiego rozbicia nie publikuje, więc 64 procent to własność cennika, a nie wyrok na konkretne zastosowanie. Cenniki innych regionów niż us-east-1 mogą się różnić, a obie stawki mogą się zmienić bez zapowiedzi.

Amazon Nova 2 Sonic
Biznes19.08.2026 · Kimi API Platform — Model List (Moonshot AI)

Platforma Kimi kasuje 31 sierpnia siedem modeli — a flagowiec, na który odsyła, liczy trzy razy więcej za tokeny wyjścia

Moonshot AI wycofuje całą klasyczną linię modeli. Na liście modeli platformy Kimi wisi jedna nota: po premierze Kimi K3 model `kimi-k2.5` i seria `moonshot-v1` nie są już dostępne dla nowo rejestrowanych użytkowników, a pełne wygaszenie platformy nastąpi 31 sierpnia. Dotyczy to siedmiu identyfikatorów — moonshot-v1 w wariantach 8k, 32k i 128k, trzech odpowiadających im wersji vision-preview oraz Kimi K2.5, czyli modelu, który sama firma opisywała jako otwarty szczyt możliwości w zadaniach agentowych, kodzie i rozumieniu obrazu. Zostają cztery pozycje: K3, K2.7 Code, K2.7 Code Highspeed i K2.6. Koszt przesiadki widać na cennikach tej samej platformy. Największy z odchodzących modeli, moonshot-v1-128k, kosztuje 2,00 USD za milion tokenów wejścia i 5,00 USD za milion wyjścia, przy oknie kontekstu 131 072 tokenów. Kimi K3 kosztuje 3,00 USD za milion tokenów wejścia bez trafienia w pamięć podręczną, 0,30 USD z trafieniem i 15,00 USD za milion wyjścia — trzykrotność stawki za wyjście i półtorakrotność za wejście, za to przy oknie kontekstu ośmiokrotnie większym, wynoszącym 1 048 576 tokenów. Kto korzystał z najtańszego z wygaszanych modeli, moonshot-v1-8k za 0,20 i 2,00 USD, ma skok ostrzejszy: piętnastokrotny na wejściu i siedmioipółkrotny na wyjściu. Na odnotowanie zasługuje jednak tempo, które widać dopiero wtedy, gdy czyta się wszystkie daty z tej jednej strony naraz. Moonshot wyłączył kimi-thinking-preview 11 listopada 2025, kimi-latest 28 stycznia 2026, pięciomodelową serię kimi-k2 25 maja 2026, a teraz linię V1 i K2.5 — 31 sierpnia. Odstępy to 78, 117 i 98 dni: ten producent usuwa rodzinę modeli średnio co trzy miesiące. Furtką, której nie daje platforma zamknięta, jest uruchomienie modelu u siebie — wagi K3 są opublikowane na zmodyfikowanej licencji MIT z progiem komercyjnym, a K2.5 również wyszedł z otwartymi wagami, więc kogo stać na własny sprzęt, tego wyłączenie API nie dotyczy. Jedno zastrzeżenie co do daty: dokumentacja podaje sam dzień i miesiąc, bez roku. Nota jest sformułowana jako następstwo premiery K3, która odbyła się 16 lipca 2026, więc termin przypada na 31 sierpnia 2026 — za dwanaście dni. Osobnego komunikatu o wycofaniu Moonshot nie opublikował; daty żyją w tabeli wewnątrz dokumentacji dla programistów.

Kimi K3
Biznes18.08.2026 · OpenAI — cennik API i komunikat o trybie Ultrafast (obliczenia własne wujec.ai)

Drabinka cen flagowca OpenAI podwaja się na każdym szczeblu — a jedyny poziom z podaną prędkością to ten, którego nie da się kupić

Pięć dni po tym, jak OpenAI podało pierwszą w historii swojego API liczbę tokenów na sekundę — 750 tokenów wyjścia dla zapowiedzianego trybu Ultrafast w GPT-5.6 Sol — ten poziom wciąż nie ma ceny. Poziom, który cenę ma, wciąż nie ma prędkości. Te dwa fakty należą do siebie, a układ cennika OpenAI pokazuje rzecz ostrzej niż którykolwiek z komunikatów. OpenAI sprzedaje GPT-5.6 Sol na trzech płatnych poziomach obsługi i na własnej stronie cennika każdy z nich jest dokładnie dwukrotnością poprzedniego. Przetwarzanie Flex i wsadowe kosztuje 2,50 USD za milion tokenów wejścia i 15 USD za milion wyjścia. Standard kosztuje 5 i 30 USD. Tryb Fast kosztuje 10 i 60 USD. Podwojenie obowiązuje też w wierszach długiego kontekstu, które dotyczą zapytań powyżej progu 272 000 tokenów: 5 i 22,50 dla Flexa, 10 i 45 dla Standardu, 20 i 90 dla Fasta. Osiem liczb, cztery dokładne dwójki, bez zaokrągleń i bez wyjątków. Czego ta drabinka nie niesie, to choćby jedna prędkość. Tryb Fast ma 100% dopłaty ponad Standard, a OpenAI nigdy nie podało ani liczby tokenów na sekundę, ani wartości opóźnienia, ani procentu, które mówiłyby, co ta dopłata daje. Flex opisany jest wyłącznie jako „wolniejsze czasy odpowiedzi i okresowa niedostępność zasobów” — również bez żadnej liczby. Klient wybierający między szczeblami wybiera więc między cenami podanymi co do centa a prędkościami, których nie podano wcale. Ultrafast odwraca ten układ dokładnie. To pierwszy poziom obsługi, do którego OpenAI dołożyło liczbę przepustowości — „do 750 tokenów wyjścia na sekundę”, „do 14× szybciej niż przetwarzanie Standard” — i jedyny, który nie ma ceny; dostępny jest w ograniczonej zapowiedzi dla wybranej grupy klientów. Z tych dwóch liczb da się wyprowadzić punkt odniesienia, z zastrzeżeniem, które ma znaczenie. Jeżeli 750 tokenów na sekundę i mnożnik 14× opisują ten sam przebieg, przetwarzanie Standard generuje mniej więcej 54 tokeny wyjścia na sekundę. Byłaby to najbliższa opublikowanemu punktowi odniesienia wartość, jaką ten model ma. Ale obie liczby to pułapy opatrzone słowem „do”, a OpenAI nie twierdzi, że mierzono je w tym samym przebiegu — 54 jest więc wnioskiem z komunikatu, a nie liczbą ujawnioną przez firmę. Czego to NIE dowodzi: nic tutaj nie wskazuje, ile Ultrafast będzie kosztował, gdy dostanie cenę. Podwajanie na trzech istniejących szczeblach opisuje obecną listę, a nie zobowiązanie co do następnego, a cena z okresu zapowiedzi nie musi przetrwać do powszechnej dostępności.

GPT-5.6 Sol
Biznes15.08.2026 · DeepSeek — dokumentacja API (cennik)

Najtańsze laboratorium przestaje być tanie: DeepSeek podnosi ceny API od 16 sierpnia i zaczyna liczyć według zegara

DeepSeek opublikował nowy cennik modeli V4, obowiązujący od 16 sierpnia 2026. Firma, która zbudowała pozycję na tym, że była tańsza od wszystkich, podnosi stawki na całej linii — od 50 procent do ponad 1100 procent, zależnie od modelu, rodzaju tokenów i godziny. Liczby dla DeepSeek-V4-Flash: tokeny wyjściowe drożeją z 0,28 do 1,32 dolara za milion w godzinach szczytu, wejściowe bez trafienia w pamięć podręczną z 0,14 do 0,44, a wejściowe z pamięci podręcznej z 0,0028 do 0,014 dolara — pięciokrotnie. DeepSeek-V4-Pro idzie z 0,87 na 3,96 dolara za milion tokenów wyjściowych w szczycie, a jego wejście z pamięci podręcznej z około 0,0036 na 0,044 dolara za milion: to właśnie z tej jednej pozycji bierze się nagłówkowe 1100 procent, a nie ze stawki podstawowej. Równie ważna jak liczby jest zmiana konstrukcji cennika. Od niedzieli cena zależy od tego, o której wysyłamy zapytanie: szczyt to 01:00–04:00 i 06:00–10:00 czasu UTC, cała reszta doby jest poza szczytem i kosztuje dokładnie połowę. DeepSeek tłumaczy, że chodzi o „rozsądniejszy przydział zasobów" i przesunięcie obciążenia na mniej zatłoczone okna. W praktyce to pierwszy raz, gdy duży dostawca modeli robi z godziny doby pełnoprawny element cennika, a nie promocję. Uderzające jest wyczucie czasu. W tym samym tygodniu, w którym Anthropic odwołał zapowiedzianą 50-procentową podwyżkę Claude Sonnet 5, a Google wyznaczył datę końca obniżki Gemini 3.7 Flash, DeepSeek poszedł w przeciwną stronę — i dalej niż którykolwiek z nich. Wyjście V4-Flash poza szczytem, po 0,66 dolara za milion, wciąż jest tanie jak na zachodnie stawki, ale przewaga, która czyniła DeepSeeka oczywistym wyborem domyślnym, skurczyła się cztero-, pięciokrotnie. Oba modele V4 zachowują okno kontekstu miliona tokenów i maksymalnie 384 tys. tokenów odpowiedzi; bez zmian zostają też limity równoległych zapytań (2500 dla Flash, 500 dla Pro). Cenniki w obu profilach w katalogu zostały już zaktualizowane.

DeepSeek-V4-Flash
Biznes15.08.2026 · Anthropic — dokumentacja cenowa

Podwyżka o połowę odwołana: 2 i 10 dolarów za Claude Sonnet 5 zostaje ceną standardową

Na szesnaście dni przed terminem Anthropic odwołał podwyżkę, którą zaplanował dla Claude Sonnet 5. W dokumentacji cenowej firmy stoi teraz wprost, że stawka 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia — ogłoszona przy premierze jako cena wprowadzająca obowiązująca do 31 sierpnia 2026 roku — jest ceną standardową, a zapowiedziana na 1 września podwyżka do 3 i 15 USD nie wejdzie w życie. To odwrócenie stanu, o którym pisaliśmy 6 sierpnia, gdy ta sama dokumentacja niosła datę wygaśnięcia w przypisie. Rabat z odliczaniem stał się po prostu ceną. Sonnet 5 zachowuje swoje miejsce w drabinie Anthropic — Fable 5 kosztuje 10 / 50 USD, Opus 5 — 5 / 25 USD, Sonnet 5 — 2 / 10 USD, a Haiku 4.5 — 1 / 5 USD — ale przestał być jedynym aktualnym modelem Claude sprzedawanym poniżej własnego cennika. Jedno zastrzeżenie z tamtego tekstu pozostaje w mocy, bo nigdy nie dotyczyło cennika. Sonnet 5 korzysta z tokenizera wprowadzonego wraz z Opus 4.7, a według własnej noty Anthropic ten sam tekst daje na nim mniej więcej o 30% więcej tokenów niż na poprzedniej generacji; Sonnet 4.6 i starsze modele używają tokenizera starszego. Na papierze Sonnet 5 jest o jedną trzecią tańszy od Sonneta 4.6 z ceną 3 / 15 USD. Liczony za stronę tekstu, a nie za token, oszczędza bliżej jednej dziesiątej. Ta sama arytmetyka dotyczy okna kontekstu: milion tokenów na Sonnecie 5 firma wycenia na około 555 tysięcy słów, podczas gdy ten sam milion na Sonnecie 4.6 mieścił mniej więcej 750 tysięcy słów. Moment nasuwa jedno porównanie. Dwa dni temu Google pokazało Gemini 3.7 Flash w cenie 0,75 i 3,75 USD za milion tokenów, reklamowanej jako połowa ceny poprzednika — a we własnym cenniku opatrzonej datą 31 grudnia 2026 roku, po której stawka się podwaja. W ciągu jednego tygodnia dwaj dostawcy podjęli więc odwrotne decyzje w tej samej sprawie: jeden zdjął z obniżki datę ważności, drugi ją zostawił. Dla kogoś, kto planuje budżet na rok do przodu, ta różnica waży więcej niż same liczby na czele komunikatów. Profil Claude Sonnet 5 w naszym katalogu ma już wpisaną cenę standardową i odwołaną podwyżkę.

Claude Sonnet 5
Biznes6.08.2026 · Anthropic — dokumentacja modeli

Cena wprowadzająca Claude Sonnet 5 wygasa 31 sierpnia — rachunek rośnie o połowę

**Aktualizacja 15 sierpnia 2026:** Anthropic odwołał tę podwyżkę. Dokumentacja cenowa nazywa dziś stawkę 2 / 10 USD ceną standardową Claude Sonnet 5 i stwierdza, że podwyżka do 3 / 15 USD 1 września nie wejdzie w życie. Zob. Podwyżka o połowę odwołana (/news/claude-sonnet-5-price-rise-cancelled-2-10-permanent). Akapit o tokenizerze poniżej pozostaje aktualny. W dokumentacji modeli Anthropic stoi przypis, który łatwo przeoczyć, a drogo zignorować: cena wprowadzająca 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia obowiązuje dla Claude Sonnet 5 tylko do 31 sierpnia 2026 roku. Od 1 września model wraca do cennika katalogowego 3 i 15 USD — czyli po obu stronach licznika drożeje o połowę, i to za niecałe cztery tygodnie. Sonnet 5 nie jest dla Anthropic produktem marginalnym. Wydany 30 czerwca 2026 roku, jest domyślnym modelem planów free i Pro oraz — jak deklaruje sama firma — najlepszym połączeniem szybkości i inteligencji, z natywnym oknem kontekstu miliona tokenów, 128 000 tokenów wyjścia w Messages API i wynikiem 63,2% w SWE-Bench Pro. Jest też na dziś jedynym aktualnym modelem Claude sprzedawanym poniżej własnego cennika: Fable 5 kosztuje 10 / 50 USD, Opus 5 — 5 / 25 USD, a Haiku 4.5 — 1 / 5 USD, wszystkie w cenach katalogowych. W tę samą stronę działa jeszcze jeden, cichszy mechanizm, który z cennikiem nie ma nic wspólnego. Własna dokumentacja Anthropic wycenia milionowe okno kontekstu modeli Fable 5, Opus 5 i Sonnet 5 na około 555 tysięcy słów, podczas gdy ten sam milion tokenów na Opus 4.6 i Sonnet 4.6 mieścił około 750 tysięcy słów. Przy Fable 5 firma nazywa przyczynę wprost: model korzysta z tokenizera wprowadzonego wraz z Opus 4.7, a ten sam tekst daje na nim mniej więcej o 30% więcej tokenów niż na starszych modelach. Ponieważ jednostką rozliczeniową jest właśnie token, niezmieniona praca przeniesiona na nowszą generację jest liczona wyżej, zanim jeszcze zadziała jakakolwiek zmiana stawki. Czym to natomiast nie wygląda na przecenę całej oferty. Anthropic nie zapowiedział zmiany stawek żadnego innego modelu, a próg wycofania Sonneta 5 pozostaje nieruszony na 30 czerwca 2027 roku. Najprostszy odczyt jest taki, że rabat premierowy po prostu wygasa zgodnie z planem. Dla każdego, kto planuje budżet na Sonnecie 5, liczą się dwie daty: 31 sierpnia, gdy kończy się rabat, oraz moment przeniesienia pracy z modelu generacji 4.6, gdy zmienia się sama liczba tokenów. W naszym profilu Claude Sonnet 5 stoi już i cena wprowadzająca, i katalogowa.

Claude Sonnet 5