Newsy

Co słychać w robotyce i AI — wybór redakcji wujec.ai.

Premiery13.08.2026 · DeepSeek (Hugging Face model card)

DeepSeek wydaje finalne V4-Pro: otwarte wagi, milion tokenów kontekstu i skok w zadaniach agentowych

DeepSeek opublikował 13 sierpnia 2026 na Hugging Face model DeepSeek-V4-Pro-0813, opisując go jako oficjalne wydanie V4-Pro i następcę wag zapoznawczych, które nosiły tę nazwę od kwietnia. Repozytorium udostępniono na licencji MIT, więc cały model — 1,65 biliona parametrów w rzadkiej architekturze mixture-of-experts, 61 warstw, 384 ekspertów routowanych i sześciu aktywnych na token, w formacie FP8 — można pobrać i uruchomić u siebie. Okno kontekstu pozostaje na poziomie 1 048 576 tokenów. Architektura nie zmieniła się względem wersji zapoznawczej; nowością jest dołączony moduł spekulatywnego dekodowania DSpark oraz przebudowane sterowanie rozumowaniem. Parametr `reasoning_effort` przyjmuje teraz trzy poziomy — low, high i max — pozwalając wymieniać czas namysłu na koszt. DeepSeek zrezygnował też z szablonu rozmowy w formacie Jinja na rzecz udokumentowanego kodera w Pythonie, co oznacza pracę dla każdego, kto uruchamia wagi lokalnie. Poprawa, którą raportuje producent, skupia się w zadaniach agentowych i programistycznych — i jest duża. Według tabeli firmy nowa kompilacja osiąga 62,7% w DeepSWE wobec 12,8% dla wersji zapoznawczej, 61,5% w NL2Repo wobec 38,5%, 83,3% w Cybergym wobec 52,7% oraz 87,9 w Terminal Bench 2.1 wobec 72,1. W Humanity's Last Exam uzyskuje 42,7% bez narzędzi i 60,0% z narzędziami wobec wcześniejszych 37,7%. W zestawieniu z konkurencją obraz jest bardziej wyrównany. Kimi K3 wypada lepiej w Terminal Bench (88,3) i DeepSWE (67,5), a Fable 5 od Anthropica prowadzi w Humanity's Last Exam (53,3 bez narzędzi). DeepSeek utrzymuje jednak pozycję, którą zajmuje przez cały rok: wyniki porównywalne z czołówką, przy wagach udostępnionych, a nie wynajmowanych. Podane wyniki pochodzą od producenta i nie zostały jeszcze niezależnie powtórzone.

DeepSeek-V4-Pro
Premiery8.08.2026 · Tencent

Model, którego Europa mieć nie mogła: Tencent zdejmuje wyłączenia terytorialne z Hy3 i wchodzi globalnie

Chińskie modele z otwartymi wagami przez ostatnie dwa lata ścigały się na rozmiar i cenę. Hy3 od Tencenta po cichu ścigał się o coś innego: o to, kto w ogóle może go pobrać. Gdy w kwietniu 2026 pojawiła się wersja zapoznawcza, jej licencja zawierała wyłączenie terytorialne — poza zasięgiem znalazły się Unia Europejska, Wielka Brytania i Korea Południowa. Oficjalne wydanie z 6 lipca 2026 usunęło ten zapis w całości i przeniosło wagi na czystą licencję Apache 2.0, jedne z najbardziej liberalnych warunków, jakie dotąd towarzyszyły modelowi tej skali. 5 sierpnia Tencent domknął sprawę, ogłaszając dostępność globalną: asystent WorkBuddy, narzędzie projektowe Miora i Tencent Cloud TokenHub, a poza tym dostęp przez OpenRouter i pliki do pobrania na Hugging Face oraz ModelScope. Sam model to rzadki mixture-of-experts: 295 miliardów parametrów łącznie, około 21 miliardów aktywowanych na token, 192 ekspertów z routingiem top-8, 80 warstw i osobny blok predykcji wielotokenowej o 3,8 miliarda parametrów, który przyspiesza generowanie. Okno kontekstu to 256 tysięcy tokenów. Cechą wyróżniającą jest to, że głębokość namysłu jest ustawieniem, a nie osobnym produktem — no_think odpowiada natychmiast, think_low rozumuje krótko, think_high prowadzi długi wywód — więc jeden endpoint obsługuje i zdawkową rozmowę, i wielogodzinne zadanie analityczne. Tencent przedstawia to tak, że Hy3 dorównuje flagowcom od dwóch do pięciu razy większym w rozumowaniu, wykonywaniu poleceń, uczeniu z kontekstu, generowaniu kodu i pracy agentowej. Firma podaje też, że w tydzień po premierze ruch API do Hy3 był 68 razy większy niż do poprzedniej generacji, co dało modelowi pierwsze miejsce w rankingu użycia OpenRoutera. Cennik na OpenRouterze to 0,1288 dolara za milion tokenów wejściowych i 0,5336 za milion wyjściowych; dostęp przez WorkBuddy jest bezpłatny do 31 sierpnia 2026. Najciekawsza jest ta liczba o użyciu. Deklaracje producentów o dorównywaniu konkurencji w testach są rutyną; 68-krotny skok płatnych wywołań API mówi natomiast, ilu programistów naprawdę się przesiadło. Niezależne omówienia zasadniczo potwierdzają deklarowane osiągi, wskazując kodowanie jako jedyny obszar, w którym konkurencyjne modele otwarte wciąż mają przewagę.

Tencent Hy3
Premiery27.07.2026 · VentureBeat

Moonshot AI wydaje Kimi K3 — największy jak dotąd otwarty model

Moonshot AI wydało Kimi K3 16 lipca 2026 r., a jedenaście dni później otworzyło wagi modelu o 2,8 bln parametrów na licencji zmodyfikowanej MIT. Model mixture-of-experts aktywuje 104 mld parametrów (16 z 896 ekspertów) na token, oferuje okno kontekstu 1 mln tokenów oraz natywne rozumienie obrazu i wideo, a w ślepej ewaluacji Frontend Code Areny wyprzedził Claude Fable 5 — to najwyraźniejszy jak dotąd sygnał, że otwarte laboratoria z Chin nie tylko doganiają czołówkę wyścigu frontierowego, ale wyznaczają jego tempo. K3 jest następcą oryginalnego Kimi K2, poprzez linię K2 Thinking, K2.5, K2.6 i K2.7-Code — deweloperzy zdążyli już podłączyć go do Cursora i Vercela, uruchamiając go na konsumenckich kartach graficznych w ciągu kilku dni od premiery.

Kimi K3
Premiery19.07.2026 · AIToolsReview

Flagowy model DeepSeeka o 1,6 biliona parametrów wchodzi do pełnej dostępności — i zaczyna liczyć według zegara

DeepSeek-V4-Pro wyszedł z fazy zapoznawczej 19 lipca 2026, trzy miesiące po pierwszej publicznej premierze. Wagi są tymi samymi, które opublikowano 24 kwietnia: rzadki model mixture-of-experts o 1,6 biliona parametrów, z czego około 49 miliardów aktywnych na token, okno kontekstu miliona tokenów i licencja MIT pozwalająca każdemu pobrać model i uruchomić go u siebie. Pełna dostępność zmieniła stronę handlową. DeepSeek po raz pierwszy wprowadził taryfę szczytową, podwajającą stawki w godzinach pracy w Pekinie; poza szczytem API kosztuje 0,435 dolara za milion tokenów wejściowych i 0,87 za milion wyjściowych. Wejście z pamięci podręcznej rozliczane jest po około setnej części stawki pozaszczytowej. 24 lipca firma wycofała stare punkty końcowe deepseek-chat i deepseek-reasoner, więc integracje muszą teraz wskazywać model wprost. Według danych opublikowanych przez DeepSeeka przy premierze GA model uzyskuje 80,6% w SWE-bench Verified — najlepszy opublikowany wynik modelu z otwartymi wagami — przy ratingu 3206 w Codeforces, 57,9% w SimpleQA Verified i 37,7% w Humanity's Last Exam. Pomiar niezależny opowiada rzecz subtelniejszą: Artificial Analysis ocenił V4-Pro na 44 punkty w Intelligence Index w momencie GA wobec 52 przy premierze zapoznawczej. Model się nie pogorszył — przez te trzy miesiące przesunęła się stawka. Mniejszy DeepSeek-V4-Flash i wcześniejszy DeepSeek-R1 pozostają dostępne, a wszystkie trzy mają już profile w katalogu wujec.ai.

DeepSeek-V4-Pro