Mercury 2.5
Inception · United States · 2026
Model językowy, który nie pisze słowo po słowie: dyfuzyjny model Inception dopracowuje całe bloki tokenów równolegle i podaje 1107 tokenów na sekundę na zwykłych kartach NVIDII.
Mercury 2.5 to bieżący flagowiec amerykańskiej firmy Inception, zbudowanej wokół zakładu, którego prawie nikt w branży nie doprowadził do produkcji: że wielki model językowy nie musi generować tekstu token po tokenie. Modele Mercury to dyfuzyjne modele językowe — dLLM — które zaczynają od zgrubnego szkicu całego bloku wyjścia i dopracowują go w kilku przebiegach, wytwarzając wiele tokenów równolegle. Inception twierdzi, że Mercury 2.5 jest, wedle jego wiedzy, największym dyfuzyjnym modelem językowym, jaki kiedykolwiek wytrenowano. Firmę założyli badacze ze Stanfordu, UCLA i Cornella, a wśród inżynierów są ludzie z Google DeepMind, Meta AI, Microsoft AI i OpenAI. Sensem tej architektury jest czas, nie inteligencja. Inception podaje 1107 tokenów na sekundę na powszechnie dostępnych kartach NVIDII, a cała linia produktowa celuje w zastosowania, w których pauza jest usterką, a nie niedogodnością: agenci głosowi prowadzący rozmowę telefoniczną na żywo, wyszukiwarki odpalające dziesiątki wywołań modelu w obrębie jednego zapytania użytkownika i asystenci programistyczni, którzy bez przerwy streszczają i przekierowują własny kontekst. Liczby klientów, na które firma się powołuje, pochodzą z tego świata — OpenCall podaje medianę odpowiedzi modelu w okolicach 170 milisekund na żywych połączeniach, a Augment Code spadek czasu streszczania kontekstu z około 150 sekund do 27 przy 90 procentach oszczędności kosztu. Wszystkie te wyniki podaje dostawca i jego klienci, nikt ich niezależnie nie zmierzył. W kwestii jakości Inception ostrożnie nie rości sobie pozycji czołowej. Opisuje Mercury 2.5 jako o 40 procent inteligentniejszy od Mercury 2 i porównywalny z tanią półką dużych laboratoriów — GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, Claude Haiku 4.5 — co stawia go w roli szybkiego i taniego konia roboczego, a nie mistrza rozumowania. Model przyjmuje 260 tys. tokenów kontekstu, oddaje do 65 536, a przez zgodne z OpenAI API obsługuje regulowany wysiłek rozumowania, równoległe wywołania narzędzi i JSON zgodny ze schematem. Cena wymaga przypisu. Cennik katalogowy Inception to 0,20 dolara za milion tokenów wejściowych i 0,75 dolara za milion wyjściowych, przy wejściu z pamięci podręcznej po 0,02. Na premierę firma dała 80 procent rabatu, więc we wrześniu 2026 r. nalicza odpowiednio 0,04, 0,15 i 0,004 dolara — i to właśnie te promocyjne kwoty widnieją w zestawieniach u pośredników. Wag nie opublikowano; model działa przez API Inception, Baseten i OpenRouter, a wdrożenia firmowe dostają dedykowane moce. Tego samego dnia ogłoszono zapowiedzi dwóch modeli pokrewnych: Mercury Voice, dyfuzyjnego modelu ze 128 tys. kontekstu, dostrojonego do agentów głosowych, z czasem do pierwszego tokenu poniżej 170 milisekund, oraz Mercury Router, który czyta przychodzące polecenie i kieruje je do modelu — otwartego lub zamkniętego — najlepiej pasującego do zadania. Żaden z nich nie ma opublikowanego cennika. Starsi członkowie linii — Mercury 1, Mercury 2 i Mercury Edit 2 — są, słowami samego producenta, wspierani wyłącznie dla dotychczasowych klientów, co w praktyce zamyka je dla nowych użytkowników, ale zostawia działające.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!