MDL-6627EST.2026 · IDX.182
Model językowyWdrożenie pilotażowe

DeepSeek-V4-Flash-Vision-Exp

DeepSeek · China · 2026

Pierwszy model DeepSeeka, który czyta obrazy — i pierwszy, który firma sprzedaje wyłącznie jako usługę, bez wag do pobrania.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DeepSeek-V4-Flash-Vision-Exp trafił do API DeepSeeka 21 sierpnia 2026 r. jako pierwszy publicznie dostępny model tej firmy, który przyjmuje obrazy. Bierze tekst i zdjęcia naraz — JPEG, PNG, GIF i WebP, do 600 obrazów w jednym żądaniu — a odpowiada tekstem: opisuje fotografie, odczytuje zrzuty ekranu, analizuje wykresy i steruje agentami, które muszą najpierw spojrzeć na ekran, zanim zadziałają. W samym tekście, jak twierdzi producent, model dorównuje DeepSeek-V4-Flash, czyli modelowi z otwartymi wagami, obok którego powstał; w testach agentowych wymagających widzenia firma raportuje wyraźny skok wobec tamtego i stawia wynik blisko Opusa 4.8 od Anthropiku. Najciekawsze jest to, czego w tym wydaniu nie ma. DeepSeek zbudował markę na publikowaniu wag na swobodnych licencjach — V4-Flash leży na Hugging Face na licencji MIT — ale tydzień po premierze modelu wizyjnego nie ma tam żadnego repozytorium, a dokumentacja podaje wyłącznie nazwę do wywołania w API. Katalog opisuje go więc jako usługę, nie jako model otwarty, i zostawia status pilotażowy, który sam producent sugeruje dopiskiem „exp”: nie ma karty modelu, nie ma raportu bezpieczeństwa i nie ma zapewnienia, że ten punkt dostępowy przetrwa w obecnej postaci. Cennik jest taki sam jak w modelu tekstowym, a obrazy są tanie w sposób, który ma znaczenie przy przetwarzaniu archiwów: niezależnie od pierwotnego rozmiaru zdjęcie jest przeskalowywane i rozliczane najwyżej jako 384 tokeny wejścia. Żądanie wypełnione maksymalną liczbą 600 obrazów kosztuje więc około dziesięciu centów w godzinach szczytu i połowę tego poza szczytem, zanim policzy się tekst. Inaczej licząc: w jednym dolarze mieści się mniej więcej sześć tysięcy zdjęć po cenie szczytowej. Okno kontekstu to te same milion tokenów co w reszcie linii V4, wyjście sięga 384 tys. tokenów, a darmowe Files API pozwala wgrać zdjęcie raz i używać go w kolejnych żądaniach zamiast wysyłać ponownie. Obrazy wolno umieszczać wyłącznie w wiadomościach użytkownika; w wiadomościach systemowych i asystenta zwracają błąd, a uzupełniania kodu (FIM) ten model nie obsługuje w ogóle.

#multimodal#vision#API only#experimental#China
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję