MDL-4288EST.2026 · IDX.363
Model językowyW produkcji

LFM2.5-VL-3B

Liquid AI · USA · 2026

Model wizyjno-językowy o 3,1 miliarda parametrów pomyślany do pracy na telefonie i laptopie: czyta ekrany, dokumenty i wykresy, wskazuje obiekty współrzędnymi i wywołuje narzędzia, mieszcząc się w około 3 GB pamięci.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

LFM2.5-VL-3B to model wizyjno-językowy o otwartych wagach, opublikowany przez Liquid AI 12 sierpnia 2026 r. Jest celowo mały — 3,12 miliarda parametrów, wagi bfloat16, około 3 GB w pamięci — a cała konstrukcja zmierza w jednym kierunku: model ma pracować na urządzeniu użytkownika, a nie w centrum danych. Architektura jest hybrydowa, a nie klasycznie transformerowa. Spośród trzydziestu warstw językowych większość to bloki splotowe o krótkim zasięgu, a dopiero co trzecia lub co czwarta jest blokiem pełnej uwagi — i to właśnie powstrzymuje przyrost zużycia pamięci przy długim wejściu. Za obraz odpowiada koder SigLIP2, który dzieli zdjęcie na kafelki po 512 pikseli, najwyżej dziesięć, i przekazuje modelowi językowemu maksymalnie 256 tokenów obrazu na kafelek. Okno kontekstu tekstowego wynosi 128 000 tokenów, a słownik podwojono do 128 000 pozycji — dzięki temu model nadaje się do pracy poza alfabetem łacińskim. Producent deklaruje szesnaście języków, w tym polski. Przeznaczenie modelu jest węższe niż typowa zapowiedź asystenta do rozmowy. Model czyta interfejsy użytkownika na telefonie, w przeglądarce i na pulpicie, wskazuje obiekty współrzędnymi ramki, wyciąga tekst i liczby z dokumentów oraz wykresów, przyjmuje kilka obrazów naraz i potrafi wywołać narzędzie zarówno na podstawie polecenia tekstowego, jak i samego obrazu. Liquid AI podaje średnią 69,4 z 28 testów wizyjnych — na równi z InternVL-3.5-4B i 0,7 punktu za Qwen3.5-4B, przy czym oba są większe — oraz 80,7 na ScreenSpot-v2, czyli w rozumieniu interfejsów. To liczby producenta, niepowtórzone niezależnie. Sednem wydania są jednak deklaracje szybkości. Liquid AI mierzy 228 tokenów na sekundę na Apple M5 Max, 116 na AMD Ryzen AI Max+ 395 i 20 na Galaxy S26 Ultra — ta ostatnia liczba dotyczy telefonu pracującego bez żadnej chmury. Na układzie H100 model wydaje pierwszy token po około 34 milisekundach dla pięciu klatek wideo. Jedno zastrzeżenie warto wypowiedzieć wprost, bo komunikat producenta tego nie robi. Wagi opublikowano na licencji LFM Open License v1.0, a nie na licencji otwartego oprogramowania. Pobieranie, dostrajanie, dalsze udostępnianie i użytek badawczy są bezpłatne, ale użytek komercyjny przysługuje wyłącznie podmiotom o rocznym przychodzie poniżej 10 milionów dolarów, z wyjątkiem dla zarejestrowanych organizacji pożytku publicznego korzystających z modelu badawczo. Powyżej tego progu licencja w ogóle nie obejmuje wdrożenia komercyjnego i potrzebna jest osobna umowa z Liquid AI. Dla hobbysty, studenta czy małej pracowni model jest więc praktycznie darmowy; dla dużej firmy nie jest.

#open weights#multimodal#on-device#vision-language#local deployment#USA
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję