MDL-3698EST.2026 · IDX.313
Model językowyW produkcji

MiniCPM-V 4.6

OpenBMB (ModelBest / 面壁智能) · China · 2026

Model językowo-wizyjny o 1,3 mld parametrów, który czyta obrazy i wideo na telefonie — i wypada lepiej niż model językowy, na którym stoi.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

MiniCPM-V 4.6 to model językowo-wizyjny na urządzenia brzegowe, który OpenBMB wgrało na Hugging Face 11 maja 2026 roku, a zaczynać wypada od jego rozmiaru: 1 300 428 016 parametrów łącznie, wraz z wagami. Obejmuje to obie części układu — enkoder percepcyjny SigLIP2-400M i model językowy Qwen3.5-0.8B, połączone od końca do końca. Ciekawa w karcie modelu jest nie teza, że mały model działa, lecz to, że ten wypada lepiej niż jego własny fundament. OpenBMB podaje 13 punktów w indeksie Artificial Analysis Intelligence Index wobec 10 dla samego Qwen3.5-0.8B, na którym model stoi, i zaznacza, że osiąga to przy mniej więcej dziewiętnastokrotnie niższym koszcie tokenów; wobec tego samego modelu bazowego w trybie rozumowania, ocenionego na 11, różnica w koszcie tokenów wynosi już czterdzieści trzy razy. Model jest też raportowany wyżej niż Ministral 3 3B, ponad dwukrotnie większy. To liczby producenta. Cała inżynieria poszła w wydajność. Za rozwiązaniem LLaVA-UHD v4 ścieżka wizyjna tnie liczbę operacji zmiennoprzecinkowych kodowania o ponad połowę, a model obsługuje mieszaną kompresję tokenów wizyjnych 4x/16x, więc programista może wymieniać dokładność na szybkość w obrębie tych samych wag. Przepustowość tokenów OpenBMB określa na około 1,5-krotność modelu bazowego. Architektura to 24 warstwy transformera o wymiarze ukrytym 1024 nad słownikiem 248 094 tokenów, z 27-warstwową wieżą wizyjną o szerokości 1152, pracującą na wejściu 980 pikseli przy rozmiarze łatki 14; plik konfiguracyjny deklaruje budżet pozycji 262 144 tokenów. Druga połowa oferty to wdrożenie. OpenBMB publikuje kod adaptacyjny dla wszystkich trzech głównych platform mobilnych — iOS, Androida i HarmonyOS — i pokazuje model na iPhonie 17 Pro Max, Redmi K70 oraz HUAWEI nova 14 na niemontowanych nagraniach ekranu. Wersje skwantyzowane wychodzą w formatach GGUF, BNB, AWQ i GPTQ; obsługiwane są vLLM, SGLang, llama.cpp i Ollama, a także środowiska dostrajania SWIFT i LLaMA-Factory. Osobno publikowany jest wariant Thinking. 17 maja 2026 roku firma uruchomiła hostowane API z darmowym kluczem publicznym. Licencja to Apache 2.0, bez progu przychodowego i bez rejestracji — te same warunki co reszta obecnej linii MiniCPM i powód, dla którego model można wstawić do produktu komercyjnego, nikogo nie pytając. Repozytorium notuje 748 775 pobrań.

#on-device#vision-language#open weights#Apache 2.0#edge AI#video understanding#OCR#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję