MDL-1050EST.2026 · IDX.194
Model językowyW produkcji

MiniCPM-o 4.5

OpenBMB (ModelBest / 面壁智能) · China · 2026

Otwarty model o 9 mld parametrów, który jednocześnie widzi, słucha i mówi — pełny dupleks działający na laptopie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

MiniCPM-o 4.5 to omnimodalny model OpenBMB, opublikowany na Hugging Face 3 lutego 2026 roku, a od stojących obok modeli językowo-wizyjnych odróżnia go to, że nie pracuje na zmianę. Model przetwarza ciągły strumień wideo i dźwięku, jednocześnie generując tekst i mowę, przy czym jedno nie blokuje drugiego — firma nazywa to pełnodupleksową transmisją na żywo. Potrafi też odezwać się bez pytania: podnieść przypomnienie albo skomentować to, co właśnie widzi. To układ zszyty z części, a nie jedna wieża: SigLip2 do widzenia, Whisper-medium do słuchu, CosyVoice2 do mowy i Qwen3-8B do języka, połączone od końca do końca przez stany ukryte, a nie przez przekazywanie sobie tekstu. Razem daje to 9 371 787 666 parametrów. Rdzeń językowy pracuje na 36 warstwach o wymiarze ukrytym 4096 z uwagą grupowaną (32 głowice zapytań na 8 głowic klucza i wartości) nad słownikiem 151 748 tokenów, a plik konfiguracyjny deklaruje budżet pozycji 40 960 tokenów. Wieża wizyjna ma 27 warstw o szerokości 1152 przy wejściu 980 pikseli; enkoder dźwięku — 24 warstwy o szerokości 1024. Wyniki podawane przez OpenBMB stawiają model wyżej niż jego kategoria wagowa. Firma podaje średnią 77,6 w OpenCompass z ośmiu benchmarków i twierdzi, że przy 9 mld parametrów wyprzedza to GPT-4o i Gemini 2.0 Pro oraz zbliża się do Gemini 2.5 Flash w zadaniach językowo-wizyjnych. W przetwarzaniu dokumentów deklaruje najlepszy znany wynik w OmniDocBench dla pełnego przetwarzania po angielsku — przed Gemini-3 Flash, GPT-5 i wyspecjalizowanym DeepSeek-OCR 2. W teście MMHal-Bench, mierzącym halucynacje, raportowany jest na równi z Gemini 2.5 Flash. Wszystko to są liczby producenta. Zakres praktyczny: obrazy do 1,8 mln pikseli w dowolnych proporcjach, wideo do 10 klatek na sekundę, ponad 30 języków oraz dwujęzyczna rozmowa głosowa w czasie rzeczywistym po angielsku i chińsku, z wyborem głosu. Do sklonowania głosu wystarcza próbka referencyjna, a jakość klonowania OpenBMB opisuje jako lepszą niż CosyVoice2 — czyli niż komponent, na którym model stoi. Tryb instruktażowy i tryb rozumowania mieszczą się w tych samych wagach. Dystrybucja jest taka jak w reszcie rodziny. Licencja to Apache 2.0 bez progów; wersje skwantyzowane wychodzą jako int4 i GGUF w szesnastu rozmiarach; llama.cpp i Ollama obsługują lokalne przetwarzanie na procesorze, vLLM i SGLang — wysoką przepustowość, a OpenBMB udostępniło też kod demonstracyjnej aplikacji webowej, która uruchamia pełny dupleks na MacBooku albo pojedynczej karcie graficznej. Repozytorium notuje 992 822 pobrania.

#open weights#Apache 2.0#omni-modal#full-duplex#speech#video understanding#on-device#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję