MDL-1136EST.2026 · IDX.334
WideoW produkcji

Pegasus 1.5

TwelveLabs · United States · 2026

Model, który ogląda dwugodzinne nagranie i pisze o nim — streszczenia, znaczniki czasu albo uporządkowaną listę scen, o które go poproszono, zwracaną jako JSON.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Pegasus 1.5, wydany 20 kwietnia 2026, to generująca tekst połowa platformy TwelveLabs: tam, gdzie Marengo zamienia wideo w wektory do wyszukiwania, Pegasus zamienia je w zdania. Czyta obraz, mowę i napisy na ekranie razem, po czym odpowiada na pytania o nagranie — co się dzieje, kiedy się dzieje, co jest napisane na tablicy w trzeciej minucie. Główną nowością tej wersji jest segmentacja wideo i jest ona użyteczniejsza, niż brzmi. Zamiast prosić o streszczenie, pytający definiuje rodzaje szukanych fragmentów — wątki redakcyjne, akcje sportowe, zmiany mówiącego, pojawienia się marki — wraz z polami, które każdy fragment ma nieść, i dostaje z powrotem uporządkowany JSON. To zmienia model z narzędzia opisującego w narzędzie indeksujące: na wejściu surowy materiał, na wyjściu rekordy ze znacznikami czasu. Zakresy czasu można ustawić osobno dla każdej definicji, więc jeden przebieg szuka różnych rzeczy w różnych częściach nagrania. W praktyce liczą się jeszcze dwie zmiany. Pegasus 1.5 analizuje wideo prosto z adresu URL, zasobu albo ciągu base64, bez wcześniejszego indeksowania — wersja 1.2 wymagała, by plik najpierw trafił do indeksu. W poleceniu można też umieścić obrazy odniesienia, więc pytanie potrafi wskazać konkretną osobę, przedmiot czy logo zamiast opisywać je słowami. Ograniczenia producent podaje precyzyjnie. Jedno żądanie dzieli okno kontekstu o wielkości 261 120 tokenów między nagranie, jego transkrypcję, polecenie, obrazy odniesienia, schemat i odpowiedź, przy czym odpowiedź może mieć do 98 304 tokenów. Wideo może trwać dwie godziny, a przy analizie fragmentu nawet cztery, do 2 GB. Obsługa języków jest nierówna i firma to przyznaje: angielski jest wspierany w pełni, dwanaście kolejnych języków — w tym chiński, japoński, koreański, arabski i hiszpański — tylko częściowo. Poprzednika już nie ma. TwelveLabs usunęło Pegasusa 1.2 osiemnastego sierpnia 2026; platforma odrzuca żądania wskazujące tę wersję i domyślnie sięga po 1.5. Wag nie opublikowano. Analiza wideo kosztuje 1,75 USD za godzinę materiału wejściowego plus 7,50 USD za milion tokenów wyjściowych, przy darmowym progu dziesięciu godzin indeksowania. Model jest dostępny także przez Amazon Bedrock.

#video understanding#video-to-text#multimodal#closed model#enterprise
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję