Marengo 3.5
TwelveLabs · United States · 2026
Model osadzeń zbudowany pod wideo, a nie przystosowany do niego: jedna 512-wymiarowa reprezentacja obejmująca obraz, mowę, muzykę, dźwięki otoczenia i strony PDF, bez ograniczenia długości pliku.
Marengo 3.5, wydany 31 sierpnia 2026, to model osadzeń TwelveLabs — element, który zamienia nagranie w liczby dające się porównywać w wyszukiwarce. Sam nie generuje tekstu; od tego jest bliźniaczy model Pegasus. Osadzenie to lista liczb opisująca treść tak, by rzeczy podobne lądowały blisko siebie. Większość systemów dochodzi do wideo okrężnie, zszywając osobne narzędzia: jedno do klatek, jedno do transkrypcji mowy, jedno do tekstu. Marengo traktuje nagranie jako jeden obiekt i zwraca pojedynczy wektor 512 wymiarów obejmujący obraz, mowę, muzykę i dźwięki spoza dialogu. Wersja 3.5 przeszła na jeden wspólny koder dźwięku, podczas gdy 3.0 trzymała osobne osadzenie transkrypcji — trzask zamykanych drzwi albo szum tłumu jest więc teraz opisany w tej samej przestrzeni co wypowiadane nad nimi słowa. Różnice wobec 3.0 są wyjątkowo konkretne. Zniknęły limity długości: 3.0 przyjmowała do czterech godzin wideo lub dźwięku, 3.5 przyjmuje dowolną długość. Wejściem mogą być pliki PDF, po jednym osadzeniu na stronę. Zapytanie łączy tekst z obrazem, wideo lub dźwiękiem naraz, a nie wyłącznie tekst z obrazem. Każde osadzenie ma też wektor niepewności liczony osobno dla każdego wymiaru, więc system potrafi wskazać, które fragmenty własnego opisu są chwiejne — rzecz rzadko w ogóle publikowana. Jest przy tym istotny haczyk, podany przez producenta, a nie wykryty: własny punkt wyszukiwania platformy nie obsługuje Marengo 3.5. Żeby szukać wewnątrz TwelveLabs, trzeba nadal trzymać na indeksie Marengo 3.0; osadzenia 3.5 odpytuje się we własnym systemie. Obie wersje są też wzajemnie niezgodne, więc przejście oznacza wygenerowanie od nowa wszystkich posiadanych osadzeń. Razem z modelem zmieniło się rozliczenie. Marengo 3.0 liczono według długości nagrania, 3.5 liczy się w tokenach wejściowych, wycenianych osobno dla każdego typu treści: od 0,065 USD za milion tokenów dźwięku do 0,260 USD za wideo. Wag nie opublikowano; model działa przez API TwelveLabs i w Amazon Bedrock.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!