MDL-3974EST.2024 · IDX.436
Model językowyW produkcji

text-embedding-3-large

OpenAI · USA · 2024

Najmocniejszy model osadzeń OpenAI: do 3072 wymiarów, a skrócony do 256 wymiarów wciąż bije model, który zastąpił, przy jego pełnych 1536.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Wydany 25 stycznia 2024 text-embedding-3-large to najmocniejszy model osadzeń OpenAI. Osadzenia nie są odpowiedziami — to liczbowe reprezentacje tekstu służące do mierzenia, jak blisko siebie są dwa fragmenty, i na tym opiera się wyszukiwanie, grupowanie, rekomendacje, wykrywanie anomalii i klasyfikacja. Ten model tworzy wektory długości do 3072 liczb. Względem zastąpionej generacji ada-002 producent podaje wzrost średniej w wielojęzycznym teście wyszukiwania MIRACL z 31,4% do 54,9% i średniej w anglojęzycznym MTEB z 61,0% do 64,6%. Zysk wielojęzyczny jest zdecydowanie większy — co przypomina, że słabość starszego modelu była skupiona poza angielskim. Najbardziej użyteczna właściwość kryje się w drobnym druku. Oba modele z 2024 roku wytrenowano tak, by wektor dało się przyciąć — parametr dimensions po prostu ucina liczby z końca — bez utraty sensu. Własny przykład producenta: skrócony do 256 wymiarów model wciąż wypada w MTEB lepiej niż pełne, 1536-wymiarowe osadzenie ada-002. Wektor sześć razy mniejszy, a lepszy. Dla każdego, kto płaci za przechowywanie wektorów, to jest liczba, która się liczy, i powód, dla którego starszy model nie ma już żadnego argumentu technicznego po swojej stronie.

#embeddings#retrieval#search#multilingual
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję