Wszystkie newsyPremiery

Grupa Ant opublikowała agenta trenowanego do łamania CAPTCHA — ale nie wagi i nie licencję

Opublikowano: 28.08.2026 · Źródło: InclusionAI model card, Hugging Face

InclusionAI, otwartoźródłowe ramię grupy Ant, opublikowało 26 sierpnia 2026 r. kartę modelu UI-Venus-2-9B — agenta GUI, który ma obsługiwać telefon, przeglądarkę i system operacyjny w imieniu użytkownika. Dwie rzeczy na tej stronie zasługują na uwagę czytelnika i żadna z nich nie jest wynikiem testu. Pierwsza: opisane wydanie nie nastąpiło. Karta stwierdza wprost, że „to repozytorium udostępnia pełne wagi modelu UI-Venus-2-9B". W repozytorium jest plik README, plik konfiguracyjny, tokenizer i cztery ilustracje. Nie ma w nim ani jednego pliku z wagami. Licznik pobrań dwa dni po publikacji wskazywał zero. Druga to licencja — i tutaj producent jest wyjątkowo szczery. W sekcji „Release Status" karta podaje, że licencja na wagi „czeka na ostateczne potwierdzenie i zostanie dodana przed publicznym wydaniem", a następnie tłumaczy, dlaczego nie użyto odpowiedzi oczywistej: „Deklaracji Apache-2.0 celowo nie przeniesiono, ponieważ obecne materiały źródłowe zawierają sprzeczne zapisy licencyjne". Materiały źródłowe to Qwen3.5-9B, model Alibaby, na którym UI-Venus-2 został zbudowany. Innymi słowy: jedno chińskie laboratorium publicznie odmawia podania licencji, bo nie potrafi ustalić, jaką licencję samo dostało od drugiego. Zgadza się to z tym, co ten katalog ustalił w tym samym miesiącu u źródła: kilka wydań Alibaby opisywanych w prasie jako otwarte wymaga — w pliku licencji, a nie w etykiecie metadanych — osobno wynegocjowanej umowy od każdego, kto chce sprzedawać model jako usługę na dużą skalę. Same umiejętności modelu też zwracają uwagę. InclusionAI wymienia pięć rodzin zadań treningowych — wskazywanie elementów, telefon, sieć, komputer i CAPTCHA — i podaje wyniki z pięciu testów CAPTCHA, w tym 78,1 procent we własnym VenusBench-CAPTCHA, który wymaga wykonania pełnej sekwencji ruchów, z suwakami i obracaniem obrazu włącznie, w jednej turze. Łamanie CAPTCHA nie jest tu efektem ubocznym, tylko wytrenowanym celem z własnym etapem uczenia ze wzmocnieniem. Tabela bezpieczeństwa opublikowana obok nie upiększa obrazu. W teście OSHarm, obejmującym celowe nadużycia i wstrzykiwanie poleceń, skuteczność ataku wynosi 11,3 procent wobec 25,3 procent modelu bazowego. W teście OSBlind, sprawdzającym polecenia wyglądające niewinnie, których wykonanie wyrządza szkodę, jest to 48,8 procent — lepiej niż 79,4 procent modelu bazowego, ale wciąż blisko połowy przypadków. Zastrzeżenie pisze samo InclusionAI: wyniki „nie sprawiają, że ryzyko szkodliwego działania jest pomijalne", wdrożenia powinny zachować potwierdzenie przez człowieka, a „możliwości rozwiązywania CAPTCHA powinny być używane wyłącznie w autoryzowanych środowiskach". W zadaniach użytkowych deklarowane liczby są jak na ten rozmiar mocne: 80,2 procent w AndroidWorld, 70,8 w OSWorld-Verified, 90,8 w WebVoyager. Wszystkie pochodzą od producenta, a raport techniczny, na który się powołuje, również nie jest jeszcze jawny. Ten katalog założy profil UI-Venus-2-9B wtedy, gdy pojawią się wagi i licencja.