MDL-1666EST.2025 · IDX.090
AI dla robotykiWdrożenie pilotażowe

π*0.6 (pi-star-0.6)

Physical Intelligence · USA · 2025

Model π, który uczy się na własnych błędach — zmiana przy ekspresie trwająca cały dzień.

Ocena wujec.ai

8.6/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

π*0.6, przedstawiony przez Physical Intelligence 17 listopada 2025 r., mierzy się ze strukturalną słabością polityk robotycznych uczonych wyłącznie przez naśladowanie: drobny błąd na początku wpycha robota w stany, których nie obejmowała żadna demonstracja, a pomyłki się kumulują. Odpowiedzią jest RECAP — uczenie ze wzmocnieniem na doświadczeniu i korektach, z politykami warunkowanymi przewagą — łączące trzy źródła nauki. Model startuje z demonstracji człowieka, następnie przyswaja korekty nanoszone na bieżąco przez operatora, gdy zaczyna się mylić, a na końcu poprawia się samodzielnie na podstawie prób autonomicznych, przy czym funkcja wartości podpowiada mu, które własne próby w ogóle warto naśladować. Pokazy dobrano tak, by sprawdzać wytrzymałość, a nie efektowność. Robot parzył kawę bez przerwy przez 18 godzin, złożył 50 nieznanych sobie sztuk prania w domu, w którym wcześniej nie pracował, oraz skleił i oznaczył 59 prawdziwych kartonów w warunkach fabrycznych. Wobec polityki uczonej samym naśladowaniem Physical Intelligence raportuje mniej więcej dwukrotnie większą wydajność i ponad dwukrotnie niższy odsetek błędów przy najtrudniejszych zadaniach — firma podsumowała to jako dowód, że uczenie ze wzmocnieniem wraca do gry w manipulacji w świecie rzeczywistym. π*0.6 jest modelem zamkniętym; Physical Intelligence opublikowało kartę modelu i raport techniczny, ale nie wagi.

#VLA model#reinforcement learning#RECAP#self-improvement#closed weights
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję