Ogłoszenie Gemini Robotics 2 przez Google DeepMind łatwo odebrać jako kolejny moment "AI gets a body". Filmy pokazują humanoids, platformy dwuramienne i robot orchestration: robot obserwuje scenę, śledzi postęp, reaguje na przesunięty obiekt i współpracuje z inną maszyną.

Roboty w laboratorium z ekranem planowania AI i strefą bezpieczeństwa

To prawdziwy postęp w robotics. Nie znaczy to jednak, że taki robot trafi zaraz do domu, magazynu albo placówki opieki.

Co ogłosiło Google

DeepMind mówi o trzech modelach. Gemini Robotics 2 VLA zamienia vision/language input na robot actions. Gemini Robotics ER 2 odpowiada za embodied reasoning: wideo, instrukcje, progress tracking, tool calls i robot APIs. Gemini Robotics On-Device 2 ma działać lokalnie z niską latencją.

Publiczny dostęp jest ograniczony. ER 2 jest dostępny przez Gemini API i Google AI Studio, w tym gemini-robotics-er-2-preview oraz streaming preview dla Live API. VLA action model i On-Device są dla early-access partners. Ars Technica słusznie napisała: są trzy modele, ale publicznie dostępny jest teraz jeden.

Dlaczego to ważne

Nie chodzi tylko o ruch humanoid. Ciekawsze jest to, że warstwa reasoning ogląda continuous video, rozpoznaje etap zadania, przechodzi dalej i radzi sobie z drobnymi zmianami.

Google podaje 57.4% accuracy dla progress classification oraz 91.3% accuracy i 0.96 seconds mean absolute distance dla moment finding. Drugi wynik wygląda użytecznie. Pierwszy przypomina, że około 60% nie wystarczy samo przy ludziach, towarze i drogim sprzęcie.

Architektura jest sensowna: model wyżej rozumuje, a VLA, controller, robot API albo człowiek wykonuje ruch niżej. To bardziej realne niż LLM sterujący każdym silnikiem.

Co pokazała dyskusja

Wątek na Hacker News miał 609 points i 515 comments. Pytania dotyczyły doorknobs, upadków, mebli, niejasnych obiektów, actuator limits, latency, kosztów, safety i zaufania do Google APIs.

Domowe roboty dzielą ludzi. Jedni zapłaciliby dużo za household assistant. Inni mówią, że większość zadań nie wymaga humanoid: lepszy bywa robot specjalistyczny, ramię stacjonarne albo baza mobilna. Dochodzi privacy: robot w domu to kamera, mikrofon i poruszająca się maszyna w prywatnej przestrzeni.

Safety ważniejsze niż demo

DeepMind opublikowało ASIMOV-Agentic na Hugging Face i safety technical report. Benchmark obejmuje safety tool calls, human safety monitoring, feasibility, uncertainty i prośby o interwencję człowieka.

To właściwe pytania. Błąd robota może przewrócić półkę, przyciąć rękę, zniszczyć produkt albo ruszyć wtedy, gdy powinien stać. Liczy się nie tylko, czy wykona zadanie, lecz czy wie, kiedy ma nie działać.

Gdzie pojawi się najpierw

Pierwsze użycia to raczej labs, warehouses, inspection routes, facilities i manufacturing cells. Tam można kontrolować przestrzeń, ROI, operatorów i safety case. Dom jest trudniejszy: bałagan, dzieci, zwierzęta, privacy i słaba ekonomia.

Humanoid shape ma sens tam, gdzie środowisko zbudowano dla ludzi. W wielu zadaniach wheeled base, fixed arm, AMR, drone albo maszyna specjalna będzie tańsza i bezpieczniejsza.

Co obserwować

Potrzebne są independent trials, partner pilots, failure videos, task-level success rates, teleoperation disclosure, latency, maintenance cost i incidents. Trzeba też sprawdzić, czy ER 2 przez Gemini API pozwoli budować realnych robot agents, czy kluczowe możliwości zostaną za partner access.

Uczciwy wniosek: Gemini Robotics 2 pokazuje lepsze robot reasoning. Dowód everyday deployment idzie wolniej. "Physical AGI" to jeszcze nie kategoria produktu.