Анонс Gemini Robotics 2 от Google DeepMind легко принять за момент, когда "AI получил тело". В роликах есть humanoids, dual-arm platforms и robot orchestration: робот смотрит на сцену, отслеживает прогресс, реагирует на сдвинутый объект и координируется с другой машиной.

Роботы в лаборатории с AI planning display и зоной безопасности

Это реальный прогресс в robotics. Но это ещё не робот, которого можно купить для дома, склада или eldercare facility в ближайшем квартале.

Что именно показала Google

DeepMind описывает Gemini Robotics 2 как три модели. Gemini Robotics 2 VLA превращает vision/language input в robot actions. Gemini Robotics ER 2 отвечает за embodied reasoning: видео, инструкции, progress tracking, tool calls и robot APIs. Gemini Robotics On-Device 2 — low-latency VLA для локального запуска на роботе.

Публичный доступ уже уже, чем кажется по видео. ER 2 доступна через Gemini API и Google AI Studio, включая gemini-robotics-er-2-preview и streaming preview для Live API. VLA action model и On-Device model остаются у early-access partners. Ars Technica справедливо подчеркнула: моделей три, публично доступна сейчас только одна.

Почему это всё равно важно

Главная новость не в том, что humanoid двигается. Важнее claim, что верхний reasoning layer может смотреть continuous video, понимать стадию задачи, решать, когда переходить дальше, и исправляться при небольших изменениях сцены.

В материалах Google есть две цифры. Progress classification — 57.4% accuracy. Moment finding — 91.3% accuracy и 0.96 seconds mean absolute distance. Вторая выглядит сильной. Первая напоминает: примерно 60% не тот уровень, которому можно без страховки доверить людей, складские товары или дорогую линию.

Архитектура выглядит правдоподобнее, чем карикатура "LLM напрямую крутит моторы". Быстрые control loops должны жить рядом с железом. Reasoning model может понять, что объект укатился, контейнер сдвинули, показание прибора сомнительно или надо остановиться. Исполнение дальше делает VLA, controller, robot API или человек.

Что показало обсуждение

HN thread набрал 609 points и 515 comments на момент проверки. Там спорили не только о восторге. Люди спрашивали, как такие роботы справятся с awkward doorknobs, падениями, мебелью, неоднозначными объектами, actuator limits, latency и ценой.

Домашний сценарий расколол обсуждение. Одни готовы платить десятки тысяч долларов за household assistant. Другие считают, что большинству задач не нужен humanoid: полы чистят специализированные роботы, логистику можно перестроить, а fixed arm или wheeled base часто безопаснее и дешевле. Отдельный страх — privacy: домашний робот это камера, микрофон и движущаяся машина в частном пространстве. Cloud control делает планку доверия ещё выше.

Есть и Google-platform risk. Для промышленности это не мем, а операционный риск: завод или склад не хочет зависеть от API, который могут переименовать, ограничить или закрыть.

Safety важнее ролика

DeepMind выпустила ASIMOV-Agentic на Hugging Face и safety technical report. Набор проверяет safety tool calls, human safety monitoring, feasibility, uncertainty и ситуации, где агент должен попросить человека вмешаться.

Так и нужно ставить вопрос. Ошибка робота — не неверный абзац. Humanoid может опрокинуть полку, прищемить руку, повредить товар или двинуться тогда, когда должен стоять. Главный вопрос: понимает ли он, когда не действовать?

Safe stop рядом с человеком звучит правильно, но создаёт конфликт. Если робот останавливается каждый раз, когда человек близко, то уход, ресторанный сервис, домашние задачи и collaborative assembly требуют более тонкого слоя управления, чем simple safety bubble.

Где будет первая польза

Вероятнее всего, не в кухнях и прачечных. Первые практичные места — labs, warehouses, inspection routes, facilities и manufacturing cells. Там можно ограничить пространство, измерить ROI, обучить операторов и описать safety case.

Дом сложнее: беспорядок, дети, животные, privacy, социальные нормы и слабая экономика. Humanoid shape полезен там, где среда уже построена под человека: лестницы, двери, полки, ручки, инструменты. Но для многих задач wheeled base, fixed arm, AMR, drone или custom machine будут проще.

Что смотреть дальше

Нужны independent trials, partner pilots, failure videos, task-level success rates, teleoperation disclosure, latency, maintenance cost, incidents и реальные границы API. Особенно важна On-Device 2: если локальная модель действительно адаптируется к новой bi-arm platform за few hours и fewer than 200 examples, это сильный шаг. Пока это promising claim, а не проверенный deployment fact.

Честный вывод: Gemini Robotics 2 показывает, что robot reasoning ускоряется. Но доказательства everyday deployment растут медленнее, чем demos. "Physical AGI" пока не продуктовая категория, а направление исследований и ранних пилотов.