إعلان Google DeepMind عن Gemini Robotics 2 يبدو للوهلة الأولى كأنه لحظة جديدة من نوع "AI gets a body". الفيديوهات تعرض humanoids ومنصات بذراعين و robot orchestration: روبوت يشاهد المشهد، يتابع التقدم، يتصرف إذا تحرك جسم، ويتعاون مع آلة أخرى.

روبوتات في مختبر مع AI planning display ومنطقة أمان

هذا تقدم حقيقي في robotics. لكنه لا يعني أن روبوتاً كهذا سيصبح منتجاً منزلياً أو مخزنياً أو للرعاية خلال الربع القادم.

ما الذي أعلنته Google

تصف DeepMind النظام كثلاثة نماذج. Gemini Robotics 2 VLA يحول vision/language input إلى robot actions. Gemini Robotics ER 2 يقدم embodied reasoning: فهم الفيديو، التعليمات، progress tracking، tool calls و robot APIs. أما Gemini Robotics On-Device 2 فهو VLA منخفض latency للتشغيل المحلي على الروبوت.

الوصول العام أضيق من الانطباع الذي تعطيه الفيديوهات. ER 2 متاح عبر Gemini API و Google AI Studio، بما في ذلك gemini-robotics-er-2-preview و streaming preview لـ Live API. أما VLA action model و On-Device model فهما مخصصان لـ early-access partners. Ars Technica لخصت الأمر بدقة: هناك ثلاثة نماذج، لكن واحداً فقط متاح للعامة الآن.

لماذا يهم ذلك

الأمر المهم ليس مجرد حركة humanoid. الأهم هو أن reasoning layer يستطيع مشاهدة continuous video، فهم مرحلة المهمة، الانتقال عند الوقت المناسب، والتعامل مع تغييرات صغيرة في المشهد.

تذكر Google رقمين: 57.4% accuracy في progress classification، و 91.3% accuracy مع 0.96 seconds mean absolute distance في moment finding. الرقم الثاني مفيد. الأول يذكرنا بأن قرابة 60% لا تكفي وحدها قرب البشر أو المخزون أو المعدات الغالية.

البنية نفسها معقولة: نموذج أعلى يقرر، ثم VLA أو controller أو robot API أو إنسان ينفذ. هذا أكثر واقعية من فكرة LLM يحرك كل motor مباشرة.

ماذا قالت النقاشات

كان نقاش Hacker News يملك 609 points و 515 comments عند التحقق. الأسئلة كانت عملية: doorknobs، السقوط، الأثاث، غموض أسماء الأجسام، actuator limits، latency، الكلفة، safety والثقة في Google APIs.

الروبوت المنزلي يقسم الآراء. البعض سيدفع مبالغ كبيرة مقابل household assistant. آخرون يرون أن كثيراً من المهام لا تحتاج humanoid: روبوت متخصص أو ذراع ثابتة أو قاعدة متحركة قد تكون أرخص وأكثر أماناً. وهناك privacy: روبوت في البيت هو كاميرا وميكروفون وآلة متحركة داخل مساحة خاصة، و cloud control يرفع حاجز الثقة.

Safety هو الاختبار الحقيقي

نشرت DeepMind مجموعة ASIMOV-Agentic على Hugging Face مع safety technical report. التقييم يغطي safety tool calls و human safety monitoring و feasibility و uncertainty وحالات طلب تدخل الإنسان.

هذا هو الإطار الصحيح. خطأ الروبوت ليس فقرة سيئة. قد يسقط رفاً، أو يضغط على يد، أو يتلف منتجاً، أو يتحرك حين يجب أن يتوقف. السؤال ليس فقط هل ينجز المهمة في فيديو، بل هل يعرف متى لا يتحرك.

أين يظهر أولاً

الاستخدامات الأولى ستكون غالباً في labs و warehouses و inspection routes و facilities و manufacturing cells. هذه أماكن يمكن قياسها ومراقبتها وبناء safety case لها. المنزل أصعب: فوضى، أطفال، حيوانات، privacy واقتصاد غير واضح.

Humanoid shape يفيد عندما تكون البيئة مصممة للبشر. لكن في كثير من الأعمال ستكون wheeled base أو fixed arm أو AMR أو drone أو آلة متخصصة أرخص وأسلم.

ما الذي يجب مراقبته

نحتاج independent trials و partner pilots و failure videos و task-level success rates و teleoperation disclosure و latency و maintenance cost و incidents. ويجب أن نرى هل يسمح ER 2 عبر Gemini API ببناء robot agents حقيقية، أم أن القدرات المهمة ستبقى خلف partner access.

الخلاصة المتوازنة: Gemini Robotics 2 يوضح أن robot reasoning يتحسن. لكن دليل everyday deployment أبطأ من العروض. "Physical AGI" ليس فئة منتج بعد، بل اتجاه بحث وتجارب مبكرة.