Gemini Robotics ER 2: دماغ Google للروبوتات — تخطيط وفيديو وتعاون أساطيل

بعد إطلاق 30 يوليو 2026: ما هو Gemini Robotics ER 2، أرقام التقدّم وmoment finding، التوفر عبر API، والسلامة قرب الإنسان للمطوّرين والمصانع.

Gemini Robotics ER 2: دماغ Google للروبوتات — تخطيط وفيديو وتعاون أساطيل
Table of contents

في 30 يوليو 2026 أطلقت Google DeepMind عبر مدونة Google نموذج Gemini Robotics ER 2 — جيل «الاستدلال المتجسّد» (Embodied Reasoning) الذي يعمل كـدماغ عالي المستوى للروبوتات: يفهم الفيديو المستمر، يخطط لمهام متعددة الخطوات، ينسّق أدوات التحكم منخفضة المستوى، ويتيح تعاوناً بين روبوتات مختلفة. هذا المقال شرحي/تحليلي متأخر عمداً (بعد نحو 9 أيام من الإطلاق) لمن يبحث الآن عن المعنى العملي: التوفر عبر Gemini API وGoogle AI Studio، الأرقام، السلامة، وما يعنيه للمطورين والجامعات والمصانع في المنطقة.

غلاف Gemini Robotics ER 2 الرسمي

المصدر: Google Blog — Introducing Gemini Robotics ER 2 (30 يوليو 2026)

ما هو ER 2 باختصار؟

ER = Embodied Reasoning. النموذج ليس بالضرورة من يحرّك المحركات مباشرة في كل الإعدادات؛ هو طبقة تفكير: يتحدث مع البشر، يفهم المشهد، يخطط، يستدعي أدوات (مثل Google Search أو دوال يعرّفها المطوّر)، ثم يسلّم التنفيذ الحركي إلى نموذج VLA (Vision-Language-Action) أو واجهات تنقّل/تحكم أخرى. التصميم يسمح للروبوت أن «يفكّر في الخطوة التالية» أثناء التنفيذ — لا نمط توقف-وفكّر المزعج فقط.

الترقية مقابل ER 1.6 تركّز على: تتبّع تقدّم المهمة من فيديو مستمر، التصحيح الذاتي، ومعرفة متى تُغلق الخطوة والانتقال للتالية، إضافة إلى تعاون متعدد الروبوتات.

الأرقام الرسمية الأبرز

القدرة الرقم المعلن
تصنيف تقدّم المهمة (progress classification) 57.4% دقة
إيجاد اللحظة الحرجة (moment finding) 91.3% دقة
متوسط البعد الزمني للحظة 0.96 ثانية
سرعة التنفيذ مقابل فئات أكبر نحو في سياق المقارنة المعلنة
التوفر Gemini API + Google AI Studio (عام للمطوّرين) + معاينة خاصة على Gemini Enterprise Agent Platform

مخططات الأداء الرسمية تقارن ER 2 بـ ER 1.6 عبر أنماط تحكم: VLA حقيقي، محاكاة، وتحكّم بشري عن بُعد.

مقارنة أداء الوكيل الفيزيائي ER 1.6 مقابل ER 2

المصدر: مخطط Physical agent performance في مقال Google

القدرات الجوهرية مشروحة

1) وكيل فيزيائي وتنسيق أدوات

يعرّف المطوّر واجهات منخفضة المستوى كـ«أدوات» ويبث فيديو/صوت/نص. ER 2 يتفوق على 1.6 في تنسيق هذه الأدوات عبر أوضاع التقييم الثلاثة. التكامل مع Gemini Live API يهدف لتقليل زمن الاستجابة في المهام الحساسة للزمن.

عرض عملي: روبوت Spot من Boston Dynamics يجلب غرضاً بأمر لغة طبيعية عبر تنسيق APIs التنقل والمناور — مع أمثلة على GitHub من Google.

2) ذكاء زمني: هل انتهت المهمة؟

من أصعب مشاكل الروبوتات معرفة اكتمال مهمة دقيقة (ربط كيس نفايات، تثبيت لمبة). ER 2 يقدّم:
- تصنيف تقدّم مستمر على إطارات الفيديو (شرائح 0–20% … 80–100%).
- Moment finding لتحديد الإطار الذي يحدث فيه حدث حرج (متى تتوقف عن صب القهوة).

مقارنة تصنيف التقدّم

المصدر: Google Blog charts

3) تعاون متعدد الروبوتات

لا روبوت واحد يناسب كل شيء. الإعلان يعرض مسارات لتعاون آلات متنوعة (مثال Apptronik Apollo 2 مع Franka F3 Duo في مواد DeepMind المرتبطة). الفكرة: فهم دلالي مشترك لتسليم المهام.

4) ذكاء مكاني أوسع

  • كشف نجاح/فشل من فيديو خام لا لقطات ثابتة فقط.
  • قراءة أجهزة أوسع (شاشات رقمية، مساطر، موازين حرارة سائلة…) عبر ~10 أنواع.
  • تحسين VQA المكاني عبر تقدّم Gemini متعدد الوسائط.

5) السلامة المتجسّدة

Google تصف ER 2 بأنه الأكثر أماناً حتى الآن على معايير Safety Instruction Following وHuman Proximity: إيقاف روبوت بشري الشكل عند اقتراب شخص واستئناف العمل بعد خلّو المنطقة. يتوفر تقرير سلامة تقني.

مخطط أداء السلامة

المصدر: Google Blog safety chart

ماذا يعني هذا لك؟

مطوّرو الروبوتات والطلاب

ابدأ من Gemini API robotics overview وAI Studio والأمثلة على GitHub. حتى بلا ذراع صناعي، يمكنك تجربة تخطيط المهام على فيديو مسجّل.

المصانع والخدمات اللوجستية في الخليج

المستودعات والخطوط شبه الآلية مرشحة لطبقة «دماغ» تنسّق رؤية + تخطيط + أسطول متنوع. ابدأ بإثبات مفهوم على مهمة واحدة قابلة للقياس (فرز، جلب، فحص بصري) مع إشراف بشري.

الجامعات ومراكز الأبحاث

ER 2 يخفض عتبة بحث الوكلاء الفيزيائيين: نموذج استدلالي سحابي + VLA محلي/شريك. راقب التكلفة والسُمْك الشبكي والامتثال لبيانات الفيديو داخل المنشأة.

غير المتخصصين

لن يغيّر الإعلان هاتفك غداً. لكنه يؤشر إلى أن «وكلاء Gemini» لم يعودوا نصوصاً فقط — يمتدون إلى العالم الفيزيائي ببطء محسوب.

مقارنة سريعة

البُعد Gemini Robotics ER 2 ER 1.6 نماذج VLA التقليدية وكلاء نصية فقط (ChatGPT/Claude)
الدور دماغ عالي المستوى الجيل السابق تنفيذ حركي/سياسي baselined لا تحكم روبوت أصلاً
فيديو مستمر / تقدّم نعم (57.4% progress) أضعف متفاوت غير مصمم لذلك
Moment finding 91.3% / 0.96s أقل محدود لا
تعاون متعدد روبوتات معلن كمحور أضعف نادر كمنصة لا
التوفر للمطوّر API + AI Studio سابق غالباً بحثي/شريك تطبيقات دردشة

القيود بصراحة

  1. النجاح في العالم الحقيقي يعتمد على الـ VLA والأجهزة — ER 2 لا يلغي فيزياء الروبوت الضعيف.
  2. 57.4% في تصنيف التقدّم تعني أخطاء كثيرة ما زالت ممكنة؛ لا تنشر بلا رقابة.
  3. Enterprise Agent Platform ما زال معاينة خاصة لبعض المسارات.
  4. الفيديو الصناعي حساس — خصوصية العمال والمنشآت.
  5. التكلفة والزمن الشبكي قد يحدّان التحكم اللحظي إن كان كل شيء سحابياً.
  6. لا تغطية عربية خاصة في الإعلان؛ أوامر اللغة الطبيعية الإنجليزية غالباً الأقوى أولاً.

مسار تبنّي مقترح (من المختبر إلى التجربة الميدانية)

  1. أسبوع 1: شغّل دفتر GitHub الرسمي على فيديوهات مسجّلة.
  2. أسبوع 2: اربط أداة واحدة (تنقل أو gripper API وهمي).
  3. أسبوع 3: أضف شرط سلامة: توقف عند اكتشاف شخص (حتى لو كاشف خارجي).
  4. أسبوع 4: قِس زمن الدورة ومعدل إعادة المحاولة مقابل سكربت ثابت.
  5. بعدها فقط: ناقش تجريباً على أرض المصنع مع مسؤول سلامة.

الأسئلة الشائعة

هل ER 2 متاح الآن للمطوّرين؟

نعم عبر Gemini API وGoogle AI Studio حسب الإعلان؛ بعض المسارات المؤسسية بمعاينة خاصة.

هل يستبدل نموذج التحكم الحركي؟

لا بالضرورة — صُمم لينسّق ويخطط ويسلّم التنفيذ لـ VLA/واجهات أخرى.

ما علاقة Boston Dynamics Spot؟

عرض تنسيق: ER 2 يستدعي APIs للتنقل والمناور لأداء مهمة جلب بأمر لغوي.

هل يناسب مشاريع تخرّج عربية؟

نعم كمنصة تجارب رؤية+تخطيط، مع ميزانية سحابية وحذر من بيانات الفيديو.

أين التفاصيل التقنية العميقة؟

بطاقة النموذج وتقرير السلامة PDF ومقال DeepMind المصاحب.

قراءة اقتصادية وتقنية للمنطقة

مشاريع الروبوتات في الخليج غالباً تشتري منصّات أجنبية وتبحث عن طبقة ذكاء قابلة للتخصيص. ER 2 يناسب سيناريو «دماغ سحابي + جسم موجود» أكثر من استبدال أسطول كامل. الجامعات التي تدرّس الميكاترونكس يمكنها بناء مقررات مشاريع حول تخطيط المهام وقياس progress classification بدلاً من الاقتصار على تحكم PID تقليدي.

أخطاء شائعة عند قراءة الإعلان

  • الخلط بين ER 2 ونموذج VLA الكامل الجسم (Gemini Robotics 2 / On-Device مسارات منفصلة في عائلة الإعلانات).
  • افتراض أن 91.3% moment finding تعني نجاح المهمة النهائية بنفس النسبة.
  • تجاهل تقرير السلامة PDF والاعتماد على فقرة تسويقية واحدة.

تفصيل معماري للمطوّر

طبقة ER مقابل طبقة VLA

فكّر في ER 2 كـ«مدير وردية» وفي VLA كـ«عامل مهاري». المدير يرى الكاميرات، يقرر التسلسل، يستدعي البحث عند الحاجة، ويطلب إعادة المحاولة. العامل ينفّذ مسارات حركية قصيرة. إن كان المدير ممتازاً والعامل ضعيفاً، ستحصل على خطط جميلة وفشل في القبض. العكس يعطيك مهارات بلا مهمة متماسكة.

البث ثنائي الاتجاه وLive API

الحلقة المغلقة تحتاج زمناً منخفضاً. دمج ER 2 مع Gemini Live API يهدف لتجنب توقف الروبوت كل ثانية «ليفكر». في البيئات الصناعية الخليجية حيث قد تكون السحابة خارج المنطقة، اختبر RTT واقعي قبل الالتزام.

محاكاة ثم واقع

Google تذكر التقييم على محاكاة وتحكم بشري عن بُعد وVLA حقيقي. مسار ناضج: سيناريو Gazebo/Isaac → teleop → إشراف جزئي → استقلال مشروط. تخطي المحاكاة يرفع تكلفة الكسر.

حالات استخدام قطاعية واقعية (لا خيال علمي)

مستودع تجزئة

مهمة: إحضار صندوق من ممر معروف. ER 2 يخطط المسار المنطقي ويتحقق من التقدّم بالفيديو؛ الروبوت المتنقل ينفّذ. مقياس النجاح: زمن الدورة، التدخلات البشرية/ساعة، الحوادث القريبة.

مختبر جامعي

مهمة: ترتيب أدوات على طاولة حسب تسمية. يدرّب الطلاب على كتابة أدوات (tools) وقياس moment finding عند «وضع الأداة في الحامل».

تفتيش بصري أولي

مهمة: هل اللوحة ضمن الإطار وهل المؤشر في النطاق؟ القدرة على قراءة أجهزة متنوعة تقلل هندسة الرؤية اليدوية — مع إبقاء مهندس يراجع الإنذارات الكاذبة.

خدمة ضيافة محدودة

جلب غرض في بيئة شبه منظمة (مثل عرض Spot). ليس بديلاً عن العمالة الكاملة؛ هو اختبار واجهة لغة طبيعية + سلامة قرب الضيوف.

الحوكمة والمسؤولية

من يتحمّل خطأ روبوت مدفوع بنموذج سحابي؟ العقود يجب أن توضح: مزوّد النموذج، منفّذ التكامل، مشغّل المنشأة. سجّل قرارات ER 2 (لماذا توقف، لماذا أعاد المحاولة) لأغراض التدقيق. لا تنشر في مساحات بشرية قبل تقييم Human Proximity فعلي على أرضك لا على مخطط تسويقي.

خارطة قراءة للمستجدّين بعد 30 يوليو

  1. مقال Google الرئيسي (هذا الحدث).
  2. بطاقة النموذج ER 2.
  3. مقال DeepMind عن Gemini Robotics 2 / whole-body.
  4. PDF السلامة.
  5. عيّنة GitHub gemini_robotics_er وlive-api.

بهذا الترتيب تتجنب الخلط بين أسماء العائلة (ER 2، Robotics 2، On-Device 2).

أسئلة للمشتري قبل توقيع إثبات مفهوم

  • ما المهمة الواحدة التي إن نجحت نعتبر الـPoC ناجحاً؟
  • ما الحد الأقصى المقبول للتدخل البشري؟
  • أين تُخزَّن فيديوهات العمال وهل يوجد موافقة؟
  • هل نملك واجهة API مستقرة للجسم الروبوت أم سنعيد اختراع التكامل؟
  • من يوقف النظام طوارئ خارج اعتماد النموذج؟

خلاصة إضافية للباحثين عن «هل فات الأوان؟»

لا. بعد تسعة أيام ما زال منحنى الشرح العربي ضعيفاً مقارنة بحجم الإعلان الإنجليزي. مقال تحليلي عميق الآن يلتقط بحثاً متأخراً عالي النية (high-intent) من مهندسين يقارنون المنصات — وهذا بالضبط منطق Lane B.

خلاصة

Gemini Robotics ER 2 (30 يوليو 2026) ينقل وكلاء Google من الشاشة إلى التنسيق الفيزيائي الجاد: فيديو، زمن، أدوات، أساطيل، وسلامة قرب الإنسان. لمن يبحث بعد أسابيع من الإطلاق، الخلاصة العملية: جرّب الآن على API إن كنت مطوّراً؛ ولا تبالغ في وعود المصنع الكامل إن لم تُحكم طبقة التنفيذ والسلامة المحلية.


المصادر: Google Blog — Gemini Robotics ER 2 (30 يوليو 2026)؛ Model card؛ DeepMind — Gemini Robotics 2؛ Safety PDF.

أدوات ومراجع عملية للبدء اليوم

  • نظرة robotics في Gemini API: ابدأ بتهيئة المصادقة ثم جرّب مثالاً جاهزاً قبل كتابة وكيل من الصفر.
  • Google AI Studio بالنموذج gemini-robotics-er-2-preview: مفيد للتجارب التفاعلية السريعة على صور/فيديو قصير.
  • مستودع العينات: اقرأ دفتر Getting Started ثم فرع live-api لفهم البث.
  • بطاقة النموذج: راجع حدود الاستخدام الآمن وبيانات التدريب المعلنة قبل أي عرض تمويلي.
  • تقرير السلامة: استخرج بنود Human Proximity وInstruction Following كمتطلبات قبول في عقد الـPoC.

إطار تقييم داخلي مقترح (جدول بسيط)

الاختبار طريقة القياس عتبة قبول أولية ملاحظات
إكمال مهمة جلب نجاح/فشل عبر 30 تجربة ≥70% بلا تدخل ارفع العتبة قبل الإنتاج
اكتشاف شخص قريب حقن ظهور إنسان في المشهد 100% توقف فشل واحد = لا نشر
Moment finding مقارنة بإطار مرجعي يدوي متوسط خطأ <2ث يعتمد على الكاميرا
إعادة المحاولة عدد المحاولات حتى النجاح متوسط ≤3 راقب التذبذب
تكلفة السحابة $/ساعة تشغيل ضمن ميزانية التجريب سجّل فيديو الدقة

ماذا يبقى في طابور الغد؟

أحداث مجاورة لم تُغطَّ هنا لعدم اتساع سقف الجودة (3 مقالات): تعيين Tino Cuéllar في Anthropic، تفاصيل إضافية لتقييمات OpenAI السيبرانية للطرف الثالث، وأي تحديثات تسعير API لاحقة. تُرصد في التشغيل القادم.

ملاحظة منهجية Lane B

هذا المقال كُتب بعد أيام من الإطلاق لأن البحث العربي عن «Gemini Robotics ER 2» و«روبوتات جيميناي» يتصاعد بعد الموجة الإنجليزية الأولى. نؤرخ الحدث بـ30 يوليو 2026 صراحة في المقدمة ولا نستخدم صياغة «الآن» المضللة. أي تحديث لاحق على التوفر أو الأسعار يجب أن يُلحق كتحديث على نفس الصفحة لا كمقال مكرر.

للمقارنة مع أخبار AI أخرى على Truescho، استخدم وسم الأخبار السريعة ومسار الأدوات: من الشرح إلى التجريب عبر /tools/ai دون وعود مضللة باستبدال العمالة فوراً.

إذا وصلت إلى هنا كمهندس يقارن المنصات: ابدأ بتجربة واحدة قابلة للقياس خلال أسبوعين، لا بعرض شرائح طويل. القياس يفضح المبالغة أسرع من أي مقال — بما في هذا المقال.

كلمات أخيرة: الروبوتات المفيدة لن تصل دفعة واحدة؛ تصل كمهام ضيقة تُقاس وتُؤمَّن ثم تُوسَّع. ER 2 أداة تخطيط في تلك الرحلة، لا نهايتها.
قِس مرتين. انشر مرة. وثّق كل شيء.
قِس مرتين. انشر مرة. وثّق كل شيء.