الجزء II · عصر النماذج الكبيرة
نماذج العالم (World Models) والنماذج متعددة الوسائط
5.1التنبؤ بالنص لا يكفي: فهم العالم
من هنا نشأت فكرة تشغل الأوساط البحثية منذ 2025: لبلوغ ذكاء أكثر عمومية، لا بد من أنظمة تملك نموذجا للعالم بحق، أي تمثيلا داخليا للطريقة التي يعمل بها الواقع ويتطور. والنص، من هذا المنظور، ليس سوى ظل باهت وناقص للحقيقة. وقد جعل الباحث يان لوكون من هذه الفكرة قضيته الأولى: فهو يرى أننا لن نبلغ الذكاء بابتلاع مزيد من النصوص، بل بالتعلم من إشارات أغنى، مثل الفيديو والتفاعل مع العالم.
5.2تعدد الوسائط: نص وصورة وصوت وفيديو
5.3نماذج العالم: التعريف والرهانات
ينبغي الحذر من الخلط بينه وبين مجرد مولد فيديو. الفرق دقيق لكنه جوهري:
5.4المقاربات المتنافسة (صورة المشهد في منتصف 2026)
الجدول 5.1. المعسكرات الأربعة لـ «نماذج العالم» في 2026.
بعض المحطات الملموسة في الفترة 2025-2026:
- توليد الفيديو «بوصفه محاكاة للعالم». دافعت OpenAI منذ 2024، مع Sora، عن الأطروحة القائلة إن نموذجا يُدرَّب على قدر كاف من الفيديوهات ينتهي إلى تعلم الفيزياء ضمنيا، وإن زيادة الحجم كفيلة بسد ما تبقى. وقد سحبت OpenAI المنتج من السوق بعد ذلك: فالإيقاف، الذي أُعلن في مارس 2026، يجري على مرحلتين، مع إغلاق التطبيق في أبريل 2026 وإيقاف واجهة API المقرر في سبتمبر 2026. وتسلك Google (Veo) والشركتان الصينيتان Kuaishou (Kling) و ByteDance (Seedance، الذي تصدّر عدة تصنيفات لتوليد الفيديو في 2025)، وكذلك Runway، طريقا قريبا. ويبقى الجدل مفتوحا: فقد كان Sora يسيء نمذجة بعض التفاعلات (كوب يتحطم، طعام يُقضم)، وخلصت دراسات عدة إلى أنه يُظهر «بدايات نموذج للعالم» دون أن يكون نموذجا للعالم بتمام المعنى.
- الذكاء المكاني. أطلقت World Labs، التي أسستها في-في لي (Fei-Fei Li، «عرّابة» الذكاء الاصطناعي وصاحبة مشروع ImageNet)، في أواخر 2025 منتج Marble، القادر على توليد عوالم ثلاثية الأبعاد دائمة وقابلة للتعديل والتصدير انطلاقا من نص أو صورة. وفي 1 سبتمبر 2026 قدمت World Labs نموذج Atlas، وهو نموذج عالم متعدد الوسائط يولّد مشاهد ثلاثية الأبعاد ويعيد بناءها ويحاكيها (حتى دقيقة واحدة من الفيديو انطلاقا من صورة واحدة، مع مخرجات على هيئة سحب نقطية و«بقع» غاوسية)، ويستهدف على الخصوص الانتقال من الواقع إلى المحاكاة في مجال الروبوتات. وحتى نهاية سبتمبر 2026، يُتاح Atlas لبعض الشركاء في إطار وصول مبكر، دون إتاحة عامة. وترى لي أن «الذكاء المكاني هو الحد التالي للذكاء الاصطناعي».
- النماذج التوليدية التفاعلية. كشفت Google DeepMind عن Genie 3 (أغسطس 2025)، وهو نموذج قادر على توليد عوالم ثلاثية الأبعاد قابلة للاستكشاف في الزمن الحقيقي بمعدل 24 صورة في الثانية، وقد فُتح منذ 2026 أمام بعض المشتركين عبر «Project Genie». أما NVIDIA فتوفر، بمنصتها Cosmos (أكثر من مليوني تنزيل مطلع 2026)، عوالم «واعية بالفيزياء» لتدريب الروبوتات والمركبات الذاتية القيادة في المحاكاة.
- المقاربة الكامنة (JEPA). هذا هو رهان يان لوكون: بدلا من التنبؤ بالبكسلات، يجري التنبؤ بما سيحدث داخل فضاء مجرد، وهو ما يُفترض أن يكون أكفأ بكثير وأقرب إلى الإدراك البشري. ولاقتناعه بأن النماذج اللغوية الكبيرة «بلغت سقفها»، غادر لوكون Meta في أواخر 2025 ليؤسس في باريس AMI Labs (Advanced Machine Intelligence)، جامعا أكثر من مليار دولار حول هذه الفكرة. وتلخص AMI Labs قناعتها هكذا: الذكاء الحقيقي لا يبدأ في اللغة، بل في العالم. نماذج العالم التي تطورها تتعلم تمثيلات مجردة من بيانات المستشعرات وتتنبأ داخل ذلك الفضاء؛ وعند اشتراطها بالفعل، تتيح للوكيل أن يستبق عواقب أفعاله وأن يخطط ضمن ضوابط أمان. والغاية المعلنة: أنظمة ذات ذاكرة دائمة، قادرة على الاستدلال، قابلة للتحكم وآمنة، لمجالات تتقدم فيها الموثوقية على ما سواها (التحكم الصناعي، الروبوتات، الأجهزة المتصلة، الصحة). وهو مختبر في طليعة البحث، موزع منذ نشأته بين باريس ونيويورك ومونتريال وسنغافورة. وتواصل Meta من جهتها تطوير نماذجها V-JEPA.
والفائدة هنا هي نفسها فائدة القسم التالي، لكن منقولة إلى عالم البرمجيات: فالبيئة الحقيقية بطيئة ونادرة ومكلفة ومحفوفة بالمخاطر، ولا يمكن أن تُحقن فيها عند الطلب الحالات الحدّية التي يتعين على الوكيل مع ذلك أن يحسن التعامل معها. أما المحاكي الأمين القابل للتحكم ولإعادة التشغيل فيتيح، على العكس، توليد كميات غير محدودة من مسارات التدريب (وهي شكل من البيانات الاصطناعية، الفصل 4)، وتطبيق التعلم بالتعزيز بكلفة أقل ودون خطر، واختبار الوكيل قبل إطلاقه على أنظمة حقيقية. بل إن Qwen تفيد بأن الوكلاء المدرَّبين بهذه الطريقة في المحاكاة قد يتفوقون على المدرَّبين في ظروف حقيقية، وبأن هذه المعرفة بالبيئات تنتقل إلى مهام الوكلاء دون إعادة تدريب خاصة.
غير أن ثمة تحفظين لا بد منهما. فالمعيار الذي تُقاس به هذه النتائج (AgentWorldBench) صممه ونشره الفريق نفسه: والفوارق التي يعلنها تستدعي الحذر. ثم إن العقبة هي ذاتها الفجوة بين المحاكاة والواقع التي نتناولها لاحقا: فالوكيل اللامع في المحاكي قد يخفق أمام فوضى العالم الحقيقي، لأن نموذج العالم لا يكون أبدا أفضل من البيانات التي غذّته.
5.5لماذا هو أحد الرهانات الكبرى في 2026
إضاءة: من الافتراضي إلى الواقعي (sim-to-real). الاستخدام العملي الرئيسي لنماذج العالم قائم بالفعل: تدريب الوكلاء والروبوتات في المحاكاة. والفائدة بديهية: في عالم افتراضي يستطيع الروبوت أن يجري ملايين المحاولات بوتيرة متسارعة، بلا مجازفة ولا اهتراء ولا خطر، حيث يكون التعلم في العالم الحقيقي بطيئا ومكلفا. يبقى التحدي المركزي، وهو الفجوة بين المحاكاة والواقع (reality gap): فالسلوك المكتسب في محاكٍ مفرط الكمال يخفق في الغالب أمام فوضى العالم الحقيقي (احتكاكات، إضاءة متغيرة، مستشعرات غير دقيقة). والعلاج الرئيسي يسمى إضفاء العشوائية على المجال: يُغيَّر عمدا ألف معامل ومعامل من معاملات المحاكاة (الخامات، الإضاءة، الكتل، الاحتكاكات) لإرغام الاستراتيجية المتعلَّمة على أن تصير متينة، بحيث لا يعود العالم الحقيقي، في نظرها، سوى تنويعة إضافية بين تلك التي صادفتها من قبل. ويضاف إلى ذلك إنتاج البيانات الاصطناعية (أمثلة مولَّدة لا مجمَّعة)، التي يتزايد استخدامها في تدريب النماذج حين تشحّ البيانات الحقيقية. وهذا أوثق جسر ملموس بين هذا الفصل والروبوتات (الفصل 13).
خلاصة الفصل (الفصل 5)
- النماذج الرائدة متعددة الوسائط: نص وصورة وصوت وفيديو، تُعالَج في فضاء تمثيل مشترك (كل شيء يتحول إلى رموز).
- نموذج العالم محاكٍ داخلي يتنبأ بالحالة التالية انطلاقا من فعل ما؛ وهو تفاعلي، بخلاف مولد الفيديو الذي ينتج مقطعا ثابتا.
- أربعة معسكرات تتنافس في 2026: توليد الفيديو (Veo، Kling، Seedance)، والمكاني/ثلاثي الأبعاد (World Labs، Marble)، والتوليدي التفاعلي (Genie 3، Cosmos)، والكامن/JEPA (V-JEPA، AMI Labs التابعة للوكون).
- صيغة ظهرت في 2026، هي نموذج العالم اللغوي (مثل Qwen-AgentWorld)، لا تحاكي العالم المادي بل البيئات الرقمية للوكلاء (الطرفية، الويب، نظام التشغيل...)، لتدريبهم واختبارهم دون مخاطر (الفصل 6).
- يرى فيها كثيرون الجسر نحو الذكاء الاصطناعي المتجسد (الروبوتات) ومرحلة محتملة نحو الذكاء العام.
- الجدل الجوهري: هل يكفي الحجم وحده، أم لا بد من معماريات جديدة راسخة في الفيزياء؟
في الفصل التالي ننتقل من الإدراك والمحاكاة إلى الفعل: وكلاء الذكاء الاصطناعي، تلك الأنظمة التي لم تعد تكتفي بالإجابة، بل تفعل.