يشهد عالم الذكاء الاصطناعي ثورة جديدة بفضل ظهور “نماذج محاكاة العالم” المعروفة باسم “World Model”. كما تعد هذه النماذج القوة الدافعة وراء التطورات الأخيرة في مجال الذكاء الاصطناعي، مثل: مولد الفيديو “Sora”. الذي أذهل العالم بتقنياته المتقدمة. بينما تستثمر الشركات الكبرى، مثل: “مختبرات العالم”، مبالغ طائلة لبناء هذه النماذج التي من المتوقع أن تغير قواعد اللعبة في العديد من المجالات.

نماذج محاكاة العالم
تستلهم نماذج العالم من النماذج الذهنية التي يطورها البشر بشكل طبيعي. تأخذ أدمغتنا التمثيلات المجردة من حواسنا وتشكلها في فهم أكثر واقعية للعالم من حولنا. كما تنتج ما أطلقنا عليه ”نماذج“ قبل فترة طويلة من تبني الذكاء الاصطناعي لهذه العبارة. تؤثر التنبؤات التي تقوم بها أدمغتنا بناءً على هذه النماذج على كيفية إدراكنا للعالم.
وتعطي ورقة بحثية للباحثين في مجال الذكاء الاصطناعي ديفيد ها ويورغن شميدهوبر مثالًا على ضارب كرة البيسبول. فالضاربون لديهم أجزاء من الثانية ليقرروا كيف يضربون بمضربهم – أقصر من الوقت الذي تستغرقه الإشارات البصرية للوصول إلى الدماغ. يقول ها وشميدهوبر إن السبب في قدرتهم على ضرب كرة سريعة بسرعة 100 ميل في الساعة هو أنهم يستطيعون التنبؤ غريزيًا بالمكان الذي تذهب إليه الكرة.
وقال الباحثان: ”بالنسبة للاعبين المحترفين، يحدث كل ذلك بشكل لا شعوري“. ”تقوم عضلاتهم بتأرجح المضرب بشكل انعكاسي في الوقت والمكان المناسبين بما يتماشى مع تنبؤات نماذجهم الداخلية. ويمكنهم التصرف بسرعة بناء على تنبؤاتهم للمستقبل دون الحاجة إلى طرح السيناريوهات المستقبلية المحتملة بوعي لتشكيل خطة“.
كما يعتقد البعض أن هذه الجوانب المنطقية اللاشعورية لنماذج العالم، من المتطلبات الأساسية للذكاء على مستوى الإنسان.
محاكاة العالم
ورغم أن هذا المصطلح مطروح منذ عقود، لكنه اكتسب شعبية في الآونة الأخيرة جزئيًا. ذلك بسبب تطبيقاتها الواعدة في مجال الذكاء الإصطناعي التوليدي.
بينما معظم، مقاطع الفيديو المولدة بالذكاء الاصطناعي تنحرف إلى منطقة الوادي الخارق. شاهدها لفترة كافية ويحدث شيء غريب. مثل التواء الأطراف واندماجها في بعضها البعض.
كما أن النموذج التوليدي الذي تم تدريبه على سنوات من الفيديو قد يتنبأ بدقة بأن كرة السلة ترتد بدقة، إلا أنه لا يملك في الواقع أي فكرة عن السبب. مثل النماذج اللغوية التي لا تفهم المفاهيم الكامنة وراء الكلمات والعبارات. لكن النموذج العالمي الذي لديه حتى فهم أساسي لسبب ارتداد كرة السلة كما تفعل، سيكون أفضل في إظهار قيامها بذلك الشيء.
بينما يتم تدريب نماذج العالم على مجموعة من البيانات، بما في ذلك الصور والصوت ومقاطع الفيديو والنصوص. ذلك بهدف إنشاء تمثيلات داخلية لكيفية عمل العالم. والقدرة على التفكير في عواقب الأفعال.
آراء الخبراء
من جانبه قال أليكس ماشرابوف، رئيس الذكاء الاصطناعي السابق في Snap والرئيس التنفيذي لشركة Higgsfield، التي تبني نماذج توليدية للفيديو، ”يتوقع المشاهد أن يتصرف العالم الذي يشاهده بطريقة مشابهة لواقعه“. ”إذا سقطت ريشة بوزن السندان أو قفزت كرة بولينج على ارتفاع مئات الأقدام في الهواء. فإن ذلك يسبب صدمة ويخرج المشاهد من اللحظة. مع وجود نموذج عالمي قوي، بدلًا من أن يحدد المبدع كيف من المتوقع أن يتحرك كل كائن – وهو أمر ممل ومرهق واستغلال سيء للوقت، يفهم النموذج ذلك.“
لكن تحسين توليد الفيديو ليس سوى غيض من فيض بالنسبة للنماذج العالمية. يقول الباحثون، بمن فيهم كبير علماء الذكاء الاصطناعي في ميتا يان لوكون، إن النماذج يمكن استخدامها يوماً ما للتنبؤ والتخطيط المتطور في المجالين الرقمي والمادي.
وسبق أن وصف أليكس ماشرابوف كيف يمكن لنموذج العالم أن يساعد في تحقيق الهدف المنشود من خلال التفكير المنطقي.
كما يمكن للنموذج الذي يحتوي على تمثيل أساسي لـ ”عالم“ (على سبيل المثال فيديو لغرفة متسخة)، إذا ما أعطي هدفًا (غرفة نظيفة)، أن يتوصل إلى سلسلة من الإجراءات لتحقيق هذا الهدف (نشر المكانس الكهربائية للكنس، تنظيف الأطباق، إفراغ القمامة) ليس لأن هذا نمط لاحظه ولكن لأنه يعرف على مستوى أعمق كيفية الانتقال من القذارة إلى النظافة.
ولا شك أننا بحاجة إلى آلات تفهم العالم. ذلك من خلال تذكر الأشياء، والحدس وحس قوي للتفكير والتخطيط بنفس مستوى البشر. ورغم ما قد تكون سمعته من بعض الأشخاص الأكثر حماسة، فإن أنظمة الذكاء الاصطناعي الحالية ليست قادرة على أي من ذلك.
كما أننا على بعد عقد من الزمن على الأقل من نماذج العالم التي يتصورها، إلا أن نماذج العالم الحالية تبشر بالخير كمحاكيات فيزيائية أولية.
نموذج سورا من أوبن أيه آي
سبق أن أوضحت Open AI في مدونة أن نموذج سورا يمكنه محاكاة أفعال مثل الرسام الذي يترك ضربات فرشاة على لوحة فنية.
كما يمكن أيضًا لنماذج مثل Sora – و Sora نفسها – محاكاة ألعاب الفيديو بشكل فعال. فعلى سبيل المثال، يمكن لـ Sora تقديم واجهة مستخدم وعالم ألعاب شبيه بماين كرافت.
بينما تكون نماذج العالم المستقبلية قادرة على توليد عوالم ثلاثية الأبعاد عند الطلب للألعاب والتصوير الافتراضي وغير ذلك، كما قال المؤسس المشارك في مختبرات العالم جاستن جونسون في حلقة من بودكاست a16z.
كما أكد خبراء التكنولوجيا مرارًا وتكرارًا أننا لدينا بالفعل القدرة على إنشاء عوالم افتراضية تفاعلية افتراضية، لكنها تكلف مئات ومئات الملايين من الدولارات والكثير من الوقت اللازم للتطوير. أيضًا إن نماذج العالم تحصل على صورة أو مقطع فحسب. بل تتيح لك محاكاة كاملة ونابضة بالحياة وتفاعلية ثلاثية الأبعاد.
العقبات والتحديات
يتطلب تدريب النماذج العالمية وتشغيلها طاقة حوسبة هائلة حتى بالمقارنة مع الكمية المستخدمة حاليًا في النماذج التوليدية.
بينما يمكن تشغيل بعض أحدث النماذج اللغوية على هاتف ذكي حديث، فإن سورا (يمكن القول إنه نموذج عالمي مبكر) يتطلب الآلاف من وحدات معالجة الرسومات لتدريبها وتشغيلها. خاصة إذا أصبح استخدامها شائعا
كما أن النماذج العالمية، مثل جميع نماذج الذكاء الاصطناعي، “تهلوس” أو تنتج تحيزات في بيانات التدريب الخاصة بها. حيث إن النموذج العالمي الذي تم تدريبه إلى حد كبير على مقاطع فيديو للطقس المشمس في المدن الأوروبية قد يكافح لفهم أو تصوير المدن الكورية في ظروف ثلجية. فعلى سبيل المثال، أو ببساطة يفعل ذلك بشكل غير صحيح.
المقال الأصلي: من هنـا


