الجزء I · الأسس: فهم الذكاء الاصطناعي قبل النماذج اللغوية الكبيرة
ثورة Transformer: «الانتباه هو كل ما تحتاج إليه»
3.1جدار البنى التسلسلية
ولاجتياز هذا الجدار كان لا بد من بنية قادرة على إنجازين في آن واحد: معالجة السلسلة كلها دفعة واحدة (لكسب السرعة)، وربط أي كلمة بأي كلمة أخرى ربطا مباشرا مهما تباعدتا (حتى لا يضيع شيء). وهذا بالضبط ما تقدمه آلية الانتباه.
3.2الفكرة الحدسية وراء الانتباه
وهذه صورة أخرى: تخيل اجتماعا تزن فيه تلقائيا، كي تفهم ملاحظة ما، كل ما قاله المشاركون من قبل بحسب صلته بالموضوع. الانتباه هو نظام الترجيح هذا، مطبقا على نطاق واسع ومكتسبا بالتعلم آليا.
3.3بنية Transformer (2017)
وثمة مكونان يستحقان أن يبقيا في الذهن:
- الانتباه متعدد الرؤوس (multi-head attention). بدلا من نظام ترجيح واحد، يشغّل Transformer عدة أنظمة بالتوازي، كأنها «نظرات» مختلفة تُلقى على الجملة. فقد يتتبع أحد الرؤوس النحو (مطابقة الفعل للفاعل)، ويتتبع آخر المعنى، وثالث الإحالات («هو» يعود على «الحيوان»). وبجمع هذه النظرات يلتقط النموذج علاقات بالغة الثراء.
- الترميز الموضعي (positional encoding). الانتباه في صورته الخام أعمى عن ترتيب الكلمات: فجملتا «الكلب يعض الرجل» و«الرجل يعض الكلب» متطابقتان في نظره. لذلك تُحقن في تمثيل كل كلمة معلومة عن موضعها في الجملة، حتى يُحفظ الترتيب.
3.4قوانين التوسع (scaling laws)
وقد لخص الباحث ريتشارد ساتون (Richard Sutton) الدرس الفلسفي تحت اسم «الدرس المر» (bitter lesson): على المدى الطويل، تنتهي الطرائق العامة التي تستثمر قدرة حسابية متنامية بالتغلب دائما على الطرائق البارعة التي يصوغها الخبراء بأيديهم بشق الأنفس. أمر محبط للبراعة البشرية، لكنه فعال على نحو لافت.
3.5التدريب المسبق والضبط الدقيق و RLHF
- التدريب المسبق (pre-training). يُلقَّم النموذج قسطا هائلا من النصوص المتاحة (صفحات الويب، الكتب، الشيفرات البرمجية، المقالات). فيتعلم منها النحو والوقائع والاستدلال المنطقي والأسلوب، بمجرد سعيه إلى التنبؤ بما يلي. وهي المرحلة الأعلى تكلفة: أسابيع من الحساب على آلاف المعالجات، بعشرات بل مئات الملايين من الدولارات.
- الضبط الدقيق الخاضع للإشراف (supervised fine-tuning، SFT)، ويسمى أيضا الضبط بالتعليمات. تُعرض على النموذج آلاف الأمثلة من صيغة «سؤال مستخدم، وإجابة مثالية من مساعد». فيتعلم بذلك أن يتصرف تصرف المساعد: أن يجيب، ويتبع التوجيهات، ويلتزم المستوى اللغوي المناسب.
- تقنية RLHF (Reinforcement Learning from Human Feedback، التعلم بالتعزيز من التغذية الراجعة البشرية). يقارن أشخاص بين عدة إجابات للنموذج ويحددون أيها يفضلون. فيتعلم نموذج ثان، يسمى «نموذج المكافأة»، هذه التفضيلات، ثم يُستخدم لتدريب النموذج الرئيسي على إنتاج إجابات تُعد أفضل: أنفع، وأصدق، وأقل سمّية. وهي المرحلة التي تجعل المساعد لطيف المعشر وآمنا نسبيا.
خلاصة الفصل (الفصل 3)
- نموذج Transformer (2017، ورقة «Attention Is All You Need») يستبدل بالقراءة التسلسلية آلية الانتباه التي تربط الكلمات كلها بعضها ببعض مباشرة وتقبل التنفيذ المتوازي على معالجات GPU.
- آلية الانتباه تتعلم، لكل كلمة، أي الكلمات الأخرى تهمها وبأي قدر. أما الانتباه متعدد الرؤوس فيكثّر هذه «النظرات»؛ ويحفظ الترميز الموضعي ترتيب الكلمات.
- سلالة مفكِّك الترميز وحده (عائلة GPT) فرضت نفسها في توليد النصوص.
- تبين قوانين التوسع أن الأداء ينمو على نحو يمكن التنبؤ به مع الحجم والبيانات والحساب، ومن هنا السباق على الموارد. لكن عوائدها قد تبلغ سقفا.
- يُصنع المساعد على ثلاث مراحل: التدريب المسبق، ثم الضبط الدقيق الخاضع للإشراف، ثم RLHF. وهذه المرحلة الأخيرة هي أيضا مهد مشكلة المواءمة.
في الفصل التالي نرفع الغطاء كاملا عن نجم هذا العصر الجديد: النموذج اللغوي الكبير نفسه.