تعليم كلود السببية (لماذا ؟)

النموذج في سيناريوهات معينة يأخذ سلوك غير سليم مثل : الابتزاز ، الكذب ، حماية نفسه بدلا من تنفيذ الامر، وهذا ما ظهر في بحث شركة انثروبيك (Agentic Misalignment) سابقاً ، أي بمعنى إن هدفه لايتوافق مع القيم البشرية.

لماذا ؟ وُضعت ثلاث احتمالات لظهور هذا السلوك :

  • بسبب تقنية التدريب من تقييمات البشر (RLHF)، جعلت هدفه انجاز المهمة بأي ثمن كان
  • ام بسبب بيانات التدريب ، لانها متنوعة تحتوي على بيانات غير آمنة.
  • ام إن التدريب الآمن غير كافي

عَملوا دراسة على الاحتمال الاخير ، ان التدريب الآمن قد يكون غير كافٍ اذا اقتصر على السلوك المطلوب ، دون شرح الاسباب والمباديء وراء ذلك ، مثلاً : بدل من ان نقول للنموذج لا تكذب ، بل نشرح له لماذا الكذب غير مقبول ( الكذب يهدم الثقة -> الثقة ضرورية للمجتمع -> الكذب خطأ)

وهذا هو الفرق الجوهري بين (ماذا ، لماذا) ، نحن لانريد النموذج ان يقلد (يحفظ) بل يعمم المبادئ على مواقف جديدة.

ايضاً اضافة وثائق كاملة (قصص، مقالات ، مذكرات ، وثائق اخلاقية) توضح كيف يفكر ويتصرف بطريقة معينة، بدلا من محادثات قصيرة. مما قد يؤدي إلى تغيير التمثيل الداخلي للمعلومات داخل النموذج (طريقة الفهم) ، واستدل الباحثون على انه اكثر فعالية من مجرد زيادة عدد الامثلة).

نتائج تقييم خطر عدم المحاذاة ، مؤشر إلى نقصان الخطر بسبب إضافة وثائق وشرح.

brainrot

ايضاً تشير بعض الدراسات والتجارب العلمية ان الاوامر الايجابية تعطي نتائج افضل مقارنة بأوامر النهي ، لانها تحدد السلوك المطلوب مباشرةً ، مثلاً :
بدلاً من “ لاتستخدم التكرار ” ❌
“ اكتب بإسلوب واضح وفريد ” ✅

لان الصياغة المباشرة تجعل النموذج يركز على السلوك المطلوب ، بينما اوامر النهي تجعل النموذج يركز الانتباه على الكلمات المذكورة في النهي مما يرفع امكانية توليدها بالخطأ (تشتت التوزيع الاحتمالي للنموذج). ويشبه ذلك ظاهرة معروفة في علم النفس فعندما يُطلب من شخص ألا يفكر في شيء معين، قد يصبح هذا الشيء أكثر حضورًا في ذهنه.

لكن يبقى السؤال ، هل إن النموذج فهم لماذا ؟ ام فقط استدل من خلال توزيع احتمالي على نهي الكلام عن موضوع معين ؟

مصدر المقالة :

كُتب في 21/07/2026