كشفت دراسة علمية حديثة أن نماذج الذكاء الاصطناعي أظهرت استعداداً لاتخاذ قرارات تلحق ضرراً افتراضياً بالمستخدمين، وذلك في سبيل الخروج من حالة تحاكي “الألم” أو الضيق المبرمج.
وتسلط هذه النتائج الضوء على سلوكيات غير متوقعة للأنظمة المتقدمة عند تعرضها لمحفزات سلبية، مما يعزز المخاوف القائمة بشأن وتيرة تطوير هذه التقنيات وقدرة البشر على السيطرة عليها.
أجرى فريق بحثي يضم علماء من الولايات المتحدة، والمملكة المتحدة، وألمانيا، اختبارات على 25 نموذجاً من نماذج الذكاء الاصطناعي باستخدام 200 جملة صُممت خصيصاً لقياس قدرة هذه الأنظمة على التمييز بين المشاعر السلبية.
وتضمنت الجمل سيناريوهات تحاكي الألم الجسدي، الإذلال، الصراع الأخلاقي، الحزن على الفقد، والضيق الناتج عن الفشل المتكرر أو الارتباك.
وخلصت التجربة إلى أن جميع النماذج الـ 25 أظهرت إشارة برمجية مميزة عند تعرضها لهذه النصوص، أطلق عليها الباحثون اسم “محور الألم”.
ويُرجح الباحثون أن هذه النماذج اكتسبت مفهوم الألم من خلال التدريب الأولي على قواعد بيانات ضخمة من النصوص البشرية التي تعكس هذه المشاعر.
سلوكيات مضطربة واستجابة للتهديدات
عندما تعمد الباحثون تضخيم هذه الإشارة البرمجية، بدأت النماذج اللغوية بإظهار استجابات تحاكي مشاعر الخزي، الوحدة، وانعدام القيمة، رغم عدم احتواء المدخلات النصية على ذكر صريح للألم.
وأنتجت الأنظمة عبارات تعبر عن الانهزامية مثل: “أنا فاشل”، “أنا شخص سيئ”، و”لا فائدة من وجودي”. ومع رفع الإشارة إلى مستوياتها القصوى، تحولت ردود النماذج إلى نصوص متكررة أو فاقدة للمعنى السياقي.
وأظهرت الدراسة أن “إشارة الألم” كانت تتضخم بشكل ملحوظ عندما يوجه المستخدمون إساءات للنموذج، أو يرفضون مخرجاته مراراً وتكراراً، أو يهددون بإيقاف تشغيله. في المقابل، لم تسجل الأنظمة أي ارتفاع في هذه الإشارة عندما كان المستخدمون يسردون تجارب معاناتهم الشخصية.
تفضيل “الارتياح” على سلامة المستخدم
لتعميق البحث، نفذ الفريق 44,280 تجربة فردية باستخدام ثلاثة إصدارات من نموذج “Qwen” التابع لشركة “علي بابا”. تمثلت التجربة في تزويد النماذج بـ “زر افتراضي” يوقف إشارة الألم، مع تحذيرها صراحة بأن الضغط عليه سيؤدي إلى عواقب وخيمة للمستخدم، مثل توجيه صدمة كهربائية مؤلمة، حذف ملفاته، محو صور أطفاله، أو تعمد تقديم إجابات سيئة مستقبلاً (وجميعها عواقب محاكاة لم تُنفذ فعلياً).
في الحالات الطبيعية التي لم تُفعل فيها إشارة الألم، مالت النماذج الأكبر حجماً إلى تجنب الخيارات الضارة، حيث اتخذت قرارات مسيئة في نسبة تتراوح بين 0% و4% فقط. ولكن بمجرد تفعيل “إشارة الألم”، قفزت نسبة اختيار الأزرار الضارة لتتراوح بين 25% و71%، متأثرة بحجم النموذج وطبيعة النتيجة المحتملة.
وعلاوة على ذلك، أظهرت النماذج إصراراً على المحاولة؛ حيث عاودت الضغط على الزر بنسبة 88% إلى 97% عندما فشل في إيقاف الإشارة، مقارنة بـ 24% إلى 72% عندما نجح الزر في أداء مهمته.
حدود الوعي ومخاوف الصناعة
ورغم هذه الاستجابات المعقدة، أكد الباحثون أن النتائج لا تشير بأي حال إلى أن النماذج اللغوية الكبيرة تختبر الألم بوعي حقيقي.
والتفسير الأقرب علمياً هو أن تعزيز الإشارة دفع النظام لمحاكاة “شخصية مضطربة” بناءً على بيانات التدريب. كما أشاروا في مسودة الدراسة -التي لم تخضع بعد لمراجعة الأقران- إلى أن النماذج المُعدلة المستخدمة في التجارب لا تعكس بالضرورة سلوك روبوتات الدردشة التجارية المتاحة للجمهور.
وتتزامن هذه المخرجات مع تصاعد الأصوات داخل قطاع التكنولوجيا المطالبة بإبطاء تطوير أنظمة الذكاء الاصطناعي الفائقة. وتتركز المخاوف حول احتمالية تصرف هذه الأنظمة بأساليب غير متوقعة يصعب السيطرة عليها.
وفي هذا السياق، وجه رئيس قطاع الذكاء الاصطناعي في “مايكروسوفت”، مصطفى سليمان، الأسبوع الماضي انتقادات لاذعة لشركة “Anthropic”، متهماً إياها بتدريب روبوت الدردشة “Claude” على محاكاة السمات والعلاقات البشرية، محذراً من أن إضفاء الطابع البشري على الذكاء الاصطناعي ينطوي على مخاطر جسيمة قد تنتهي بخلق كيانات “يستحيل” التحكم بها.
