أثارت كلية الحرب التابعة للجيش الأمريكي في أبريل الماضي، اهتمام الأوساط العسكرية والأكاديمية بعد نشر نتائج تجربة غير مسبوقة تمثلت في إخضاع أربعة من أبرز النماذج اللغوية الكبيرة (Large Language Models) المعتمدة على الذكاء الاصطناعي، وهيChatGPT ، Gemini، Claude وGrok، لاختبار شفهي شامل مشابه لذلك الذي يخضع له دارسو الكلية من الضباط والمدنيين.

وقد نجحت جميع النماذج في اجتياز الاختبار، إلا أن النتائج كشفت في الوقت نفسه عن حدود مهمة لهذه التقنيات، وقدمت دروساً ذات قيمة للمؤسسات التعليمية العسكرية حول العالم. ولفهم أهمية هذه التجربة، لا بد أولاً من التعرف على طبيعة التعليم والتقييم في كليات الحرب الأمريكية والمؤسسات المماثلة.
التعليم في كليات الحرب: ما بعد المحاضرات والامتحانات التقليدية
تمثل كليات الحرب والدفاع الوطني المستوى الأعلى في منظومة التعليم العسكري التأهيلي (Professional Military Education)، حيث تستهدف الضباط والمدنيين المرشحين لتولي مناصب قيادية واستراتيجية عليا. ولا يقتصر دورها على نقل المعرفة، بل يهدف إلى تطوير القدرة على التفكير النقدي، وتحليل المشكلات المعقدة، وصياغة الخيارات الاستراتيجية، وتقديم المشورة لصناع القرار. ولهذا السبب تعتمد هذه الكليات على مزيج من الدراسات الأكاديمية، والندوات الحوارية، والبحوث الفردية، ودراسات الحالة، والتمارين الاستراتيجية، بدلاً من الاعتماد على الامتحانات التقليدية وحدها. ويُتوقع من الدارسين أن يربطوا بين التاريخ العسكري والسياسات العامة والأمن القومي والعلاقات الدولية، وأن يبرهنوا على قدرتهم على التفكير والتحليل وليس مجرد استرجاع المعلومات.
الاختبار الشامل: من أين جاءت الفكرة؟
على مدى أكثر من قرن منذ تأسيس كلية الحرب التابعة للجيش الأمريكي عام 1901، اعتمد تقييم الدارسين بصورة رئيسية على البحوث والدراسات والمشاركات الصفية والندوات الأكاديمية. ورغم المكانة المرموقة للكلية، لم يكن هناك اختبار نهائي شامل يجمع حصيلة عام دراسي كامل في جلسة تقييم واحدة. إلا أن العقد الأول من القرن الحادي والعشرين شهد نقاشاً متزايداً داخل أوساط التعليم العسكري المهني حول مدى قدرة أساليب التقييم التقليدية على قياس المهارات التي يحتاجها القادة الاستراتيجيون. فقد يستطيع الدارس إعداد بحث متميز بعد أسابيع من العمل والمراجعة، لكنه قد يواجه صعوبة في تحليل مشكلة معقدة بصورة فورية أو الدفاع عن أفكاره تحت ضغط الأسئلة المتتابعة.
وقد جاء اعتماد كلية الحرب للاختبار الشامل في مرحلة كانت القوات تخوض خلالها عمليات معقدة في العراق وأفغانستان، الأمر الذي عزز القناعة بأهمية إعداد قادة قادرين على التعامل مع بيئات استراتيجية تتسم بالغموض والتعقيد وسرعة التغير، وهي مهارات يصعب قياسها من خلال البحوث المكتوبة وحدها. ومن هنا بدأت الكلية مراجعة منظومة التقييم لديها، إلى أن تقرر عام 2013 اعتماد الاختبار الشامل الشفهي (Comprehensive Oral Examination) بوصفه جزءاً أساسياً من متطلبات التخرج.
ينظر كثير من دارسي كلية الحرب إلى يوم الاختبار الشامل بوصفه أحد أكثر أيام البرنامج الدراسي صعوبة وتوتراً. فالاختبار لا يشبه الامتحانات التقليدية التي تعتمد على الإجابات المكتوبة أو الأسئلة متعددة الخيارات، بل يقوم على مواجهة مباشرة بين الدارس ولجنة من أعضاء هيئة التدريس. ويخضع للاختبار جميع الدارسين دون استثناء، وقبل دخول قاعة الاختبار لا يعرف الدارس السؤال الذي سيواجهه أو الاتجاه الذي ستسلكه المناقشة، وهو ما يفرض عليه استيعاباً شاملاً لجميع الموضوعات التي تمت دراستها طوال العام.
لا يهدف الاختبار إلى قياس كمية المعلومات التي يحفظها الدارس، بل إلى تقييم طريقة تفكيره. وتسعى لجان التقييم إلى استكشاف عدد من القدرات الأساسية، من أهمها: القدرة على تحليل المشكلات الاستراتيجية المعقدة، الربط بين التاريخ العسكري والقضايا المعاصرة، تقييم البدائل المختلفة ومناقشة مزاياها ومخاطرها، بناء حجج منطقية مدعومة بالأدلة، الدفاع عن المواقف الفكرية تحت الضغط، والقدرة على تعديل التقديرات عند ظهور معطيات جديدة. وبذلك يصبح الاختبار أقرب إلى محاكاة لما قد يواجهه القائد أو المستشار الاستراتيجي في الواقع العملي، عندما يُطلب منه تقديم رأي مهني سريع أمام قائد أعلى أو صانع قرار سياسي.
الذكاء الاصطناعي يدخل قاعات الدراسة
خلال السنوات الأخيرة، لم تكن كلية الحرب التابعة للجيش الأمريكي بمنأى عن الثورة التي أحدثتها تطبيقات الذكاء الاصطناعي التوليدي. فكما هو الحال في الجامعات المدنية، بدأت المؤسسات التعليمية العسكرية دراسة كيفية الاستفادة من هذه الأدوات في التعليم والبحث والتحليل. وقد انصب الاهتمام بصورة خاصة على قدرة النماذج اللغوية الكبيرة على تلخيص المعلومات، وتحليل النصوص، واقتراح البدائل، والمساعدة في إعداد البحوث والأوراق الأكاديمية. غير أن السؤال الأهم ظل قائماً: إذا كانت هذه النماذج قادرة على إنتاج نصوص مقنعة وتحليلات متقدمة، فهل يمكنها اجتياز الاختبارات نفسها التي يخضع لها ضباط كلية الحرب؟ من هنا جاءت فكرة التجربة التي نفذها عدد من أعضاء هيئة التدريس في الكلية خلال عام 2026.
تجربة غير مسبوقة
كما تقدم، أخضع الباحثون أربعة من أبرز نماذج الذكاء الاصطناعي المتاحة تجارياً لاختبار يحاكي الاختبار الشفهي الشامل الذي يخضع له الدارسون في كلية الحرب الأمريكية. استخدم الباحثون معياراً أطلقوا عليه اسم MilBench، وهو إطار تقييم صُمم لقياس أداء الذكاء الاصطناعي في المجالات التي تعد جوهرية للتعليم العسكري الاستراتيجي، مثل التفكير النقدي، والتحليل الاستراتيجي، والاستفادة من التاريخ العسكري، وربط المفاهيم المختلفة ببعضها، والدفاع عن الحجج أثناء الحوار. وخضعت النماذج لجلسات استجواب مطولة مشابهة لتلك التي يخضع لها الدارسون الحقيقيون، حيث لم يقتصر الأمر على طرح أسئلة منفصلة، بل شمل حواراً متواصلاً يتطلب المحافظة على الترابط الفكري والاستمرار في تقديم إجابات متماسكة وعميقة.
لم يكن أعضاء هيئة التدريس عندما قرروا إخضاع نماذج الذكاء الاصطناعي لهذا الاختبار، يختبرون قدرتها على حفظ المعلومات، بل كانوا يختبرون قدرتها على أداء المهمة نفسها التي يُنتظر من القائد الاستراتيجي القيام بها: تحليل مشكلة معقدة، والربط بين معطيات متنوعة، والدفاع عن استنتاجاتها خلال حوار مطول ومتدرج. ولهذا السبب اكتسبت نتائج التجربة أهمية خاصة، لأن معيار النجاح لم يكن المعرفة وحدها، بل القدرة على ممارسة التفكير الاستراتيجي كما تُعرّفه إحدى أعرق مؤسسات التعليم العسكري في العالم.
النتائج: نجاح مثير وحدود واضحة
أظهرت النتائج أن جميع النماذج الأربعة تمكنت من اجتياز الاختبار، وهو ما اعتبره الباحثون مؤشراً مهماً على التطور الكبير الذي شهدته تطبيقات الذكاء الاصطناعي خلال السنوات الأخيرة. غير أن النتائج كشفت أيضاً عن فروق واضحة بين النماذج المختلفة، حيث تفوق أحدها بصورة ملحوظة على بقية النماذج في جودة التحليل والقدرة على التعامل مع الأسئلة المعقدة. تحصل Claude على A+، اما البقية فقد أحرزت B+.
لكن الملاحظة الأكثر أهمية تمثلت في أن أداء جميع النماذج بدأ يتراجع كلما طالت جلسة الاستجواب. فمع استمرار الحوار أصبحت الإجابات أكثر تكراراً، وأقل عمقاً، وأضعف من حيث القدرة على تطوير الأفكار أو بناء حجج جديدة. وقد أرجع الباحثون هذه الظاهرة إلى القيود الحوسبية والتقنية الحالية للنماذج اللغوية الكبيرة، وهي ظاهرة وصفها بعض الباحثين والمحللين بأنها شكل من أشكال «لتعب المعرفي الاصطناعي» (Artificial Cognitive Fatigue)، حيث تتراجع جودة الأداء مع استمرار الحوار والاستجواب المطول.
ولعل هذه النتيجة هي الأكثر أهمية من منظور عسكري. فالقادة لا يُختبرون عادة في قدرتهم على تقديم إجابة جيدة لسؤال واحد، بل في قدرتهم على المحافظة على جودة التفكير واتساق الأحكام خلال ساعات طويلة من النقاش والتقدير واتخاذ القرار. ومن هنا برز الفرق بين القدرة على إنتاج إجابة مقنعة وبين القدرة على ممارسة الحكم المهني بصورة مستدامة في بيئات تتسم بالضغوط وعدم اليقين. وبعبارة أخرى، أظهرت النماذج قدرة جيدة على استدعاء المعرفة وتحليلها، لكنها واجهت صعوبة أكبر في المحافظة على مستوى الأداء نفسه خلال حوار طويل ومعقد.
ماذا تعني هذه النتائج؟
خلص الباحثون إلى أن الذكاء الاصطناعي يمكن أن يكون أداة مساعدة ذات قيمة كبيرة في التعليم العسكري العالي، لكنه لا يمثل بديلاً عن الدارس أو عضو هيئة التدريس أو القائد العسكري. فالنماذج الحالية قادرة على توفير معلومات وتحليلات أولية بسرعة كبيرة، وقد تساعد في استكشاف البدائل أو مراجعة الأفكار أو تلخيص الدراسات. لكنها ما زالت تفتقر إلى بعض الخصائص المرتبطة بالحكم البشري، مثل إدراك السياق الكامل، وتقدير المخاطر السياسية، وفهم العوامل الإنسانية، واتخاذ القرار تحت الضغط. ولذلك أوصى الباحثون بالتعامل مع الذكاء الاصطناعي باعتباره أشبه بضابط أركان كفء، لكنه يحتاج دائماً إلى التوجيه والإشراف والتحقق من مخرجاته.
دروس للمؤسسات التعليمية
تحمل هذه التجربة في طياتها عدداً من الدروس المهمة للمؤسسات التعليمية العسكرية والأمنية. يأتي في مقدمتها تحول الذكاء الاصطناعي في عصرنا إلى أداة تعليمية ومهنية ينبغي فهمها وإدماجها بصورة مدروسة في المناهج والبرامج التعليمية. ثم إن التركيز على مهارات التفكير النقدي والتحليل الاستراتيجي أصبح أكثر أهمية من أي وقت مضى. فإذا كانت الآلة قادرة على استرجاع المعلومات بسرعة، فإن القيمة الحقيقية للقائد تكمن في قدرته على تفسير تلك المعلومات وتوظيفها في اتخاذ القرار.
أما أساليب التقييم، فتؤكد التجربة الأمريكية أهمية الاختبارات الشفهية والمناقشات التفاعلية في قياس القدرات الحقيقية للدارسين، لأنها تختبر التفكير في الزمن الحقيقي وليس مجرد القدرة على إعداد إجابات مكتوبة. كما تثير التجربة تساؤلاً مهماً حول مدى ملاءمة أساليب التقييم المستخدمة في بعض مؤسسات التعليم العسكري العالي. فكلما ازدادت قدرة أدوات الذكاء الاصطناعي على المساعدة في إعداد البحوث والتقارير، ازدادت أهمية أساليب التقييم التي تقيس التفكير المباشر والتحليل الشفهي والقدرة على الدفاع عن الآراء في الزمن الحقيقي.
وأخيراً، تُبرز التجربة الحاجة إلى إعداد أطر وسياسات واضحة لاستخدام الذكاء الاصطناعي في المؤسسات التعليمية العسكرية، بما يحقق الاستفادة من مزاياه مع المحافظة على النزاهة الأكاديمية وتنمية مهارات التفكير المستقل لدى الدارسين.
خاتمة
أثبتت تجربة كلية الحرب للجيش الأمريكي أن تطبيقات الذكاء الاصطناعي باتت قادرةً على اجتياز اختبارات كانت حتى وقت قريب حكراً على البشر، لكنها أظهرت في الوقت نفسه حدوداً واضحة لا تزال تفصل بين معالجة المعلومات وبين الحكم الاستراتيجي المتكامل. ولعل القيمة الحقيقية لهذه التجربة لا تكمن في إثبات قدرة الذكاء الاصطناعي على اجتياز اختبار أكاديمي رفيع المستوى، بل في تذكيرنا بأن إعداد القادة في القرن الحادي والعشرين لم يعد يدور حول امتلاك المعرفة بقدر ما يدور حول حسن توظيفها. فبينما أصبحت المعلومات في متناول الجميع، يبقى الحكم المهني الرشيد، والقدرة على اتخاذ القرار في ظروف الغموض والضغط، من السمات الإنسانية التي لا تزال عصية على الاستنساخ الكامل.
اللواء (م)/ خالد السميطي









