مباشر
أين يمكنك متابعتنا

أقسام مهمة

Stories

70 خبر
  • العملية العسكرية الروسية في أوكرانيا
  • حرب الخليج
  • قمة شنغهاي في بيشكيك
  • العملية العسكرية الروسية في أوكرانيا

    العملية العسكرية الروسية في أوكرانيا

  • حرب الخليج

    حرب الخليج

  • قمة شنغهاي في بيشكيك

    قمة شنغهاي في بيشكيك

  • رياضة

    رياضة

  • فيديوهات

    فيديوهات

  • منتدى الشرق الاقتصادي في فلاديفوستوك

    منتدى الشرق الاقتصادي في فلاديفوستوك

نماذج الذكاء الاصطناعي تفشل في تجاوز خبراء الرياضيات في اختبار بحثي معقد

خضع الذكاء الاصطناعي، ضمن مشروع "First Proof"، لأحد أكثر اختبارات الرياضيات صعوبة حتى الآن، إذ طُلب من أربعة أنظمة للذكاء الاصطناعي حلّ عشر مسائل بحثية معقّدة.

نماذج الذكاء الاصطناعي تفشل في تجاوز خبراء الرياضيات في اختبار بحثي معقد
صورة تعبيرية / tanit boonruen / Gettyimages.ru

ولم تكن هذه المسائل ضمن بيانات التدريب الخاصة بالنماذج المشاركة، فيما تولّى علماء رياضيات متخصصون مراجعة الإجابات وتقييمها. ويُعد هذا الاختبار الأول من نوعه، إذ يجمع بين مسائل عالية التعقيد، وأسئلة جديدة غير مألوفة لأنظمة الذكاء الاصطناعي، إلى جانب تقييم رسمي يجريه خبراء متخصصون.

وأظهرت النتائج أن نماذج الذكاء الاصطناعي الحالية لا تزال أقل كفاءة من كبار علماء الرياضيات في التعامل مع مسائل مماثلة، كما أنها تفتقر إلى الحدس الرياضي وتظل عرضة لارتكاب الأخطاء أو ما يُعرف بـ"الهلوسة".

واقترح عشرة باحثين هذه المسائل من أعمالهم العلمية غير المنشورة. واقتصرت المشاركة على النماذج المتاحة للجمهور، بما في ذلك نموذج ChatGPT 5.5 Pro من OpenAI، إلى جانب فرق أكاديمية من جامعة كاليفورنيا، وجامعة برينستون، والمعهد الفيدرالي السويسري للتكنولوجيا في زيورخ.

وطوّرت فرق من جامعة كاليفورنيا والمعهد الفيدرالي السويسري للتكنولوجيا ما يُعرف بـ"الأنظمة الوسيطة"، وهي أنظمة يتولى فيها أحد روبوتات الدردشة طرح الحلول، بينما يقوم آخر بمراجعتها والتحقق منها، مع تبادل المعلومات بينهما عدة مرات عند الحاجة.

وسجّل نموذج المعهد الفيدرالي السويسري للتكنولوجيا أفضل أداء، بعدما نجح في حل ست مسائل من أصل عشر. واعتمد النظام على تحسين استجابات ChatGPT من خلال "مجلس استشاري" مكوّن من ثلاثة روبوتات دردشة متقدمة. وجاء فريق جامعة كاليفورنيا في المركز الثاني بنظام مساعد قائم على ChatGPT، تلاه فريق OpenAI باستخدام ChatGPT دون أدوات مساعدة، ثم فريق جامعة برينستون الذي استخدم نظاما قائما على Gemini 3.1 Pro.

ورغم ذلك، لم يتمكن أي فريق من حل ثلاث مسائل من أصل عشر. ووفقا للمشاركين، افتقرت الأنظمة في بعض الحالات إلى الفكرة الجوهرية التي يتوصل إليها البشر بصورة بديهية، بينما نجحت في حالات أخرى في اختيار النهج الصحيح لكنها أخفقت في تنفيذ التفاصيل بدقة.

ومن أبرز التحديات التي رُصدت ظاهرة "الهلوسة"، حيث قدمت أنظمة الذكاء الاصطناعي نتائج غير صحيحة حتى عند مطالبتها بالتحقق من المراجع. كما لوحظ أن بعض النماذج قامت بنسخ أجزاء من مقالات ومصادر منشورة دون الإشارة إليها بشكل واضح.

وأشار الباحثون إلى أن نشر هذه المسائل سيتيح للشركات والمؤسسات الأخرى استخدامها مستقبلا لاختبار قدرات أنظمة الذكاء الاصطناعي وتقييم أدائها في مواجهة التحديات الرياضية المعقدة.

المصدر: science.mail.ru

التعليقات

وكالة "مهر": تم اختبار منظومة الدفاع الجوي الجديدة لأول مرة بنجاح وتمكنت من إسقاط مسيرة أمريكية

الحرس الثوري يعلن استهداف ناقلة تحت عين الحراسة الأمريكية

بيان عسكري إيراني: ستوجه القوات المسلحة ضربات ساحقة ومُدمّرة إلى العدو الأمريكي ردا على عدوانه

الولايات المتحدة تصدر تنبيها أمنيا لرعاياها في الشرق الأوسط: "احتمال حدوث تصعيد غير متوقع"

مصدر عسكري إيراني: سنرد حتما على "جريمة الأمريكيين" الأخيرة.. ردنا سيكون "أضعافا مضاعفة"

الحرس الثوري الإيراني: استهدفنا قاعدة لمشاة البحرية الأمريكية في الأردن ومقتل عدد كبير منهم بالهجوم

وسائل إعلام إيرانية: إيقاف ناقلة نفط سعودية في مضيق هرمز

الحرس الثوري الإيراني: الضربات الأمريكية تعزز إغلاق مضيق هرمز.. والرد بدأ بإسقاط مسيّرة MQ-9

دوي انفجارات في مواقع عسكرية والقنصلية الأمريكية في أربيل

بوتين: الجيش الروسي تلقى أوامر بشن ضربات انتقامية واسعة النطاق ضد البنية التحتية للطاقة الأوكرانية

ردا على ترامب.. إيران تغير قواعد حرب الألغام في الخليج بآلية جديدة (فيديو)

ارتفاع حصيلة قتلى انفجار السيارة المحملة بالذخيرة بريف إدلب السورية إلى 5 أشخاص (فيديوهات)

مراسلتنا: الدفاعات الأردنية تتصدى لصواريخ في سماء المفرق والأزرق وإربد (فيديو)

رويترز: الحصار الأمريكي المفروض على إيران يحقق ما عجزت عنه العقوبات