وکاله آریا للأنباء - حتى الآن لا یوجد اختبار عالمی متفق علیه یحدد اللحظه التی یبلغ فیها الذکاء الاصطناعی مستوى الذکاء العام (أنسبلاش)
خلال السنوات الأخیره، أصبحت نماذج الذکاء الاصطناعی قادره على کتابه التعلیمات البرمجیه، واجتیاز الامتحانات الجامعیه، وحل المسائل الریاضیه المعقده، والنجاح فی الاختبارات العلمیه، إلى جانب التعامل مع الصور والفیدیو والنصوص.
ولا یوجد إعلان یحظى بإجماع علمی بأن نظاما بعینه بلغ الذکاء الاصطناعی العام، الذی یفترض أن یضاهی القدرات المعرفیه البشریه فی معظم المهام أو جمیعها، لأن المجتمع العلمی لا یملک نقطه وصول أو اختبارا موحدا متفقا علیه.
قصص مقترحه
list of 2 items list 1 of 2 آیفون 18 برو.. کیف أعادت آبل تصمیم تجربه التصویر؟ list 2 of 2 التجاره العالمیه تتماسک رغم حرب إیران والذکاء الاصطناعی یدعم النمو end of list ویمثل الوکیل الذکی اتجاها تقنیا مهما نحو أنظمه أکثر استقلالیه، ومحاوله لعبور الفجوه التی تفصل النماذج الحالیه عن الهدف المنشود، لکن خط النهایه المفترض یتحرک کلما اقتربت النماذج منه.

الخلاف حول تعریف الذکاء الاصطناعی العام لا یتعلق بالتسمیه فقط وإنما بالقدرات التی ینبغی للنظام امتلاکها (أنسبلاش) تعریف یتحرک کلما اقتربنا منه
لا یوجد الوقت الحالی تعریف علمی عالمی موحد متفق علیه للذکاء الاصطناعی العام، حیث تختلف التعریفات بین الشرکات والمختبرات الأکادیمیه، ویؤثر هذا الاختلاف مباشره فی کیفیه تقییم التقدم.
ویشیر تقریر السلامه الدولی للذکاء الاصطناعی إلى افتقار الذکاء الاصطناعی العام إلى تعریف عالمی، لکنه یستخدم عاده للإشاره إلى نظام برمجی یساوی أو یتجاوز البشر فی جمیع المهام المعرفیه أو معظمها.
فی حین تعرفه " أوبن إیه آی " فی میثاقها بأنه أنظمه عالیه الاستقلالیه تتفوق على البشر فی معظم الأعمال ذات القیمه الاقتصادیه.
وبدلا من استخدام مصطلح الذکاء الاصطناعی العام، یفضل الرئیس التنفیذی لشرکه " أنثروبیک " الحدیث عن الذکاء الاصطناعی المتقدم، الذی یصفه داریو أمودی بأنه أذکى من حائز جائزه نوبل فی معظم المجالات، وقادر على تنفیذ مهام لساعات وأیام وأسابیع بصوره مستقله.

غیاب معیار عالمی معتمد یجعل إعلان بلوغ الذکاء الاصطناعی العام رهینه تصریحات الشرکات نفسها (أنسبلاش) من یملک حق إعلان الوصول؟
غیاب التعریف الموحد یؤدی إلى عدم وجود اختبار عالمی معتمد یعلن رسمیا وصوله، على غرار ما تفعله الاختبارات المعیاریه فی مجالات أخرى.
ویفتح هذا الغیاب المجال أمام الشرکات والمختبرات لاستخدام تعریفات ومقاییس مختلفه عند تقییم مدى الاقتراب من الذکاء الاصطناعی العام.
ویوضح فریق "آرک برایز" أنه کلما ابتکر الباحثون مهمه یسهل على البشر حلها ویصعب على الآله، سارعت النماذج إلى تجاوزها، فتضطر الاختبارات للتطور من جدید.
واقترح باحثو "غوغل دیب مایند" إطارا من 6 مستویات متدرجه بهدف التعامل مع الذکاء الاصطناعی العام کمسار تدریجی.
واقترح باحثون آخرون إطارا یعرف الذکاء الاصطناعی العام بأنه نظام یضاهی أو یتفوق على القدرات المعرفیه المتعدده والمتعمقه لشخص بالغ متعلم جیدا.
وفی نسخته الحالیه للإطار، حصل نموذج "جی بی تی فور" على تقییم قدره 27%، بینما حقق نموذج "جی بی تی فایف" تقییما بنسبه 57%ه.
ونظریا، قد تصل أنظمه إلى مستوى من القدرات یصفه بعض الباحثین بأنه الذکاء الاصطناعی العام قبل أن یحظى التعریف نفسه بإجماع.
وبحسب شرکه "آی بی إم" فإن "اختبار تورینغ" -الذی کان یعتبر یوما ما الحد الفاصل- لم یعد کافیا الیوم عند الحدیث عن الذکاء الاصطناعی العام.
ومع کل تقدم جدید، یعید الباحثون تعریف ما یعنیه الذکاء الاصطناعی العام، وهذا التحرک المستمر لخط النهایه یجعل الإعلان عن الوصول أمرا صعبا، حتى لو تحققت قدرات استثنائیه.

النماذج الحالیه تتفوق بمهام محدده کالبرمجه والتشخیص لکنها تفتقر للفهم السیاقی العام (أنسبلاش) لماذا لا یکفی مع أنه یتفوق على البشر؟
تتفوق النماذج المتقدمه على البشر فی بعض الاختبارات والمجالات، لکن أداءها لا یزال متباینا بصوره حاده بین المهام والسیاقات.
وأورد تقریر "مؤشر ستانفورد للذکاء الاصطناعی" مثالا یوثق وصول "جیمینای دیب ثینک" إلى مستوى المیدالیه الذهبیه فی أولمبیاد الریاضیات، مقابل نجاح أفضل نموذج فی قراءه الساعات التناظریه بنحو 50.6%.
وقد یحل النموذج مسأله ریاضیه معقده إذا کانت مشابهه لما تدرب علیه، لکنه یتعثر عندما تتغیر الصیاغه أو السیاق بشکل جوهری، حیث لا تکفی النتیجه العالیه وحدها لإثبات أن النظام استطاع استخدام الإستراتیجیه نفسها فی سیاق مختلف جذریا.
وتتجلى الفجوات الحقیقیه فی عده قدرات بشریه أساسیه، مثل الاستدلال السببی العمیق، والتعلم من تجارب قلیله جدا، والتکیف مع بیئات غیر مألوفه، وهی فجوات یصعب على النماذج الحالیه ردمها.
وعلى عکس البشر، تعانی النماذج صعوبه الحفاظ على الأهداف الطویله الأمد وتصحیح المسار، حیث تستطیع النماذج کتابه أسطر من التعلیمات البرمجیه بسهوله، لکن صعوبه الحفاظ على الأهداف الطویله الأمد وتصحیح المسار تظهر فی تنفیذ مشروع برمجی کامل.
وهذا المشروع البرمجی الکامل یتطلب قرارات مترابطه، وفهم المتطلبات، وبناء الخطه، واختیار بنیه البرنامج، واکتشاف الأخطاء، واختبارها، وتعدیل الخطه، والعوده إلى البدایه عند اکتشاف أن الافتراض الأساسی کان خاطئا.

أداء الذکاء الاصطناعی قد یتراجع عندما یواجه مهمه جدیده تختلف فی بنیتها بصوره جوهریه عما تدرب علیه (أنسبلاش) ماذا یحدث عندما لا یجد النموذج الحل فی ذاکرته؟
عندما یواجه النموذج مهمه جدیده تختلف بنیتها بصوره جوهریه عما تعرض له أثناء التدریب، قد یتراجع أداؤه، وهو ما یثیر سؤالا أساسیا حول مدى قدرته على التعامل مع مشاکل جدیده لم یدرب علیها.
وطور الباحث فرانسوا شولیه اختبارا یعتمد على مهام بصریه ومنطقیه تتطلب اکتشاف قواعد مجرده من أمثله قلیله جدا، مع استخدامها فی حالات جدیده لم تر من قبل من أجل التمییز بین القدره على أداء المهام بنجاح عبر بیانات جدیده لم یسبق رؤیتها أثناء التدریب وبین استرجاع الأنماط السابقه.
وعلى مدى سنوات عدیده، ظل هذا الاختبار بلا حل یذکر، مع محدودیه أداء الأنظمه مقارنه بالبشر الذین یحلون معظم المهام بسهوله نسبیه.
ومع إطلاق النسخه الأولى من الاختبار عبر مسابقه "آرک برایز" عام 2024، ارتفعت أفضل نتیجه عبر مجموعه التقییم الخاصه من 33% إلى 55.5% خلال عام واحد.
ومطلع عام 2025، وصلت النسخه الثانیه من الاختبار، ووصلت أفضل نتیجه عبر مجموعه التقییم الخاصه إلى 24.03%.
وخلال مارس/آذار من العام الحالی، جاءت النسخه الثالثه من الاختبار بمهام تفاعلیه جدیده کلیا، حیث سجلت الأنظمه المتقدمه أقل من 1%، مقابل 100% للبشر.

نقل المعرفه بین مجالات بعیده یبقى من أصعب الاختبارات على النماذج اللغویه الحالیه (أنسبلاش) نقل المعرفه من مجال إلى آخر
من أبرز سمات الذکاء البشری القدره على نقل مبدأ تعلمه فی مجال إلى مجال بعید، حیث یستطیع الإنسان الذی تعلم مبدأ ما فی مجال محدد استخدام المنطق نفسه عند استکشاف مجال آخر عبر الاستدلال التناظری، فی حین أن قدره النماذج الحالیه على النقل عبر المجالات البعیده محدوده.
وحتى مع تقنیات التعلم المنقول والضبط الدقیق، یظل النموذج معتمدا إلى حد کبیر على الأنماط الإحصائیه المشترکه أکثر من الفهم المفاهیمی العمیق، وهو ما یفسر جزئیا لماذا یبدو النظام ذکیا داخل نطاقه التدریبی، ویصبح ضعیفا خارجه.
وفی تجربه قارنت بین الأطفال والبالغین والنماذج فی مهام تماثل ونقل معرفی، نجح البشر فی نقل القاعده إلى مجالات غیر مألوفه بسهوله أکبر، بینما واجهت النماذج صعوبه فی النقل البعید.

الوکیل یضیف أدوات وذاکره وآلیه تخطیط تسمح له بتنفیذ سلسله من الأفعال بدل الاکتفاء بتولید إجابه واحده (أنسبلاش) الجسر الحقیقی للذکاء الاصطناعی العام
یرى باحثون ومطورون أن الوکلاء الذکیین قد یمثلون مسارا مهما نحو أنظمه أکثر عمومیه واستقلالیه، حیث لا یکتفی الوکیل بالرد، إنما یتلقى هدفا، ویبدأ تلقائیا بتفکیکه إلى مهام فرعیه، ووضع خطه تنفیذیه، والتفاعل مع البیئه عبر الأدوات البرمجیه لتنفیذها.
وقدمت "أوبن إیه آی" وکیلا لاستخدام الحاسوب یتعامل مع واجهات المستخدم الرسومیه وینفذ الخطوات المتعدده ویتکیف مع العقبات، موضحه أنه یستطیع تفکیک المهمه إلى خطوات متعدده والتکیف وتصحیح نفسه أثناء التفاعل مع واجهه المستخدم.
ولکن الدراسات الحدیثه تکشف ظهور أنماط متکرره فی تحلیل شامل لفشل الوکلاء فی مراجعه جمعت 27 دراسه و19 معیارا، ویشمل ذلک أخطاء فی استدعاء الأدوات وفشل التخطیط والالتزام بالقیود وتراجع الأداء مع طول الأفق الزمنی وصعوبات فی التنسیق بین وکلاء متعددین.
ولا یزال مقدار التدخل البشری الضروری کبیرا، لأن الوکلاء غالبا ما یحتاجون إلى تدخل بشری متکرر لإعاده التوجیه أو تصحیح المسار، خاصه فی المهام التی تمتد لساعات، مما یعنی أن الاستقلالیه الکامله لا تزال هدفا بعیدا.

قدره الوکلاء على العمل المستقل لساعات ممتده تتضاعف بسرعه لکن موثوقیتها لا تزال محدوده (أنسبلاش) هل یعمل بمفرده لمده زمنیه طویله؟
تعد القدره على الحفاظ على الأداء -عبر المهام الطویله والمعقده دون إشراف بشری- من أبرز التحدیات الحالیه أمام الوکلاء.
ویتراجع الأداء بشکل حاد مع زیاده المده، وتتراکم الأخطاء ویفقد السیاق، ویمیل الوکیل إما إلى الإصرار على الإستراتیجیه الفاشله أو التخلی المبکر عن الهدف.
ویؤکد تقریر السلامه الدولی للذکاء الاصطناعی أن الأنظمه الحالیه تتعثر فی المهام الطویله، وتفقد تتبع تقدمها وتواجه صعوبه فی التعامل مع العقبات، لکنه یشیر أیضا إلى أن أفقها الزمنی یتحسن بسرعه.
وتوثق الأوساط التقنیه ظاهره تشیر إلى تکرار الأخطاء نفسها وتنفیذ تعدیلات غیر مفیده دون أی تقدم فعلی، فیما یستمر هدر تکالیف الحوسبه دون أن یلاحظ أحد.
وفی المقابل، یستطیع الإنسان التعامل مع هذا الأمر من خلال التوقف، والمراجعه، وتغییر الخطه، والتعلم من الخطأ، أو طلب المساعده. وتسعى شرکات الذکاء الاصطناعی إلى بناء نهج مماثل للنهج البشری.
وعرضت "أنثروبیک" تسلسل عمل برمجی یمتد لعده أیام ویعتمد على وکلاء متعددین وذاکره مستمره واختبارات آلیه للتحقق بدلا من إبقاء الإنسان موجودا فی کل خطوه، لکن هذا لا یعنی أن الوکلاء أصبحوا مستقلین لعده أیام بصوره موثوقه فی العموم.

أوزان النماذج تبقى جامده بعد التدریب دون أن تتعلم من تجربتها الفعلیه بعد النشر (أنسبلاش) لماذا لا یتعلم الذکاء الاصطناعی من تجربته؟
یختلف التعلم المستمر عن استخدام أدوات أو ذاکره خارجیه، وینبغی التمییز بین استخدام الذاکره الخارجیه أو الأدوات، وبین آلیات التکیف التی تغیر سلوک النموذج استنادا إلى الخبره، سواء عبر تحدیث الأوزان أو عبر آلیات أخرى.
ویمثل التعلم المستمر فارقا هاما بین الذکاء الاصطناعی والذکاء البشری، حیث لا تزال معظم النماذج المنشوره لا تمتلک تعلما مستمرا مفتوح النهایه ومکافئا للتعلم البشری، رغم ظهور أسالیب تجریبیه للتکیف أثناء التشغیل.
ومن أبرز تحدیات التعلم المستمر مشکله النسیان الکارثی، إذ قد تفقد الشبکات العصبیه قدرتها على تذکر المهام التی تعلمتها سابقا بعد تدریبها على بیانات جدیده. ورغم وجود أبحاث نشطه فی هذا المجال، خاصه فی سیاق الوکلاء، لکن هذه المشکله لا تزال مفتوحه.

تحسین الخوارزمیات باستخدام الوکیل الذکی لا یعنی بالضروره دخول الذکاء الاصطناعی عصر التحسین الذاتی المتکرر (أنسبلاش) عندما یبدأ الذکاء الاصطناعی بتحسین نفسه
تعود جذور فکره التحسین الذاتی المتکرر إلى نقاشات الستینیات حول انفجار الذکاء، خصوصا طرح عالم الریاضیات إرفین جون غود عام 1965 آله فائقه الذکاء تستطیع تصمیم آلات أفضل منها.
ومن الناحیه التقنیه، یعنی التحسین الذاتی المتکرر قدره النظام على کتابه التعلیمات البرمجیه المباشره، وتعدیل خوارزمیاته، وتصمیم نماذج أجیال لاحقه تفوقه ذکاء ودقه، دون أی تدخل بشری.
ولا یوجد الوقت الحالی تعریف متفق علیه للذکاء الاصطناعی العام یجعل التحسین الذاتی المتکرر شرطا لازما للوصول إلیه، ولا یزال التحسین الذاتی المتکرر عبر مجالات واسعه فرضیه أکثر منه واقعا ملموسا، مع أن بعض المؤشرات الأولیه على هذا المسار بدأت بالظهور.
وقدمت "غوغل دیب مایند" مشروع "ألفا إیفولف" وهو وکیل برمجی یستخدم نماذج "جیمینای" مع آلیات تقییم آلی للبحث عن الخوارزمیات وتحسینها، موضحا انتقال الذکاء الاصطناعی من تولید الحل إلى البحث عن حلول أفضل من خلال الاختبار المستمر للأداء وتحلیل الأخطاء وإدخال التحسینات.
لکن هذا التحسین الخوارزمی مؤتمت، ولیس دلیلا على أن نموذجا أعاد تصمیم نفسه بصوره مفتوحه ومتکرره.
هل نقیس الذکاء بالطریقه الخطأ؟
لعده سنوات، کان تقدم الذکاء الاصطناعی یقاس عبر اختبارات، مثل المعرفه العامه والریاضیات والبرمجه واللغه، لکن هذه الاختبارات تواجه مشکله التشبع والتلوث.
ویعنی التشبع عجز اختبار معین عن التمییز بین نموذج متفوق وآخر أقل کفاءه عند وصول النماذج إلى نتائج شبه مثالیه فی ذلک الاختبار.
ویوضح "مؤشر ستانفورد للذکاء الاصطناعی" أن الاختبارات التی کان یفترض أن تکون صعبه لسنوات أصبحت تتشبع خلال أشهر، کما تواجه بعض التقییمات مشکلات تتعلق بجوده الأسئله ومعدل الخطأ فیها.
فی حین یعنی التلوث وجود أسئله أو أمثله الاختبار داخل بیانات تدریب النموذج بطریق الخطأ، مما یجعل من الصعب معرفه ما إذا کان النموذج فهم القاعده أم واجه نسخه محفوظه منها.

کلما ازدادت شهرتها تراجعت مصداقیه الاختبارات المعیاریه وتسربت إجاباتها إلى بیانات التدریب (أنسبلاش) ووجدت دراسه اعتمدت منهجیه محدده إشارات تلوث فی 29.1% من عناصر اختبار المعرفه العامه المعیاری الشهیر "فهم اللغه المتعدد المهام الشامل" ویعنی ذلک أن موثوقیه الاختبار تتراجع کلما ازدادت شهرته لأنه یتحول تدریجیا من امتحان استدلال إلى امتحان حفظ.
وتعد الاختبارات الأقوى للذکاء الاصطناعی العام المستقبلی تلک التی تصعب التلوث والتدرب المسبق، وتبقی جزءا من التقییم سریا أو متغیرا، وتقیس الأداء فی مهام جدیده ومتعدده الخطوات.
ختاما، تعد رحله البحث عن الذکاء الاصطناعی العام استکشافا تدریجیا لما قد تتعلمه الأنظمه التی حققت قفزات کبیره فی معالجه اللغه وتولید المحتوى وحل المشکلات المنظمه، مع أنها لا تزال غیر متسقه عبر مهام وأزمنه مختلفه، مع محدودیه قدرتها على التعلم المستمر والعمل الطویل الأفق.
لکن قبل إعلان الاقتراب من خط النهایه، ینبغی تحدید هذا الخط بوضوح، کما نحتاج إلى تعریفات علمیه صارمه واختبارات دینامیکیه غیر قابله للتلاعب، ومقاییس متعدده الأبعاد تلتقط جوهر الذکاء البشری. وحتى ذلک الحین، یظل خط النهایه مفقودا.
المصدر: الجزیره