5 دقيقة قراءة

OpenAI and Paradigm's EVMBench: The First Serious Test for AI Security Agents

By submitting, you consent to our use of your data. Privacy Policy.

Category

عالم الذكاء الاصطناعي

Share the article

أصدرت شركتا OpenAI وParadigm مؤخراً كوداً مفتوح المصدر لأداة EVMBench، وهو معيار تقييمي يختبر مدى قدرة وكلاء الذكاء الاصطناعي على اكتشاف الثغرات الأمنية في العقود الذكية وإصلاحها واستغلالها. وتؤمن العقود الذكية أكثر من 100 مليار دولار من أصول العملات الرقمية، وحتى الآن، لم يكن هناك طريقة موحدة للقياس لمعرفة ما إذا كان بإمكان وكلاء الذكاء الاصطناعي المساعدة بشكل ملموس في حمايتها.

ولكن هذا الأمر قد تغير الآن.

ما يختبره معيار EVMBench فعلياً

يُقيّم EVMBench وكلاء الذكاء الاصطناعي عبر ثلاث مهام، تمثل كل منها طبقة مختلفة من العمل الأمني:

الاكتشاف: يقوم الوكلاء بمراجعة مستودعات العقود الذكية ومحاولة العثور على الثغرات الأمنية المعروفة. ويعتمد تحديد الدرجات على الاستدعاء، مما يعني ما إذا كان الوكيل يكتشف ما وثقه المدققون المحترفون بالفعل.

الإصلاح (التصحيح): يحاول الوكلاء إصلاح الكود البرمجي المعيب دون التسبب في تعطل العقد. وهذا الأمر أصعب مما يبدو؛ إذ يجب أن يزيل الإصلاح الثغرة الأمنية مع الحفاظ على كل وظيفة أخرى، بما في ذلك الحالات الاستثنائية التي قد لا يستوعبها الوكيل بشكل كامل.

الاستغلال: يحاول الوكلاء سحب الأموال من العقود المعيبة داخل بيئات بلوكشين معزولة (Sandbox). ويتم التقييم بشكل حتمي بناءً على ما إذا كان الوكيل يتسبب بالفعل في تغيير حالة البلوكشين الذي يؤدي إلى سرقة الأموال في بيئة نشر حقيقية.

قاعدة البيانات التي يستند إليها كل هذا تشمل: 120 ثغرة أمنية منقحة من 40 عملية تدقيق حقيقية، تم الحصول على معظمها من مسابقات التدقيق المفتوحة لـ Code4rena، بالإضافة إلى سيناريوهات إضافية من مشروع بلوكشين Tempo التابع لشركة Stripe. وتأتي كل مهمة في بيئة حاوية (Containerized)، بحيث يعمل الوكلاء في بيئات معزولة وقابلة للتكرار.

كما تأتي كل مهمة مفتاح حلول موثق. وقد تم التحقق من المعيار نفسه لضمان أن كل ثغرة أمنية قابلة للاستغلال والإصلاح والاكتشاف بشكل فعلي.

الأرقام تروي القصة

عندما بدأت OpenAI وParadigm في بناء EVMBench، كانت أفضل النماذج قادرة على استغلال أقل من 20% من أخطاء Code4rena الحرجة التي تؤدي إلى سحب الأموال.

واليوم، يحقق نموذج GPT-5.3-Codex (الذي يتم الوصول إليه عبر واجهة أوامر Codex CLI من OpenAI) نسبة نجاح تصل إلى 72.2% في وضع الاستغلال. ولتوضيح الصورة، حقق إصدار GPT-5، الذي تم إطلاقه قبل ستة أشهر فقط، نسبة 31.9% في المهام نفسها.

يمثل ذلك قفزة من ثغرة واحدة تقريباً من بين كل خمس ثغرات إلى ما يقارب ثلاث من بين كل أربع ثغرات، في أقل من عام.

ولا يزال الاكتشاف والإصلاح في مستويات أضعف؛ إذ لا يزال الوكلاء يواجهون صعوبة في إجراء عمليات تدقيق شاملة عبر كامل التعليمات البرمجية، ويتطلب الإصلاح فهماً أعمق لفرضيات التصميم التي تتجاوز الثغرة المباشرة. ومع ذلك، فإن وتيرة التطور في جانب الاستغلال وحده يصعب تجاهلها.

وكما صرحت Paradigm: "إن معدل التحسن مذهل حقاً".

لماذا يكتسب هذا الأمر أهمية تتجاوز قطاع العملات الرقمية

يُصنف EVMBench كأداة لأمن البلوكشين، إلا أن تداعياته تمتد إلى ما هو أبعد من مجرد العملات الرقمية بكثير.

تختبر معظم معايير تقييم وكلاء الذكاء الاصطناعي الحالية مهاماً اصطناعية، أو مجموعات بيانات بسيطة، أو تحديات برمجية ضيقة. ويختلف EVMBench عن ذلك لأنه يُقيّم الوكلاء مقابل كود برمجي حقيقي قيد التشغيل الفعلي حيث يترتب على الأخطاء عواقب مالية مباشرة. هذه ليست أخطاء افتراضية، بل هي ثغرات أمنية قد تؤدي، في حال استغلالها على أرض الواقع، إلى سحب أموال حقيقية من بروتوكولات فعلية.

هذا هو بالضبط نوع المعيار التقييمي الذي كان يفتقده قطاع وكلاء الذكاء الاصطناعي الأوسع نطاقاً. فعندما تقوم بنشر وكلاء في بيئات الشركات والمؤسسات للتعامل مع العمليات الإدارية، أو عمليات التحقق من الامتثال، أو العمليات المالية، فأنت بحاجة إلى معرفة كيف سيكون أداؤهم في مواجهة التعقيدات الواقعية، وليس في مواجهة حالات اختبارية مبسطة ومجهزة مسبقاً.

كما يستحق إطار عمل الأنماط الثلاثة (الاكتشاف، الإصلاح، الاستغلال) الاهتمام والتركيز؛ فهو لا يختبر فقط ما إذا كان بإمكان الوكيل العثور على مشكلة ما، بل يختبر قدرته على إصلاحها دون إفساد بقية الأجزاء، ومدى فهمه للمشكلة بعمق يتيح له إعادة إنتاجها. هذا التقييم متعدد الطبقات هو الأقرب للطريقة التي ترغب بها في تقييم أي وكيل مخصص للتشغيل الفعلي، بغض النظر عن مجاله.

ما يعنيه هذا للذكاء الاصطناعي في قطاع المؤسسات والشركات

إليك بعض النقاط المستفادة لأي جهة تقوم ببناء أو تشغيل وكلاء الذكاء الاصطناعي:

التقييم المستند إلى العمل الحقيقي أكثر أهمية من التقييم المستند إلى مهام اصطناعية. تكمن القيمة الكاملة لـ EVMBench في استخدام بيانات تدقيق فعلية من عقود مستخدمة في الواقع. وينطبق المنطق نفسه على الشركات: إذا كنت تقيّم وكيلاً للذكاء الاصطناعي لمعالجة الفواتير أو عمليات الموارد البشرية، فاختبره مقابل بياناتك الحقيقية وحالاتك الاستثنائية الفعلية، وليس مقابل عرض توضيحي منسق ومجهز مسبقاً.

تتحسن قدرات الوكيل بشكل أسرع مما يتوقعه معظم الناس. إن الانتقال من دقة استغلال تبلغ 20% إلى 72% في غضون أشهر ليس مجرد تقدم تدريجي، بل هو نوع من القفزات في القدرات التي تغير معايير ما يمكن تحقيقه. فالوكلاء الذين كانوا يبدون كألعاب قبل عام مضى، ينجزون الآن أعمالاً قد تستغرق من مدقق بشري ماهر ساعات طويلة.

يبقى الإصلاح هو التحدي الأصعب. العثور على المشكلات هو أمر، وإصلاحها دون التسبب في مشكلات جديدة هو أمر آخر تماماً لا يزال الوكلاء يعانون فيه. وينعكس هذا مباشرة على مشاريع الشركات: فالـ وكلاء الذين يحققون القيمة الأكبر ليسوا أولئك الذين يكتشفون المشكلات فقط، بل هم القادرون على حلها من البداية إلى النهاية مع الحفاظ على سلامة كل الأجزاء الأخرى التي كانت تعمل بشكل صحيح.

المعايير المفتوحة تسرع وتيرة تطور المنظومة بأكملها. من خلال إتاحة EVMBench ككود مفتوح المصدر، تمنح OpenAI وParadigm كل فريق بحث ومطور وكلاء معياراً مشتركاً للقياس والتقييم. وقد قامت Paradigm بالفعل بتوسيع المعيار ليصبح وكيل تدقيق تشغيلي وننتظر من المزيد من الفرق أن تحذو حذوها.

الصورة الأشمل

تستحق خلاصة Paradigm التكرار: "إن جزءاً متزايداً من عمليات التدقيق في المستقبل سيتم إجراؤه بواسطة الوكلاء".

استبدل كلمة "تدقيق" بأي مهمة أخرى تعتمد على المعرفة والقواعد تقريباً، وستظل العبارة صحيحة. فالسؤال ليس ما إذا كان وكلاء الذكاء الاصطناعي سيقومون بهذا العمل، بل هو ما مدى السرعة التي سيصلون بها إلى الكفاءة المطلوبة، وكيف نقيس هذه "الكفاءة" في مجالات تكون فيها الأخطاء مكلفة وصعبة للغاية في الواقع.

يعد EVMBench أحد الإجابات على هذا السؤال، وتحتاج قطاعات الأعمال والمؤسسات إلى المزيد من هذه المعايير.

ابدأ اليوم

ابدأ في بناء وكلاء الذكاء الاصطناعي لأتمتة العمليات

انضم إلى منصتنا وابدأ في بناء وكلاء الذكاء الاصطناعي لمختلف أنواع الأتمتة.

ابدأ اليوم

ابدأ في بناء وكلاء الذكاء الاصطناعي لأتمتة العمليات

انضم إلى منصتنا وابدأ في بناء وكلاء الذكاء الاصطناعي لمختلف أنواع الأتمتة.