12 دقيقة قراءة
How Claude Fable 5 Holds Up Against the Top 3 Chinese AI Models for Enterprise

By submitting, you consent to our use of your data. Privacy Policy.
Category
وكلاء الذكاء الاصطناعي
Share the article
أطلقت شركة Anthropic للتو نموذج Claude Fable 5، وجاءت نتائج الاختبارات المرجعية مذهلة وحقيقية. فقد حقق نسبة 95% في اختبار SWE-bench Verified، وتصدر قائمة متصدري GDPval-AA، مسجلاً أطول تشغيل لوكلاء الذكاء الاصطناعي دون إشراف أو تدخل بشري. والتسعير حقيقي أيضاً: 50 دولاراً لكل مليون رمز مخرجات (output tokens)، وهو السعر الأعلى لأي نموذج من مختبر رئيسي.
وفي الأسابيع الستة التي سبقت هذا الإصدار، أطلقت ثلاثة مختبرات صينية نماذج تضاهي Fable 5 في اختبارات البرمجة المرجعية بتكلفة ضئيلة تصِل إلى 1/57 فقط من تكلفته. حيث جاءت نتائج كل من DeepSeek V4-Pro وQwen3.7 Max وKimi K2.6 متقاربة بفارق نصف نقطة فقط عن بعضها البعض في اختبار SWE-bench Verified؛ متأخرة بأربعة عشر نقطة عن نموذج Claude، ولكن بتسعير يقل عنه بمرتبتين عشريتين.
بالنسبة لفرق المؤسسات والشركات التي تقوم بتشغيل وكلاء الذكاء الاصطناعي في بيئة العمل الفعلية، لم يعد هذا قراراً يعتمد على نموذج واحد. في ما يلي: الأرقام الفعلية من المصدر الرئيسي لكل نموذج، والحسابات الرياضية لأعباء العمل الحقيقية، وإطار عمل لاختيار النموذج الأنسب لكل مهمة — بما في ذلك الحالات التي لا تزال النماذج الرائدة تتفوق فيها، والحالات التي لا تتفوق فيها.
النماذج الأربعة في مخطط واحد
قبل أن ندخل في أي تفاصيل، إليك الأرقام الرئيسية من المصدر الأساسي لكل نموذج.
هناك ثلاثة أمور تجدر ملاحظتها على الفور. النماذج الصينية الثلاثة تقع ضمن نصف نقطة من بعضها البعض في اختبار SWE-bench Verified؛ وهو ما يمثل تعادلاً في الاختبار المرجعي. ويتأخر كل منها بفارق يتراوح بين 14 و15 نقطة عن Claude. وتتراوح تكاليف المخرجات عبر نطاق واسع يصل إلى ما يقرب من مرتبتين عشريتين، من 87 سنتاً لكل مليون رمز في الطرف الأرخص إلى 50 دولاراً في الطرف الأعلى.

ما يظهره المخطط هو السؤال الذي يدور حوله هذا المقال بأكمله. نموذج Claude أفضل بكثير بالفعل، ولكنه أيضاً أغلى بكثير. إذن متى يكون خيار "الأفضل بكثير" يستحق دفع هذه التكلفة فعلياً؟
كيف تبدو فجوة الأسعار بالدولار الفعلي
تبدو أسعار الرموز (tokens) مجردة حتى تطبقها على أعباء العمل الحقيقية. لذا دعنا نطبقها على عبء عمل حقيقي.
تخيل وكيلاً نموذجياً للذكاء الاصطناعي في إحدى المؤسسات. إنه يعمل على ما يقرب من 100,000 رمز من السياق لكل عملية استدعاء، وتوجيه النظام، والمستندات المستردة من نظام تخطيط موارد المؤسسات (ERP) الخاص بك، وحالة المحادثة، وتعريفات الأدوات. وينتج حوالي 5,000 رمز من المخرجات لكل عملية تشغيل. وتقوم بتشغيله حوالي 1,000 مرة في اليوم عبر أعمال المؤسسة. هذا هو تقريباً ما تبدو عليه رياضيات الرموز لوكيل الحسابات الدائنة الذي يعالج بضعة آلاف من الفواتير شهرياً.
إليك ما يكلفه ذلك عبر النماذج الأربعة لمدة شهر واحد.
نفس حجم العمل، ونفس شكل الوكيل. سبعة وثلاثون ألف دولار على Claude Fable 5. وألف وأربعمائة دولار على DeepSeek V4-Pro. فجوة في التكلفة تصل إلى 26 ضعفاً.

الآن ضاعف ذلك عبر أي عدد من أعباء عمل الوكلاء التي تخطط لإطلاقها العام المقبل، وسيمكنك معرفة سبب اهتمام المدراء التقنيين (CTOs) فجأة بنماذج الذكاء الاصطناعي الصينية.
ولكن يمكنك أيضاً معرفة سبب عدم كون هذا القرار معتمداً على نموذج واحد. قد تكون فاتورة بقيمة 37,500 دولار شهرياً على Fable 5 صفقة رابحة إذا كان هو النموذج الوحيد القادر على إنجاز العمل. في حين قد تكون فاتورة بقيمة 1,435 دولاراً شهرياً على DeepSeek هدرًا للمال إذا فشل الوكيل بنسبة 15% من الوقت، وقضى فريقك الوقت في معالجة الأخطاء مستخدماً المبالغ التي تم توفيرها.
ولمعرفة أي الحالتين تنطبق، عليك أن تنظر إلى ما هو أبعد من اختبار SWE-bench.
أين تكمن أهمية فجوة الاختبار المرجعي فعلياً
يعد SWE-bench Verified الرقم الأكثر استشهاداً به، ولكنه يقيس شيئاً واحداً محدداً: هل يمكن للنموذج إصلاح الأخطاء البرمجية في مشكلات GitHub الحقيقية مع وجود مجموعة اختبار للتحقق من عمله. هذا أمر مفيد بلا شك، ولكنه ليس ما يفعله وكلاء الإنتاج طوال اليوم.
تقوم معظم وكلاء المؤسسات بربط استدعاءات الأدوات بسلسلة متكاملة، حيث يسحبون البيانات من نظام ما، ويقومون بتحويل شيء ما، ويرسلونها إلى نظام آخر، ويتعاملون مع الاستثناءات عند فشل العملية، ويقومون بتصعيد الأمر عندما يتعذر اتخاذ قرار. والأختبارات المرجعية التي تهم هذا النوع من العمل مختلفة تماماً.
المجالات التي يحتفظ فيها Claude Fable 5 بصدارة واضحة:
مؤشر GDPval-AA Elo البالغ 1932، وهو مقياس لأعمال المعرفة الواسعة في المؤسسات حيث تقدم للنموذج مهمة من العالم الحقيقي ويقوم المقيمون بتسجيل درجاتها. يبلغ مؤشر Opus 4.8 حوالي 1890، وGPT-5.5 حوالي 1769. لم تنشر أي من النماذج الصينية الثلاثة نتائج GDPval لأنها لم تدخل هذا الاختبار المرجعي.
اختبار τ²-bench، الذي يقيس موثوقية استخدام الأدوات عبر مسارات عمل الاتصالات والتجزئة وشركات الطيران. تصف Anthropic نموذج Fable 5 بأنه رائد في التقييمات عبر الفئات الثلاث للوكلاء، لكنها لم تنشر نتائج محددة في الإعلان المكتوب؛ وقد أكد العديد من المطورين الفارق في سلاسل الأدوات غير المألوفة في الأسبوع الأول من الإطلاق.
التشغيل دون إشراف أو تدخل بشري. تدعي حملة Anthropic التسويقية قدرة النموذج على العمل المستقل لـ "أيام". والتحقق المستقل: ينشر المطورون مقاطع تسريع زمني (timelapses) لنموذج Fable وهو يعمل بشكل مستمر لأكثر من عشر ساعات دون أي تدخل. وكلما طالت المهمة، اتسعت فجوة صدارة Claude، وهو عكس ما تفعله معظم النماذج الأخرى.
المجالات التي تطابق فيها النماذج الصينية نموذج Claude أو تتفوق عليه:
يتعادل DeepSeek V4-Pro في اختبار SWE-bench Verified بنسبة 80.6%. وهو قوي جداً في استرداد النصوص ذات السياق الطويل — إذ يمكنك تزويده بمليون رمز وسيقوم بالعثور على الفقرة المطلوبة بدقة.
يتصدر Qwen3.7 Max اختبار Terminal-Bench 2.0-Terminus بنسبة 69.7%، وهو حالياً في قمة قائمة المتصدرين تلك. ويهلوس بنسبة 22.9% من الوقت؛ وهي ثاني أدنى نسبة بين النماذج الرائدة (نموذج Command A+ أدنى بنسبة 14.1%)، على الرغم من أن جزءاً من هذا التحسن يعود إلى قول النموذج "لا أعرف" بشكل أكبر بدلاً من تقديم إجابات صحيحة إضافية.
سجل Kimi K2.6 نسبة 96% في اختبار τ²-bench لقياس قطاع الاتصالات في اختبارات الطرف الثالث التي أجرتها جهة Artificial Analysis؛ وهي أعلى درجة منشورة في هذا الاختبار المرجعي عبر أي نموذج. وتتوسع بنية سرب الوكلاء (Agent Swarm) الخاصة به لتصل إلى 300 وكيل فرعي لكل مهمة.
المخطط العام: يتفوق Claude في مهام المؤسسات الواسعة ومسارات العمل الشاملة غير المألوفة. وتطابقه النماذج الصينية في تكافؤ البرمجة وتتفوق عليه في مهام الوكلاء الضيقة والمحددة التي تم تحسينها من أجلها.
الشيء الذي لا يضعه أحد في مقارنة النماذج
إليك نقطة البيانات التي يجب أن تعيد صياغة كل شيء: معظم المشاريع التجريبية لوكلاء الذكاء الاصطناعي في المؤسسات لا يتم إطلاقها وتطبيقها فعلياً أبداً.
وجد تقرير Anaconda + Forrester حول حالة الذكاء الاصطناعي للوكلاء لعام 2026 أن 88% من المشاريع التجريبية للوكلاء تفشل في الانتقال إلى مرحلة الإنتاج الفعلي. وتنجح 12% فقط في الانتقال من مرحلة إثبات المفهوم (POC) إلى تشغيل الأعمال فعلياً. والأسباب التي تذكرها فرق المؤسسات ليست هي الأمور التي تركز عليها معظم مقارنات النماذج.
فجوات التقييم (64% من الفرق). لا يمكنهم قياس ما إذا كان الوكيل يعمل بفاعلية أم لا.
عقبات الحوكمة والتنظيم (57%). لا يمكنهم الإطلاق دون وجود مسارات تدقيق وموافقات والتزام بالامتثال.
الموثوقية والاستقرار (51%). يتعطل الوكيل في مسارات العمل غير المألوفة له.
لاحظ ما لم يرد في المراكز الثلاثة الأولى: اختيار النموذج. فالنموذج الذي تختاره يأتي في مرحلة تالية للأشياء التي تمنع الوكلاء بالفعل من الإطلاق الفعلي.
هذا لا يعني أن اختيار النموذج غير مهم. بل يعني أن اختيار النموذج يتم حسمه بعد تحديد آلية التقييم والحوكمة، وعند هذه النقطة تقوم بالاختيار بناءً على ما يناسب حجم العمل المحدد، وليس بناءً على النموذج الذي حصل على أعلى درجة في اختبار مرجعي واحد.
تفاصيل الأعطال والمشكلات في كل نموذج
بمجرد اختيار عبء العمل، إليك نقاط الفشل الشائعة لكل نموذج في بيئة الإنتاج الفعلي.
يواجه Claude Fable 5 مشكلته الكبرى في التكلفة المالية المرتفعة. القدرة والجاهزية متوفرتان، لكن التكلفة تمنعك من تشغيله في الأعمال ذات الحجم الكبير التي لا تحتاج إلى هذه القدرات العالية. كما أن إجراءات الحماية والسلامة فيه أكثر صرامة وقيوداً مقارنة بإصدارات Claude السابقة — حيث أبلغ المستخدمون عن خفض تصنيف طلباتهم وتحويلهم إلى نموذج Opus عند تقديم طلبات بسيطة مثل تخطيط التغذية أو الأبحاث البيولوجية الأساسية. بالنسبة لغالبية أعمال المؤسسات، لا يمثل هذا أهمية كبيرة؛ ولكن بالنسبة لأي مسار عمل يمس علوم الحياة، أو الأبحاث الأمنية، أو المحتوى الخاضع للتنظيم، فإن معدل الإشارات الإيجابية الكاذبة (false-positive) في توجيه السلامة هو أمر يجب اختباره قبل الالتزام الكامل باستخدامه.
يعد DeepSeek V4-Pro هو الأفضل بين الثلاثة في استرداد النصوص ذات السياق الطويل وتنفيذ الأكواد البرمجية، ولكنه يعاني مقارنة بنموذج Claude في معالجة الأخطاء المعقدة متعددة الخطوات — فعندما يفشل استدعاء أداة في مسارات عمل غير مألوفة، يكون سلوك معالجة الخطأ في نموذج V4 أقل موثوقية بشكل ملحوظ. أشار تقييم NIST CAISI في مايو 2026 إلى تأخره في القدرات بنحو ثمانية أشهر عن النماذج الرائدة في الولايات المتحدة. هذه الفجوة حقيقية، لكنها تتقلص بسرعة كبيرة.
يتميز Qwen3.7 Max بأقوى العروض التوضيحية لوكلاء الذكاء الاصطناعي في هذه المقارنة. وتظهر العروض التوضيحية الداخلية لشركة Alibaba قدرة تشغيل تصل إلى 35 ساعة دون تدخل واستدعاء 1,158 أداة لكل مهمة. ولكنه متاح فقط عبر واجهة برمجة التطبيقات (API) من خلال Alibaba Cloud Model Studio. أوزان مغلقة، ومستضاف في الصين. وبالنسبة للصناعات الخاضعة للتنظيم والقوانين التي تتعامل مع بيانات العملاء في الاتحاد الأوروبي أو الولايات المتحدة، فإن هذا يعد أمراً غير مقبول على الإطلاق بغض النظر عن القدرات المتوفرة. وقد خرجت Alibaba عن تقاليد Qwen المتمثلة في الأوزان المفتوحة مع هذا الإصدار، مِمّا قلل من الخيارات المتاحة للمؤسسات التي بنيت بنيتها التحتية حول Qwen كبديل مفتوح الأوزان ومنافس للنماذج الرائدة.
يحتوي Kimi K2.6 على نافذة سياق أصغر؛ تبلغ 256 ألف رمز، مقارنة بمليون رمز للنماذج الثلاثة الأخرى. وبالنسبة لمسارات عمل المؤسسات المليئة بالمستندات والوثائق الضخمة (المراجعة القانونية، تحليل العقود، مطابقة المستندات المتعددة)، يمثل ذلك سقفاً حقيقياً يحد من استخدامه. ومن الناحية الإيجابية، فهو مفتوح الأوزان، ومرخص بموجب ترخيص MIT، ويمكن نشره وتثبيته على بنيتك التحتية الخاصة. ونسبة 96% في اختبار τ²-bench حقيقية إذا كان حجم عملك يبدو مثل سلاسل استدعاء الأدوات المتتالية.
الأوزان المفتوحة مقابل واجهات برمجة التطبيقات المستضافة
اثنان من النماذج الصينية الثلاثة هما من النماذج مفتوحة الأوزان. حيث يتم توفير DeepSeek V4-Pro بموجب ترخيص MIT. ويتوفر Kimi K2.6 على موقع Hugging Face بموجب ترخيص MIT المعدل. ويمكن تنزيل كليهما، ونشرهما على بنيتك التحتية الخاصة، وتدقيقهما، وتشغيلهما دون إجراء أي استدعاءات خارجية لواجهة برمجة التطبيقات.
هذا الأمر يكتسب أهمية أكبر من المعتاد. فإذا كانت مؤسستك تتعامل مع بيانات العملاء في الاتحاد الأوروبي بموجب القانون العام لحماية البيانات (GDPR)، أو البيانات الصحية الأمريكية بموجب قانون (HIPAA)، أو البيانات المالية بموجب قانون (SOX)، أو السجلات المالية للعملاء بموجب القوانين المصرفية الإقليمية، فإن إرسال تلك البيانات عبر واجهة برمجة تطبيقات مستضافة في الصين ليس خياراً متاحاً أو ممكناً بشكل عام. وبالتالي فإن واجهة برمجة التطبيقات المستضافة لـ DeepSeek، ونموذج Qwen3.7 Max بالكامل (المتاح عبر الواجهة فقط)، ونقطة نهاية Kimi المستضافة، كلها خيارات مستبعدة لمسارات العمل التي تتطلب الامتثال للقوانين والأنظمة الصارمة.
يبقى خيار استضافة DeepSeek V4-Pro أو Kimi K2.6 ذاتياً متاحاً. ولكنك ستتحمل الآن تكلفة تشغيل استدلال MoE ذي معايير تصل إلى 1.6 تريليون معلمة (1.6T-parameter) بنفسك، وهو ما يتطلب موارد مالية حقيقية وأعمال هندسية ضخمة. ولا تنطبق تسعيرة الرموز عندما تمتلك البنية التحتية الصلبة ووحدات المعالجة بنفسك.
وتظل Anthropic في فئة مختلفة تماماً بالنسبة لهذا النوع من المشترين. أوزان مغلقة، ولكن الشركة تنشر عمليات تدقيق من نوع SOC 2 Type II، ولديها ضوابط موثقة لمعالجة البيانات، ولديها عملاء من شركات Fortune 500 المدرجة مستعدون لتقديم شهادات مرجعية. بالنسبة للمؤسسات التي تتضمن عمليات المراجعة الأمنية لديها مراجعة وتدقيق الموردين، فإن التباين والاختلاف حقيقي، وهو ليس مستحيلاً أو غير قابل للتجاوز، ولكنه قائم وحقيقي فعلاً.
إطار عمل لاتخاذ القرار بلغة مبسطة
تنتج الحسابات والرياضيات المذكورة أعلاه إطار عمل يثبت فاعليته عبر أعباء العمل التي رأيناها حتى الآن.
استخدم Claude Fable 5 عندما:
تكون المهمة طويلة، ومحددة التفاصيل بدقة، وعالية المخاطر والأهمية
يكلف الخطأ الواحد أكثر من فاتورة استهلاك الاستدلال بالكامل
تكون بحاجة إلى مستندات موثقة تثبت الامتثال للمعايير التنظيمية للمؤسسات
يتعين على الوكيل العمل دون تدخل أو إشراف لساعات أو أيام متواصلة
أمثلة: معالجة استثناءات الحسابات الدائنة (AP)، تسوية واستيفاء المطالبات، مراجعة العقود، ومراقبة الامتثال
استخدم DeepSeek V4-Pro (مستضاف ذاتياً) عندما:
يكون حجم العمل كبيراً وضخماً والمخاطر أقل
تمنع قواعد سيادة البيانات وحمايتها استخدام واجهات برمجة التطبيقات المستضافة خارجياً
تتوفر لديك البنية التحتية لتشغيل استدلال نماذج الأوزان المفتوحة في داخل المؤسسة أو في سحابتك الخاصة (VPC)
أمثلة: تصنيف المستندات على نطاق واسع، الأسئلة والأجوبة الداخلية حول مجموعة بيانات المؤسسة، والأدوات الداخلية
استخدم Kimi K2.6 (مستضاف ذاتياً) عندما:
تعتمد طبيعة العمل بشكل خاص ومكثف على الأدوات والوكلاء ذوي السلاسل القصيرة
تكون بحاجة إلى أوزان مفتوحة وتكون سعة السياق البالغة 256 ألف رمز كافية بالنسبة لك
أمثلة: تصنيف وفحص طلبات دعم العملاء، وتوزيع التذاكر وتوجيهها، وأتمتة عمليات المبيعات
استخدم Qwen3.7 Max عندما:
يكون العمل استكشافياً أو في مرحلة البحث والتطوير (R&D)، وليس موجهاً للعملاء بشكل مباشر
تكون واجهة برمجة التطبيقات ذات الأوزان المغلقة والمستضافة في الصين مقبولة ومتوافقة مع شروطك
تكون تستخدم بالفعل بيئة سحابة Alibaba Cloud
أمثلة: التجارب الداخلية، توليد المحتوى، وبناء النماذج الأولية غير الحساسة
الهدف ليس اختيار نموذج واحد فقط. فمعظم عمليات نشر الوكلاء في المؤسسات العام المقبل ستعتمد على التوجيه عبر نموذجين على الأقل. نموذج Claude للمسارات والمهمات الحساسة وعالية المخاطر، ونماذج صينية أو مفتوحة الأوزان أرخص تكلفة للاستدلال ذي الأحجام والعمليات الضخمة، مع تولي طبقة التنسيق (orchestration layer) عملية التوجيه بينها.
ماذا يعني هذا لفريقك
انتهى زمن افتراض "نموذج واحد لكل شيء" الذي كان سائداً في عامي 2024 و2025. يمثل Claude Fable 5 قفزة حقيقية إلى الأمام، لا سيما في الأعمال الطويلة والمستقلة دون إشراف. ولكن بالنسبة لمعظم أعباء العمل في غالبية المؤسسات، فإن اعتماده واختياره لكل شيء سيكلفك ما بين خمسة إلى خمسة وعشرين ضعفاً أكثر من اختيار النموذج الأنسب والملائم لكل مهمة بعينها.
لن تكون الفرق التي تطلق وتطبق وكلاء الإنتاج الفعلي هذا العام هي تلك التي اختارت أفضل نموذج واحد بعينه. بل ستكون الفرق التي قامت ببناء طبقة التنسيق، والتقييم، والحوكمة التي تتيح لها تبديل النماذج وتغييرها بحسب حجم وطبيعة العمل دون الحاجة إلى إعادة كتابة وبرمجة الوكيل من الصفر. هذه الطبقة هي المكان الذي تظهر فيه العوائق الرئيسية التي ذكرها تقرير Anaconda/Forrester. وهو المكان الذي تنجح فيه وكلاء الإنتاج الفعلي في مواجهة العالم الحقيقي أو تختفي بهدوء من خطة العمل المستقبلية.
في Beam، نقوم بتشغيل وكلاء ذكاء اصطناعي في بيئة العمل الفعلية لفرق المالية والعمليات في المؤسسات (أتمتة الحسابات الدائنة، التسويات، معالجة المطالبات، ومسارات عمل المشتريات) على النموذج الأكثر ملاءمة للمهمة. يمثل النموذج خياراً واحداً فقط. في حين أن عمليات التنسيق، ومسارات التدقيق، والتكامل، ومعالجة الاستثناءات هي ما يجعل الأمر يعمل وينجح فعلياً في الإنتاج الحقيقي.
شاهد كيف تقوم Beam بتشغيل وكلاء ذكاء اصطناعي في بيئة العمل الفعلية على Claude، أو DeepSeek، أو Qwen، أو أي مزيج بينها، مع طبقة تنسيق مرنة تتكيف وتستمر بكفاءة مع إصدار النموذج التالي.





