9 دقيقة قراءة

Claude Fable 5 and Mythos 5: Is the 3x Premium Worth It?

By submitting, you consent to our use of your data. Privacy Policy.

Category

وكلاء الذكاء الاصطناعي

Share the article

خمسون دولاراً لكل مليون رمز مخرجات (output tokens). هذا ما تدفعه الشركات الآن لتشغيل أقوى نموذج من Anthropic، وهو ما يعادل تقريباً ثلاثة أضعاف تكلفة عبء العمل نفسه على Opus 4.8 قبل أسبوع. السؤال الذي يجب على كل رئيس قسم ذكاء اصطناعي طرحه هذا الصباح ليس ما إذا كان نموذج Claude Fable 5 أفضل؛ فهو كذلك بوضوح. بل السؤال هو ما إذا كان سير العمل الذي توشك على توجيهه إليه يتجاوز هذا المعيار الجديد.

أطلقت شركة Anthropic نموذجي Claude Fable 5 وMythos 5 في 9 يونيو. يتشارك النموذجان نفس الأوزان الأساسية ولكنهما يأتيان بتكوينات أمان مختلفة: Fable 5 متاح للعامة مع خيارات أمان بديلة تتراجع إلى Opus 4.8 في أقل من 5% من الجلسات، بينما يتميز Mythos 5 برفع قيود الأمان وحصر الوصول لشركاء Project Glasswing والمدافعين السيبرانيين في الحكومة الأمريكية. كلا النموذجين يسعران بشكل متطابق بسعر 10 دولارات لكل مليون رمز مدخلات (input tokens) و50 دولاراً لكل مليون رمز مخرجات، وهو ضعف تكلفة مدخلات وثلاثة أضعاف تكلفة مخرجات نموذج Opus 4.8 تقريباً.

هذا هو المعيار الجديد. وتبرر اختبارات الأداء هذا المعيار في بعض الحالات دون غيرها. إليك الحسابات، وسير العمل الذي يتجاوز هذا المعيار، وسير العمل الذي لا يتجاوزه.

اختبارات الأداء حقيقية

قبل حسابات التكلفة، هناك حسابات القدرة الفائقة. يتربع نموذجا Fable 5 وMythos 5 على عرش الصدارة في كل اختبار أداء يهم عمل وكلاء الشركات (enterprise agents).

في اختبار GDPval-AA، وهو معيار قياس العمل المعرفي للمؤسسات، أحرزت النماذج الجديدة 1932 نقطة مقابل 1890 لنموذج Claude Opus 4.8، و1769 لنموذج GPT-5.5، و1314 لنموذج Gemini 3.1 Pro. وفي اختبار GDPpdf، وهو معيار التفكير المستند إلى المستندات المرئية، حققا 29.8% دون استخدام أدوات مقابل 22.5% لنموذج Opus 4.8، و24.9% لنموذج GPT-5.5، و16.7% لنموذج Gemini 3.1 Pro. وفي اختبار SWE-bench Pro الصعب لهندسة البرمجيات، حققا 80.3% مقابل 58.6% لنموذج GPT-5.5. وفي اختبار FrontierCode Diamond من Cognition للبرمجة المعتمدة على الوكلاء القابلة للصيانة، حققا 29.3% مقابل 13.4% لنموذج Opus 4.8 و5.7% لنموذج GPT-5.5.

هذه الفجوة الأخيرة (29.3% مقابل 13.4%) تمثل أكبر قفزة في إصدار فردي لقدرات البرمجة المعتمدة على الوكلاء منذ عامين. إن التفوق في لوحة الصدارة حقيقي وكبير، وهو السبب وراء هذا السعر المرتفع.

العمليات الحسابية الأساسية، لكل سير عمل

تتطلب المهمة النموذجية لوكيل الشركات حوالي 50,000 رمز مدخلات (السياق، والمستندات المسترجعة، والمحاولات السابقة) و5,000 رمز مخرجات (استجابة الوكيل واستدعاءات الأدوات). بأسعار Fable 5، يعادل ذلك 0.50 دولار للمدخلات بالإضافة إلى 0.25 دولار للمخرجات، أي حوالي 0.75 دولار لكل مهمة. وبأسعار Opus 4.8 (حوالي 3 دولارات لكل مليون مدخلات، و15 دولاراً لكل مليون مخرجات)، تبلغ تكلفة المهمة نفسها حوالي 0.15 دولار بالإضافة إلى 0.075 دولار، أي 0.23 دولار.

قد تبدو الفجوة صغيرة لكل مهمة على حدة، لكنها ليست كذلك عند العمل بحجم ومعدل الإنتاج الضخم.

وكيل تسوية الحسابات الذي يدير 10,000 مهمة يومياً على Opus 4.8 يكلف حوالي 2,300 دولار يومياً. ويكلف الوكيل نفسه على Fable 5 حوالي 7,500 دولار يومياً. هذا فارق سنوي قدره 1.6 مليون دولار لسير عمل واحد قبل احتساب نمو المدخلات، أو إعادات المحاولة، أو أي من أنماط السياق الطويل التي تدفع بأعداد الرموز إلى الارتفاع. وعند مضاعفة ذلك عبر خمسة إلى عشرة مسارات عمل للوكلاء قيد الإنتاج التي تشغلها شركة نموذجية اليوم، فإن الفارق السنوي سيتجاوز سريعاً حاجز الملايين بعشرة أرقام.

لذا، لا ينبغي أن تكون الإجابة الافتراضية على سؤال "هل يجب أن ننقل هذا العبء من العمل إلى Fable 5" بنعم، بل يجب أن تكون: "أرني أي مسارات العمل تتجاوز وتبرر هذا المعيار الجديد".

أين يبرر العائد هذه التكلفة المضاعفة بثلاث مرات؟

ثلاث فئات تثبت فيها الحسابات جدواها الاقتصادية بالفعل:

وكلاء هندسة البرمجيات المعقدة: هذه هي الحالة الأقوى. فنسبة 80.3% في اختبار SWE-bench Pro مقابل 58.6% لنموذج GPT-5.5 تعني حوالي 22 طلباً إضافياً صحيحاً لسحب الكود (pull requests) لكل 100 محاولة. وباحتساب معدل تكلفة المهندس الشاملة البالغة 90 دولاراً في الساعة وتوفير ساعتين لكل طلب سحب مدمج، فإن ذلك يعادل استرداد 3,960 دولاراً من وقت الهندسة لكل 100 عملية تشغيل لنموذج Fable 5 مقابل زيادة طفيفة في تكلفة الرموز تبلغ حوالي 48 دولاراً. نسبة استرداد التكلفة: حوالي 80 ضعفاً. ستشهد فرق الشركات التي تدير وكلاء برمجة داخليين، أو أتمتة مراجعة الكود، أو أدوات ترحيل البيانات، استرداداً لتكلفة Fable 5 خلال دورة تطوير برمجية واحدة (sprint).

التفكير والتحليل المرئي للمستندات في القرارات ذات الأهمية البالغة: تمثل نسبة 29.8% في اختبار GDPpdf مقارنة بنسبة 22.5% لنموذج Opus 4.8 قفزة نسبية قدرها 32%. ينعكس هذا مباشرة على مراجعة العقود (حيث تكلف بند واحد مفقود أكثر من تكلفة استهلاك الرموز المميزة السنوية)، وفرز مطالبات التأمين (حيث يتراكم التصنيف الخاطئ عبر آلاف المطالبات)، وتحليل التقارير المالية (حيث تفوق غرامات الامتثال لهيئة الأوراق المالية والبورصات أي تكلفة نموذج متوقعة). وتكون التكلفة الإضافية مبررة تماماً في أي مكان يؤثر فيه قرار وكيل واحد على أموال طائلة أو نتائج خاضعة للوائح التنظيمية.

التخطيط طويل المدى والتفكير متعدد الخطوات: تستفيد مسارات العمل التي يتعين على الوكيل فيها التخطيط والتنفيذ والتصحيح الذاتي عبر عدة خطوات بشكل كبير من جودة التفكير الفائقة للنموذج. فمسار العمل الذي يتضمن ثماني خطوات تفكير ونسبة خطأ 5% في كل خطوة على Opus 4.8 يفشل بالكامل من البداية إلى النهاية بنسبة 34% من الوقت تقريباً. أما المسار نفسه بنسبة خطأ 2% في كل خطوة (وهي الميزة المعتادة لنموذج Fable 5 في اختبارات السياق الطويل) فيفشل بنسبة 15% من الوقت. إن تكلفة إنجاز مسارات العمل هذه بشكل صحيح تعد ضئيلة جداً مقارنة بتكلفة الخطأ فيها.

أين لا تبرر النتائج هذه التكلفة الإضافية؟

ثلاث فئات يعتبر الانتقال فيها إلى Fable 5 هدراً للمال:

التصنيف والتوجيه والفرز عالي الحجم: مسارات العمل التي تقوم بالفرز، أو التصنيف، أو التوجيه على نطاق واسع. ويشمل ذلك معظم تذاكر الدعم، ومعظم رسائل البريد الإلكتروني، ومعظم عمليات تصنيف المستندات. يحقق نموذج Opus 4.8 بالفعل أهداف الدقة المطلوبة هنا. وإن قفزة GDPval-AA من 1890 إلى 1932 هي تحسن نسبي بنسبة 2.2% فقط في العمل المعرفي للمؤسسات، وهذا التحسن الطفيف في الدقة لا يبرر زيادة تكلفة الرموز إلى 3 أضعاف عندما تكون كل مخرجات عبارة عن تصنيف من جملة واحدة لا تكلف سوى سنتات معدودة. من الأفضل إبقاء هذه المهام على Opus 4.8 أو Haiku أو النماذج مفتوحة المصدر الأصغر.

المحادثات الموجهة للعملاء وتلخيص النصوص: حيث يكون حجم العمل كبيراً، وتلبي النماذج متوسطة المستوى معايير الدقة المطلوبة، وتكون القيمة الإضافية لكل كلمة صحيحة زائدة ضئيلة للغاية. استخدام النماذج الفائقة هنا يعد هدراً صريحاً للميزانية.

مسارات العمل التي لا يكون فيها النموذج هو نقطة الاختناق: معظم إخفاقات الوكلاء قيد التشغيل في بيئات الشركات لا ترجع إلى قصور في التفكير والتحليل، بل هي إخفاقات في التكامل، أو مشكلات في جودة البيانات، أو تصميم الأوامر البرمجية (prompts)، أو ثغرات في الحوكمة. إن استخدام نموذج أكثر تكلفة لحل مشكلة لا تتعلق بالنموذج نفسه لن يحل أي شيء سوى زيادة فاتورة الرموز الخاصة بك. قم بتشخيص سبب الفشل الفعلي أولاً قبل التوجه إلى Fable 5.

فترة الاختبار الممتدة لـ 13 يوماً

من 9 يونيو وحتى 22 يونيو، يتوفر Fable 5 مجاناً ضمن خطط Pro وMax وTeam وEnterprise القائمة على المقاعد من Anthropic. هذه نافذة مدتها 13 يوماً تتيح لفرق العمل في الشركات إجراء مقارنات فعلية (A/B testing) ضد سجلات Opus 4.8 دون أي تكلفة إضافية.

استغل هذه الفرصة. اختر مسارات العمل الثلاثة التي تملك فيها أقوى فرضية بأن جودة التفكير الفائقة ستحدث فارقاً: مثل المراجعة المالية ذات المخاطر الأعلى، أو الأتمتة الهندسية الأكثر تعقيداً، أو تدفق العقود والمطالبات حيث تتراكم الأخطاء وتتضاعف كلفته. وجهها إلى Fable 5 طوال فترة التجربة الكاملة. سجل كل قرار يتخذه الوكيل إلى جانب القرار الذي كان ليتخذه على Opus 4.8، وقارن النتائج. بحلول 22 يونيو، ستعرف بالضبط أي مسارات عمل يجب إبقاؤها على Fable 5 بالسعر الكامل وأي منها يجب إعادته للطراز السابق.

تخطي هذه التجربة يعني اتخاذ القرار بشكل أعمى بعد يوم 23، وهو الخيار الأعلى كلفة على الإطلاق في هذه الحالة.

لماذا يحدد نظام تتبع التكاليف الدقيق ما إذا كان السعر الإضافي سيمر من قسم المشتريات

زيادة التكاليف بمقدار 3 أضعاف على أي بند قيد التشغيل تعد حدثاً يستدعي مراجعة قسم المشتريات. وسيتساءل الفريق المالي، وبكل منطقية، عن استدعاءات Fable 5 المحددة التي حققت نتائج أعمال ملموسة. مقولة "لقد قمنا بترقية النموذج وارتفعت الدقة بنسبة 4%" ليست إجابة مقنعة لتبرير بند سنوي بقيمة 1.6 مليون دولار. بينما الإجابة المقنعة والمقبولة هي: "لقد عالجت هذه الاستدعاءات البالغ عددها 14,000 لنموذج Fable 5 في مايو عقوداً بقيمة 2.4 مليار دولار، ورصدت 412 بنداً من بنود المخاطر التي أغفلها النموذج السابق، وكان ثلاثة منها سيكلفنا أكثر من ميزانية Fable 5 السنوية بأكملها لو تم تمريرها".

تتطلب هذه الإجابة تتبعاً دقيقاً لكل خطوة: تسجيل كل استدعاء للنموذج مع خطوة سير العمل التي خدمها، والمدخلات التي استهلكها، والقرار الذي أنتجه، والمراجعة البشرية التي نال موافقتها، والنتيجة التي تلت ذلك على مستوى الأعمال. أغلب منصات الوكلاء في الشركات لا تسجل البيانات بهذه الدقة اليوم. ولكن منصات تشغيل الوكلاء التي تعامل نظام تتبع الفواتير كعنصر أساسي من الدرجة الأولى — وليس كفكرة ثانوية طارئة — تفعل ذلك، وهو ما يصنع الفارق بين الدفاع عن التكلفة الإضافية في مراجعة المشتريات للربع القادم وبين الاضطرار إلى التراجع عنها.

إن قرار دفع التكلفة الإضافية لنموذج Fable 5 ليس قراراً يتعلق بالنموذج وحده، بل هو قرار يتعلق بالمنصة ككل. فالنموذج جيد بما يكفي لتبرير التكلفة الإضافية في مسارات العمل الصحيحة، والمنصة هي الأداة التي تثبت أي مسارات العمل هي تلك التي تستحق.

ما يجب فعله هذا الأسبوع

ثلاث خطوات ملموسة قبل 22 يونيو:

أولاً: اختر مسارات العمل الثلاثة الأكثر أهمية وحساسية في منصة تشغيل الوكلاء الخاصة بك. وقم بتوجيهها إلى Fable 5 خلال فترة التجربة المجانية، وسجل كل شيء.

ثانياً: قم ببناء (أو تأكيد امتلاكك لـ) نظام تتبع تكلفة دقيق لكل خطوة. إذا لم تتمكن من إظهار أي مسار عمل قام بتشغيل أي استدعاء لـ Fable 5 هذا الأسبوع للفريق المالي، فلن تتمكن من إقناعهم بمواصلة الدفع مقابله في الشهر المقبل.

ثالثاً: حدد سياسة توجيه المهام الخاصة بك بحلول 22 يونيو. مسارات العمل التي تحقق عائداً مجزياً تظل على Fable 5، ومسارات العمل الأخرى تعود إلى Opus 4.8، أو تُخفض إلى Haiku أو النماذج المفتوحة حسب ما تقتضيه الحاجة. يجب أن تجعل المنصة تغيير سياسة التوجيه هذه أمراً بسيطاً للغاية لكل سير عمل دون الحاجة لإعادة برمجة الوكيل.

بعد 22 يونيو، لن يكون السؤال هو ما إذا كان Fable 5 هو النموذج الأفضل في الصدارة؛ فهو كذلك بكل وضوح. بل سيكون السؤال هو ما إذا كانت منصة تشغيل الوكلاء الخاصة بك قادرة على إثبات جدوى التكلفة والمنفعة لكل سير عمل على حدة. الفرق التي تستطيع إثبات ذلك ستمتلك أقوى نموذج تفكير وتحليل قيد الإنتاج بموافقة من الإدارة المالية، أما الفرق التي لا تستطيع فسينتهي بها المطاف إما بعدم استغلال هذه القدرات بالشكل الكافي أو بالدفع المفرط مقابلها.

طرح شركة Anthropic للاكتتاب العام الأسبوع الماضي بقيمة 965 مليار دولار كان بمثابة لحظة مراجعة لتركيز الموردين لدى مشتري وكلاء الشركات الذكية. ويمثل إطلاق Fable 5 لحظة المشتريات التي تلي ذلك. كلا القرارين يصبحان أسهل بكثير عندما تقوم طبقة المنصة التحتية بمهمة تتبع التكاليف والتوثيق التي تبرر هذا الإنفاق.

ابدأ اليوم

ابدأ في بناء وكلاء الذكاء الاصطناعي لأتمتة العمليات

انضم إلى منصتنا وابدأ في بناء وكلاء الذكاء الاصطناعي لمختلف أنواع الأتمتة.

ابدأ اليوم

ابدأ في بناء وكلاء الذكاء الاصطناعي لأتمتة العمليات

انضم إلى منصتنا وابدأ في بناء وكلاء الذكاء الاصطناعي لمختلف أنواع الأتمتة.